RAG 论文精读方法
问题
RAG 论文精读有个共同特点:方法章节看起来很复杂,但真正决定效果的往往只有几个选择——用什么检索器、检索回来怎么塞进上下文、怎么评测,以及怎么判断评测本身可不可信。
如果从引言按顺序一路读到实验,很容易陷进实现细节里,读完说不清这篇论文到底比别人好在哪。这也是为什么需要一套固定的论文精读方法,而不是每篇换一种读法。
更常见的情况是读了五六篇,最后分不清哪篇改了检索、哪篇改了融合方式。
方法
下面这套论文精读方法按四条主线走:先看结论、再拆组件、再核评测、最后记短板。四点抓住之后,同一方向连读五六篇 RAG 论文也不会记混。
先读摘要和实验结论,再回读方法。 第一遍不要读方法章节。先读摘要,再看实验部分的结论和主表,搞清楚"这篇论文声称在什么任务上比谁好多少"。带着这个结论再回读方法,阅读就有了目标:你要找的是"它是怎么做才拿到这个结果的"。这样做还有一个好处:如果实验结论本身就不可信,可以早点放弃这篇,省下精读时间。
记录检索器和生成器的选型。 RAG(检索增强生成)的差异绝大部分落在这两个组件上。精读时把下面几点单独记下来:
- 检索器类型:稀疏(BM25 类)、稠密(双塔向量检索),还是混合检索。
- 切块策略:块大小、是否有重叠、按什么单位切(段落、句子、固定长度)。
- 检索数量:一次取回多少个片段,以及有没有做重排(rerank)。
- 上下文组织:检索结果怎么拼进提示词,是否压缩,放在提示词的什么位置。
- 生成器:用哪个基座模型,是直接生成还是先做后处理。
同一方向的不同论文,差异基本都能在这几项上找到落点。
记录数据集与评测指标。 RAG 的评测尤其容易不可比:有的用精确匹配,有的用答案的语义相似度,有的直接让人打分。精读时至少要记下数据集名称、指标定义、以及是否用了同一个基座模型做对照。一个常见的坑是:两篇论文报告了同一数据集上的指标,但用的生成模型不同,结论其实无法直接比较。
记录论文自述的短板。 论文的局限章节信息密度很高,别跳过。作者在什么条件下承认失效、哪些场景没有验证,往往就是下一篇工作的切入点,也是你判断要不要采用这个方法的关键依据。
常见坑
- 只看指标不看评测口径。 指标涨了但换了评测方式,结论可能是假的。
- 忽略切块和检索数量这类"小参数"。 在检索增强生成里它们经常比模型选择影响更大。
- 不记基座模型。 无法判断提升来自方法还是来自更强的模型。
用工具加速
按上面这套 RAG 论文精读流程逐篇记录,字段其实高度重复,手工记容易漏项也容易写歪。LitLens 的结构化抽取会把基础信息、核心技术、实验配置、对比基准、论文短板一次性抽出来,你可以逐字段核对修改;选多篇 RAG 论文一起对比时,检索器、数据集、指标上的差异会直接体现在对比表里。