八篇 related 里只有一篇与 RAG 存在直接谱系关系,其余同属 category: algorithm
但主题分散,构成"同 category 的方法学对照组"而非"同问题的竞品"。分层如下:
A. 直接后继 / 同问题(RAG 的问题域内)
[2401.18059]。它接受 RAG 的"检索非参数化文本 + 生成"范式,
但攻击 RAG 未解决的一个具体缺陷:RAG 索引的是 ~100-token 的连续 chunk,
只能答局部性事实问题,答不了需要跨长文档综合证据的主题/多跳问题。RAPTOR
用递归聚类-摘要建的多层树替换扁平 chunk 索引。这是与 RAG 唯一可做逐指标对比的一篇。
B. 检索/上下文机制相关(对 RAG 的"检索有没有用"提供旁证或反证)
生成器就能用上"。NoLiMa 证明当 query 与目标信息无词面重叠、只有潜在联想链接时,
即使信息在上下文里,13 个主流 LLM 中 11 个在 32K 时也定位不到
[2502.05167]。这直接质疑 RAG"检索到即答对"的链条。
负责上下文知识理解,破坏后 GSM8K 76.9%→4.0%、Passkey 100%→0%
[2502.01563]。这为"参数知识 vs 上下文知识"这一 RAG 核心二分提供了
机制层面的实体化解释——RAG 靠外部记忆补的正是这条上下文通道承载的东西。
C. 同 category 但主题正交(方法学镜子,非竞品)
信号 + 不可信数据"的混合 [2402.06363],而 RAG 把不可信的检索
文档直接拼进 prompt。
GPU 通信重叠,纯系统/kernel 层。
后文的 delta / 攻击面主要围绕 A、B 展开;C 只在"生态位"与"未探索方向"里作对照。
RAG 把 Wikipedia 切成 21M 个不相交的 100-word chunk,MIPS 取 top-K 直接拼进 BART
[2005.11401]。RAPTOR 的核心 delta 是索引结构:递归地 UMAP+GMM
软聚类、LLM 摘要、再嵌入,建自底向上的树,非叶节点是语义(非邻接)簇的摘要
上层(主题摘要)。这是 RAG 结构上做不到的:RAG 的所有文档都在同一粒度。
(human-readable/writable)和"检索→生成"流程。RAPTOR 甚至可加在任意 retriever
(含 DPR,即 RAG 用的那个)之上 [2401.18059]。
[2005.11401];RAPTOR 在长文档主题题 QuALITY 上 62.3%→82.6%
(+20.3 绝对) [2401.18059]。两者的 headline 提升幅度差异**恰恰印证
了各自的问题域**:RAG 面向的短事实题,扁平 chunk 已够用;RAPTOR 面向的主题题,
才是扁平索引的痛点。二者不冲突,是同一范式在不同问题难度上的延伸。
RAG 反复主张:参数化记忆(BART 权重)存事实但不可修改/追溯,非参数化记忆(Wikipedia
索引)可热插拔更新 [2005.11401]。RAG 只从行为上证明了这个二分
(索引热插拔实验 70/68% vs 12/4%)。Massive Values 提供了一个互补的、机制层面
的视角:LLM 内部本就有专职处理"上下文知识"的 Q/K 大值通道,与"参数知识检索"通道
可分离 [2502.01563]。
delta 与张力:RAG 假定"参数知识"和"上下文知识"是两种存储介质(权重 vs
索引);Massive Values 揭示即使在纯参数模型内部,二者也是两条可分离的计算通道。
这意味着 RAG 把上下文注入外部索引,其实是在外部复刻了模型内部本已存在的通道分工——
一个 RAG 论文完全没意识到的机制事实(RAG 2020 早于 RoPE 主流化)。
RAG 的论证链第 4-5 步默认:检索出相关文档 → 生成器就能用上 →
答对 [2005.11401]。RAG 甚至骄傲地报告"答案不在任何检索文档里时仍能
对 11.8%"[2005.11401]。NoLiMa 从反面切入:当上下文里有答案
但 query 与之无词面重叠时,模型反而定位不到 [2502.05167]。
这不是矛盾而是错位覆盖:RAG 的实验都是有大量词面重叠的短事实题(DPR 本就在
NQ/TQA 上训练检索);NoLiMa 专门构造零重叠的联想题。RAG 未测的正是 NoLiMa 的
主战场,见 §3 与 §7。
RAG 把检索文档直接 concat 进 BART 输入 [2005.11401],视其为
知识资产。StruQ 指出这种"控制信号 + 不可信数据混同一输入"正是提示注入的根因
[2402.06363]。delta:RAG 时代(2020)无人考虑检索文档可能被投毒;
StruQ 的通道分离思想直接暴露了 RAG 的一个安全盲点(RAG 索引可被恶意编辑,正因为它
"human-writable"——RAG 当卖点,StruQ 视角下是攻击面)。
A1. "生成 > 抽取"的证据被检索监督污染。 RAG 声称生成式模型击败抽取式 reader
且无需 re-ranker [2005.11401]。但 RAG 的 DPR retriever 本就是在
NQ/TQA 上用检索监督训练的(L1 §2.2、§4.1 自承)。所谓"无监督检索"仅指 fine-tune
阶段不加检索 loss,检索器的初始化已吸收了 NQ/TQA 的答案-文档对齐信号。因此
"generation beats extraction"的干净归因是可疑的:优势可能部分来自更强的检索初始化,
而非生成范式本身。
A2. 频域二分的机制假设已过时。 RAG 的"参数 vs 非参数记忆"二分把上下文知识
外包给索引。Massive Values 证明上下文理解在 RoPE 模型里是一条特定的内部通道
[2502.01563],且极其脆弱(破坏即崩)。可攻击点:RAG 把大量上下文塞进
prompt(K 个文档拼接),但若生成器的上下文通道容量有限(Massive Values 暗示它是
少数低频维承载的),检索更多文档未必线性提升利用率——这与 RAG 观察到的
RAG-Token 在 K=10 后性能见顶 [2005.11401] 高度吻合,却被 RAG
归因为"检索质量"而非"生成器上下文通道饱和"。RAG 给了错误的机制解释。
A3. 检索-利用链条在零词面重叠时断裂。 RAG 全部实验都在高词面重叠的短事实题上。
NoLiMa 显示零重叠联想题下模型定位失败 [2502.05167]。RAG 的"答案不在文档
里仍对 11.8%"是参数记忆兜底,不是检索-利用成功。若把 RAG 放到 NoLiMa 式任务
上,检索出的文档很可能因缺乏表面线索而根本没被生成器有效读取,RAG 从未测过
这条边界。
A4. Frozen document encoder 的普适性被 RAPTOR 间接质疑。 RAG 的核心壁垒是冻结
文档编码器/索引、只训 query 编码器 [2005.11401]。这在同粒度扁平索引上成立。
但一旦索引结构复杂化(RAPTOR 的多层摘要),冻结文档侧是否仍够用是未验证的——RAPTOR
用的是现成 SBERT 嵌入 + 独立摘要,也没训文档编码器,但它的增益来自聚类结构
而非编码器学习 [2401.18059],说明 RAG 的"query 侧旋转到
静态文档流形"论证在结构化索引上不再是主导因素。
A5. Retrieval collapse 是被淡化的失败模式。 RAG 附录 H 承认在 story generation
上检索器"塌缩"、生成器学会忽略文档、RAG 退化成 BART。这在 L2 里几乎没提。这个失败
模式恰恰是 NoLiMa 现象的训练时对应物:当任务对事实知识需求不显式时,检索信号弱到
无法训出有用检索器。RAG 把它藏在附录,却是范式的真实边界。
范式定位:RAG 是"非参数化外部记忆 + 生成"这一整支范式的奠基论文。 它的历史
地位不在于任何单一组件(DPR、BART 都已存在),而在于把"检索到的文档作为潜变量、
通过生成式 seq2seq loss 端到端边缘化"这一 recipe 确立为通用范式
[2005.11401]。这个词——RAG——本身成了一个领域的名字。
采纳证据(强):
RagSequenceForGeneration /RagTokenForGeneration 两个类直接对应两个边缘化变体
[2005.11401],代码公开可复现。
是"RAG 范式仍在演进"的直接证据。
[2301.04104]、Qwen2.5-Omni 的参数化多模态 [2503.20215])
代表了 RAG 想补足的"参数化记忆不可更新"痛点的另一端——它们把知识全压进权重,
正是 RAG 反对的做法。RAG 生态位就是这条光谱上"外部可更新记忆"的锚点。
范式转移性质:RAG 是加法式范式转移而非替代式。它没有取代参数化 LLM,而是
在其上叠加一层可热插拔的非参数记忆。这解释了它的持久生命力:任何参数化生成模型
(含后来的多模态模型如 Qwen2.5-Omni)都可被"RAG 化"。
D1. 结构感知检索 × 上下文通道机制的联合优化。 RAPTOR 优化了检索结构
(多层树 [2401.18059]),Massive Values 揭示了生成器利用上下文
的内部通道 [2502.01563]。二者从未被联合考虑:能否让树的层级设计对齐
生成器上下文通道的容量?例如上层摘要节点专门喂给 Massive Value 通道承载的
"上下文理解",叶节点喂给参数知识兜底。这是 RAG/RAPTOR/Massive Values 三篇交叉的空白。
D2. NoLiMa-hard 检索基准。 RAG 与 RAPTOR 都在高词面重叠或抽取式题上评测。把
NoLiMa 的零词面重叠联想题 [2502.05167] 作为 RAG/RAPTOR 的检索-利用联合
评测集是完全未做的方向——它能区分"检索失败"和"检索成功但生成器没读进去",而现有
RAG 评测把二者混在 EM 一个数里。
D3. 可信检索通道(RAG × StruQ)。 RAG 的 human-writable 索引是双刃剑
[2005.11401]。把 StruQ 的 reserved-token 通道分离
[2402.06363] 用于把"检索文档"标记为不可信数据通道、把"用户 query"标记
为可信控制通道,可在保留 RAG 更新性的同时防索引投毒。这是一个 clean 的 hybrid,
两篇都没做。
D4. 自适应参数/非参数路由。 RAG 的 RAG-Token 已隐含"每 token 选不同文档"
[2005.11401],且观察到生成 title 首 token 后 posterior 变平(转向参数
记忆)[2005.11401]。结合 Massive Values 的通道可分离性,可训一个
显式 router:per-token 决定走参数通道还是非参数检索。这把 RAG 的隐式行为升级为
可控机制。
D5. 检索 collapse 的可诊断化。 RAG 附录 H 的塌缩是靠事后观察发现的。用 NoLiMa
式的"needle 可解性控制实验" [2502.05167] 思路,可在训练中在线检测
检索器是否塌缩(检索分布是否 input-independent),这是防止 RAG 悄悄退化成 BART 的
未探索工程方向。