本篇(Transformer, 2017)是这一 cluster 的共同祖先——所有 8 篇相关论文都在 self-attention / RoPE-based Transformer 之上构建或对其做手术。关系可按"距原始机制的手术层次"分四组:
A. 机制内部的量化/加速(不改语义,改数值)
B. 机制内部的科学解剖(解释 attention 为什么工作)
C. 架构骨架的复用与扩展(保留 Transformer,换应用/模态)
D. 弱相关(同为 algorithm 类,但机制正交)
| 相关论文 | 相对本篇的 delta | 类型 |
|---|---|---|
| 2410.02367 | 本篇假设 attention 全程 FP16/FP32;SageAttention 证明 $QK^\top$ 可 INT8、$PV$ 须留 FP16,端到端损失 <0.2% [2410.02367] | 增量(数值层) |
| 2502.01563 | 本篇把 attention heads 的可解释性留给定性可视化(Figs 3–5,无量化指标 [1706.03762]);本论文给出因果实验——破坏 massive-value 维度使 GSM8K 76.9%→4.0% [2502.01563] | 新增(把定性→因果定量) |
| 2502.05167 | 本篇 §4 主张 $O(1)$ path length 让长程依赖"更易学" [1706.03762];NoLiMa 显示去掉词面线索后 11/13 模型在 32K 崩到基线 50% 以下 [2502.05167] | 矛盾/证伪(见 §3) |
| 2503.20215 | 本篇是固定正弦编码、单模态文本;Qwen-Omni 用 TMRoPE 编码绝对时间、Thinker-Talker 解耦文本/语音输出 [2503.20215] | 扩展(位置编码 + 多模态) |
| 2401.18059 | 本篇单次前向上下文由 $n$ 决定、$O(n^2)$ 受限;RAPTOR 用树形索引把"多跳/主题"检索外置,QuALITY 62.3%→82.6% [2401.18059] | 增量(外部脚手架,非改机制) |
| 2402.06363 | 本篇不涉安全;StruQ 把 injection 归因为"instruction-tuned LLM 扫描整个输入" [2402.06363],用保留 token 分离 prompt/data 通道 | 新增(安全维度) |
| 2412.14335 | 本篇只报单机 8×P100 训练成本 [1706.03762];ConCCL 攻的是多 GPU 下 GEMM+collective 并发只达理想 21% 的系统瓶颈 [2412.14335] | 增量(系统层,机制无关) |
| 2301.04104 | 本篇用 attention 取代 recurrence [1706.03762];DreamerV3 反向——在世界模型里保留 GRU/RSSM recurrence [2301.04104],证明 recurrence 在 model-based RL 仍有位置 | 分岔(反向选择) |
最本质的 delta 归纳:本篇确立"attention-only、$O(1)$ path length、full parallelism"三支柱 [1706.03762]。后续 cluster 分别在四条正交轴上继续:数值精度(2410.02367)、系统并发(2412.14335)、机制解释(2502.01563 / 2502.05167)、应用/模态扩展(2503.20215 / 2401.18059 / 2402.06363)。没有一篇挑战核心机制本身——足见其范式地位。
攻击 1 — "$O(1)$ path length ⇒ 长程依赖更易学"是被证伪的过度乐观。
本篇 §4 用 Table 1 的 $O(1)$ maximum path length 论证 self-attention 比 recurrent 更易学长程依赖 [1706.03762]。NoLiMa 的反例数据直接打脸:一旦去掉问题与 needle 间的词面重叠(R-1 从 0.905 降到 0.069),GPT-4o 的 effective length 从 claimed 128K 崩到 8K,11/13 模型在 32K 低于基线 50% [2502.05167]。
矛盾根源:本篇的 $O(1)$ 是图论路径长度(信息可达性),而非检索可靠性。Table 1 只保证任意两位置"有一条长度为 1 的边",不保证 softmax 权重能把注意力实际分配过去。NoLiMa 指出瓶颈是"注意力稀释"——$n$ 个 token 竞争同一 softmax 分布,权重被摊薄 [2502.05167]。本篇的 $O(1)$ 论断在 2017 年的短序列 MT($n
攻击 2 — "self-attention 更可解释"当年只有定性证据。
本篇 §4 para 6 + Appendix 声称 heads 学到可解释的句法/语义结构,但完全靠可视化,无量化指标 [1706.03762]。2502.01563 五年后才补上因果证据(破坏 massive-value 维度使 CK 任务崩溃 [2502.01563])——反过来说明本篇的可解释性主张在发表时是未经证实的直觉,且真正承载语义的不是"某个 head 干某件事",而是"Q/K 低频维度的 massive values"这一本篇完全没预见的结构。
攻击 3 — attention 全程需高精度是未加验证的隐含假设。
本篇整个实验都在 FP16/FP32 下跑,从未讨论 attention 对数值精度的敏感性。SageAttention 揭示这是个可攻击的空白:$QK^\top$ 能安全 INT8,但 $PV$ 若也 INT8 则 worst-case 余弦相似度仅 56.4%、图像全糊 [2410.02367]。本篇没有区分两个 matmul 的精度需求,是"把 attention 当单一 op"的粗粒度视角遗留的盲区。
攻击 4 — "每个位置 attend 所有位置"是安全漏洞的温床。
本篇把"decoder 每位置可 attend 到全部输入"当纯优点 [1706.03762]。StruQ 指出这恰是 prompt injection 的机制根因:instruction-tuned 模型扫描整个输入找指令,攻击者往 data channel 塞指令即可劫持 [2402.06363]。本篇的"全局可达性"在 LLM-app 时代成了 control/data 通道混淆的漏洞。
范式转移的震中。 本篇是本 cluster 唯一的"paradigm shift"论文——它用 attention 完全取代 recurrence/convolution [1706.03762],其余 7 篇都是在这一新范式内部做增量、解剖或扩展。采纳证据密度极高:
生态位定位:本篇处于"foundational primitive"层,cluster 内其他论文分居其上下游——上游是应用(Omni、RAPTOR、StruQ),中游是解剖(Massive Values、NoLiMa),下游是数值/系统实现(Sage、ConCCL)。
从 cluster 的交叉点看,几个 hybrid / adaptive 方向尚无人系统做:
Synthesis scope: target 1706.03762 vs 8 related entities (2301.04104, 2401.18059, 2402.06363, 2410.02367, 2412.14335, 2502.01563, 2502.05167, 2503.20215). Built 2026-07-21.