Language Models are Few-Shot Learners (GPT-3)

model 2005.14165 — Cross-paper Synthesis

GPT-3 (Language Models are Few-Shot Learners) — L3 相关性综合 #

1. 相关论文 #

GPT-3 [2005.14165] 作为 model 类别的奠基文本,与本簇 8 篇论文的关系可归为三条继承脉络,每一条都从 GPT-3 定义的原型(dense decoder-only + next-token 预训练 + in-context learning)分叉出去:

脉络 A — 效率化 / 架构进化(正统继承)

脉络 B — in-context learning 的病理学(能力继承 + 缺陷诊断)

脉络 C — instruction/priority 的缺位(安全继承)

2. 本篇 vs 相关论文的 delta #

维度GPT-3 (2005.14165)后续论文的 delta
核心贡献类型scale 本身即贡献;架构=vanilla GPT-2 [2005.14165]DeepSeek-V2 贡献是算法级效率(MLA/MoE)而非 scale [2405.04434]
Attentiondense MHA + 交替 banded-sparse [2005.14165]MLA 低秩联合压缩,cache=GQA-2.25 质量>MHA [2405.04434]
位置编码学习式绝对位置,2048 上限 [2005.14165]RoPE 成为默认;PCD 甚至把 RoPE 频率当可操纵的解码旋钮 [2506.08371]
对齐/后训练(base-model only,明确留给未来) [2005.14165]IH 用 SFT+RLHF 教特权 [2404.13208];DeepSeek-V2 用两阶段 GRPO [2405.04434]
长 context 利用声称 in-context learning 随 scale 变强,未测中间位置 [2005.14165]FilM 证明这是数据位置偏置而非能力 [2404.16811];2412.10079 加测"证据间距"第二维退化 [2412.10079]
指令/数据边界无任何隔离;prompt 是单一 token 流ISE 加 4×D segment 表 [2410.09102];SEP 证明越大越差 [2403.06833]

最尖锐的 delta(矛盾):GPT-3 的中心论点是"更大 = 更好的 meta-learner,few-shot gap 随 scale widens" [2005.14165]SEP 直接反驳了这一 scaling 单调性的一个侧面:在指令/数据隔离度上,同族越大的模型隔离越差——GPT-3.5 (56.6%) > GPT-4 (20.8%)、Gemma-2B (73.2%) > Gemma-7B (56.9%) [2403.06833]

矛盾根源:两者测的是不同的能力方向。GPT-3 的 scaling 收益衡量的是"完成 prompt 里任务的能力"(task superposition 是优点);SEP 衡量的是"拒绝执行数据位任务的能力"(task superposition 恰是缺陷)。SEP 作者明确归因于"任务叠加"——大模型更能同时执行两个任务 [2403.06833]两者在各自度量上都正确:GPT-3 的"越大越会做任务"与 SEP 的"越大越不会不做任务"是同一 in-context 机制的一体两面。GPT-3 的表述(scaling 全面向好)过于乐观,因为它从未把"该不该执行"作为评测轴。

3. 可攻击面 #

针对 GPT-3 具体 claim 的对抗性反驳,用本簇证据支撑:

  1. "few-shot gap 随 scale 单调 widens"过度外推。GPT-3 用 $L=2.57\,C^{-0.048}$ 的 loss 幂律为"下游能力也会持续变好"背书 [2005.14165]。但 loss 幂律只保证平均交叉熵下降,不保证任何具体能力单调。反例遍布本簇:SEP 上隔离度随 scale 反向 [2403.06833];GPT-3 自己也承认 WiC 停在 49.4%(chance)、ANLI 抗 scale [2005.14165]攻击点:GPT-3 把"loss 可预测"偷换成"能力可预测",而 §6 论证链第 3 步("if loss predicts downstream ability")的这个 if 本身就是未验证的桥梁 [2005.14165]
    1. "train≈val ⇒ 收益是泛化非记忆"的论证有盲区。GPT-3 用 Fig 4.1 训练/验证曲线几乎重叠来论证"gap 来自难度而非过拟合" [2005.14165]。但 in-context learning 的真正污染风险不在 corpus 记忆,而在 prompt 内位置偏置——2412.10079 证明模型对 prompt 中段证据系统性丢失 [2412.10079],2404.16811 证明这是训练数据自身的位置偏置(自回归 loss 近距离主导 + system message 恒在开头)[2404.16811]。GPT-3 的 few-shot 分数在 2048 短 ctx 下没暴露此问题,但其"in-context learning 是通用机制"的结论被这些工作证否——它只在信息位于 prompt 边缘时可靠。
      1. "in-context learning 是无副作用的免费适配"忽略了安全代价。GPT-3 把"forward-pass only、不改权重"当作 in-context learning 的优点 [2005.14165]。但正因为不改权重、prompt 平权进 attention,GPT-3 结构上无法区分"我的指令"和"数据里的指令"。IH 论证这正是 prompt injection/jailbreak/extraction 三类攻击的共同根因:"lack of instruction privileges,所有指令都跑在 kernel mode" [2404.13208]。ISE 进一步指出 GPT-3 式的 token embedding 只编码"语义+顺序",根本没有 role/priority 通道 [2410.09102]攻击点:GPT-3 引以为傲的"纯 context 适配"是一个 unpatched 的安全设计缺陷。
        1. banded-sparse attention 的可复现性缺口。GPT-3 唯一的架构偏离是"交替 dense / locally-banded sparse attention",但 §7 承认公开配置里没有这个细节,vLLM 的 GPT-2 复刻是 dense-only [2005.14165]。对比 DeepSeek-V2 完全开源权重 + 训练框架细节 [2405.04434],GPT-3 的"175B 复刻"实际上不可能 bit-level 忠实。
        2. 4. 生态位 #

          范式转变定位:GPT-3 是 LLM 领域的范式奠基点(paradigm anchor),而非某条技术路线上的一环。它确立的三件事定义了此后所有 model 类论文的默认前提:(1) decoder-only + next-token 预训练是通用底座;(2) scale 是一等公民;(3) prompt = 通用任务接口(in-context learning)。本簇 8 篇全部默认继承前两条,第三条则被反复修补。

          采纳证据

          • 架构 DNA 的延续:DeepSeek-V2 / Qwen3-Omni 的主干仍是 GPT-3 式 decoder(pre-norm、GeLU/SwiGLU FFN、weight-tied head 的直系变体)[2405.04434][2509.17765],改的是 attention/FFN/位置模块而非拓扑。
          • 评测协议的延续:FilM/2412.10079 用的 zero/few-shot prompting 协议直接来自 GPT-3 的三档评测设计 [2005.14165]
          • 缺陷驱动的整个子领域:IH/ISE/SEP 三篇的存在本身,就是 GPT-3 "prompt 平权 token 流"设计遗留问题催生出的安全子领域。

          生态位判定:GPT-3 处于生态位的根节点——它不与任何一篇竞争(它比所有 8 篇都早 4–6 年),而是被所有人当作 baseline、default backbone 或 problem statement。它的"过时"恰恰是采纳成功的证据:dense MHA + 绝对位置 + 无对齐今天已全被取代,但取代它的每个模块都以"改进 GPT-3 的某个具体选择"来定义自己。

          5. 未探索方向 #

          从本簇的组合中浮现的、GPT-3 时代未触及的杂交/自适应方向:

          1. MLA × in-context 长 ctx 利用的联合分析。DeepSeek-V2 的 MLA 把 KV 压到 latent space [2405.04434],而 PCD 假设"高频 RoPE 管 local、低频管 global" [2506.08371]。MLA 的低秩瓶颈是否会改变这种频率分工,从而放大或消除 lost-in-the-middle?没人测过压缩 KV 的模型上位置偏置的形态——PCD 自己把这列为开放问题("频率分工假设在 MoE/混合架构上是否成立")[2506.08371]
            1. 把"指令特权"做进位置/segment embedding 而非训练。IH 靠 SFT+RLHF 教特权 [2404.13208],ISE 靠加 segment 表 [2410.09102]。但 GPT-3 的绝对位置 embedding 本就是一张可学习的表——能否直接把 role/priority 折进位置编码几何(类似 TM-RoPE 把 temporal/height/width 分频 [2509.17765]),让"指令来自 system 位"成为位置先验而非训练目标?这是 segment embedding 与位置编码的未探索杂交。
              1. 数据位置均匀化(IN2)应用于安全隔离数据。IN2 的 load-bearing insight 是"把 gold segment 位置的均匀分布做进训练数据" [2404.16811]。SEP 显示指令误执行率对探针位置极敏感(四向放置消位置偏置)[2403.06833]。把 IN2 式的位置均匀 reject-sampling 用于隔离训练数据——让"数据位指令"在所有位置等概率出现——可能比 IH 的固定 system/user/tool 层级更鲁棒。无人尝试。
                1. base-model scaling 与对齐 tax 的联合曲线。GPT-3 只发布 base、明确拒绝对齐 [2005.14165];DeepSeek-V2 报告了 RL 的选择性 alignment tax(BBH −1.6 但 code/math +)[2405.04434],Qwen3-Omni 报告 Thinking 变体反而恶化 ASR/music [2509.17765]。GPT-3 的"scaling 单调向好"从未与"对齐后能力重分布"放在同一坐标系。一个把 base scaling law 与 post-training capability shift 统一的 Pareto 分析,是 GPT-3 幂律的自然但缺失的续集。
                  1. 多跳 in-context 的"证据聚簇"训练。2412.10079 发现 adjacent > separated(证据紧邻优于分散)1–7pp [2412.10079],并建议 serving 侧加 evidence-clustering reranker [2412.10079]。但这纯是 inference-time 补丁。把"gold 证据间距"也做成 IN2 式的训练随机化维度——同时随机化绝对位置相对间距——是消除 lost-in-between 的训练侧方向,两篇长 ctx 论文都未合流至此。