本篇是一个 frontier 密集模型的完整训练配方 + technical report,它把 pre-training scaling law、data
curation、和 SFT→rejection-sampling→DPO 对齐链条打包成一套可复现叙事。八个被指派的 peer 表面同属
algorithm 类,实则分成三条真正相关的连线,外加若干"共享底层机制但主题正交"的对照组:
A. 对齐范式 / preference optimization 连线(最相关)
[2503.20215],且同为团队自撰的 technical report。两篇是"用 DPO 替代 RL 做
production 对齐"这一趋势的两个独立数据点。
actor-critic)[2301.04104]。它是"复杂 RL 也能鲁棒"的反命题,与 Llama 3
"简单 offline DPO 就够"的赌注正面对撞。
B. RoPE / 位置编码与长上下文连线(机制相关)
[2502.01563]。Llama 3 把 RoPE base $\theta$ 从 10000 拉到 500000
[2407.21783],这直接改变了该论文所分析的频率衰减结构。
声称值 [2502.05167]。它是对 Llama 3 "0.1% 长上下文数据即可 128K"乐观叙事的外部
审计。
C. 弱相关 / 底层机制对照(主题正交,仅作生态位参照)
"同为 Transformer 上的 post-training 工程"层面相关。
并行 / MFU 问题 [2407.21783] 的更底层剖面,但一个是训练系统 characterization,
一个是模型配方。
方法论无重叠。
诚实标注:C 组四篇在 KB 里被归为 algorithm 同类,但与本篇的真实 delta 极薄。下文 §2–§5
的重心放在 A、B 两组,对 C 组只做生态位定位,避免制造虚假的"跨论文对比"。
| 维度 | Llama 3 (2407.21783) | Qwen2.5-Omni (2503.20215) | DreamerV3 (2301.04104) |
|---|---|---|---|
| 对齐方法 | 6 轮 RM→SFT→DPO | ICL warmup → 单轮 DPO | 想象空间 actor-critic (on-policy RL) |
| 偏好来源 | RM 打分 + 人工 edit 三元组 | 自动指标 (WER + pause) 排序 | 环境 reward,世界模型想象 |
| DPO 稳定化 trick | mask 格式 token + 0.2·NLL on chosen | 无公开 trick | N/A(不是 DPO) |
| 域 | 通用文本对齐 | 语音 codec token | 决策 / 控制 |
free bits / 百分位回报归一化) 让 RL 鲁棒到无需逐域调参"[2301.04104]。
Llama 3 的立场恰恰相反——它主动回避 RL 的调参脆弱性,选 DPO 因其"compute 更省、IFEval 更好"
[2407.21783]。两篇对"RL 是否值得"给出相反答案,但领域不同(详见 §7 冲突分析)。
"offline preference loss 正在取代 PPO"的行业收敛。Qwen 的增量是把 DPO 用到 speech codec token
上并用自动指标 (WER) 而非 RM 打分构造偏好对 [2503.20215]——这是 Llama 3
RM-based pipeline 的一个更轻量、更可自动化的变体。
[2407.21783],而 2502.01563 指出正是 RoPE 低频维度承载了上下文理解
[2502.01563]。delta:Llama 3 只把 $\theta$ 当超参调,2502.01563 揭示了调它
会移动 massive-value 分布——一个 Llama 3 未意识到的机制后果。
[2407.21783],NoLiMa 则用去词面匹配的 needle 证明包括 Llama 3.3 70B
在内的模型在 32K 时联想检索能力崩溃 [2502.05167]。delta:Llama 3 的
"128K 达标"基于 needle-in-haystack 式(高词面重叠)评测,NoLiMa 是对这类乐观结论的证伪性外部审计。
SageAttention / ConCCL / RAPTOR / StruQ 与本篇不共享方法论,delta 无法在"同一问题上谁更好"的意义上
定义。它们与 Llama 3 的关系是互补而非竞争:Llama 3 产出模型,它们分别加速其推理
[2410.02367]、优化其训练通信 [2412.14335]、增强其检索、防御其注入。
bound [2407.21783]。四个数量级外推($10^{22}\to3.8\times10^{25}$ FLOPs)依赖
loss-vs-token 曲率不变的假设,一旦 off-regime 曲率变化即失效。对手可问:为什么"slightly"没有量化?
若实际偏差 5%,flagship 尺寸决策可能就错了。
law 的 step 2 (NLL→accuracy) 需要 Llama 2 全家族作为 anchor [2407.21783]。
攻击点:这不是"简单可复现",而是"只有已在牌桌上的玩家才能复现"——配方本身把新入场者排除在外。
[2407.21783],但 DreamerV3 证明结构化 RL 在长程决策上不可替代
[2301.04104]。Llama 3 的"DPO 够用"只在单步对齐语境成立,不能外推到 agentic /
多步 RL。
[2502.05167],直接质疑 Llama 3 "0.1% 数据 128K 达标"的评测充分性。
90% effective time 是该窗口的均值,不保证整个训练周期或更大规模(32K→64K GPU)线性外推。
MoE / 复杂 RLHF 成为学术热点时,押注 dense Transformer + DPO + 数据/规模/复杂度管理三杠杆
[2407.21783]。这一"boring architecture, disciplined engineering"哲学与
DreamerV3 的"one config fits all domains"哲学 [2301.04104] 精神同源:都把
鲁棒性/可复现性置于新颖性之上,只是一个在 LLM 训练、一个在 RL。
说明这是行业级收敛而非孤例。权重开源(8B/70B/405B)使 Llama 3 成为下游工作的默认底座——本 cluster
里 NoLiMa 直接测 Llama 3.3 70B [2502.05167]、Massive Values 分析 Llama3-8B
[2502.01563],都以 Llama 为分析对象,这本身就是生态位统治力的证据。
[2503.20215]),也不覆盖推理/训练系统层(SageAttention / ConCCL)。它是**模型层
的中心节点**,周边论文围绕它做加速、审计、扩展。
[2301.04104]。agentic LLM 需要两者——用 DPO 稳定单步风格、用 world-model RL
规划多步任务。cluster 里两条线尚未交叉。
[2407.21783],2502.01563 给出了 massive value 分布的机制
[2502.01563]。未探索:以"保护 CK 上下文通道"为约束反向选择 $\theta$ 与长上下文
数据配比,而非纯经验试错。
评测为准 [2407.21783];若改用 NoLiMa 的 latent-association 指标
[2502.05167] 作训练/验证目标,可能得到真正抗 attention-dilution 的数据混合。
Qwen2.5-Omni 证明自动指标 (WER) 可替代 RM 打分 [2503.20215]。未探索:把可验证
信号(代码执行、数学 correctness)直接作为通用文本 DPO 的自动偏好来源,跳过 RM。
与 2502.01563 的 massive-value 分析同源。若在 pre-training 阶段就 shape massive value 分布,可能同时
优化下游量化友好性与上下文理解——一个训练×推理的跨层组合,cluster 里无人做。