同族不同尺寸 LLM 的 KV cache 之间存在大量线性结构:用 500 条 FineWeb-Edu 序列、按 target 的每个 (layer, head) 做闭式 ridge,就能让接收方直接从发送方的 KV 解码、完全跳过 prefill。六对中四对保住 target 自身 73–98% 精度、比 re-prefill 快 2.7–25$\times$;另两对崩到 42–44%。成败由残差落在 attention 敏感子空间的位置决定,而非残差大小。
生产 serving 同时被两个趋势挤压:agentic 会话让 prompt 随轮次累积;cost-quality cascading / 会话中途切换 / routing 让请求在同一模型家族的不同尺寸之间跳转。两者相乘的结果是——每次换模型,接收方都要把已累积的全部上下文重新 prefill 一遍,而 prefill 成本同时随模型规模和 prompt 长度增长。prefix caching 只在单模型内部有效,跨模型完全不复用。
论文把这件事化归成一个表示问题:既然 prefill 的产物就是 KV cache,那么跨模型复用就等价于「把 A 模型的 KV 变换成 B 模型期待的格式」。难点在于 source 与 target 的层数、hidden dim、KV head 配置都可能不同。已有的跨模型 KV 复用路线全都要么需要梯度训练、要么要求架构完全相同:

论文 Table 6(Appendix A),原表:C2C 训练 per-pair neural fuser;LatentAlign 学 per-model 的共享潜空间 adapter;IAM 替换的是小模型的 attention pattern 而不是 KV 值;DroidSpeak 只在架构完全一致的模型之间共享 KV。
这张表是全文的立论起点:四个准则(gradient-free / cross-scale / 传的是 KV 值 / 闭式)中,本文声称自己是唯一同时满足四项的。真正的空白不是「没人做过跨模型 KV 复用」,而是没人检验过这个关系是否简单到根本不需要训练。注意 DroidSpeak 那两个 "—" 按脚注是「不适用」而非「不具备」,所以这张表的信息量集中在 gradient-free 与 closed-form 两列。
核心技术壁垒——不是 ridge 求解本身(那是几十行代码),而是知道该用哪个标量来筛选一对模型能不能转:把 mapper 的 K 残差投影到 target 每个 head 的 query 矩阵 $\mathbf{Q}_h$ 的右奇异向量上、按对应奇异值平方加权,得到 K-concentration;把 V 残差按 ground-truth attention 权重平方加权,得到 V-concentration。这套诊断要求同时拿到 target 的 per-head query 与真值 attention 权重,并且必须在评测域而非校准域的 token 上计算——同一个 mapper 在校准域 $R^{2}_{K}{=}0.84$、在 HellaSwag token 上却是 $-7.81$,用错域会把结论完全颠倒。

论文 Figure 1,原图(caption: "Cross-model KV cache transfer pipeline. A per-head linear map converts the source's prefilled KV cache into the target's expected format, so the target decodes without re-prefilling.")。
要看的是这条流水线上被删掉的东西:target 的整个 transformer body 前向被一组 per-layer 批量 matmul 替代,target 从映射后的 cache 直接进 decode。这也解释了后面延迟表的量级——省下的不是常数开销,而是接收方一次完整 prefill。

论文 Figure 3,原图(caption: "Per-head linear mapper. For each target $(l,h)$, the top-$k$ source layers (selected per target layer by head-averaged $R^{2}$) are concatenated. Independent ridge regressions $\mathbf{W}_{K}^{l,h}$ and $\mathbf{W}_{V}^{l,h}$ project to the target's K and V spaces. No parameters are shared across heads or between K and V.")。
caption 里那句显式的否定最关键:head 之间、K 与 V 之间都不共享任何参数。参数量因此是 $2\,L_{t}\,n_{\text{kv}}^{t}\,(k\,n_{\text{kv}}^{s}\,d_{h}^{s})\,d_{h}^{t}$,实测 1.01–3.36 B、落盘 4–12 GB——比很多小模型本身还大。另一处容易看漏的是:设计矩阵的输入宽度是 $k \cdot n_{\text{kv}}^{s} \cdot d_{h}^{s}$,即选中层的所有 head,不是同序号 head 的那一片。
K 与 V 走的是两条不同长度的通路,图 3 没有把 RoPE 的往返画出来:
三段式夹心(逆旋转 → content 空间线性映射 → 重旋转)之所以代价可忽略,是因为 $\mathbf{R}_{\Theta}$ 正交,$\mathbf{R}_{\Theta}^{-1}=\mathbf{R}_{\Theta}^{\top}$,逆变换精确且几乎免费。source 与 target 的 RoPE 配置允许不同,这是「同一份权重跨上下文长度复用」这一主张的形式基础。
无形式化作者证明 — 仅实证。 全文没有定理、命题或收敛性/样本复杂度界;Eq 1 里的 $\approx$ 从未被量化。以下是符号表、方程的物理含义,以及六项可自查的一致性检验。
| 符号 | 含义 |
|---|---|
| $\mathcal{S},\mathcal{T}$ | source / target 模型,层数 $L_{s}$ / $L_{t}$ |
| $n_{\text{kv}}^{s},n_{\text{kv}}^{t}$ | source / target 的 KV head 数 |
| $d_{h}^{s},d_{h}^{t}$ | source / target 的 per-head 维度 |
| $\mathbf{K}_{s}^{l,h},\mathbf{V}_{s}^{l,h}\in\mathbb{R}^{T\times d_{h}^{s}}$ | source 第 $l$ 层第 $h$ 头的 key / value |
| $\mathcal{C}_{\mathcal{S}},\mathcal{C}_{\mathcal{T}},\hat{\mathcal{C}}_{\mathcal{T}}$ | source 全量 cache / target 真值 cache / 映射得到的 cache |
| $\mathbf{X}_{K}^{l},\mathbf{X}_{V}^{l}$ | target 第 $l$ 层的 K / V 设计矩阵,宽度 $d_{s}=k\,n_{\text{kv}}^{s}\,d_{h}^{s}$ |
| $\mathbf{W}_{K}^{l,h},\mathbf{b}_{K}^{l,h}$ | per-head ridge 权重与偏置 |
| $\lambda=0.01$ | Tikhonov 强度 |
| $N\approx128\text{K}$ | 每个 target head 的 token 级观测数 |
| $\mathbf{R}_{\Theta}(t)$ | 位置 $t$ 的 RoPE 旋转(正交) |
| $k$ | 每个 target 层选用的 source 层数 |
成功判据(Eq 1)
$$m\bigl(\mathcal{T}(\mathbf{x};\hat{\mathcal{C}}_{\mathcal{T}})\bigr)\;\approx\;m\bigl(\mathcal{T}(\mathbf{x};\mathcal{C}_{\mathcal{T}})\bigr)$$
判据下在指标层而非张量层——论文刻意不要求 $\hat{\mathcal{C}}_{\mathcal{T}}$ 逐元素接近 $\mathcal{C}_{\mathcal{T}}$。这一步是后来「$R^{2}$ 是错的标量」那条论证的形式种子:如果一开始就把重构误差写进目标,$R^{2}$ 失效就会变成自相矛盾。
探针(Eq 2)
$$\hat{C}_{t}^{l,h}=C_{s}^{l^{\prime},h}\,\mathbf{W}+\mathbf{b},\qquad\mathbf{W}\in\mathbb{R}^{d_{h}^{s}\times d_{h}^{t}},\ \mathbf{b}\in\mathbb{R}^{d_{h}^{t}}$$
单 source 层、单 head、单 cache 类型、无正则的最简 OLS。故意做得这么弱,是为了让高 $R^{2}$ 不能被归因于模型容量。
生产映射与其闭式解(Eq 3–4)
$$\hat{\mathbf{K}}_{t}^{l,h}=\mathbf{X}_{K}^{l}\mathbf{W}_{K}^{l,h}+\mathbf{b}_{K}^{l,h},\qquad\hat{\mathbf{V}}_{t}^{l,h}=\mathbf{X}_{V}^{l}\mathbf{W}_{V}^{l,h}+\mathbf{b}_{V}^{l,h},\qquad\mathbf{W}^{*}=(\mathbf{X}^{\top}\mathbf{X}+\lambda\mathbf{I})^{-1}\mathbf{X}^{\top}\mathbf{Y}$$
ridge 在这里的定位是条件化而不是容量控制:top-$k$ 选出的 source 层按构造互相高度相关(它们是因为各自都能预测同一个 target 才被选中的),$\mathbf{X}^{\top}\mathbf{X}$ 因此接近奇异。求解前对 $\mathbf{X},\mathbf{Y}$ 中心化,偏置事后还原为 $\mathbf{b}=\bar{\mathbf{Y}}-\bar{\mathbf{X}}\mathbf{W}^{*}$,使 $\lambda$ 不会惩罚截距。
RoPE 往返
$$\hat{\mathbf{K}}_{t}=\bigl(\mathbf{K}_{s}\,\mathbf{R}_{\Theta_{s}}^{-1}(t)\,\mathbf{W}_{K}+\mathbf{b}_{K}\bigr)\,\mathbf{R}_{\Theta_{t}}(t),\qquad \mathbf{R}_{\Theta}^{-1}=\mathbf{R}_{\Theta}^{\top}$$
校准时的回归目标 $\mathbf{Y}$ 也是从 target 真值 key 里剥掉 target RoPE 得来的,所以 $\mathbf{W}_{K}$ 全程在位置无关空间里拟合。剥离必须在拟合与推理两端对称施加。
参数量、拟合主项、车队规模
$$\text{params}=2\,L_{t}\,n_{\text{kv}}^{t}\,(k\,n_{\text{kv}}^{s}\,d_{h}^{s})\,d_{h}^{t},\qquad \text{fit}=\mathcal{O}(N d_{s}^{2}),\qquad \text{ordered pairs}=P(P-1)$$
前两式说明一件对 serving 很关键的事:mapper 体积与拟合成本都不随序列长度或 cache 大小增长,只由 target 深度/head 数与 $k$ 决定。
最想要而全文没有的,是把重构侧标量与下游指标连起来的界:给定 attention-output cosine $c$,target 的任务指标退化至多多少?论文自己证明了 $R^{2}$ 做不到这件事,然后用一个 $n{=}12$ 的相关系数把 cosine 顶上去——这是把一个失败的代理换成一个更好的代理,而不是给出保证。其次缺的是可辨识性讨论:top-$k$ 层按构造共线,$\mathbf{W}^{*}$ 在共线方向上并不唯一确定,而 mapper 的输出恰恰要喂进对方向敏感的 attention。

论文 Figure 2,原图(caption: "Cross-model KV exhibits substantial linear structure. Each heatmap cell shows head-averaged $R^{2}$ from a single-source linear regression mapping source layer $l^{\prime}$ (row) to target layer $l$ (column), for raw keys ($K_{\text{rope}}$), RoPE-stripped keys ($K_{\text{stripped}}$), and values ($V$).")。行=source 层,列=target 层,格值=head-averaged $R^{2}$。
四个定性结论都能从图上直接读出:对角线明显高于零;模型越近对角线越锐(架构与深度差距会把对应关系「摊开」);剥掉 RoPE 后对角线普遍变锐;K 比 V 好预测约 0.2 个 $R^{2}$。
但要注意三个数字是不同的量,论文自己在 Appendix B 里把它们对齐过:热图单格峰值 $K_{\text{stripped}}$ $R^{2}{=}0.81$(Qwen3 14B→32B)挑的是最好预测的那个 (source, target) 层对;逐 target 层取最优单源再跨层平均只有 0.56;$k{=}8$ 聚合才回到 0.79。摘要里「one source layer explains 56%」用的是第二个量,$\S2.3$ 展示的却是第一个量。此外这些 $R^{2}$ 全是 in-sample 的。
还有一处方法论落差论文明确披露了:Figure 5 的多源证据用的是 greedy forward selection(逐步加入使联合 $R^{2}$ 增益最大的层),而出厂 mapper 用的是固定 top-$k$、按单源 head-averaged $R^{2}$ 排序。两者只被声称在定性结论上一致,没有量化对比。

论文 Table 1,原表:per-benchmark 列是 retention(= transfer accuracy / target standalone accuracy),Avg 与 Avg$_{\text{fn}}$ 分别是 retention 与 floor-normalized retention 的均值。
Tier 1 四对 73–98%,Tier 2 两对 42–44%——但真正的分化在 floor-normalized 列:Tier 2 掉到 14.7% / 11.1%。原因是 Ministral 两个失败对在 MMLU 上的绝对准确率是 25.25 与 24.73,而 MMLU 的随机基线就是 25%;3B→14B 的 floor-normalized MMLU retention 是 $-0.5$%。在那个 benchmark 上,转移过来的 cache 携带的可用任务信息不多于「没有信息」。raw retention 之所以还能给出 32% 这种数字,纯粹是因为它拿 25% 的随机地板去除以 77% 的 target 分数。论文报了 Avg$_{\text{fn}}$、也用 Table 14 的双锚点校准过这个度量(被削弱的 $k{=}1$ mapper 得 35.1 / $-0.5$),这一点是可信的做法;但 Tier 2 的正确读法是「失败」而不是「保住四成」。
另一头也要压住。Qwen3 14B→32B 在 ARC-C 上 101.0%、在留出的 BoolQ 上 101.9%,绝对值是 61.60 vs 32B standalone 的 61.01。ARC-Challenge 约 1,172 题,0.59 pp 相当于 7 题,落在配对二项噪声内;Table 14 的 ground-truth 锚点在 ARC-C 上也正好是 100.0。所以该读作与 target 自己的 cache 打平,不是「近似重构打败了精确计算」。把它当作胜利来叙述会掩盖真正该问的问题——见下一段。
论文的 retention 全部以 target standalone 为分母。但 cascading / routing 场景里真实的对照是「不切换,继续用手上的小模型」。Table 13 同时印了 source standalone,把差值算出来(Tier 1 四对,transfer − source standalone,单位 pp):
| Pair | ARC-C | HellaSwag | WinoGrande | MMLU (5-shot) | GSM8K (8-shot CoT) | 五项均值 |
|---|---|---|---|---|---|---|
| Qwen3 14B→32B | $+1.11$ | $+1.83$ | $-0.32$ | $-0.77$ | $-4.02$ | $-0.43$ |
| Qwen3 8B→32B | $+0.51$ | $+3.67$ | $-1.19$ | $-2.68$ | $-26.16$ | $-5.17$ |
| Llama 3.1 8B→70B | $+1.11$ | $+1.71$ | $0.00$ | $-7.19$ | $-41.32$ | $-9.14$ |
| Ministral 3B→8B | $+0.85$ | $+2.68$ | $+0.87$ | $-13.76$ | $-50.26$ | $-11.92$ |
模式非常整齐:零样本分类类 benchmark 上升级确实有小幅正收益($+0.5$ 到 $+3.7$ pp),而 5-shot MMLU 与 8-shot CoT GSM8K 上四对全部大幅倒退,倒退幅度随对子变远而放大,以致四对的五项均值全为负。Llama 8B→70B 的 GSM8K 转移后只有 14.78,而 8B 自己就有 56.10。也就是说,按论文自己的附录数据,「小转大以提升质量」这个动机在需要长 few-shot prompt 或多步生成的任务上不成立。
一个反向证据值得同时记住:perplexity 显示映射后的 cache 确实带进了 target 的信息。Llama 8B→70B 转移 PPL 4.37 介于 8B 的 5.58 与 70B 的 2.47 之间;Qwen3 14B→32B 是 7.33,介于 7.63 与 6.79 之间。所以失败不是「cache 什么都没转过来」,而是退化集中在长 prompt 与长生成——正好对应论文自己列出的第一条 limitation:校准只用 1,024-token 的 FineWeb-Edu 散文。顺带一处可疑的巧合:Llama 8B→70B 的 WinoGrande 转移值与 8B standalone 完全相同(都是 63.14)。

论文 Table 2,原表:Full 为 $k{=}8$ + ridge + content-space;"$-$ inference RoPE" 只在推理端不重旋转,制造拟合-评测不匹配;"$-$ all RoPE" 是拟合与推理都保留 RoPE 的全耦合变体;最后两行再叠加去掉 cross-layer selection ($k{=}1$) 与 ridge。
三条内部张力必须一起读:
(a) RoPE 解耦的实测收益是零。 "$-$ all RoPE" 行与 Full 行在每一列都在噪声内(ARC-C 61.09 vs 61.60、HellaSwag 80.73 vs 80.70、GSM8K 90.98 vs 90.98、PPL 7.35 vs 7.33)。论文对此完全坦诚,理由改为「泛化」:解耦后的权重在位置无关空间里,因此跨 RoPE 配置、跨上下文长度按构造可用。这个理由被支持到什么程度? 建设性的一半成立:$\mathbf{R}_{\Theta}$ 正交、逆变换精确,所以在 1,024-token 上拟合的 content-space 权重形式上确实在任何 target RoPE 支持的位置有定义。但实证的一半完全缺失——没有任何实验在 1,024 token 上拟合、再在 8k/32k 上测精度;$\S4.7$ 的 32k 只测延迟。「耦合变体会被绑死在 1,024-token 位置分布上」这句话是断言,不是观测。结论:该部件是成本为零的保险(第 4 节检验 4:正交变换不丢信息),把它放进流水线是合理工程决策;但把它列为摘要三步法中的第二步,与「它在任何被测量的轴上都没有贡献」这一事实之间有真实落差。另外要注意 "$-$ inference RoPE" 行(MMLU 25.79、GSM8K 4.17)是拟合-推理不匹配的伪影,论文 caption 自己这么写;Figure 7 的叙述(「去掉推理端 RoPE 处理在 WinoGrande/MMLU/GSM8K 上代价最大」)读起来却像是在衡量该部件的价值,这两种读法不能混用。
(b) 消融是非单调的:在 $k{=}1$ 基础上再去掉 ridge,每一列都变好。 第 5 行 vs 第 4 行:ARC-C 36.43 vs 27.65、HellaSwag 62.26 vs 44.81、MMLU 51.26 vs 26.07、GSM8K 1.44 vs 0.38、PPL 9.86 vs 22.73。论文未置评。用论文自己给 ridge 的理由去推,能得到一个自洽的解释:ridge 存在的目的是在大 $k$ 下条件化近奇异的 $\mathbf{X}^{\top}\mathbf{X}$,那么在 $k{=}1$($d_{s}=1024$,超定比约 125$\times$、条件数良好)它至多应当无害。表里它却大幅有害。这说明 $\lambda{=}0.01$ 不是尺度无关的:它是隐式地按生产 $k$ 的 Gram 尺度定的,$k{=}1$ 时同一个 $\lambda$ 过度收缩,把 key/value 的范数压小、attention logit 变平(PPL 22.73 正是这种症状)。而 Table 8 的 $\lambda$ 扫描只在 $k{=}8$ 做过,$k{=}1$ 没有对应扫描。两个推论:第一,第 4 行的崩塌里有一部分是 $\lambda$ 失配而非 cross-layer 信息丢失,Table 2 因此高估了 cross-layer 部件的贡献幅度;第二,即便用条件更公平的第 5 行做对照(ARC-C 36.43 vs Full 61.60),cross-layer selection 依然是三个部件里唯一有大幅实测正贡献的那个——定性结论站得住,量化幅度不可直接引用。
(c) ridge 自身的实测贡献也接近零。 Table 8 在 $k{=}8$ 下 $\lambda{=}0$(纯 OLS)给 80.86,比生产的 80.73 还高 0.13 pp;崩塌只出现在 $\lambda{=}1$($-15.79$ pp)。所以在生产配置上 ridge 可有可无。把 (a)(b)(c) 合起来:摘要列出的三个部件中,只有 cross-layer source selection 有被测量到的正贡献,另两个分别是零收益的构造性保险与零收益的数值稳妥措施。校准协议的其余部分很稳健:$N$ 在 200 序列后基本平坦($N{=}50$ 也只差约 1.6 pp),域是唯一有真实代价的轴(CodeAlpaca $-5.24$ pp / HellaSwag,跨七个 benchmark 平均 95.9%,Wikipedia 99.4%)。

论文 Table 4,原表:$\Delta=\text{MLP}-\text{ridge}$。失败对上 ridge 的 $R^{2}_{K}$ 深度为负,MLP 把它拉回近零、压低 K-concentration、抬高 attention-output cosine、并恢复 HellaSwag retention。
配套的 Table 3(ridge vs MLP 的 HellaSwag retention):
| Pair | Ridge | MLP | $\Delta$ |
|---|---|---|---|
| Qwen3 14B→32B | 97.6% | 97.3% | $-0.3$ pp |
| Ministral 3B→8B | 93.3% | 91.8% | $-1.5$ pp |
| Ministral 3B→14B | 68.0% | 92.3% | $+24.3$ pp |
| Ministral 8B→14B | 58.7% | 95.5% | $+36.8$ pp |
论文的机制主张是:MLP 的收益来自把残差重新分布到 attention 读不到的方向(K-concentration 平均降约 2.5、cosine 平均升约 0.45),而不是把残差变小。支撑这一主张的两个跨对相关系数是 attention-output cosine $r{=}{+}0.57$、校准域 $R^{2}_{K}$ $r{=}{-}0.20$($n{=}12$)。
这条链上有三处需要如实记录:
最后一处仍然开放:$R^{2}_{K}{=}-7.81$(比预测均值还差)的 mapper 依然保住 68% HellaSwag retention。这既说明 HellaSwag 的 log-likelihood 打分对 cache 退化相当宽容,也说明「误差落点」这个解释框架还没有把这个量级的落差说透。

论文 Figure 4,原图:实线=target standalone,虚线=单轮选定 $k$ 下的 mapper(S→L $k{=}8$、L→S $k{=}20$),点线=多轮扫描会选出的 $k$。100 段对话、每段约 15 轮、五个领域。
S→L 的差距从第 1 轮到第 10 轮只扩大 1.7 pp,且扩大的原因是 32B 的天花板在上升而 mapper 持平;L→S 是线性漂移 0.33 pp/turn。论文自己压住了这个结论的适用范围:十轮内不会级联失效,但线性的 L→S 漂移在很长会话里仍会累积;而且这是单对评测。

论文 Figure 9,原图:8$\times$H100、bf16。mapper 在短序列近乎水平(固定 dispatch 成本主导),之后线性上升;re-prefill 在每一对、每一个序列长度上都高于 mapper。
Qwen3 14B$\leftrightarrow$32B 的具体值:S→L 在 64 / 8K / 32K token 上是 14.0 / 67.8 / 277.6 ms,对应 re-prefill 61.7 / 1154.8 / 6975.3 ms(4$\times$ / 17$\times$ / 25$\times$);L→S 是 3$\times$ / 5$\times$ / 7$\times$。七对全量测量下 70 个格子里 mapper 全部更快,摘要的 2.7–25$\times$ 正是各对区间的并集(下界来自 Ministral 3B→8B,上界来自 Qwen3 14B→32B)。
三处口径需要记住:延迟对比不含把映射后的 cache 送到 target 进程的开销;Ministral 的 re-prefill 只计语言模型解码体、不含 vision tower;mapper 跑在 eager 模式、没有 torch.compile 或 CUDA graph(这一条对 mapper 不利,短序列 14.0 ms 的地板里有 Python dispatch 与跨 GPU 传输)。此外这只是计算侧的账,服务侧还要背 1.01–3.36 B / 4–12 GB 的 mapper,且方向性使车队需要 $P(P-1)$ 个有序对(5 模型约 131 GB),换页的 80–480 ms 是按体积与带宽算出来的、不是测出来的。
$k$ 是在也用于报告结果的 log-likelihood benchmark 上选的。论文用留一 benchmark 重选来界定这种乐观:18 折里 12 折 $k$ 不变,被留出 benchmark 的准确率最多移动 2.49 pp(均值 0.30 pp,且移动时总是向下),最大那个 2.49 pp 出现在 Tier 2 的 Ministral 8B→14B,四个 Tier 1 对最多 1.45 pp。另外在三个从未参与选择的 benchmark(PIQA / BoolQ / ARC-Easy)上,Tier 1 四对均值 $\geq$ 96.8%、Tier 2 两对 63.7% / 59.3%,层级结构复现。
两处披露与正文口径的落差要记下:正文说选择准则覆盖四个 benchmark,但 Appendix H 说 WinoGrande 在这六对的多数 $k$ 上缺失,实际 argmax 只在 ARC-C / HellaSwag / MMLU 三项上做;Ministral 3B→8B 表中的 "(all)" 是对数据驱动 argmax($k{=}20$,差 0.38 pp)的人工覆盖,这一点在附录披露、Table 1 里没有标记。留出集 retention「对每一对都不低于 in-sample retention」这个方向与通常的选择偏差方向相反,论文归因于 PIQA/ARC-Easy 本身更容易,这个解释合理但未被单独验证。
| # | 论点 | 依据 | 内部张力 / 成立程度 |
|---|---|---|---|
| 1 | 换模型的代价可归约为一个表示映射问题 | prefill 的产物就是 KV cache($\S1$);成功判据下在指标层而非张量层(Eq 1) | 成立。把判据放在指标层是后续「$R^{2}$ 是错标量」不自相矛盾的前提 |
| 2 | 该关系有大量线性结构,故闭式拟合足够 | 单源 OLS 探针,$K_{\text{stripped}}$ 单格峰值 $R^{2}{=}0.81$(Fig 2);$k{=}8$ 层平均 0.79 | 三个不同的 $R^{2}$ 量(单格峰值 0.81 / 逐层最优单源均值 0.56 / $k{=}8$ 聚合 0.79)在不同位置被引用;全为 in-sample。更根本的是第 6 步会证明 $R^{2}$ 不预测转移质量,使这一步支撑的是「可重构」而非「可转移」 |
| 3 | 单个 source 层不够,需 top-$k$ 跨层聚合 | greedy forward selection 曲线(Fig 5);$k{=}1$→$k{=}8$ 使 K $R^{2}$ 0.5572→0.7914;$k{=}1$ 下游普遍崩塌(Fig 6, Table 2) | 成立,且是三个部件里唯一有大幅实测正贡献者。但证据用 greedy joint 选择、出厂用固定 top-$k$ 单源排序,两算法只被声称定性一致;且 Table 2 第 4 行的崩塌幅度被 $\lambda$ 失配放大(见第 4 步) |
| 4 | RoPE 污染拟合,应在 content 空间映射 | Fig 2 中 $K_{\text{stripped}}$ 对角线比 $K_{\text{rope}}$ 更锐;$\mathbf{R}_{\Theta}$ 正交故往返精确 | 实测收益为零:Table 2 "$-$ all RoPE" 每列都在 Full 的噪声内。泛化理由的建设性部分成立(正交、位置无关),实证部分完全缺失(无「1k 拟合、32k 测精度」实验;$\S4.7$ 的 32k 只测延迟)。净评价:零成本保险,作为摘要三步之一被列出与其零实测贡献之间有落差 |
| 5 | 消融显示各部件贡献可分离 | Table 2 五行顺序移除 | 非单调:在 $k{=}1$ 上再去掉 ridge,五列全部变好(PPL 22.73→9.86)。与论文给 ridge 的理由(条件化大 $k$ 下的近奇异 Gram)相冲突,最自洽的解释是 $\lambda{=}0.01$ 隐式按生产 $k$ 定标、$k{=}1$ 下过度收缩;$\lambda$ 扫描只在 $k{=}8$ 做过。后果:cross-layer 部件的量化幅度被高估,且 $\lambda{=}0$ 在 $k{=}8$ 比生产还好 0.13 pp 意味着 ridge 本身实测贡献也约为零 |
| 6 | 六对结果两极 ⇒ matched-KV 必要不充分,需要别的解释变量 | Tier 1 73–98% vs Tier 2 42–44%(Table 1);参数比 8.8$\times$ 的 Llama 进 Tier 1、1.8$\times$ 的 Ministral 8B→14B 崩掉(Table 10) | 成立且重要:架构距离不排序结果。但 Tier 2 在 MMLU 上是 25.25 / 24.73 对 25% 地板、floor-normalized 到 11–15%(MMLU 甚至 $-0.5$%),正确读法是失败而非「保住四成」 |
| 7 | 决定成败的是残差落点而非大小;cosine 优于 $R^{2}$ | K/V-concentration 定义;MLP 使 K-conc $-2.5$、cosine $+0.45$、HS $+24.3/+36.8$ pp(Table 4);$r{=}{+}0.57$ vs $r{=}{-}0.20$($n{=}12$) | 排序证据清楚,但:$R^{2}$ 相关符号为负且它正是第 2 步的证据货币;$n{=}12$ 时 0.05 临界值约 0.576,$+0.57$ 恰在线上且 12 点由 6 对 × 2 方向构成、非独立;论文自己表里有反例(Ministral 3B→8B 两个机制量都改善却掉 1.5 pp),故机制被降级为条件性陈述;$R^{2}_{K}{=}-7.81$ 仍保住 68% retention 这一落差仍未解释 |
| 8 | 非线性 MLP 可修复失败对 | Table 3 的 $+24.3$ / $+36.8$ pp | 是修复而非普遍升级:MLP 在两个 Tier 1 对上分别输 0.3 / 1.5 pp。且 MLP 需要梯度训练,等于放弃了本文相对 C2C/LatentAlign 的 gradient-free 差异点——在最需要它的两对上,四准则表里的第一列不再成立 |
| 9 | 因此跨模型 KV 转移在生产上可用 | 2.7–25$\times$ 加速(70/70 格全胜);十轮 CoQA 漂移小;mapper 不必常驻 GPU | 计算侧成立,服务侧账未结清:不含 cache 搬运、Ministral 排除 vision tower、mapper 跑 eager(不利于自己);$P(P-1)$ 有序对使 5 模型车队约 131 GB,80–480 ms 换页是算出来的不是测的(且第 4 节检验 1 表明权重按 fp32 存,若改 bf16 可减半);L→S 的 0.33 pp/turn 是线性漂移,长会话仍会累积 |
| 10 | 结论:应把跨模型 mapper 的评价标准从重构指标转向子空间感知诊断 | $\S6$ | 方法论层面这是本文最站得住的贡献,且它是自我削弱的——它同时说明本文自己用来立论的 $R^{2}$ 证据不足以支撑可转移性。另一条论文未展开的账:以 source standalone 为基线时($\S5.3$ 的推导),四个 Tier 1 对的五项均值全为负($-0.43$ 到 $-11.92$ pp),退化集中在 5-shot 与 CoT 生成,与「校准只用 1k-token 散文」这条 limitation 一致 |
[实现未公开] —— 论文未给出代码仓库、脚本或权重发布地址。以下是从 $\S3$、$\S4.1$、Appendix D/E/G 拼出的复现清单,按「照抄即可」与「容易漏」分开。
| 项 | 值 | |
|---|---|---|
| 校准数据 | FineWeb-Edu,500 序列 × 1,024 token,stride 4 ⇒ 每个 target head 约 128K 个 token 级观测 | |
| ridge | $\lambda=0.01$;$\lambda{=}0$ 与 $10^{-4}$ 同样可用,$\lambda{=}1$ 崩($-15.79$ pp) | |
| 精度 | 前向 bf16、协方差 fp32、分析 fp64;权重落盘按 fp32(由参数量与 GB 反推) | |
| 源特征维度 | $d_{s}=k\cdot n_{\text{kv}}^{s}\cdot d_{h}^{s}$(跨 head 拼接) | |
| $k$ 扫描 | $\{1,2,4,6,8,10,12,16,20,24,\text{all}\}$,按 ARC-C / HellaSwag / MMLU 的算术平均取 argmax,近似并列时偏向大 $k$ | |
| MLP 对照 | 每 (target layer, head, K$\ | $V):Linear($d_{s}$,1024) → ReLU → Linear(1024,1024) → ReLU → Linear(1024,$d_{h}^{t}$);Adam,lr $10^{-3}$,20 epoch,MSE,batch 4,096 |
| 拟合成本 | 单 8$\times$H100 节点,47–87 min/pair(Qwen3 8B→32B 47、14B→32B 52、Llama 8B→70B 50、Ministral 3B→8B 75、3B→14B 84、8B→14B 87) | |
| 评测口径 | lm-evaluation-harness 默认;ARC-C / HellaSwag 用 acc_norm,WinoGrande / MMLU / GSM8K 用 acc;MMLU 5-shot、GSM8K 8-shot CoT,其余 zero-shot;HellaSwag/MMLU 16 路分片、ARC-C 4 路 | |
| 延迟测量 | 8$\times$H100 + NVLink,bf16,50 warmup / 30 计时;re-prefill 用 flash_attention_2 且不含 LM head;mapper 跑 eager,无 torch.compile / CUDA graph | |
| perplexity 协议 | WikiText-2 切成不重叠的 2,048-token 块,用前 1,024 token 的 prefix KV(自身前向或经 mapper)去打后 1,024 token 的分 |
真正难复制的不是闭式解——$(\mathbf{X}^{\top}\mathbf{X}+\lambda\mathbf{I})^{-1}\mathbf{X}^{\top}\mathbf{Y}$ 谁都写得出来,而且论文自己的消融表明三个部件里两个的实测贡献约为零。难复制的是诊断量的构造与它的适用域:把 K 残差投到 target per-head query 矩阵 $\mathbf{Q}_h$ 的右奇异向量上、按对应奇异值平方加权,再除以全分量平均误差,得到 K-concentration($>1$ 表示误差落在 attention 会读的方向上);V 侧按真值 attention 权重平方加权同理。要算它就必须能拿到 target 的 per-head query 与真值 attention 权重,还必须在评测域 token 上算——同一个 mapper 的校准域 $R^{2}_{K}$ 是 0.84、评测域是 $-7.81$,域选错会把结论整个翻过来。这套诊断是本文唯一无法靠工程直觉绕过、且能迁移到其他跨模型映射工作上的东西;论文对它的定位(跨对预测有效、$n{=}12$ 下 $r{=}{+}0.57$)目前也只到「比 $R^{2}$ 好」,而不是一个可依赖的部署前筛选器——它需要先把 mapper 拟合出来才能计算,这一点论文在 future work 里自己点明了。