Cross-Model KV Cache Transfer in LLM Families: A Closed-Form Linear Mapping for Prefill Reuse

algorithm 2608.03893
kv-cachecross-model-transferprefill-reuseridge-regressionropemodel-routing

Cross-Model KV Cache Transfer in LLM Families — L2 #

1. TL;DR #

同族不同尺寸 LLM 的 KV cache 之间存在大量线性结构:用 500 条 FineWeb-Edu 序列、按 target 的每个 (layer, head) 做闭式 ridge,就能让接收方直接从发送方的 KV 解码、完全跳过 prefill。六对中四对保住 target 自身 73–98% 精度、比 re-prefill 快 2.7–25$\times$;另两对崩到 42–44%。成败由残差落在 attention 敏感子空间的位置决定,而非残差大小。


2. Q1 / Q2 / Q3 #

Q1 — 痛点:换模型就得重付一次 prefill #

生产 serving 同时被两个趋势挤压:agentic 会话让 prompt 随轮次累积;cost-quality cascading / 会话中途切换 / routing 让请求在同一模型家族的不同尺寸之间跳转。两者相乘的结果是——每次换模型,接收方都要把已累积的全部上下文重新 prefill 一遍,而 prefill 成本同时随模型规模和 prompt 长度增长。prefix caching 只在单模型内部有效,跨模型完全不复用。

论文把这件事化归成一个表示问题:既然 prefill 的产物就是 KV cache,那么跨模型复用就等价于「把 A 模型的 KV 变换成 B 模型期待的格式」。难点在于 source 与 target 的层数、hidden dim、KV head 配置都可能不同。已有的跨模型 KV 复用路线全都要么需要梯度训练、要么要求架构完全相同:

Table 6: 跨模型 KV cache transfer 方法的四准则对比

论文 Table 6(Appendix A),原表:C2C 训练 per-pair neural fuser;LatentAlign 学 per-model 的共享潜空间 adapter;IAM 替换的是小模型的 attention pattern 而不是 KV 值;DroidSpeak 只在架构完全一致的模型之间共享 KV。

这张表是全文的立论起点:四个准则(gradient-free / cross-scale / 传的是 KV 值 / 闭式)中,本文声称自己是唯一同时满足四项的。真正的空白不是「没人做过跨模型 KV 复用」,而是没人检验过这个关系是否简单到根本不需要训练。注意 DroidSpeak 那两个 "—" 按脚注是「不适用」而非「不具备」,所以这张表的信息量集中在 gradient-free 与 closed-form 两列。

Q2 — 方法:三个部件拼出的闭式 per-head 映射 #

  1. Per-head ridge:对 target 每个 (layer $l$, head $h$) 独立拟合一个仿射映射,K 与 V 各一套、不共享任何参数;用 $\lambda=0.01$ 的 Tikhonov 项做数值条件化,一次矩阵求逆出解,无反向传播。
  2. Cross-layer source selection:每个 target 层按 head-averaged $R^{2}$ 挑 top-$k$ 个 source 层,把这些层的全部 KV head 横向拼成设计矩阵。同一 target 层内所有 head 共享同一组 source 层——这既让信息跨 head 流动,也让 Gram 矩阵 $\mathbf{X}^{\top}\mathbf{X}$ 每层只算一次、被该层所有 head 复用。
  3. Content-space mapping:先用 source 的 RoPE 逆旋转把 key 剥回位置无关的 content 空间,在该空间做线性映射,再用 target 的 RoPE 重新旋转回去。V 不带位置编码,直接映射、跳过整条 RoPE 通路。
  4. 核心技术壁垒——不是 ridge 求解本身(那是几十行代码),而是知道该用哪个标量来筛选一对模型能不能转:把 mapper 的 K 残差投影到 target 每个 head 的 query 矩阵 $\mathbf{Q}_h$ 的右奇异向量上、按对应奇异值平方加权,得到 K-concentration;把 V 残差按 ground-truth attention 权重平方加权,得到 V-concentration。这套诊断要求同时拿到 target 的 per-head query 与真值 attention 权重,并且必须在评测域而非校准域的 token 上计算——同一个 mapper 在校准域 $R^{2}_{K}{=}0.84$、在 HellaSwag token 上却是 $-7.81$,用错域会把结论完全颠倒。

    Q3 — 结果:两级分化 + 一个被推翻的诊断量 #

    • 六对 matched-KV pair 里四对(Qwen3 14B→32B、Qwen3 8B→32B、Llama 3.1 8B→70B、Ministral 3B→8B)保住 target standalone 的 73–98%(五 benchmark 平均),两对(Ministral 3B→14B、8B→14B)掉到 42–44%、floor-normalized 后只剩 11–15%。
    • 把 ridge 换成同数据训练的 per-head MLP,在两个失败对上把 HellaSwag retention 拉回 $+24.3$ / $+36.8$ pp;但在两个成功对上 MLP 反而输给 ridge($-0.3$ / $-1.5$ pp)。
    • 校准域 $R^{2}_{K}$ 与 HellaSwag retention 的 Pearson 相关是 $-0.20$(符号是反的),attention-output cosine 是 $+0.57$(12 个 pair-direction 评测)。
    • Qwen3 14B$\leftrightarrow$32B 上,mapper 比 re-prefill 快 4–25$\times$(S→L)/ 3–7$\times$(L→S);七对全量测量下界 2.7$\times$。CoQA 十轮交替切换的漂移在两个方向上都很小(S→L 十轮共 1.7 pp,L→S 线性 0.33 pp/turn)。

    3. 架构 / 方法图 #

    Figure 1: 跨模型 KV cache transfer 的整体流水线

    论文 Figure 1,原图(caption: "Cross-model KV cache transfer pipeline. A per-head linear map converts the source's prefilled KV cache into the target's expected format, so the target decodes without re-prefilling.")。

    要看的是这条流水线上被删掉的东西:target 的整个 transformer body 前向被一组 per-layer 批量 matmul 替代,target 从映射后的 cache 直接进 decode。这也解释了后面延迟表的量级——省下的不是常数开销,而是接收方一次完整 prefill。

    Figure 3: per-head 线性 mapper 的内部结构

    论文 Figure 3,原图(caption: "Per-head linear mapper. For each target $(l,h)$, the top-$k$ source layers (selected per target layer by head-averaged $R^{2}$) are concatenated. Independent ridge regressions $\mathbf{W}_{K}^{l,h}$ and $\mathbf{W}_{V}^{l,h}$ project to the target's K and V spaces. No parameters are shared across heads or between K and V.")。

    caption 里那句显式的否定最关键:head 之间、K 与 V 之间都不共享任何参数。参数量因此是 $2\,L_{t}\,n_{\text{kv}}^{t}\,(k\,n_{\text{kv}}^{s}\,d_{h}^{s})\,d_{h}^{t}$,实测 1.01–3.36 B、落盘 4–12 GB——比很多小模型本身还大。另一处容易看漏的是:设计矩阵的输入宽度是 $k \cdot n_{\text{kv}}^{s} \cdot d_{h}^{s}$,即选中层的所有 head,不是同序号 head 的那一片。

    K 与 V 走的是两条不同长度的通路,图 3 没有把 RoPE 的往返画出来:

    flowchart LR S["source prefilled cache"] --> K1["keys K_rope"] S --> V1["values V"] K1 --> K2["strip source RoPE by R_s inverse"] K2 --> K3["concat top-k layers, all heads: X_K"] K3 --> K4["ridge W_K per target head"] K4 --> K5["re-encode with target RoPE R_t"] V1 --> V3["concat top-k layers, all heads: X_V"] V3 --> V4["ridge W_V per target head"] K5 --> T["target decodes, no prefill"] V4 --> T

    三段式夹心(逆旋转 → content 空间线性映射 → 重旋转)之所以代价可忽略,是因为 $\mathbf{R}_{\Theta}$ 正交,$\mathbf{R}_{\Theta}^{-1}=\mathbf{R}_{\Theta}^{\top}$,逆变换精确且几乎免费。source 与 target 的 RoPE 配置允许不同,这是「同一份权重跨上下文长度复用」这一主张的形式基础。


    4. 作者证明 #

    无形式化作者证明 — 仅实证。 全文没有定理、命题或收敛性/样本复杂度界;Eq 1 里的 $\approx$ 从未被量化。以下是符号表、方程的物理含义,以及六项可自查的一致性检验。

    符号表 #

    符号含义
    $\mathcal{S},\mathcal{T}$source / target 模型,层数 $L_{s}$ / $L_{t}$
    $n_{\text{kv}}^{s},n_{\text{kv}}^{t}$source / target 的 KV head 数
    $d_{h}^{s},d_{h}^{t}$source / target 的 per-head 维度
    $\mathbf{K}_{s}^{l,h},\mathbf{V}_{s}^{l,h}\in\mathbb{R}^{T\times d_{h}^{s}}$source 第 $l$ 层第 $h$ 头的 key / value
    $\mathcal{C}_{\mathcal{S}},\mathcal{C}_{\mathcal{T}},\hat{\mathcal{C}}_{\mathcal{T}}$source 全量 cache / target 真值 cache / 映射得到的 cache
    $\mathbf{X}_{K}^{l},\mathbf{X}_{V}^{l}$target 第 $l$ 层的 K / V 设计矩阵,宽度 $d_{s}=k\,n_{\text{kv}}^{s}\,d_{h}^{s}$
    $\mathbf{W}_{K}^{l,h},\mathbf{b}_{K}^{l,h}$per-head ridge 权重与偏置
    $\lambda=0.01$Tikhonov 强度
    $N\approx128\text{K}$每个 target head 的 token 级观测数
    $\mathbf{R}_{\Theta}(t)$位置 $t$ 的 RoPE 旋转(正交)
    $k$每个 target 层选用的 source 层数

    方程与物理含义 #

    成功判据(Eq 1)

    $$m\bigl(\mathcal{T}(\mathbf{x};\hat{\mathcal{C}}_{\mathcal{T}})\bigr)\;\approx\;m\bigl(\mathcal{T}(\mathbf{x};\mathcal{C}_{\mathcal{T}})\bigr)$$

    判据下在指标层而非张量层——论文刻意不要求 $\hat{\mathcal{C}}_{\mathcal{T}}$ 逐元素接近 $\mathcal{C}_{\mathcal{T}}$。这一步是后来「$R^{2}$ 是错的标量」那条论证的形式种子:如果一开始就把重构误差写进目标,$R^{2}$ 失效就会变成自相矛盾。

    探针(Eq 2)

    $$\hat{C}_{t}^{l,h}=C_{s}^{l^{\prime},h}\,\mathbf{W}+\mathbf{b},\qquad\mathbf{W}\in\mathbb{R}^{d_{h}^{s}\times d_{h}^{t}},\ \mathbf{b}\in\mathbb{R}^{d_{h}^{t}}$$

    单 source 层、单 head、单 cache 类型、无正则的最简 OLS。故意做得这么弱,是为了让高 $R^{2}$ 不能被归因于模型容量。

    生产映射与其闭式解(Eq 3–4)

    $$\hat{\mathbf{K}}_{t}^{l,h}=\mathbf{X}_{K}^{l}\mathbf{W}_{K}^{l,h}+\mathbf{b}_{K}^{l,h},\qquad\hat{\mathbf{V}}_{t}^{l,h}=\mathbf{X}_{V}^{l}\mathbf{W}_{V}^{l,h}+\mathbf{b}_{V}^{l,h},\qquad\mathbf{W}^{*}=(\mathbf{X}^{\top}\mathbf{X}+\lambda\mathbf{I})^{-1}\mathbf{X}^{\top}\mathbf{Y}$$

    ridge 在这里的定位是条件化而不是容量控制:top-$k$ 选出的 source 层按构造互相高度相关(它们是因为各自都能预测同一个 target 才被选中的),$\mathbf{X}^{\top}\mathbf{X}$ 因此接近奇异。求解前对 $\mathbf{X},\mathbf{Y}$ 中心化,偏置事后还原为 $\mathbf{b}=\bar{\mathbf{Y}}-\bar{\mathbf{X}}\mathbf{W}^{*}$,使 $\lambda$ 不会惩罚截距。

    RoPE 往返

    $$\hat{\mathbf{K}}_{t}=\bigl(\mathbf{K}_{s}\,\mathbf{R}_{\Theta_{s}}^{-1}(t)\,\mathbf{W}_{K}+\mathbf{b}_{K}\bigr)\,\mathbf{R}_{\Theta_{t}}(t),\qquad \mathbf{R}_{\Theta}^{-1}=\mathbf{R}_{\Theta}^{\top}$$

    校准时的回归目标 $\mathbf{Y}$ 也是从 target 真值 key 里剥掉 target RoPE 得来的,所以 $\mathbf{W}_{K}$ 全程在位置无关空间里拟合。剥离必须在拟合与推理两端对称施加。

    参数量、拟合主项、车队规模

    $$\text{params}=2\,L_{t}\,n_{\text{kv}}^{t}\,(k\,n_{\text{kv}}^{s}\,d_{h}^{s})\,d_{h}^{t},\qquad \text{fit}=\mathcal{O}(N d_{s}^{2}),\qquad \text{ordered pairs}=P(P-1)$$

    前两式说明一件对 serving 很关键的事:mapper 体积与拟合成本都不随序列长度或 cache 大小增长,只由 target 深度/head 数与 $k$ 决定。

    六项一致性检验 #

    1. 维度与参数量自洽(通过,并反推出未披露的量)。把 Qwen3 32B 的 $L_{t}=64$、$n_{\text{kv}}=8$、$d_h=128$、$k=8$ 代入参数量公式得 $2\cdot64\cdot8\cdot8192\cdot128=1.074\times10^{9}$,与 Table 12 的 1.07 B 精确吻合;Llama 70B 取 $L_{t}=80,k=20$ 得 $3.355\times10^{9}$,对上 3.36 B。反向解 Ministral 3 14B 得 $L_{t}=40$。再用「参数量 × 4 B」换算落盘体积:1.07 B→4.0 GiB、1.61 B→6.0 GiB、3.36 B→12.5 GiB,与表中 4 / 6 / 12 GB 全部对齐——也就是说 mapper 是 fp32 存储的,尽管前向是 bf16。这一点论文没写,却直接决定 Appendix D 那个 80–480 ms 的 host-to-device 换页估计(若改存 bf16,体积与换页时间都减半)。
    2. 恒等极限(通过)。当 source 与 target 是同一个模型、$\Theta_s=\Theta_t$ 时,$\mathbf{W}=\mathbf{I},\mathbf{b}=0$ 落在假设类内,映射精确还原真值 cache。评测侧也有对应锚点:Table 14 里 target 自己的 ground-truth cache 走同一套评测管线得 99.9/99.9,说明管线本身没有系统性偏置。
    3. $k$ 的单调极限(通过,但收益递减)。in-sample $R^{2}$ 随 $k$ 单调升:K 0.5572 ($k{=}1$) → 0.7914 ($k{=}8$) → 0.8451 (all),V 0.3249 → 0.6541 → 0.7645。$k{=}6$ 已达 $k{=}$all 的 92.3% (K) / 87.7% (V)。参数量与落盘却线性于 $k$,所以 $k$ 是精度-存储的直接旋钮。
    4. 正交性与信息守恒(通过)。$\mathbf{R}_{\Theta}$ 正交 ⇒ 剥离与重旋转不丢信息、逆等于转置。这使 content-space 变换是零成本可选项——即使它不带来精度收益,也不带来精度损失,只增加一次转置。这一点在评估第 4 条论证时很重要。
    5. 超定程度(部分通过,暴露一个未扫的区域)。每个 target head 有 $N\approx128$K 个观测(500 序列 × 1024 token,stride-4 = 128K,自洽)。$k{=}8$ 时 $d_{s}=8\cdot8\cdot128=8192$,超定比约 15.6$\times$——这正是论文所说 $\lambda$ 与 $N$ 有宽平坦区的原因。但 $k{=}$all 时(Qwen3 8B 源 36 层)$d_{s}\approx36{,}864$,超定比掉到约 3.5$\times$;Ministral 3B→8B 的生产配置恰好就是 $k{=}$all。论文的全部校准敏感性扫描(Table 8)都在 $k{=}8$ 做的,也就是在条件数最好的那一档;条件数最差的生产配置没有对应的 $\lambda$ 扫描。
    6. 成本核算(通过,量级合理)。Gram 矩阵每 target 层算一次、层内所有 head 共享,故拟合时间对 target head 数呈亚线性。$k{=}8$ 时单层 $\mathcal{O}(Nd_{s}^{2})\approx1.28\times10^{5}\times6.7\times10^{7}\approx8.6\times10^{12}$ MAC,64 层约 $5.5\times10^{14}$;实测 8$\times$H100 上 47–87 min/pair,考虑到协方差用 fp32、分析用 fp64,量级自洽。换页估计也对得上:4 GB / 50 GB/s = 80 ms,12 GB / 25 GB/s = 480 ms。车队规模 $\sim$6.5 GB $\times P(P-1)$ 给出 $P=3,4,5$ 时 39 / 78 / 130 GB,与论文的 39 / 79 / 131 一致。
    7. 缺了什么保证 #

      最想要而全文没有的,是把重构侧标量与下游指标连起来的界:给定 attention-output cosine $c$,target 的任务指标退化至多多少?论文自己证明了 $R^{2}$ 做不到这件事,然后用一个 $n{=}12$ 的相关系数把 cosine 顶上去——这是把一个失败的代理换成一个更好的代理,而不是给出保证。其次缺的是可辨识性讨论:top-$k$ 层按构造共线,$\mathbf{W}^{*}$ 在共线方向上并不唯一确定,而 mapper 的输出恰恰要喂进对方向敏感的 attention。


      5. 实验与数据 #

      5.1 线性结构:证据本身比标题弱一档 #

      Figure 2: 逐层 R^2 热图,K_rope / K_stripped / V 三个面板

      论文 Figure 2,原图(caption: "Cross-model KV exhibits substantial linear structure. Each heatmap cell shows head-averaged $R^{2}$ from a single-source linear regression mapping source layer $l^{\prime}$ (row) to target layer $l$ (column), for raw keys ($K_{\text{rope}}$), RoPE-stripped keys ($K_{\text{stripped}}$), and values ($V$).")。行=source 层,列=target 层,格值=head-averaged $R^{2}$。

      四个定性结论都能从图上直接读出:对角线明显高于零;模型越近对角线越锐(架构与深度差距会把对应关系「摊开」);剥掉 RoPE 后对角线普遍变锐;K 比 V 好预测约 0.2 个 $R^{2}$。

      但要注意三个数字是不同的量,论文自己在 Appendix B 里把它们对齐过:热图单格峰值 $K_{\text{stripped}}$ $R^{2}{=}0.81$(Qwen3 14B→32B)挑的是最好预测的那个 (source, target) 层对;逐 target 层取最优单源再跨层平均只有 0.56;$k{=}8$ 聚合才回到 0.79。摘要里「one source layer explains 56%」用的是第二个量,$\S2.3$ 展示的却是第一个量。此外这些 $R^{2}$ 全是 in-sample 的。

      还有一处方法论落差论文明确披露了:Figure 5 的多源证据用的是 greedy forward selection(逐步加入使联合 $R^{2}$ 增益最大的层),而出厂 mapper 用的是固定 top-$k$、按单源 head-averaged $R^{2}$ 排序。两者只被声称在定性结论上一致,没有量化对比。

      5.2 主结果:两级分化,且 floor normalization 才看得清 #

      Table 1: 六对 matched-KV pair 在各自选定 k 下的 retention

      论文 Table 1,原表:per-benchmark 列是 retention(= transfer accuracy / target standalone accuracy),Avg 与 Avg$_{\text{fn}}$ 分别是 retention 与 floor-normalized retention 的均值。

      Tier 1 四对 73–98%,Tier 2 两对 42–44%——但真正的分化在 floor-normalized 列:Tier 2 掉到 14.7% / 11.1%。原因是 Ministral 两个失败对在 MMLU 上的绝对准确率是 25.25 与 24.73,而 MMLU 的随机基线就是 25%;3B→14B 的 floor-normalized MMLU retention 是 $-0.5$%。在那个 benchmark 上,转移过来的 cache 携带的可用任务信息不多于「没有信息」。raw retention 之所以还能给出 32% 这种数字,纯粹是因为它拿 25% 的随机地板去除以 77% 的 target 分数。论文报了 Avg$_{\text{fn}}$、也用 Table 14 的双锚点校准过这个度量(被削弱的 $k{=}1$ mapper 得 35.1 / $-0.5$),这一点是可信的做法;但 Tier 2 的正确读法是「失败」而不是「保住四成」。

      另一头也要压住。Qwen3 14B→32B 在 ARC-C 上 101.0%、在留出的 BoolQ 上 101.9%,绝对值是 61.60 vs 32B standalone 的 61.01。ARC-Challenge 约 1,172 题,0.59 pp 相当于 7 题,落在配对二项噪声内;Table 14 的 ground-truth 锚点在 ARC-C 上也正好是 100.0。所以该读作与 target 自己的 cache 打平,不是「近似重构打败了精确计算」。把它当作胜利来叙述会掩盖真正该问的问题——见下一段。

      5.3 被忽略的基线:为什么不干脆继续用小模型? #

      论文的 retention 全部以 target standalone 为分母。但 cascading / routing 场景里真实的对照是「不切换,继续用手上的小模型」。Table 13 同时印了 source standalone,把差值算出来(Tier 1 四对,transfer − source standalone,单位 pp):

      PairARC-CHellaSwagWinoGrandeMMLU (5-shot)GSM8K (8-shot CoT)五项均值
      Qwen3 14B→32B$+1.11$$+1.83$$-0.32$$-0.77$$-4.02$$-0.43$
      Qwen3 8B→32B$+0.51$$+3.67$$-1.19$$-2.68$$-26.16$$-5.17$
      Llama 3.1 8B→70B$+1.11$$+1.71$$0.00$$-7.19$$-41.32$$-9.14$
      Ministral 3B→8B$+0.85$$+2.68$$+0.87$$-13.76$$-50.26$$-11.92$

      模式非常整齐:零样本分类类 benchmark 上升级确实有小幅正收益($+0.5$ 到 $+3.7$ pp),而 5-shot MMLU 与 8-shot CoT GSM8K 上四对全部大幅倒退,倒退幅度随对子变远而放大,以致四对的五项均值全为负。Llama 8B→70B 的 GSM8K 转移后只有 14.78,而 8B 自己就有 56.10。也就是说,按论文自己的附录数据,「小转大以提升质量」这个动机在需要长 few-shot prompt 或多步生成的任务上不成立。

      一个反向证据值得同时记住:perplexity 显示映射后的 cache 确实带进了 target 的信息。Llama 8B→70B 转移 PPL 4.37 介于 8B 的 5.58 与 70B 的 2.47 之间;Qwen3 14B→32B 是 7.33,介于 7.63 与 6.79 之间。所以失败不是「cache 什么都没转过来」,而是退化集中在长 prompt 与长生成——正好对应论文自己列出的第一条 limitation:校准只用 1,024-token 的 FineWeb-Edu 散文。顺带一处可疑的巧合:Llama 8B→70B 的 WinoGrande 转移值与 8B standalone 完全相同(都是 63.14)。

      5.4 组件消融:三个部件里只有一个有实测正贡献 #

      Table 2: Qwen3 14B→32B 上的组件消融

      论文 Table 2,原表:Full 为 $k{=}8$ + ridge + content-space;"$-$ inference RoPE" 只在推理端不重旋转,制造拟合-评测不匹配;"$-$ all RoPE" 是拟合与推理都保留 RoPE 的全耦合变体;最后两行再叠加去掉 cross-layer selection ($k{=}1$) 与 ridge。

      三条内部张力必须一起读:

      (a) RoPE 解耦的实测收益是零。 "$-$ all RoPE" 行与 Full 行在每一列都在噪声内(ARC-C 61.09 vs 61.60、HellaSwag 80.73 vs 80.70、GSM8K 90.98 vs 90.98、PPL 7.35 vs 7.33)。论文对此完全坦诚,理由改为「泛化」:解耦后的权重在位置无关空间里,因此跨 RoPE 配置、跨上下文长度按构造可用。这个理由被支持到什么程度? 建设性的一半成立:$\mathbf{R}_{\Theta}$ 正交、逆变换精确,所以在 1,024-token 上拟合的 content-space 权重形式上确实在任何 target RoPE 支持的位置有定义。但实证的一半完全缺失——没有任何实验在 1,024 token 上拟合、再在 8k/32k 上测精度;$\S4.7$ 的 32k 只测延迟。「耦合变体会被绑死在 1,024-token 位置分布上」这句话是断言,不是观测。结论:该部件是成本为零的保险(第 4 节检验 4:正交变换不丢信息),把它放进流水线是合理工程决策;但把它列为摘要三步法中的第二步,与「它在任何被测量的轴上都没有贡献」这一事实之间有真实落差。另外要注意 "$-$ inference RoPE" 行(MMLU 25.79、GSM8K 4.17)是拟合-推理不匹配的伪影,论文 caption 自己这么写;Figure 7 的叙述(「去掉推理端 RoPE 处理在 WinoGrande/MMLU/GSM8K 上代价最大」)读起来却像是在衡量该部件的价值,这两种读法不能混用。

      (b) 消融是非单调的:在 $k{=}1$ 基础上再去掉 ridge,每一列都变好。 第 5 行 vs 第 4 行:ARC-C 36.43 vs 27.65、HellaSwag 62.26 vs 44.81、MMLU 51.26 vs 26.07、GSM8K 1.44 vs 0.38、PPL 9.86 vs 22.73。论文未置评。用论文自己给 ridge 的理由去推,能得到一个自洽的解释:ridge 存在的目的是在大 $k$ 下条件化近奇异的 $\mathbf{X}^{\top}\mathbf{X}$,那么在 $k{=}1$($d_{s}=1024$,超定比约 125$\times$、条件数良好)它至多应当无害。表里它却大幅有害。这说明 $\lambda{=}0.01$ 不是尺度无关的:它是隐式地按生产 $k$ 的 Gram 尺度定的,$k{=}1$ 时同一个 $\lambda$ 过度收缩,把 key/value 的范数压小、attention logit 变平(PPL 22.73 正是这种症状)。而 Table 8 的 $\lambda$ 扫描只在 $k{=}8$ 做过,$k{=}1$ 没有对应扫描。两个推论:第一,第 4 行的崩塌里有一部分是 $\lambda$ 失配而非 cross-layer 信息丢失,Table 2 因此高估了 cross-layer 部件的贡献幅度;第二,即便用条件更公平的第 5 行做对照(ARC-C 36.43 vs Full 61.60),cross-layer selection 依然是三个部件里唯一有大幅实测正贡献的那个——定性结论站得住,量化幅度不可直接引用。

      (c) ridge 自身的实测贡献也接近零。 Table 8 在 $k{=}8$ 下 $\lambda{=}0$(纯 OLS)给 80.86,比生产的 80.73 还高 0.13 pp;崩塌只出现在 $\lambda{=}1$($-15.79$ pp)。所以在生产配置上 ridge 可有可无。把 (a)(b)(c) 合起来:摘要列出的三个部件中,只有 cross-layer source selection 有被测量到的正贡献,另两个分别是零收益的构造性保险与零收益的数值稳妥措施。校准协议的其余部分很稳健:$N$ 在 200 序列后基本平坦($N{=}50$ 也只差约 1.6 pp),域是唯一有真实代价的轴(CodeAlpaca $-5.24$ pp / HellaSwag,跨七个 benchmark 平均 95.9%,Wikipedia 99.4%)。

      5.5 机制:$R^{2}$ 被自己的证据链推翻 #

      Table 4: ridge 换成 MLP 后的 per-pair 变化(全部在 HellaSwag token 上测量)

      论文 Table 4,原表:$\Delta=\text{MLP}-\text{ridge}$。失败对上 ridge 的 $R^{2}_{K}$ 深度为负,MLP 把它拉回近零、压低 K-concentration、抬高 attention-output cosine、并恢复 HellaSwag retention。

      配套的 Table 3(ridge vs MLP 的 HellaSwag retention):

      PairRidgeMLP$\Delta$
      Qwen3 14B→32B97.6%97.3%$-0.3$ pp
      Ministral 3B→8B93.3%91.8%$-1.5$ pp
      Ministral 3B→14B68.0%92.3%$+24.3$ pp
      Ministral 8B→14B58.7%95.5%$+36.8$ pp

      论文的机制主张是:MLP 的收益来自把残差重新分布到 attention 读不到的方向(K-concentration 平均降约 2.5、cosine 平均升约 0.45),而不是把残差变小。支撑这一主张的两个跨对相关系数是 attention-output cosine $r{=}{+}0.57$、校准域 $R^{2}_{K}$ $r{=}{-}0.20$($n{=}12$)。

      这条链上有三处需要如实记录:

      1. 符号方向的问题。 $R^{2}$ 与 retention 的相关是的——拟合得更好,跨对来看反而略微对应转移更差。麻烦在于 $\S2.3$ 那个「跨模型 KV 有大量线性结构」的头条证据本身就是用 $R^{2}$ 表述的。论文的调和方式是区分作用域:$R^{2}$ 在对内(选 source 层)有效、跨对无效,并且明说了这一立场,但没有给出为什么同一标量会有这种作用域切换的理由。它带来的实质后果是:线性结构的证据说明的是可重构性,而不是可转移性——Table 4 里 $R^{2}_{K}{=}-7.81$ 的 mapper 保住 68% HellaSwag,而 $\S4.5$ 提到 $R^{2}_{K}{=}0.84$ 的 Llama 反向只保住 37%,$R^{2}$ 既非必要也非充分。「线性结构 ⇒ ridge 够用」这条设计论证因此比它看起来的弱,尽管最终结论靠下游指标独立成立。
      2. 统计功效。 $n{=}12$、$df{=}10$ 时双侧 $\alpha{=}0.05$ 的临界相关系数约为 0.576,$r{=}{+}0.57$ 恰好压在线上;论文未报置信区间。而且 12 个点是 6 对 × 2 个方向,同一对的两个方向并非独立样本。cosine 优于 $R^{2}$ 的排序证据是清楚的,但「cosine 可作为部署前筛选标量」的强度被这两点限制住了。
      3. 论文自己表里的反例。 Ministral 3B→8B 在两个机制变量上都改善(K-conc $-0.45$、cosine $+0.07$),HellaSwag 却掉了 1.5 pp。论文明确承认「重分布本身不充分,只有当错放的误差大到起约束作用时才会改变下游」。这个补丁使机制陈述变成条件性的,同时也意味着该机制目前不能用作预测工具。另外 MLP 在两个 Tier 1 对上都输给 ridge,所以「非线性扩展」是修复手段而非普遍升级。
      4. 最后一处仍然开放:$R^{2}_{K}{=}-7.81$(比预测均值还差)的 mapper 依然保住 68% HellaSwag retention。这既说明 HellaSwag 的 log-likelihood 打分对 cache 退化相当宽容,也说明「误差落点」这个解释框架还没有把这个量级的落差说透。

        5.6 多轮切换与延迟 #

        Figure 4: Qwen3 14B↔32B 在 CoQA 上十轮交替切换的 F1

        论文 Figure 4,原图:实线=target standalone,虚线=单轮选定 $k$ 下的 mapper(S→L $k{=}8$、L→S $k{=}20$),点线=多轮扫描会选出的 $k$。100 段对话、每段约 15 轮、五个领域。

        S→L 的差距从第 1 轮到第 10 轮只扩大 1.7 pp,且扩大的原因是 32B 的天花板在上升而 mapper 持平;L→S 是线性漂移 0.33 pp/turn。论文自己压住了这个结论的适用范围:十轮内不会级联失效,但线性的 L→S 漂移在很长会话里仍会累积;而且这是单对评测。

        Figure 9: mapper 应用(实线)vs target re-prefill(虚线)随序列长度变化

        论文 Figure 9,原图:8$\times$H100、bf16。mapper 在短序列近乎水平(固定 dispatch 成本主导),之后线性上升;re-prefill 在每一对、每一个序列长度上都高于 mapper。

        Qwen3 14B$\leftrightarrow$32B 的具体值:S→L 在 64 / 8K / 32K token 上是 14.0 / 67.8 / 277.6 ms,对应 re-prefill 61.7 / 1154.8 / 6975.3 ms(4$\times$ / 17$\times$ / 25$\times$);L→S 是 3$\times$ / 5$\times$ / 7$\times$。七对全量测量下 70 个格子里 mapper 全部更快,摘要的 2.7–25$\times$ 正是各对区间的并集(下界来自 Ministral 3B→8B,上界来自 Qwen3 14B→32B)。

        三处口径需要记住:延迟对比不含把映射后的 cache 送到 target 进程的开销;Ministral 的 re-prefill 只计语言模型解码体、不含 vision tower;mapper 跑在 eager 模式、没有 torch.compile 或 CUDA graph(这一条对 mapper 不利,短序列 14.0 ms 的地板里有 Python dispatch 与跨 GPU 传输)。此外这只是计算侧的账,服务侧还要背 1.01–3.36 B / 4–12 GB 的 mapper,且方向性使车队需要 $P(P-1)$ 个有序对(5 模型约 131 GB),换页的 80–480 ms 是按体积与带宽算出来的、不是测出来的。

        5.7 超参选择的诚实度 #

        $k$ 是在也用于报告结果的 log-likelihood benchmark 上选的。论文用留一 benchmark 重选来界定这种乐观:18 折里 12 折 $k$ 不变,被留出 benchmark 的准确率最多移动 2.49 pp(均值 0.30 pp,且移动时总是向下),最大那个 2.49 pp 出现在 Tier 2 的 Ministral 8B→14B,四个 Tier 1 对最多 1.45 pp。另外在三个从未参与选择的 benchmark(PIQA / BoolQ / ARC-Easy)上,Tier 1 四对均值 $\geq$ 96.8%、Tier 2 两对 63.7% / 59.3%,层级结构复现。

        两处披露与正文口径的落差要记下:正文说选择准则覆盖四个 benchmark,但 Appendix H 说 WinoGrande 在这六对的多数 $k$ 上缺失,实际 argmax 只在 ARC-C / HellaSwag / MMLU 三项上做;Ministral 3B→8B 表中的 "(all)" 是对数据驱动 argmax($k{=}20$,差 0.38 pp)的人工覆盖,这一点在附录披露、Table 1 里没有标记。留出集 retention「对每一对都不低于 in-sample retention」这个方向与通常的选择偏差方向相反,论文归因于 PIQA/ARC-Easy 本身更容易,这个解释合理但未被单独验证。


        6. 论证链 #

        #论点依据内部张力 / 成立程度
        1换模型的代价可归约为一个表示映射问题prefill 的产物就是 KV cache($\S1$);成功判据下在指标层而非张量层(Eq 1)成立。把判据放在指标层是后续「$R^{2}$ 是错标量」不自相矛盾的前提
        2该关系有大量线性结构,故闭式拟合足够单源 OLS 探针,$K_{\text{stripped}}$ 单格峰值 $R^{2}{=}0.81$(Fig 2);$k{=}8$ 层平均 0.79三个不同的 $R^{2}$ 量(单格峰值 0.81 / 逐层最优单源均值 0.56 / $k{=}8$ 聚合 0.79)在不同位置被引用;全为 in-sample。更根本的是第 6 步会证明 $R^{2}$ 不预测转移质量,使这一步支撑的是「可重构」而非「可转移」
        3单个 source 层不够,需 top-$k$ 跨层聚合greedy forward selection 曲线(Fig 5);$k{=}1$→$k{=}8$ 使 K $R^{2}$ 0.5572→0.7914;$k{=}1$ 下游普遍崩塌(Fig 6, Table 2)成立,且是三个部件里唯一有大幅实测正贡献者。但证据用 greedy joint 选择、出厂用固定 top-$k$ 单源排序,两算法只被声称定性一致;且 Table 2 第 4 行的崩塌幅度被 $\lambda$ 失配放大(见第 4 步)
        4RoPE 污染拟合,应在 content 空间映射Fig 2 中 $K_{\text{stripped}}$ 对角线比 $K_{\text{rope}}$ 更锐;$\mathbf{R}_{\Theta}$ 正交故往返精确实测收益为零:Table 2 "$-$ all RoPE" 每列都在 Full 的噪声内。泛化理由的建设性部分成立(正交、位置无关),实证部分完全缺失(无「1k 拟合、32k 测精度」实验;$\S4.7$ 的 32k 只测延迟)。净评价:零成本保险,作为摘要三步之一被列出与其零实测贡献之间有落差
        5消融显示各部件贡献可分离Table 2 五行顺序移除非单调:在 $k{=}1$ 上再去掉 ridge,五列全部变好(PPL 22.73→9.86)。与论文给 ridge 的理由(条件化大 $k$ 下的近奇异 Gram)相冲突,最自洽的解释是 $\lambda{=}0.01$ 隐式按生产 $k$ 定标、$k{=}1$ 下过度收缩;$\lambda$ 扫描只在 $k{=}8$ 做过。后果:cross-layer 部件的量化幅度被高估,且 $\lambda{=}0$ 在 $k{=}8$ 比生产还好 0.13 pp 意味着 ridge 本身实测贡献也约为零
        6六对结果两极 ⇒ matched-KV 必要不充分,需要别的解释变量Tier 1 73–98% vs Tier 2 42–44%(Table 1);参数比 8.8$\times$ 的 Llama 进 Tier 1、1.8$\times$ 的 Ministral 8B→14B 崩掉(Table 10)成立且重要:架构距离不排序结果。但 Tier 2 在 MMLU 上是 25.25 / 24.73 对 25% 地板、floor-normalized 到 11–15%(MMLU 甚至 $-0.5$%),正确读法是失败而非「保住四成」
        7决定成败的是残差落点而非大小;cosine 优于 $R^{2}$K/V-concentration 定义;MLP 使 K-conc $-2.5$、cosine $+0.45$、HS $+24.3/+36.8$ pp(Table 4);$r{=}{+}0.57$ vs $r{=}{-}0.20$($n{=}12$)排序证据清楚,但:$R^{2}$ 相关符号为负且它正是第 2 步的证据货币;$n{=}12$ 时 0.05 临界值约 0.576,$+0.57$ 恰在线上且 12 点由 6 对 × 2 方向构成、非独立;论文自己表里有反例(Ministral 3B→8B 两个机制量都改善却掉 1.5 pp),故机制被降级为条件性陈述;$R^{2}_{K}{=}-7.81$ 仍保住 68% retention 这一落差仍未解释
        8非线性 MLP 可修复失败对Table 3 的 $+24.3$ / $+36.8$ pp是修复而非普遍升级:MLP 在两个 Tier 1 对上分别输 0.3 / 1.5 pp。且 MLP 需要梯度训练,等于放弃了本文相对 C2C/LatentAlign 的 gradient-free 差异点——在最需要它的两对上,四准则表里的第一列不再成立
        9因此跨模型 KV 转移在生产上可用2.7–25$\times$ 加速(70/70 格全胜);十轮 CoQA 漂移小;mapper 不必常驻 GPU计算侧成立,服务侧账未结清:不含 cache 搬运、Ministral 排除 vision tower、mapper 跑 eager(不利于自己);$P(P-1)$ 有序对使 5 模型车队约 131 GB,80–480 ms 换页是算出来的不是测的(且第 4 节检验 1 表明权重按 fp32 存,若改 bf16 可减半);L→S 的 0.33 pp/turn 是线性漂移,长会话仍会累积
        10结论:应把跨模型 mapper 的评价标准从重构指标转向子空间感知诊断$\S6$方法论层面这是本文最站得住的贡献,且它是自我削弱的——它同时说明本文自己用来立论的 $R^{2}$ 证据不足以支撑可转移性。另一条论文未展开的账:以 source standalone 为基线时($\S5.3$ 的推导),四个 Tier 1 对的五项均值全为负($-0.43$ 到 $-11.92$ pp),退化集中在 5-shot 与 CoT 生成,与「校准只用 1k-token 散文」这条 limitation 一致

        7. 实现 cross-reference #

        [实现未公开] —— 论文未给出代码仓库、脚本或权重发布地址。以下是从 $\S3$、$\S4.1$、Appendix D/E/G 拼出的复现清单,按「照抄即可」与「容易漏」分开。

        可直接照抄的常数 #

        校准数据FineWeb-Edu,500 序列 × 1,024 token,stride 4 ⇒ 每个 target head 约 128K 个 token 级观测
        ridge$\lambda=0.01$;$\lambda{=}0$ 与 $10^{-4}$ 同样可用,$\lambda{=}1$ 崩($-15.79$ pp)
        精度前向 bf16、协方差 fp32、分析 fp64;权重落盘按 fp32(由参数量与 GB 反推)
        源特征维度$d_{s}=k\cdot n_{\text{kv}}^{s}\cdot d_{h}^{s}$(跨 head 拼接)
        $k$ 扫描$\{1,2,4,6,8,10,12,16,20,24,\text{all}\}$,按 ARC-C / HellaSwag / MMLU 的算术平均取 argmax,近似并列时偏向大 $k$
        MLP 对照每 (target layer, head, K$\$V):Linear($d_{s}$,1024) → ReLU → Linear(1024,1024) → ReLU → Linear(1024,$d_{h}^{t}$);Adam,lr $10^{-3}$,20 epoch,MSE,batch 4,096
        拟合成本单 8$\times$H100 节点,47–87 min/pair(Qwen3 8B→32B 47、14B→32B 52、Llama 8B→70B 50、Ministral 3B→8B 75、3B→14B 84、8B→14B 87)
        评测口径lm-evaluation-harness 默认;ARC-C / HellaSwag 用 acc_norm,WinoGrande / MMLU / GSM8K 用 acc;MMLU 5-shot、GSM8K 8-shot CoT,其余 zero-shot;HellaSwag/MMLU 16 路分片、ARC-C 4 路
        延迟测量8$\times$H100 + NVLink,bf16,50 warmup / 30 计时;re-prefill 用 flash_attention_2 且不含 LM head;mapper 跑 eager,无 torch.compile / CUDA graph
        perplexity 协议WikiText-2 切成不重叠的 2,048-token 块,用前 1,024 token 的 prefix KV(自身前向或经 mapper)去打后 1,024 token 的分

        关键实现细节(最容易漏的两处) #

        1. RoPE 剥离必须在拟合与推理两端对称施加。 回归目标 $\mathbf{Y}$ 是从 target 真值 key 里剥掉 target 的 RoPE 得到的;推理时则要在线性映射之后重新用 target RoPE 旋转回去。只做一端就是 Table 2 的 "$-$ inference RoPE" 行:MMLU 掉到 25.79、GSM8K 掉到 4.17(近乎随机),而 HellaSwag 只掉约 5 pp——也就是说这个 bug 在最常用的那个 benchmark 上几乎看不出来,只有 5-shot 与 CoT 任务会暴露它。
        2. 设计矩阵拼的是选中层的全部 head,且 top-$k$ 层集合按 target 层共享。 $\mathbf{X}_{K}^{l}=[\bar{\mathbf{K}}_{s}^{l_{1}}\|\cdots\|\bar{\mathbf{K}}_{s}^{l_{k}}]$,其中每个 $\bar{\mathbf{K}}_{s}^{l_{i}}\in\mathbb{R}^{T\times(n_{\text{kv}}^{s}\cdot d_{h}^{s})}$ 是该层所有 Key head 的拼接——不是同序号 head 的那一片。这既是跨 head 信息流的来源,也是 $\mathbf{X}^{\top}\mathbf{X}$ 能「每 target 层算一次、层内所有 head 共享」的前提;按 head 各自选层会同时损失精度并把拟合时间放大约 $n_{\text{kv}}$ 倍。另外别忘了求解前中心化、事后用 $\mathbf{b}=\bar{\mathbf{Y}}-\bar{\mathbf{X}}\mathbf{W}^{*}$ 还原截距,否则 $\lambda$ 会连截距一起惩罚。
        3. 核心技术壁垒 #

          真正难复制的不是闭式解——$(\mathbf{X}^{\top}\mathbf{X}+\lambda\mathbf{I})^{-1}\mathbf{X}^{\top}\mathbf{Y}$ 谁都写得出来,而且论文自己的消融表明三个部件里两个的实测贡献约为零。难复制的是诊断量的构造与它的适用域:把 K 残差投到 target per-head query 矩阵 $\mathbf{Q}_h$ 的右奇异向量上、按对应奇异值平方加权,再除以全分量平均误差,得到 K-concentration($>1$ 表示误差落在 attention 会读的方向上);V 侧按真值 attention 权重平方加权同理。要算它就必须能拿到 target 的 per-head query 与真值 attention 权重,还必须在评测域 token 上算——同一个 mapper 的校准域 $R^{2}_{K}$ 是 0.84、评测域是 $-7.81$,域选错会把结论整个翻过来。这套诊断是本文唯一无法靠工程直觉绕过、且能迁移到其他跨模型映射工作上的东西;论文对它的定位(跨对预测有效、$n{=}12$ 下 $r{=}{+}0.57$)目前也只到「比 $R^{2}$ 好」,而不是一个可依赖的部署前筛选器——它需要先把 mapper 拟合出来才能计算,这一点论文在 future work 里自己点明了。