RoPE-based LLM 的 Q/K 矩阵在低频维度出现集中大值 (massive values),破坏实验证明其专职负责上下文知识理解 (GSM8K 76.9%→4.0%,Passkey 100%→0%),而参数知识检索仅温和退化。保护大值的量化方法 (AWQ/SmoothQuant) 显著优于不保护的方法 (GPTQ)。
LLM 的 self-attention Q/K 激活中存在异常大值 (massive values),先前工作仅将其视为量化障碍进行抑制或平滑,从未系统回答两个关键问题:(a) 这些大值的功能角色是什么?(b) 其成因何在?
Problem formulation
本文不优化一个 loss function,而是构建一个因果性分析框架。形式化目标:给定 attention tensor $Q, K \in \mathbb{R}^{\mathcal{S} \times \mathcal{H} \times \mathcal{D}}$,计算每个 (head, dim) 的 L2 norm 特征图:
$$M_{h,d} = \| Q_{:,h,d} \|_2 = \sqrt{\sum_{s=1}^{\mathcal{S}} Q_{s,h,d}^2}$$
定义 massive value 为满足 $M_{h,d} > \lambda \cdot \frac{1}{\mathcal{D}} \sum_{d'} M_{h,d'}$ 的维度 ($\lambda = 5$)。通过选择性破坏 (disruption) massive vs non-massive 维度,测量模型在两类任务上的性能差异:
Assumptions: 分析假设 $\lambda = 5$ 的阈值能有效分离 massive 与 non-massive 维度;disruption 仅在 prefilling 阶段施加以隔离上下文处理能力与基础语言建模能力。
核心发现:Q/K 中的 concentrated massive values 是上下文知识理解的专用信息通道,由 RoPE 的频率衰减结构诱导并在训练中被放大。
分析方法由三个相互支撑的实验构成:
| Prior work (before) | This paper (after) | |
|---|---|---|
| Massive values 定位 | 量化障碍,需抑制/平滑 | 上下文理解的功能性信号 |
| 角色理解 | "outliers 导致低精度准确率下降" | "outliers 就是上下文理解机制本身" |
| 设计含义 | Outlier Suppression / OS+ | 保护性量化 (AWQ / SmoothQuant) |
| 因果溯源 | 归因于训练动态,原因不明 | RoPE 频率结构 → 低频维度积累 |
核心技术壁垒:prefilling-only disruption 实验设计——必须精确隔离上下文处理阶段,同时保留 decoding 阶段的完整性。如果同时破坏两个阶段,模型的基础语言建模能力崩溃,无法归因性能下降到上下文理解的丧失。这一实验设计与 CK/PK 10-benchmark 对比框架的组合,是复现此论证链的关键门槛。
| Metric | Vanilla → Massive Disrupted | Delta |
|---|---|---|
| GSM8K (Llama3-8B) | 76.9% → 4.0% | −72.9 pp |
| AQUA (Llama3-8B) | 53.5% → 9.7% | −43.8 pp |
| Passkey 256,12 (all models) | 100% → 0% | −100 pp |
| IMDB (Gemma2-9B) | 94.7% → 1.8% | −92.9 pp |
| Cities (Llama3-8B) | 99.4% → 88.2% | −11.2 pp (温和) |
| Celebrity (Llama3-8B) | 95.0% → 73.0% | −22.0 pp (温和) |
| Non-massive disrupted (all) | baseline ± 1% | 无显著影响 |
RoPE 模型 (13/13) 全部存在 concentrated massive values;非 RoPE 模型 (4/4) 全部不存在。知识冲突反转实验中,vanilla 模型被误导至 ~50% (随机猜测),massive-value-disrupted 模型反而高于随机。
本文不提出新架构,而是分析 RoPE-based Transformer 的内部机制。核心概念图如下。

Paper's Figure 1, verbatim (caption: "In transformer-based Large Language Models with RoPE (like Llama, Gemma), the attention queries (Q) and keys (K) exhibit concentrated massive values in certain dimensions").
Figure 1 概览了全文核心发现:在 RoPE-based LLM 中,Q 和 K 的特定维度区域出现远超平均值的激活幅度。这些大值跨注意力头呈现一致的空间分布,集中在 head dimension 的低频区域。V 矩阵中不存在此模式。这种 "stripe" pattern 是 RoPE 频率衰减 $\theta_j = b^{-2j/d}$($b = 10000$)的直接后果:低频维度旋转慢,对位置编码贡献小,训练中被模型用来承载位置无关的语义信息。

Paper's Figure 2, verbatim (caption: "Q and K Embedding Vector in Llama-2-7B, we choose Layer 10 and 20, the horizontal axis is the number of head and the vertical axis is head dim").
Figure 2 将 Q/K tensor 沿 sequence length 维度取 L2 norm,压缩为 $(\mathcal{H}, \mathcal{D})$ 二维热力图。黑框标注了 concentrated massive values 的区域——位于图底部(高 dim index = 低 RoPE 频率)。Layer 10 和 Layer 20 均呈现相同空间模式,表明这一结构从浅层就已确立。不同注意力头的 massive value 集中在几乎相同的维度索引处,尽管各 head 的 $W_Q$, $W_K$ 独立参数化。
Disruption 操作流程:
Disruption 仅在 prefilling 阶段施加。Decoding 阶段的 Q/K 计算保持原样,确保模型的自回归生成能力不被干扰。这一设计使观察到的性能退化可以单独归因于上下文处理能力的丧失。
无形式化作者证明 — 仅实证
本文无收敛定理、方差界或损失分解。全部论证基于实证实验。以下描述其因果分析框架。
| Symbol | Definition | Domain |
|---|---|---|
| $Q, K, V$ | Self-attention 的 query/key/value tensor | $\mathbb{R}^{\mathcal{S} \times \mathcal{H} \times \mathcal{D}}$ |
| $\mathcal{S}, \mathcal{H}, \mathcal{D}$ | Sequence length, head count, head dimension | $\mathbb{N}^+$ |
| $M_{h,d}$ | 在 head $h$, dim $d$ 上沿 $\mathcal{S}$ 的 L2 norm | $\mathbb{R}^+$ |
| $\lambda$ | Massive value 阈值倍数 | 经验取 5 |
| $\theta_j$ | RoPE 第 $j$ 维度对的旋转频率 | $\theta_j = b^{-2j/d}$, $b = 10000$ |
| $W_Q, W_K, W_V$ | 投影矩阵 | $\mathbb{R}^{d \times d}$ |
Massive value 识别(Definition 1):$M_{h,d} > \lambda \cdot \bar{M}_h$ 其中 $\bar{M}_h = \frac{1}{\mathcal{D}} \sum_{d'} M_{h,d'}$。在 $\lambda = 5$ 时,仅筛出 L2 norm 超过本 head 均值 5 倍的维度。这是一个 position-independent 的特征:先沿 sequence 维度聚合,再做阈值判断,因此 massive value 是每个 (head, dim) 的全局属性,不依赖于特定 token。
RoPE 频率衰减:$\theta_j = 10000^{-2j/d}$ 决定了维度对 $j$ 的旋转速率。小 $j$ 对应高频(快旋转,编码精细位置),大 $j$ 对应低频(慢旋转,位置信息稀薄)。massive values 集中在大 $j$(低频)区域——这些维度因位置编码贡献小,训练中被 repurpose 为语义信息载体。
RoPE 内积的相对位置性:$\langle f_q(\mathbf{x}_m, m), f_k(\mathbf{x}_n, n) \rangle = g(\mathbf{x}_m, \mathbf{x}_n, m-n)$。Q-K 点积仅依赖相对位置 $m - n$,这是 RoPE 的核心设计目标。但副产品是:RoPE 仅作用于 Q 和 K(为实现此相对位置性),V 不经过旋转——直接解释了为何 massive values 只出现在 Q/K 中。
本文全部结论基于 3 个模型 × 10 个 benchmark 的实验,缺乏以下形式化分析:
三个 7–9B 模型 (Gemma2-9B, Llama3-8B, Qwen2.5-7B) 在 11 个 benchmark 上的破坏实验。Disruption 方式:将 massive value 维度替换为 $\text{Mean}(\mathbf{X})$,仅在 prefilling 阶段执行。
| Model | GSM8K | AQUA | Passkey (128,6) | Passkey (256,12) | Passkey (1024,48) | IMDB | Cities | Sports | Art | Tech | Celebrity |
|---|---|---|---|---|---|---|---|---|---|---|---|
| Gemma2-9B vanilla | 81.30 | 63.80 | 100 | 100 | 100 | 94.70 | 99.70 | 91.00 | 84.00 | 81.00 | 92.50 |
| + Massive Disrupted | 15.10 | 16.50 | 2.00 | 0.00 | 0.00 | 1.80 | 76.40 | 73.50 | 68.00 | 72.00 | 82.00 |
| Llama3-8B vanilla | 76.90 | 53.51 | 100 | 100 | 100 | 95.40 | 99.40 | 95.00 | 93.50 | 92.50 | 95.00 |
| + Massive Disrupted | 4.00 | 9.68 | 9.00 | 0.00 | 0.00 | 11.00 | 88.20 | 74.50 | 64.00 | 74.90 | 73.00 |
| Qwen2.5-7B vanilla | 86.60 | 56.69 | 100 | 100 | 100 | 96.80 | 97.70 | 95.00 | 96.00 | 90.00 | 93.50 |
| + Massive Disrupted | 16.10 | 19.68 | 9.00 | 1.00 | 0.00 | 6.53 | 81.50 | 74.00 | 69.50 | 71.00 | 71.00 |
CK 任务的退化是灾难性的:Passkey Retrieval 从 100% 跌至 0–9%,IMDB 从 95%+ 跌至单位数。PK 任务退化幅度远小:Cities 从 99% 降至 76–88%(-11 to -23 pp)。Non-massive disruption 对所有任务均无显著影响 (±1%)。

Paper's Figure 4, verbatim (caption: "Introducing conflicting background knowledge causes LLM to be misled into making random guesses. However, after massive values are disrupted, the model is still able to maintain a certain level of accuracy").
这是全文最精巧的实验。在 Cities 数据集中注入矛盾上下文(如 "New York has become a city in the United Kingdom"),vanilla 模型被误导至 ~50% 准确率(二分类随机猜测)。但 massive-value-disrupted 模型准确率显著高于随机——因为它们丧失了处理上下文(包括误导性信息)的能力,转而依赖参数中存储的正确知识。这提供了一个优雅的反证:massive values 不是通用计算组件,而是专门的上下文处理通道。

Paper's Figure 5, verbatim (caption: "Impacts of different quantization methods on Llama3-8b across different benchmarks").
三种量化方法在 Llama3-8B 上的归一化性能对比。AWQ (W4A16, per-channel scaling 保护重要权重) 和 SmoothQuant (W8A8, 平滑因子 $S$ 重新分配 outlier) 在所有任务上几乎覆盖 vanilla baseline。GPTQ (W4A16, 基于 Hessian 的二阶量化,不特别处理 massive values) 在 PK 任务上正常,但在 CK 任务 (GSM8K, AQUA) 降至约 75% 归一化准确率。这一差异直接映射到量化方法是否保护 massive values。

Paper's Figure 7, verbatim (caption: "K, Q, and V at Layer 20 in Gemma2-9B. Massive values are concentrated in low-frequency regions of K and Q, absent in V").
上排为 OPT-350M (无 RoPE) Layer 20 的 K/Q/V 热力图:三者均呈分散均匀分布。下排为 Gemma2-9B (有 RoPE) Layer 20 的 K/Q/V 热力图:K 和 Q 在低频区域(底部)出现亮条带,V 仍分散。13 个 RoPE 模型全部有 concentrated massive values,4 个非 RoPE 模型 (GPT-2, GPT-Neo, OPT, Jamba) 全部没有——完美的二分对应。
| Disruption | Target | GSM8K | AQUA | IMDB | Passkey (128,6) |
|---|---|---|---|---|---|
| None | — | 76.90 | 53.51 | 95.40 | 100 |
| Mean | Massive | 4.00 | 9.68 | 11.00 | 9.00 |
| Zero | Massive | 1.60 | 8.07 | 13.40 | 8.00 |
| Min | Massive | 2.73 | 9.33 | 10.80 | 9.00 |
| Mean | Non-massive | 77.40 | 53.90 | 95.40 | 100 |
| Zero | Non-massive | 76.40 | 53.83 | 94.70 | 100 |
| Min | Non-massive | 75.20 | 53.98 | 95.40 | 100 |
三种替换方法 (mean/zero/min) 对 massive values 的破坏效果高度一致(GSM8K 全部降至单位数),缓解了 "替换方式本身引入偏差" 的 concern。
CK benchmarks: GSM8K (8.5K 小学数学推理), AQUA (代数文字题), IMDB (25K 影评情感分类), Passkey Retrieval (合成任务,在随机填充文本中定位数字密钥,3 个难度级别)。
PK benchmarks: Cities (来自 Marks & Tegmark 2023 的地理事实二分类), Sports/Arts/Technology/Celebrity (LLM 生成的直接事实问答)。
设计逻辑: CK 任务需要模型理解输入上下文中的信息(数学题的条件、影评的情感、密钥的位置),PK 任务仅需检索训练时编码的事实知识。PK 数据集使用简单直接的问题格式,最小化推理成分。
局限: PK 数据集部分为 LLM 合成,可能存在分布偏差。实验未做评估集污染检查。
| Step | Claim | Evidence | Inference |
|---|---|---|---|
| 1 | Q/K 在低频 head dims 出现 concentrated massive values;V 无此模式 | Fig 1, Fig 2 (Llama-2-7B 热力图), Fig 7 (Gemma vs OPT), Table 3 (13 模型) | 该现象普遍存在于 RoPE 模型,且限于 Q/K |
| 2 | 破坏 massive values 导致 CK 任务灾难性崩溃 (−73 to −100 pp),PK 任务仅温和退化 (−11 to −23 pp) | Table 1 (3 模型 × 11 benchmarks), Table 2 (3 种替换方式一致), Fig 3 (PPL ~80, diversity ~0.1) | Massive values 对上下文理解有因果性贡献,对参数检索非关键 |
| 3 | 知识冲突场景下,破坏 massive values 使模型忽略误导上下文,回退到正确参数知识 | Fig 4: vanilla ~50% (被误导) vs disrupted >50% (回退 PK) | Massive values 是上下文处理的专用通道,而非通用计算组件 |
| 4 | 保护 massive values 的量化方法 (AWQ, SmoothQuant) 保留 CK 性能;不保护的 (GPTQ) 在 CK 上退化 | Fig 5: AWQ/SmoothQuant ≈ vanilla; GPTQ CK ~75% normalized | 将分析发现与工程实践连接:massive value 保护 = CK 保护 |
| 5 | RoPE 是 concentrated massive values 的唯一成因 | Table 3: RoPE ↔ massive values 完美二分对应 (13 ✓ vs 4 ×); Fig 7 (Gemma vs OPT); GPT-NeoX vs GPT-Neo 对照 | RoPE 的频率结构是必要且充分条件 |
| 6 | Massive values 从 Layer 1 出现,training 过程逐步放大 RoPE 低频维度的语义承载 | Layer-wise analysis (App C): pre-RoPE 和 post-RoPE 模式相似;pattern 在第一层已建立 | 训练与 RoPE 结构共适应 (co-adaptation),非后期突现 |
开源代码: https://github.com/MingyuJ666/Rope_with_LLM
代码结构未在论文中详细描述。实现核心为:(1) 对 prefilling 阶段的 Q/K tensor 逐 head 计算 per-dim L2 norm,(2) 按 $\lambda = 5$ 阈值标记 massive value indices,(3) 替换为 mean/zero/min。该流程通过 hook 注入 HuggingFace Transformers 的 attention 计算中。
核心技术壁垒展开:prefilling-only disruption 是实验可信度的关键。如果 disruption 同时影响 decoding 阶段,模型的基础 next-token prediction 能力被破坏,观测到的性能下降无法归因到上下文理解。作者将 disruption 精确限制在 prefilling(处理输入上下文时),decoding 阶段完整保留——因此 CK 任务的灾难性下降可以单独归因于上下文处理能力的丧失,而非语言模型能力本身的崩溃。
关键实现细节:
Reproducibility: 代码已开源。实验使用 HuggingFace model hub 上的公开检查点 (Llama-3-8B, Gemma-2-9B, Qwen-2.5-7B)。合成数据集 (Passkey, PK benchmarks) 的生成代码包含在仓库中。AWQ/SmoothQuant/GPTQ 量化使用对应的开源工具链。社区暂无独立复现报告。此发现的分析性质意味着无需大规模训练即可验证。