Massive Values in Self-Attention Modules are the Key to Contextual Knowledge Understanding

algorithm 2502.01563
massive-valuesRoPEcontextual-knowledgequantizationinterpretability

§1 TL;DR #

RoPE-based LLM 的 Q/K 矩阵在低频维度出现集中大值 (massive values),破坏实验证明其专职负责上下文知识理解 (GSM8K 76.9%→4.0%,Passkey 100%→0%),而参数知识检索仅温和退化。保护大值的量化方法 (AWQ/SmoothQuant) 显著优于不保护的方法 (GPTQ)。

§2 Q1 / Q2 / Q3 #

Q1 痛点 #

LLM 的 self-attention Q/K 激活中存在异常大值 (massive values),先前工作仅将其视为量化障碍进行抑制或平滑,从未系统回答两个关键问题:(a) 这些大值的功能角色是什么?(b) 其成因何在?

Problem formulation

本文不优化一个 loss function,而是构建一个因果性分析框架。形式化目标:给定 attention tensor $Q, K \in \mathbb{R}^{\mathcal{S} \times \mathcal{H} \times \mathcal{D}}$,计算每个 (head, dim) 的 L2 norm 特征图:

$$M_{h,d} = \| Q_{:,h,d} \|_2 = \sqrt{\sum_{s=1}^{\mathcal{S}} Q_{s,h,d}^2}$$

定义 massive value 为满足 $M_{h,d} > \lambda \cdot \frac{1}{\mathcal{D}} \sum_{d'} M_{h,d'}$ 的维度 ($\lambda = 5$)。通过选择性破坏 (disruption) massive vs non-massive 维度,测量模型在两类任务上的性能差异:

Assumptions: 分析假设 $\lambda = 5$ 的阈值能有效分离 massive 与 non-massive 维度;disruption 仅在 prefilling 阶段施加以隔离上下文处理能力与基础语言建模能力。

Q2 方法 #

核心发现:Q/K 中的 concentrated massive values 是上下文知识理解的专用信息通道,由 RoPE 的频率衰减结构诱导并在训练中被放大。

分析方法由三个相互支撑的实验构成:

  1. Disruption 实验:将 massive value 维度替换为 mean/zero/min,仅在 prefilling 阶段执行——CK 任务近乎崩溃,PK 任务仅温和退化
  2. 量化对比:AWQ/SmoothQuant(保护 massive values)vs GPTQ(不保护)——CK 性能差异直接映射到 massive value 保护程度
  3. RoPE 因果分析:RoPE 模型 vs 非 RoPE 模型 (GPT-2, OPT, Jamba),完美的 ↔ 对应关系;massive values 集中在 RoPE 低频维度
  4. Prior work (before)This paper (after)
    Massive values 定位量化障碍,需抑制/平滑上下文理解的功能性信号
    角色理解"outliers 导致低精度准确率下降""outliers 就是上下文理解机制本身"
    设计含义Outlier Suppression / OS+保护性量化 (AWQ / SmoothQuant)
    因果溯源归因于训练动态,原因不明RoPE 频率结构 → 低频维度积累

    核心技术壁垒:prefilling-only disruption 实验设计——必须精确隔离上下文处理阶段,同时保留 decoding 阶段的完整性。如果同时破坏两个阶段,模型的基础语言建模能力崩溃,无法归因性能下降到上下文理解的丧失。这一实验设计与 CK/PK 10-benchmark 对比框架的组合,是复现此论证链的关键门槛。

    Q3 结果 #

    MetricVanilla → Massive DisruptedDelta
    GSM8K (Llama3-8B)76.9% → 4.0%−72.9 pp
    AQUA (Llama3-8B)53.5% → 9.7%−43.8 pp
    Passkey 256,12 (all models)100% → 0%−100 pp
    IMDB (Gemma2-9B)94.7% → 1.8%−92.9 pp
    Cities (Llama3-8B)99.4% → 88.2%−11.2 pp (温和)
    Celebrity (Llama3-8B)95.0% → 73.0%−22.0 pp (温和)
    Non-massive disrupted (all)baseline ± 1%无显著影响

    RoPE 模型 (13/13) 全部存在 concentrated massive values;非 RoPE 模型 (4/4) 全部不存在。知识冲突反转实验中,vanilla 模型被误导至 ~50% (随机猜测),massive-value-disrupted 模型反而高于随机。

    §3 架构 / 方法图 #

    本文不提出新架构,而是分析 RoPE-based Transformer 的内部机制。核心概念图如下。

    Figure 1: Concentrated massive values in Q and K of RoPE-based LLMs

    Paper's Figure 1, verbatim (caption: "In transformer-based Large Language Models with RoPE (like Llama, Gemma), the attention queries (Q) and keys (K) exhibit concentrated massive values in certain dimensions").

    Figure 1 概览了全文核心发现:在 RoPE-based LLM 中,Q 和 K 的特定维度区域出现远超平均值的激活幅度。这些大值跨注意力头呈现一致的空间分布,集中在 head dimension 的低频区域。V 矩阵中不存在此模式。这种 "stripe" pattern 是 RoPE 频率衰减 $\theta_j = b^{-2j/d}$($b = 10000$)的直接后果:低频维度旋转慢,对位置编码贡献小,训练中被模型用来承载位置无关的语义信息。

    Figure 2: Q and K embedding vectors in Llama-2-7B

    Paper's Figure 2, verbatim (caption: "Q and K Embedding Vector in Llama-2-7B, we choose Layer 10 and 20, the horizontal axis is the number of head and the vertical axis is head dim").

    Figure 2 将 Q/K tensor 沿 sequence length 维度取 L2 norm,压缩为 $(\mathcal{H}, \mathcal{D})$ 二维热力图。黑框标注了 concentrated massive values 的区域——位于图底部(高 dim index = 低 RoPE 频率)。Layer 10 和 Layer 20 均呈现相同空间模式,表明这一结构从浅层就已确立。不同注意力头的 massive value 集中在几乎相同的维度索引处,尽管各 head 的 $W_Q$, $W_K$ 独立参数化。

    Disruption 操作流程

    graph LR A[Input tokens] --> B[Prefill: compute Q, K, V] B --> C{Identify massive dims:
    M_hd > λ × mean} C -->|massive dims| D[Replace with Mean/Zero/Min] C -->|non-massive dims| E[Keep unchanged] D --> F[Continue prefill attention] E --> F F --> G[Decode phase: UNCHANGED] G --> H[Generate output]

    Disruption 仅在 prefilling 阶段施加。Decoding 阶段的 Q/K 计算保持原样,确保模型的自回归生成能力不被干扰。这一设计使观察到的性能退化可以单独归因于上下文处理能力的丧失。

    §4 作者证明 #

    无形式化作者证明 — 仅实证

    本文无收敛定理、方差界或损失分解。全部论证基于实证实验。以下描述其因果分析框架。

    符号表 #

    SymbolDefinitionDomain
    $Q, K, V$Self-attention 的 query/key/value tensor$\mathbb{R}^{\mathcal{S} \times \mathcal{H} \times \mathcal{D}}$
    $\mathcal{S}, \mathcal{H}, \mathcal{D}$Sequence length, head count, head dimension$\mathbb{N}^+$
    $M_{h,d}$在 head $h$, dim $d$ 上沿 $\mathcal{S}$ 的 L2 norm$\mathbb{R}^+$
    $\lambda$Massive value 阈值倍数经验取 5
    $\theta_j$RoPE 第 $j$ 维度对的旋转频率$\theta_j = b^{-2j/d}$, $b = 10000$
    $W_Q, W_K, W_V$投影矩阵$\mathbb{R}^{d \times d}$

    关键方程的物理意义 #

    Massive value 识别(Definition 1):$M_{h,d} > \lambda \cdot \bar{M}_h$ 其中 $\bar{M}_h = \frac{1}{\mathcal{D}} \sum_{d'} M_{h,d'}$。在 $\lambda = 5$ 时,仅筛出 L2 norm 超过本 head 均值 5 倍的维度。这是一个 position-independent 的特征:先沿 sequence 维度聚合,再做阈值判断,因此 massive value 是每个 (head, dim) 的全局属性,不依赖于特定 token。

    RoPE 频率衰减:$\theta_j = 10000^{-2j/d}$ 决定了维度对 $j$ 的旋转速率。小 $j$ 对应高频(快旋转,编码精细位置),大 $j$ 对应低频(慢旋转,位置信息稀薄)。massive values 集中在大 $j$(低频)区域——这些维度因位置编码贡献小,训练中被 repurpose 为语义信息载体。

    RoPE 内积的相对位置性:$\langle f_q(\mathbf{x}_m, m), f_k(\mathbf{x}_n, n) \rangle = g(\mathbf{x}_m, \mathbf{x}_n, m-n)$。Q-K 点积仅依赖相对位置 $m - n$,这是 RoPE 的核心设计目标。但副产品是:RoPE 仅作用于 Q 和 K(为实现此相对位置性),V 不经过旋转——直接解释了为何 massive values 只出现在 Q/K 中。

    缺失的形式化保证 #

    本文全部结论基于 3 个模型 × 10 个 benchmark 的实验,缺乏以下形式化分析:

    1. 信息论界:massive value 维度承载了多少 bits 的上下文信息?与 non-massive 维度相比信息增益如何?
    2. 收敛保证:训练中 massive values 是否保证收敛到低频维度?还是存在局部极小值导致不同的分布?
    3. $\lambda$ 敏感性:$\lambda = 5$ 如何选取?论文未提供消融,不清楚结论在 $\lambda \in [3, 10]$ 范围内的鲁棒性
    4. 因果推断严格性:disruption ≠ ablation;替换为 mean 引入的分布偏移本身可能贡献部分性能下降(尽管多种替换方式结果一致缓解了这一concern)
    5. Scale law:实验限于 7B–9B 模型,未验证 70B+ 规模是否保持相同的 CK/PK 分离度
    6. GQA/MQA 交互:Llama3 使用 GQA,Q head 数远大于 K head 数,但论文未分析共享 K head 中 massive values 如何与多个 Q head 交互
    7. §5 实验与数据 #

      核心实验 1:Massive value disruption (Table 1) #

      三个 7–9B 模型 (Gemma2-9B, Llama3-8B, Qwen2.5-7B) 在 11 个 benchmark 上的破坏实验。Disruption 方式:将 massive value 维度替换为 $\text{Mean}(\mathbf{X})$,仅在 prefilling 阶段执行。

      ModelGSM8KAQUAPasskey (128,6)Passkey (256,12)Passkey (1024,48)IMDBCitiesSportsArtTechCelebrity
      Gemma2-9B vanilla81.3063.8010010010094.7099.7091.0084.0081.0092.50
      + Massive Disrupted15.1016.502.000.000.001.8076.4073.5068.0072.0082.00
      Llama3-8B vanilla76.9053.5110010010095.4099.4095.0093.5092.5095.00
      + Massive Disrupted4.009.689.000.000.0011.0088.2074.5064.0074.9073.00
      Qwen2.5-7B vanilla86.6056.6910010010096.8097.7095.0096.0090.0093.50
      + Massive Disrupted16.1019.689.001.000.006.5381.5074.0069.5071.0071.00

      CK 任务的退化是灾难性的:Passkey Retrieval 从 100% 跌至 0–9%,IMDB 从 95%+ 跌至单位数。PK 任务退化幅度远小:Cities 从 99% 降至 76–88%(-11 to -23 pp)。Non-massive disruption 对所有任务均无显著影响 (±1%)。

      核心实验 2:知识冲突反转 #

      Figure 4: Knowledge conflict experiment

      Paper's Figure 4, verbatim (caption: "Introducing conflicting background knowledge causes LLM to be misled into making random guesses. However, after massive values are disrupted, the model is still able to maintain a certain level of accuracy").

      这是全文最精巧的实验。在 Cities 数据集中注入矛盾上下文(如 "New York has become a city in the United Kingdom"),vanilla 模型被误导至 ~50% 准确率(二分类随机猜测)。但 massive-value-disrupted 模型准确率显著高于随机——因为它们丧失了处理上下文(包括误导性信息)的能力,转而依赖参数中存储的正确知识。这提供了一个优雅的反证:massive values 不是通用计算组件,而是专门的上下文处理通道。

      核心实验 3:量化方法对比 #

      Figure 5: Quantization method impact on Llama3-8B

      Paper's Figure 5, verbatim (caption: "Impacts of different quantization methods on Llama3-8b across different benchmarks").

      三种量化方法在 Llama3-8B 上的归一化性能对比。AWQ (W4A16, per-channel scaling 保护重要权重) 和 SmoothQuant (W8A8, 平滑因子 $S$ 重新分配 outlier) 在所有任务上几乎覆盖 vanilla baseline。GPTQ (W4A16, 基于 Hessian 的二阶量化,不特别处理 massive values) 在 PK 任务上正常,但在 CK 任务 (GSM8K, AQUA) 降至约 75% 归一化准确率。这一差异直接映射到量化方法是否保护 massive values。

      核心实验 4:RoPE 因果验证 #

      Figure 7: Gemma2-9B vs OPT-350M Q/K/V comparison

      Paper's Figure 7, verbatim (caption: "K, Q, and V at Layer 20 in Gemma2-9B. Massive values are concentrated in low-frequency regions of K and Q, absent in V").

      上排为 OPT-350M (无 RoPE) Layer 20 的 K/Q/V 热力图:三者均呈分散均匀分布。下排为 Gemma2-9B (有 RoPE) Layer 20 的 K/Q/V 热力图:K 和 Q 在低频区域(底部)出现亮条带,V 仍分散。13 个 RoPE 模型全部有 concentrated massive values,4 个非 RoPE 模型 (GPT-2, GPT-Neo, OPT, Jamba) 全部没有——完美的二分对应。

      Disruption 方法鲁棒性 (Table 2) #

      DisruptionTargetGSM8KAQUAIMDBPasskey (128,6)
      None76.9053.5195.40100
      MeanMassive4.009.6811.009.00
      ZeroMassive1.608.0713.408.00
      MinMassive2.739.3310.809.00
      MeanNon-massive77.4053.9095.40100
      ZeroNon-massive76.4053.8394.70100
      MinNon-massive75.2053.9895.40100

      三种替换方法 (mean/zero/min) 对 massive values 的破坏效果高度一致(GSM8K 全部降至单位数),缓解了 "替换方式本身引入偏差" 的 concern。

      Dataset 分析 #

      CK benchmarks: GSM8K (8.5K 小学数学推理), AQUA (代数文字题), IMDB (25K 影评情感分类), Passkey Retrieval (合成任务,在随机填充文本中定位数字密钥,3 个难度级别)。

      PK benchmarks: Cities (来自 Marks & Tegmark 2023 的地理事实二分类), Sports/Arts/Technology/Celebrity (LLM 生成的直接事实问答)。

      设计逻辑: CK 任务需要模型理解输入上下文中的信息(数学题的条件、影评的情感、密钥的位置),PK 任务仅需检索训练时编码的事实知识。PK 数据集使用简单直接的问题格式,最小化推理成分。

      局限: PK 数据集部分为 LLM 合成,可能存在分布偏差。实验未做评估集污染检查。

      §6 论证链 #

      StepClaimEvidenceInference
      1Q/K 在低频 head dims 出现 concentrated massive values;V 无此模式Fig 1, Fig 2 (Llama-2-7B 热力图), Fig 7 (Gemma vs OPT), Table 3 (13 模型)该现象普遍存在于 RoPE 模型,且限于 Q/K
      2破坏 massive values 导致 CK 任务灾难性崩溃 (−73 to −100 pp),PK 任务仅温和退化 (−11 to −23 pp)Table 1 (3 模型 × 11 benchmarks), Table 2 (3 种替换方式一致), Fig 3 (PPL ~80, diversity ~0.1)Massive values 对上下文理解有因果性贡献,对参数检索非关键
      3知识冲突场景下,破坏 massive values 使模型忽略误导上下文,回退到正确参数知识Fig 4: vanilla ~50% (被误导) vs disrupted >50% (回退 PK)Massive values 是上下文处理的专用通道,而非通用计算组件
      4保护 massive values 的量化方法 (AWQ, SmoothQuant) 保留 CK 性能;不保护的 (GPTQ) 在 CK 上退化Fig 5: AWQ/SmoothQuant ≈ vanilla; GPTQ CK ~75% normalized将分析发现与工程实践连接:massive value 保护 = CK 保护
      5RoPE 是 concentrated massive values 的唯一成因Table 3: RoPE ↔ massive values 完美二分对应 (13 ✓ vs 4 ×); Fig 7 (Gemma vs OPT); GPT-NeoX vs GPT-Neo 对照RoPE 的频率结构是必要且充分条件
      6Massive values 从 Layer 1 出现,training 过程逐步放大 RoPE 低频维度的语义承载Layer-wise analysis (App C): pre-RoPE 和 post-RoPE 模式相似;pattern 在第一层已建立训练与 RoPE 结构共适应 (co-adaptation),非后期突现

      §7 实现 cross-reference #

      开源代码: https://github.com/MingyuJ666/Rope_with_LLM

      代码结构未在论文中详细描述。实现核心为:(1) 对 prefilling 阶段的 Q/K tensor 逐 head 计算 per-dim L2 norm,(2) 按 $\lambda = 5$ 阈值标记 massive value indices,(3) 替换为 mean/zero/min。该流程通过 hook 注入 HuggingFace Transformers 的 attention 计算中。

      核心技术壁垒展开:prefilling-only disruption 是实验可信度的关键。如果 disruption 同时影响 decoding 阶段,模型的基础 next-token prediction 能力被破坏,观测到的性能下降无法归因到上下文理解。作者将 disruption 精确限制在 prefilling(处理输入上下文时),decoding 阶段完整保留——因此 CK 任务的灾难性下降可以单独归因于上下文处理能力的丧失,而非语言模型能力本身的崩溃。

      关键实现细节

      1. Per-head L2 norm 聚合:massive value 识别先沿 sequence 维度取 L2 norm(而非逐 token 取 max),确保阈值反映的是该维度在整个序列上的持续激活强度,而非单个 token 的瞬时尖峰。这一选择使结果对输入内容鲁棒。
      2. Prefilling-only hook 注入:disruption 必须仅在 prefilling forward pass 中执行。实现时需要区分 prefilling(sequence length = prompt length)和 decoding(sequence length = 1)的 forward call,并在 decoding 时跳过 disruption。
      3. Reproducibility: 代码已开源。实验使用 HuggingFace model hub 上的公开检查点 (Llama-3-8B, Gemma-2-9B, Qwen-2.5-7B)。合成数据集 (Passkey, PK benchmarks) 的生成代码包含在仓库中。AWQ/SmoothQuant/GPTQ 量化使用对应的开源工具链。社区暂无独立复现报告。此发现的分析性质意味着无需大规模训练即可验证。