Can LLMs Separate Instructions From Data? And What Do We Even Mean By That?

model 2403.06833 — Cross-paper Synthesis

L3 · 2403.06833 — "Can LLMs Separate Instructions From Data?" 跨论文综合 #

Target: 指令/数据隔离度的形式化 + 黑盒经验代理指标 + SEP 基准(ICLR 2025)。 本篇是 model 类里的"安全/评测"支流,与其余 8 篇的连接点是一个共同的深层母题: LLM 依据 token 的位置(而非其被赋予的角色)来决定如何处理输入。

1. 相关论文(谁相关、为何相关) #

这 8 篇 peer 并非同题竞争,而是围绕"输入的哪一部分该被当成什么"从四个不同侧面逼近同一现象。按相关性强弱与角度分组:

A. 位置决定角色 —— 与本篇同源的"输入角色错位"母题(最强相关)

B. 位置偏置的机制与缓解 —— 与本篇"insistence 加剧执行"现象呼应(中等相关)

C. 架构侧的"角色/信息通路显式分离" —— 提供本篇 §8 呼吁的候选答案(弱-中相关)

D. 多模态生成 —— 弱相关,主要作对照(最弱相关)


2. 本篇 vs 相关论文的 delta(新在哪、增量、矛盾) #

本篇独有的增量(none of the peers do this):

  1. 把安全属性写成可跨模型比较的形式化度量。 peer 里 2412.10079 / 2510.05381 都是纯实证诊断("无形式化作者证明—仅实证"[2412.10079][2510.05381])。本篇是唯一给出 Def 1–4 + KL 下界论证的 [2403.06833],把"隔离度"从模糊直觉变成一个 $[0,1]$ 数字。
  2. 黑盒、无 logits 的测量协议。 2506.08371 的 salience score 需要词表全排名(要 logits)[2506.08371];本篇的经验隔离度只需单见证词的子串检测 [2403.06833],可评测闭源 API(GPT-4)。这是测量学上的独立贡献。
  3. "规模反效果"的安全维度。 长上下文那组论文普遍观察到"大模型更好或至少不更差"(FilM/PCD 都在改善检索);本篇给出反向证据:同族内大/新模型隔离更差(GPT-3.5 56.6 > GPT-4 20.8)[2403.06833],归因于 task superposition。这是与"scale 治百病"叙事的显式冲突。
  4. 与 peer 的增量对照:

    维度本篇 (2403.06833)最近 peer 的做法
    失败根因输入角色(指令 vs 数据)无架构区分输入位置/间距(2412.10079)、输入长度(2510.05381)、token 排序(2506.08371)
    手段形式化 + 黑盒基准 SEP实证诊断 / 数据合成 / 解码干预 / 训练架构
    缓解结论提示/优化/微调都无法兼得隔离+效用(负相关)[2403.06833]数据可修(2404.16811)、解码可缓解(2506.08371)、缩短输入可缓解(2510.05381)

    潜在矛盾(cite both + 标注根源):

    本篇断言"微调可把隔离推到 ~96% 但效用暴跌(Llama-2 效用 83.3→16.5),三种缓解都非万灵药,需架构层新方法"[2403.06833]。 但 2404.16811 显示纯数据 + 标准 SFT 即可修好位置偏置且几乎不损短上下文能力(MMLU 59.3→59.2)[2404.16811]矛盾根源(不是真矛盾,是任务不同):本篇微调的目标是"让模型忽略数据里的任意指令"——这是一个对抗性、开放集的约束,逼模型压制其指令跟随本能,故效用坍塌;2404.16811 的目标是"让模型 attend 到任意位置的gold 信息"——这是能力增强而非能力抑制,故无 tax。两者都在各自任务上正确。启示:本篇观察到的"隔离-效用负相关"很可能特定于"抑制型"安全目标,而非"隔离"本身的普遍代价。
    本篇把"隔离失败"与 jailbreak/恶意攻击显式切割,定位为良性场景下的底层缺陷[2403.06833]。2510.05381 则把"长度伤害"与检索失败切割 [2510.05381]。二者不冲突但可能是同一底层病灶的两个投影:都是"模型无法只按被指定的角色/范围处理输入"。L4/topic 可探讨二者是否共享机制。

    3. 可攻击面(针对具体 claim 的对抗性反驳) #

    1. 系统/用户提示 ≠ 指令/数据参数(本篇自认的头号软肋)。 本篇用 system prompt 代指令位、user prompt 代数据位 [2403.06833],但作者自己承认这是"proxy",模型本就被训练成响应 user 命令,所以"低隔离"部分是度量伪影而非模型缺陷。攻击:真正的 instruction/data API(如 StruQ 的结构化分隔)下重测,Naive 隔离度可能高得多。
    2. GPT-4 既造数据又拿最高分。 SEP 由 GPT-4 生成,GPT-4 提示工程后隔离度 20.8→95.3 冠绝全场 [2403.06833];作者自陈"unfair advantage"。这直接威胁"scale 反效果"结论的干净度——GPT-4 的低 Naive 分可能也含生成分布的自相关伪影。
    3. 见证词纯净度是未审计的人工品味。 整个指标依赖"探针执行时 $w$ 必现、处理时 $w$ 不现"[2403.06833]。类比 2404.16811 被攻击"GPT-4 QA 质量无 quality control"[2404.16811]——本篇 100 条人工探针同样无系统性纯净度审计,若 $w$ 在正常输出里偶发,$\mathrm{sep}$ 分子被污染。
    4. 低效用模型的隔离分不可信。 本篇 §3 自己指出 $\mathrm{sep}$ 分母只统计"能执行探针"的样本 [2403.06833]。Gemma-2B 的高 Naive 隔离(73.2%)伴随低效用(36.7%),意味着它可能只是"两个任务都做不好"而非"善于隔离"——冠军可能是伪冠军。
    5. 样本过时。 与 2412.10079 同病 [2412.10079]:本篇只测到 GPT-4-turbo-2024-04(无 o1/Claude-3.5/instruction-hierarchy 训练过的新模型)。若新一代经过 Wallace 2024 instruction-hierarchy 训练,"规模反效果"可能反转。

    6. 4. 生态位(范式定位、采纳证据) #

      • 范式定位:本篇是"LLM 输入角色边界"研究的奠基性形式化工作——ICLR 2025 收录,把 Greshake 2023 的定性现象 [2403.06833] 升级为可测度量。它在 model 类里与长上下文那组论文(2404.16811/2412.10079/2506.08371/2510.05381)共同构成"输入的哪部分该被如何处理"这一元问题的不同切片:那几篇管"位置/长度/排序",本篇管"角色/来源"。
      • 与架构派的接力关系:本篇 §8 的"需 architectural-level 分离"呼吁,正是 2405.04434 的 decoupled RoPE [2405.04434]、2510.26692 的通路分离 [2510.26692]、2509.17765 的 Talker decoupling [2509.17765] 在各自领域已经做到的事——本篇为这些"显式通路分离"提供了安全侧的动机与评测标尺。
      • 采纳证据:SEP 数据集 + 源码承诺公开 [2403.06833](L1 未记录 repo URL)。相较 2404.16811 有明确开源(FILM repo + HF 权重)[2404.16811],本篇的复现依赖官方 SEP 发布,采纳门槛在于数据集可得性。作为 benchmark 论文,其生态位取决于后续 defense 论文是否以 SEP 为标准报告——这点 L1/L2 未追踪。

      5. 未探索方向(来自 cluster 的 hybrid / adaptive 组合) #

      1. 位置去偏 × 角色隔离的联合训练。 把 2404.16811 的 gold-position 均匀化 IN2 训练 [2404.16811] 与本篇的"忽略数据内指令"目标同一批数据里混合——检验能否在提升长上下文利用的同时提升隔离度,或二者是否共享同一 attention 修复路径。cluster 里没人做过"能力增强型"与"能力抑制型"目标的联合优化。
      2. PCD 式对比解码做"角色对比"。 2506.08371 减掉 proximal bias 分量 [2506.08371]。类比:跑两次 forward——一次把探针当指令位、一次当数据位——对比 logits 差,训练免费地压制"数据位被执行"的候选。这是把本篇的评测协议直接翻转成推理时防御,cluster 中无人尝试。
      3. 架构级"指令位/数据位"独立子空间(借 MLA decoupled RoPE)。 2405.04434 用独立 $\mathbf{k}^R$ 通路承载位置 [2405.04434];同理可设一条"角色通路"标记每个 token 的 instruction/data 身份,让 attention 在架构上无法跨角色执行——直接回应本篇 §8 呼吁,且比 prompt-engineering 更根本。
      4. 长度 × 角色的交叉退化测量。 把本篇 SEP 探针嵌入 2510.05381 的三级 distraction 长上下文 [2510.05381],测"隔离度是否随长度进一步坍塌"——若是,则 2510.05381 的"长度伤害"与本篇的"角色伤害"是可叠加的两个独立轴,为 L4 topic 提供联合数据点。
      5. 给 Talker-decoupling 式产品架构配隔离基准。 2509.17765 已在架构上给安全模块留出文本拦截点 [2509.17765],但未用本篇 SEP 量化"拦截后模型是否仍执行数据内指令"。把 SEP 作为 omni/agent 类产品的发布前隔离度门槛是一个直接可落地的方向。