Algorithm 类别当前被三条主线主导。长上下文 LLM 的位置偏置诊断、评测与修复仍是最大子群(6/10 篇),覆盖从数据驱动训练修复到推理时解码修复的完整栈。LLM 服务调度算法新增为第二条主线(3/10 篇),包含 DP 负载均衡 [2605.06113]、workflow-aware agentic 调度 [2605.16637]、以及 agent 上下文惰性加载 [blog-dynamic-context-discovery]。统一多模态视频(1/10 篇)独立成支 [2510.08377]。长上下文算法已从"能否支持 128K"进入"在 128K 里到底能用多少"的精细审计阶段;LLM 服务调度从 per-request 正走向 workflow-level + barrier-aware 的结构感知优化。
| 维度 | 取值 | 说明 |
|---|---|---|
| 问题域 | long-context-diagnosis · long-context-repair · serving-scheduling · context-management · unified-multimodal | 论文解决的核心问题 |
| 干预阶段 | training · inference-decoding · serving-routing · context-assembly · evaluation-only | 在 LLM 生命周期的哪个阶段生效 |
| 方法性质 | data-engineering · algorithm-design · system-design · benchmark-design | 核心贡献的性质分类 |
| 论文 | 问题域 | 干预阶段 | 方法性质 |
|---|---|---|---|
| 2404.16811 (FilM/IN2) | long-context-repair | training | data-engineering |
| 2412.10079 (Lost-In-Between) | long-context-diagnosis | evaluation-only | benchmark-design |
| 2502.05167 (NoLiMa) | long-context-diagnosis | evaluation-only | benchmark-design |
| 2506.08371 (PCD) | long-context-repair | inference-decoding | algorithm-design |
| 2510.08377 (UniVideo) | unified-multimodal | training | algorithm-design |
| 2511.05850 (LITM-消除) | long-context-diagnosis | evaluation-only | benchmark-design |
| 2601.15300 (Intelligence Degradation) | long-context-diagnosis | evaluation-only | benchmark-design |
| 2605.06113 (BalanceRoute) | serving-scheduling | serving-routing | algorithm-design |
| 2605.16637 (HexAGenT) | serving-scheduling | serving-routing | algorithm-design |
| blog-dynamic-context-discovery | context-management | context-assembly | system-design |
本类别最密集的子簇(4 篇),从不同维度刻画 LLM 在长上下文中的信息利用失败。
Baker et al. (2412.10079) 将单跳 LITM U 形曲线推广到多跳 QA,发现第二层退化变量——多个证据片段之间的相对距离(lost-in-between)。Adjacent 配置在所有 (model, dataset) 对上稳定优于 separated 1–7 pp;CoT 在非指令微调模型上反而导致准确率崩溃至 ≤1% [2412.10079]。
Modarressi et al. (2502.05167, NoLiMa) 揭示主流长上下文 benchmark 的致命缺陷——ROUGE-L precision 0.5–0.96,模型靠字面匹配即可得高分。NoLiMa 将 ROUGE-L 压到 0.07,迫使模型依赖隐式关联推理,结果 13/13 前沿 LLM 有效长度全部 ≤8K [2502.05167]。单 distractor 句子即可将 GPT-4o 有效长度从 8K 塌到 1K [2502.05167]。
McKinnon (2511.05850) 从对立面证明:单针事实检索上 Gemini 2.5 Flash 在 1M token 窗口(92% 填充率)内达到 100% 准确率——LITM U 形曲线在该子任务上完全消失 [2511.05850]。结论严格限于单针 + 事实查询 + 单一模型。
Wang et al. (2601.15300) 提出 Natural Length Distribution Analysis,用 5 种检测器交叉验证量化 Qwen2.5-7B 在 128K 下出现悬崖式衰退的临界点 Lc ≈ 43.2%(≈55K tokens),F1 骤降 45.5%。三瓶颈框架(RoPE 周期 / attention 弥散 / 信息瓶颈)将 cliff 归因于 attention 弥散比 RoPE aliasing 更早触发 [2601.15300]。
An et al. (2404.16811, FilM-7B / IN2) 是最干净的数据驱动方案:GPT-4 合成 1.75M QA 数据,强制目标段在 4K–32K 上下文中均匀分布,仅靠 instruction tuning 将 Mistral-7B VaL Probing 从 47.3 提升至 85.9(超 GPT-4-Turbo 79.0),min-max gap 从 56.2 压到 13.9 [2404.16811]。核心论点:lost-in-the-middle 是数据问题,不是架构问题 [2404.16811]。
Xiao et al. (2506.08371, PCD) 从解码空间切入,发现 gold token 后验排名退到 3–6 位但始终在 top-8(Posterior Salience Attenuation),通过对 RoPE 低频分量过旋转做对比解码,零训练成本将 InfiniteBench KV Retrieval 8K 段从 72→79%。衰减率被压缩至 $(\ln B'/\ln B)^{2/d}<1$ [2506.08371]。
BalanceRoute (2605.06113) 解决 DP decode 的 barrier 同步负载不均:分段线性 F-score 捕获 safe-margin fill 与 overflow 之间 $(G{-}1)$ 倍不对称性,两阶段算法(贪心填充 + 精细子集选择)在毫秒级预算内完成。BR-H(含轻量二元终止分类器)在 144-NPU Ascend 910C 集群上吞吐 +15.4% over JSQ,优势随 $G$ 超线性增长($\Delta \propto G^{0.69}$) [2605.06113]。
HexAGenT (2605.16637) 将 agentic workflow 建模为 online-revealed DAG,用 projected scaled-SLO risk 排序 + 联合 prefill/decode placement,在异构 A100/H100/H200 P-D 分离集群上平均降低 Req95 20.1%、Req99 33.0%,最大分别达 45.0%/80.5%。Workflow-aware 排序本身是主收益来源(同构集群仍降 24.0%/35.4%) [2605.16637]。
Dynamic Context Discovery (blog) 将所有 agent 辅助上下文(tool output、chat history、MCP schema、terminal session)统一为文件系统上的惰性加载对象,A/B 测试显示 MCP-heavy session token 消耗减少 46.9% [blog-dynamic-context-discovery]。
Wei et al. (2510.08377, UniVideo) 双流架构(冻结 MLLM + MMDiT),通过 MLP self-attention 对齐,首次统一视频理解/生成/编辑。3 阶段 35K 步训练,in-context 生成 SC=0.88 大幅超越 Kling1.6(0.68),且展现零样本泛化到未见编辑任务的能力 [2510.08377]。
| 论文 | 核心问题 | 核心指标 | 关键数字 | 测试模型/硬件 | 代码开源 | 可复现性 |
|---|---|---|---|---|---|---|
| 2404.16811 (FilM/IN2) | LITM 数据修复 | VaL Avg / Gap | 85.9 / 13.9 (超 GPT-4-Turbo 79.0/32.1) | Mistral-7B → FilM-7B, 128×A100 | 开源 (GitHub+HF) | 部分 (训练数据未公开, GPT-4 调用 $50K–100K) |
| 2412.10079 (Lost-In-Between) | 多跳位置偏置 | Adjacent vs Separated Δacc | +1–7 pp (跨模型稳定) | GPT-3.5 / MPT-7B / Llama-2-longlora | 开源 | 复现 (单机, 数千美元 API) |
| 2502.05167 (NoLiMa) | 隐式关联长上下文评测 | Effective length (≥85% base) | GPT-4o 8K, Llama 3.3 70B 2K (vs 声称 128K) | 13 frontier LLM | 开源 | 复现 (API 费 $10K–30K) |
| 2506.08371 (PCD) | 解码端 PSA 修复 | InfiniteBench KV-Retr / RULER VT | +7.0% (8K) / +6.71 F1 (8K) | Llama-3-8B (8K/262K/1048K) | 未公开 | 部分 (算法清晰, ~100 行可实现) |
| 2510.08377 (UniVideo) | 统一视频理解/生成/编辑 | SC (Subject Consistency) | 0.88 single-ref (vs Kling 0.68) | Qwen2.5VL-7B + HunyuanVideo-13B | 开源 | 部分 (内部训练数据) |
| 2511.05850 (LITM消除) | 单针 LITM 是否消失 | Accuracy @ context fill | 26/26 (100%) at 0.13–0.92× ctx | Gemini 2.5 Flash (closed) | 未公开 | 复现 ($1–2 API cost) |
| 2601.15300 (Degradation) | 长上下文 cliff 量化 | Lc (临界比率) / F1 drop | 43.2% / -45.5% | Qwen2.5-7B-Instruct | 开源 | 复现 |
| 2605.06113 (BalanceRoute) | DP 负载均衡 | 吞吐 / 不均衡 | +15.4% / 4.1× 降不均衡 | DeepSeek-V3 671B, 144-NPU 910C | 未公开 | 不可 (Ascend 硬件, 代码未开源) |
| 2605.16637 (HexAGenT) | Workflow-aware 调度 | Req95 / Req99 reduction | -20.1% / -33.0% avg | Llama-3.1-70B / Qwen3-235B, A100/H100/H200 | 未公开 | 不可 (代码/simulator 未公开) |
| blog-dynamic-context-discovery | Agent 上下文管理 | Token reduction (MCP) | -46.9% | Cursor agent harness | 部分 (产品内置) | 不可 (产品特定) |
| 论文 | Strength | Weakness | Best-for 场景 |
|---|---|---|---|
| 2404.16811 (FilM/IN2) | 仅靠数据即可修复 LITM, 不改架构; VaL 超 GPT-4-Turbo | 仅 32K 验证; GPT-4 数据 $50K+; HellaSwag/ARC-C 退化 4–5pp | 7B-class 模型长上下文 SFT 的标准 recipe |
| 2412.10079 (Lost-In-Between) | 首次解耦 absolute position 与 between-distance; adjacent vs separated 跨模型稳定 | 仅 2023 模型; 9 个位置组合可能不够代表; 未提新算法 | RAG evidence packing 策略的理论依据 |
| 2502.05167 (NoLiMa) | ROUGE-L 0.07 彻底消除字面匹配; Last-2K 实验分离 RoPE vs attention SNR | 单针设计; 英文 Western 知识锚定; 无训练侧干预 | 长上下文模型选型的黄金标准评测 |
| 2506.08371 (PCD) | Training-free 即插即用; 理论 decay rate bound | 双 forward 使 throughput 减半; 短上下文有 regression; 依赖 RoPE | 生产中 8K–32K 段的快速长上下文提升 |
| 2510.08377 (UniVideo) | 首个统一视频理解/生成/编辑; 零样本泛化; SC 大幅领先 | VBench T2V 落后 Wan2.1; delete 任务弱; 129帧/854px 限制 | 多任务视频创作 agent |
| 2511.05850 (LITM消除) | 干净控制变量; 精确 API context cap 探测; 极低复现成本 | 单模型/单针/单域; N=26 统计功效弱; 无代码 | 作为 RAG vs 全上下文策略的决策依据 |
| 2601.15300 (Degradation) | Natural length 消除 truncation 噪声; 三瓶颈统一框架 | 单模型/单任务; 4/5 detector 共享 filter; cliff vs slope 可争议 | 推理框架的 context budget 软上限设计 |
| 2605.06113 (BalanceRoute) | 分段线性 F-score 精确编码 barrier 不对称性; 优势随 G 超线性增长 | 无理论 competitive ratio; 代码未公开; Ascend 硬件绑定 | 大规模 DP decode 集群的路由层 |
| 2605.16637 (HexAGenT) | Workflow-level SLO 归一化; 异构 P-D joint placement; 对估计误差 robust | 无 competitive ratio 证明; 代码/simulator 未公开 | 异构集群上的 agentic workflow 调度 |
| blog-dynamic-context-discovery | 46.9% token 减少; 无新协议, 用文件系统作通用接口 | 仅定性质量改善; 产品特定, 非通用框架 | Agent harness 的上下文管理设计模式 |
文档预处理(摘要 / KG 三元组)能压平多跳 QA 位置曲线,但绝对准确率下跌 1/3–1/2——GPT-3.5 HotpotQA 从 73.9% 掉至 KG 54.3% / Summary 59.5% [2412.10079]。弱模型反而从裁剪受益(Llama-longlora + KG 优于 Full),说明裁剪是弱模型友好预处理而非通用优化 [2412.10079]。
| 路径 | 训练成本 | 推理额外开销 | 主要收益 |
|---|---|---|---|
| IN2 数据合成 [2404.16811] | $60K–120K (GPT-4 + A100) | 无 | VaL +38.6 |
| PCD 对比解码 [2506.08371] | 零 | throughput 减半 (双 forward) | InfiniteBench +7% / LongBench +0.89 |
| SegR / Rephrasing [2506.08371] | 零 | prompt 改写延迟 | LongBench SegR 崩盘至 12.18 |
| Dynamic context discovery [blog-dynamic-context-discovery] | 产品工程 | 文件 I/O 延迟 (可忽略) | Token -46.9% |
三层任务难度逐级暴露有效长度缩水:
BalanceRoute 的 F-score 在毫秒级决策窗口内用 $O(1)$ 求值 [2605.06113],而 HexAGenT 的 projected ratio 需要维护 online DAG + horizon 重计算,per-invocation 10–15 ms [2605.16637]。前者 per-step 路由、后者 per-workflow 全局规划——粒度越细开销越低但优化范围越窄。
UniVideo 冻结 MLLM 避免生成训练损害理解(MMBench 83.5 保持),代价是无端到端联合优化 [2510.08377]。FilM-7B 的 IN2 训练在常识推理上退化(HellaSwag -4.5 / ARC-C -3.4),OpenOrca 11% anchor 未完全兜住 [2404.16811]。
McKinnon 2511.05850 证明 Gemini 2.5 Flash 单针 LITM 完全消失 [2511.05850],但 NoLiMa 2502.05167 证明即使是同期最强 GPT-4o,去字面匹配后有效长度仅 8K [2502.05167];Wang 2601.15300 量化 Qwen2.5-7B cliff 在 43% 标称 [2601.15300]。
矛盾根源: 三者的任务难度层级完全不同。2511.05850 测的是 single-needle factoid(ROUGE-L ~ 0.86 级字面匹配),2502.05167 测的是 latent associative recall(ROUGE-L ~ 0.07),2601.15300 测的是 NarrativeQA 阅读理解。字面匹配检索已被训练课程饱和,但隐式推理能力尚未受益于同类训练——LITM 的"消失"是任务条件的函数,不是绝对结论。
FilM 2404.16811 核心论点:LITM 是数据问题,不改架构仅靠 IN2 合成数据即可修复 [2404.16811]。但 NoLiMa 2502.05167 Last-2K 实验证明固定 RoPE 相对距离后性能仍随 L 下降——指向 attention SNR [2502.05167]。PCD 2506.08371 则从频率分工角度论证 RoPE 低频衰减可被解码侧修复 [2506.08371]。
矛盾根源: 三种归因作用于不同层级。IN2 数据修复的是训练阶段的位置偏置先验(数据层),attention SNR 是推理时 softmax 在长序列下的统计退化(计算层),RoPE 频率衰减是位置编码的固有特性(表示层)。三者可同时成立且互不矛盾——只是论文各自将自己的层级表述为"根因"。完整修复可能需要三层叠加:IN2-style 训练 + PCD 解码 + 架构级 attention 改进。
Wang 2601.15300 声称 cliff-like degradation(F1 在 10% ratio 窗口内骤降 45.5%),但 Figure 1 趋势线更接近"缓降 + 局部 dip",4/5 detector 共享 3-stage filter 等于预设了 cliff 形状 [2601.15300]。Definition 3 的 30% 阈值无理论依据。
矛盾根源: 检测方法论与叙事互相强化。rise-in-range filter 排除了非单调下降的 peak,剩下的最大 drop 自然呈 cliff 形态。更保守的解读是"存在显著退化区间",但未必是阶跃。换 25%/50% 阈值结论可能改变。
HexAGenT 2605.16637 表明 per-call FCFS 需要 $\alpha = 5.85$–26.89 才达 95% SLO,而 workflow-FCFS 立即减 31.4% [2605.16637]。但 BalanceRoute 2605.06113 聚焦 per-step DP 负载均衡也取得 +15.4% 吞吐 [2605.06113]。
矛盾根源: 优化层级不同。BalanceRoute 优化的是 decode tier 内部 worker 间均衡(intra-stage),HexAGenT 优化的是跨 prefill-decode-workflow 的全局排序(inter-stage)。两者互补而非替代——理想系统在 workflow 级做 projected-ratio 排序,在 decode 级做 F-score 均衡。
基于 §2 Taxonomy 的维度交叉,以下组合在现有 10 篇中无人覆盖但技术上可行:
| Gap | 维度组合 | 技术可行性依据 |
|---|---|---|
| 长上下文 repair × serving-routing | repair + serving-routing | PCD 的双 forward 可在 serving 框架中通过 KV cache 共享 K projection 优化到 ~1.2× overhead,但无人验证 |
| 多针 NoLiMa 评测 | diagnosis + multi-needle | 当前 NoLiMa 单针 [2502.05167];多针设定技术上只需扩展 needle 注入,已有 RULER multi-NIAH 先例 |
| IN2 在 64K–1M 的外推 | repair + 超长上下文 | IN2 框架天然可扩展 reject sampling bin 到 128K/1M [2404.16811],只需更多 GPT-4 调用 |
| PCD × long-context training 叠加 | repair + repair | 先 LongRoPE/ProLong 再叠 PCD,验证叠加性 [2506.08371] |
| Workflow-aware 调度 × DP 均衡 | scheduling + scheduling | BalanceRoute 解 intra-decode,HexAGenT 解 inter-stage;组合系统在 workflow 级 projected-ratio 排序 + decode 级 F-score 均衡 |
| Non-RoPE 架构的 cliff 行为 | diagnosis + 新架构 | 2601.15300 Table 4 给了 ALiBi 70–80% 的 conjecture 但未实测 [2601.15300] |
| Dynamic context discovery × 长上下文 benchmark | context-management + diagnosis | 惰性加载能否改善 NoLiMa 有效长度?通过减少无关 token 提升 attention SNR |
| UniVideo + workflow 调度 | multimodal + scheduling | 多步视频生成 workflow(理解→生成→编辑)需要 agentic 调度,HexAGenT 的 DAG 模型天然适用 |
| 场景 | 推荐方案 | 原因 |
|---|---|---|
| 7B-class 模型需要 32K 长上下文 | IN2-style 数据合成 + SFT [2404.16811] | 一次性训练投入后推理零开销,VaL 超 GPT-4-Turbo,已有开源 recipe |
| 生产中 8K–32K 段快速提升,不能重训 | PCD 对比解码 [2506.08371] | Training-free,~100 行 LogitsProcessor 即可实现,InfiniteBench +7% |
| 长上下文模型选型评测 | NoLiMa [2502.05167] + RULER + 2601.15300 cliff 检测 | NoLiMa 测隐式召回有效长度,cliff 检测给出 stable context 上限 |
| RAG 管道 evidence 排序 | Adjacent gold packing [2412.10079] | 多跳 QA 中证据聚簇相邻 +1–7 pp,零成本 |
| 大规模 DP decode 集群路由 | BalanceRoute F-score 两阶段 [2605.06113] | 吞吐 +15.4%,优势随 G 超线性增长,适合 G≥8 场景 |
| 异构集群 agentic workflow 调度 | HexAGenT projected-ratio [2605.16637] | Workflow-level SLO,Req99 最大 -80.5%,对估计误差 robust |
| Agent 上下文膨胀 | Dynamic context discovery [blog-dynamic-context-discovery] + context budget 40% rule [2601.15300] | 惰性加载减 46.9% token;prompt 超 40% 标称长度时触发 RAG/分段 |
| 统一视频创作 agent | UniVideo 双流架构 [2510.08377] | 唯一同时支持理解+生成+编辑+零样本泛化的统一模型 |
| ID | 标题 | 子主题 | 日期 |
|---|---|---|---|
| 2404.16811 | Make Your LLM Fully Utilize the Context (FilM-7B / IN2) | 数据驱动 LITM 修复 | 2024-04 |
| 2412.10079 | Lost in the Middle, and In-Between | 多跳位置偏置诊断 | 2024-12 |
| 2502.05167 | NoLiMa: Long-Context Beyond Literal Matching | 隐式关联长上下文评测 | 2025-02 |
| 2506.08371 | Positional Contrastive Decoding (PCD) | Training-free 解码修复 | 2025-06 |
| 2510.08377 | UniVideo: Unified Video Understanding/Generation/Editing | 统一多模态视频 | 2025-10 |
| 2511.05850 | Retrieval Quality at Context Limit | 单针 LITM 消除验证 | 2025-11 |
| 2601.15300 | Intelligence Degradation in Long-Context LLMs | 临界点量化 + 三瓶颈框架 | 2026-01 |
| 2605.06113 | BalanceRoute: DP Load Balancing for LLM Serving | Barrier-aware DP 路由 | 2026-05 |
| 2605.16637 | HexAGenT: Workflow- and Heterogeneity-Aware Scheduling | Agentic workflow DAG 调度 | 2026-05 |
| blog-dynamic-context-discovery | Dynamic Context Discovery | Agent 惰性上下文加载 | 2025 |