algorithm Survey

10 papers

Algorithm 类别综述:长上下文质量审计、服务调度与统一多模态 #

1. 现状快照 #

Algorithm 类别当前被三条主线主导。长上下文 LLM 的位置偏置诊断、评测与修复仍是最大子群(6/10 篇),覆盖从数据驱动训练修复到推理时解码修复的完整栈。LLM 服务调度算法新增为第二条主线(3/10 篇),包含 DP 负载均衡 [2605.06113]、workflow-aware agentic 调度 [2605.16637]、以及 agent 上下文惰性加载 [blog-dynamic-context-discovery]统一多模态视频(1/10 篇)独立成支 [2510.08377]。长上下文算法已从"能否支持 128K"进入"在 128K 里到底能用多少"的精细审计阶段;LLM 服务调度从 per-request 正走向 workflow-level + barrier-aware 的结构感知优化。

2. Taxonomy #

维度定义 #

维度取值说明
问题域long-context-diagnosis · long-context-repair · serving-scheduling · context-management · unified-multimodal论文解决的核心问题
干预阶段training · inference-decoding · serving-routing · context-assembly · evaluation-only在 LLM 生命周期的哪个阶段生效
方法性质data-engineering · algorithm-design · system-design · benchmark-design核心贡献的性质分类

Taxonomy 矩阵 #

论文问题域干预阶段方法性质
2404.16811 (FilM/IN2)long-context-repairtrainingdata-engineering
2412.10079 (Lost-In-Between)long-context-diagnosisevaluation-onlybenchmark-design
2502.05167 (NoLiMa)long-context-diagnosisevaluation-onlybenchmark-design
2506.08371 (PCD)long-context-repairinference-decodingalgorithm-design
2510.08377 (UniVideo)unified-multimodaltrainingalgorithm-design
2511.05850 (LITM-消除)long-context-diagnosisevaluation-onlybenchmark-design
2601.15300 (Intelligence Degradation)long-context-diagnosisevaluation-onlybenchmark-design
2605.06113 (BalanceRoute)serving-schedulingserving-routingalgorithm-design
2605.16637 (HexAGenT)serving-schedulingserving-routingalgorithm-design
blog-dynamic-context-discoverycontext-managementcontext-assemblysystem-design

3. 主线与分支 #

3.1 长上下文位置偏置——诊断与评测 #

本类别最密集的子簇(4 篇),从不同维度刻画 LLM 在长上下文中的信息利用失败。

Baker et al. (2412.10079) 将单跳 LITM U 形曲线推广到多跳 QA,发现第二层退化变量——多个证据片段之间的相对距离(lost-in-between)。Adjacent 配置在所有 (model, dataset) 对上稳定优于 separated 1–7 pp;CoT 在非指令微调模型上反而导致准确率崩溃至 ≤1% [2412.10079]

Modarressi et al. (2502.05167, NoLiMa) 揭示主流长上下文 benchmark 的致命缺陷——ROUGE-L precision 0.5–0.96,模型靠字面匹配即可得高分。NoLiMa 将 ROUGE-L 压到 0.07,迫使模型依赖隐式关联推理,结果 13/13 前沿 LLM 有效长度全部 ≤8K [2502.05167]。单 distractor 句子即可将 GPT-4o 有效长度从 8K 塌到 1K [2502.05167]

McKinnon (2511.05850) 从对立面证明:单针事实检索上 Gemini 2.5 Flash 在 1M token 窗口(92% 填充率)内达到 100% 准确率——LITM U 形曲线在该子任务上完全消失 [2511.05850]。结论严格限于单针 + 事实查询 + 单一模型。

Wang et al. (2601.15300) 提出 Natural Length Distribution Analysis,用 5 种检测器交叉验证量化 Qwen2.5-7B 在 128K 下出现悬崖式衰退的临界点 Lc ≈ 43.2%(≈55K tokens),F1 骤降 45.5%。三瓶颈框架(RoPE 周期 / attention 弥散 / 信息瓶颈)将 cliff 归因于 attention 弥散比 RoPE aliasing 更早触发 [2601.15300]

3.2 长上下文位置偏置——修复 #

An et al. (2404.16811, FilM-7B / IN2) 是最干净的数据驱动方案:GPT-4 合成 1.75M QA 数据,强制目标段在 4K–32K 上下文中均匀分布,仅靠 instruction tuning 将 Mistral-7B VaL Probing 从 47.3 提升至 85.9(超 GPT-4-Turbo 79.0),min-max gap 从 56.2 压到 13.9 [2404.16811]。核心论点:lost-in-the-middle 是数据问题,不是架构问题 [2404.16811]

Xiao et al. (2506.08371, PCD) 从解码空间切入,发现 gold token 后验排名退到 3–6 位但始终在 top-8(Posterior Salience Attenuation),通过对 RoPE 低频分量过旋转做对比解码,零训练成本将 InfiniteBench KV Retrieval 8K 段从 72→79%。衰减率被压缩至 $(\ln B'/\ln B)^{2/d}<1$ [2506.08371]

3.3 LLM 服务调度 #

BalanceRoute (2605.06113) 解决 DP decode 的 barrier 同步负载不均:分段线性 F-score 捕获 safe-margin fill 与 overflow 之间 $(G{-}1)$ 倍不对称性,两阶段算法(贪心填充 + 精细子集选择)在毫秒级预算内完成。BR-H(含轻量二元终止分类器)在 144-NPU Ascend 910C 集群上吞吐 +15.4% over JSQ,优势随 $G$ 超线性增长($\Delta \propto G^{0.69}$) [2605.06113]

HexAGenT (2605.16637) 将 agentic workflow 建模为 online-revealed DAG,用 projected scaled-SLO risk 排序 + 联合 prefill/decode placement,在异构 A100/H100/H200 P-D 分离集群上平均降低 Req95 20.1%、Req99 33.0%,最大分别达 45.0%/80.5%。Workflow-aware 排序本身是主收益来源(同构集群仍降 24.0%/35.4%) [2605.16637]

Dynamic Context Discovery (blog) 将所有 agent 辅助上下文(tool output、chat history、MCP schema、terminal session)统一为文件系统上的惰性加载对象,A/B 测试显示 MCP-heavy session token 消耗减少 46.9% [blog-dynamic-context-discovery]

3.4 统一多模态视频 #

Wei et al. (2510.08377, UniVideo) 双流架构(冻结 MLLM + MMDiT),通过 MLP self-attention 对齐,首次统一视频理解/生成/编辑。3 阶段 35K 步训练,in-context 生成 SC=0.88 大幅超越 Kling1.6(0.68),且展现零样本泛化到未见编辑任务的能力 [2510.08377]

4. 跨论文对比表 #

论文核心问题核心指标关键数字测试模型/硬件代码开源可复现性
2404.16811 (FilM/IN2)LITM 数据修复VaL Avg / Gap85.9 / 13.9 (超 GPT-4-Turbo 79.0/32.1)Mistral-7B → FilM-7B, 128×A100开源 (GitHub+HF)部分 (训练数据未公开, GPT-4 调用 $50K–100K)
2412.10079 (Lost-In-Between)多跳位置偏置Adjacent vs Separated Δacc+1–7 pp (跨模型稳定)GPT-3.5 / MPT-7B / Llama-2-longlora开源复现 (单机, 数千美元 API)
2502.05167 (NoLiMa)隐式关联长上下文评测Effective length (≥85% base)GPT-4o 8K, Llama 3.3 70B 2K (vs 声称 128K)13 frontier LLM开源复现 (API 费 $10K–30K)
2506.08371 (PCD)解码端 PSA 修复InfiniteBench KV-Retr / RULER VT+7.0% (8K) / +6.71 F1 (8K)Llama-3-8B (8K/262K/1048K)未公开部分 (算法清晰, ~100 行可实现)
2510.08377 (UniVideo)统一视频理解/生成/编辑SC (Subject Consistency)0.88 single-ref (vs Kling 0.68)Qwen2.5VL-7B + HunyuanVideo-13B开源部分 (内部训练数据)
2511.05850 (LITM消除)单针 LITM 是否消失Accuracy @ context fill26/26 (100%) at 0.13–0.92× ctxGemini 2.5 Flash (closed)未公开复现 ($1–2 API cost)
2601.15300 (Degradation)长上下文 cliff 量化Lc (临界比率) / F1 drop43.2% / -45.5%Qwen2.5-7B-Instruct开源复现
2605.06113 (BalanceRoute)DP 负载均衡吞吐 / 不均衡+15.4% / 4.1× 降不均衡DeepSeek-V3 671B, 144-NPU 910C未公开不可 (Ascend 硬件, 代码未开源)
2605.16637 (HexAGenT)Workflow-aware 调度Req95 / Req99 reduction-20.1% / -33.0% avgLlama-3.1-70B / Qwen3-235B, A100/H100/H200未公开不可 (代码/simulator 未公开)
blog-dynamic-context-discoveryAgent 上下文管理Token reduction (MCP)-46.9%Cursor agent harness部分 (产品内置)不可 (产品特定)

5. Strength-weakness matrix #

论文StrengthWeaknessBest-for 场景
2404.16811 (FilM/IN2)仅靠数据即可修复 LITM, 不改架构; VaL 超 GPT-4-Turbo仅 32K 验证; GPT-4 数据 $50K+; HellaSwag/ARC-C 退化 4–5pp7B-class 模型长上下文 SFT 的标准 recipe
2412.10079 (Lost-In-Between)首次解耦 absolute position 与 between-distance; adjacent vs separated 跨模型稳定仅 2023 模型; 9 个位置组合可能不够代表; 未提新算法RAG evidence packing 策略的理论依据
2502.05167 (NoLiMa)ROUGE-L 0.07 彻底消除字面匹配; Last-2K 实验分离 RoPE vs attention SNR单针设计; 英文 Western 知识锚定; 无训练侧干预长上下文模型选型的黄金标准评测
2506.08371 (PCD)Training-free 即插即用; 理论 decay rate bound双 forward 使 throughput 减半; 短上下文有 regression; 依赖 RoPE生产中 8K–32K 段的快速长上下文提升
2510.08377 (UniVideo)首个统一视频理解/生成/编辑; 零样本泛化; SC 大幅领先VBench T2V 落后 Wan2.1; delete 任务弱; 129帧/854px 限制多任务视频创作 agent
2511.05850 (LITM消除)干净控制变量; 精确 API context cap 探测; 极低复现成本单模型/单针/单域; N=26 统计功效弱; 无代码作为 RAG vs 全上下文策略的决策依据
2601.15300 (Degradation)Natural length 消除 truncation 噪声; 三瓶颈统一框架单模型/单任务; 4/5 detector 共享 filter; cliff vs slope 可争议推理框架的 context budget 软上限设计
2605.06113 (BalanceRoute)分段线性 F-score 精确编码 barrier 不对称性; 优势随 G 超线性增长无理论 competitive ratio; 代码未公开; Ascend 硬件绑定大规模 DP decode 集群的路由层
2605.16637 (HexAGenT)Workflow-level SLO 归一化; 异构 P-D joint placement; 对估计误差 robust无 competitive ratio 证明; 代码/simulator 未公开异构集群上的 agentic workflow 调度
blog-dynamic-context-discovery46.9% token 减少; 无新协议, 用文件系统作通用接口仅定性质量改善; 产品特定, 非通用框架Agent harness 的上下文管理设计模式

6. 核心 trade-off 轴 #

轴 1:位置鲁棒性 vs 绝对准确率 #

文档预处理(摘要 / KG 三元组)能压平多跳 QA 位置曲线,但绝对准确率下跌 1/3–1/2——GPT-3.5 HotpotQA 从 73.9% 掉至 KG 54.3% / Summary 59.5% [2412.10079]。弱模型反而从裁剪受益(Llama-longlora + KG 优于 Full),说明裁剪是弱模型友好预处理而非通用优化 [2412.10079]

轴 2:训练成本 vs 推理成本 vs 效果增幅 #

路径训练成本推理额外开销主要收益
IN2 数据合成 [2404.16811]$60K–120K (GPT-4 + A100)VaL +38.6
PCD 对比解码 [2506.08371]throughput 减半 (双 forward)InfiniteBench +7% / LongBench +0.89
SegR / Rephrasing [2506.08371]prompt 改写延迟LongBench SegR 崩盘至 12.18
Dynamic context discovery [blog-dynamic-context-discovery]产品工程文件 I/O 延迟 (可忽略)Token -46.9%

轴 3:声称上下文长度 vs 有效上下文长度 #

三层任务难度逐级暴露有效长度缩水:

轴 4:调度感知粒度 vs 算法复杂度 #

BalanceRoute 的 F-score 在毫秒级决策窗口内用 $O(1)$ 求值 [2605.06113],而 HexAGenT 的 projected ratio 需要维护 online DAG + horizon 重计算,per-invocation 10–15 ms [2605.16637]。前者 per-step 路由、后者 per-workflow 全局规划——粒度越细开销越低但优化范围越窄。

轴 5:理解能力保持 vs 生成能力获取 #

UniVideo 冻结 MLLM 避免生成训练损害理解(MMBench 83.5 保持),代价是无端到端联合优化 [2510.08377]。FilM-7B 的 IN2 训练在常识推理上退化(HellaSwag -4.5 / ARC-C -3.4),OpenOrca 11% anchor 未完全兜住 [2404.16811]

7. 冲突与调和 #

冲突 1:LITM 已消失 vs 有效长度仅 8K #

McKinnon 2511.05850 证明 Gemini 2.5 Flash 单针 LITM 完全消失 [2511.05850],但 NoLiMa 2502.05167 证明即使是同期最强 GPT-4o,去字面匹配后有效长度仅 8K [2502.05167];Wang 2601.15300 量化 Qwen2.5-7B cliff 在 43% 标称 [2601.15300]

矛盾根源: 三者的任务难度层级完全不同。2511.05850 测的是 single-needle factoid(ROUGE-L ~ 0.86 级字面匹配),2502.05167 测的是 latent associative recall(ROUGE-L ~ 0.07),2601.15300 测的是 NarrativeQA 阅读理解。字面匹配检索已被训练课程饱和,但隐式推理能力尚未受益于同类训练——LITM 的"消失"是任务条件的函数,不是绝对结论。

冲突 2:数据问题 vs 架构/attention 问题 #

FilM 2404.16811 核心论点:LITM 是数据问题,不改架构仅靠 IN2 合成数据即可修复 [2404.16811]。但 NoLiMa 2502.05167 Last-2K 实验证明固定 RoPE 相对距离后性能仍随 L 下降——指向 attention SNR [2502.05167]。PCD 2506.08371 则从频率分工角度论证 RoPE 低频衰减可被解码侧修复 [2506.08371]

矛盾根源: 三种归因作用于不同层级。IN2 数据修复的是训练阶段的位置偏置先验(数据层),attention SNR 是推理时 softmax 在长序列下的统计退化(计算层),RoPE 频率衰减是位置编码的固有特性(表示层)。三者可同时成立且互不矛盾——只是论文各自将自己的层级表述为"根因"。完整修复可能需要三层叠加:IN2-style 训练 + PCD 解码 + 架构级 attention 改进。

冲突 3:Cliff vs Slope #

Wang 2601.15300 声称 cliff-like degradation(F1 在 10% ratio 窗口内骤降 45.5%),但 Figure 1 趋势线更接近"缓降 + 局部 dip",4/5 detector 共享 3-stage filter 等于预设了 cliff 形状 [2601.15300]。Definition 3 的 30% 阈值无理论依据。

矛盾根源: 检测方法论与叙事互相强化。rise-in-range filter 排除了非单调下降的 peak,剩下的最大 drop 自然呈 cliff 形态。更保守的解读是"存在显著退化区间",但未必是阶跃。换 25%/50% 阈值结论可能改变。

冲突 4:Per-call 调度是否足够? #

HexAGenT 2605.16637 表明 per-call FCFS 需要 $\alpha = 5.85$–26.89 才达 95% SLO,而 workflow-FCFS 立即减 31.4% [2605.16637]。但 BalanceRoute 2605.06113 聚焦 per-step DP 负载均衡也取得 +15.4% 吞吐 [2605.06113]

矛盾根源: 优化层级不同。BalanceRoute 优化的是 decode tier 内部 worker 间均衡(intra-stage),HexAGenT 优化的是跨 prefill-decode-workflow 的全局排序(inter-stage)。两者互补而非替代——理想系统在 workflow 级做 projected-ratio 排序,在 decode 级做 F-score 均衡。

8. Gaps #

基于 §2 Taxonomy 的维度交叉,以下组合在现有 10 篇中无人覆盖但技术上可行

Gap维度组合技术可行性依据
长上下文 repair × serving-routingrepair + serving-routingPCD 的双 forward 可在 serving 框架中通过 KV cache 共享 K projection 优化到 ~1.2× overhead,但无人验证
多针 NoLiMa 评测diagnosis + multi-needle当前 NoLiMa 单针 [2502.05167];多针设定技术上只需扩展 needle 注入,已有 RULER multi-NIAH 先例
IN2 在 64K–1M 的外推repair + 超长上下文IN2 框架天然可扩展 reject sampling bin 到 128K/1M [2404.16811],只需更多 GPT-4 调用
PCD × long-context training 叠加repair + repair先 LongRoPE/ProLong 再叠 PCD,验证叠加性 [2506.08371]
Workflow-aware 调度 × DP 均衡scheduling + schedulingBalanceRoute 解 intra-decode,HexAGenT 解 inter-stage;组合系统在 workflow 级 projected-ratio 排序 + decode 级 F-score 均衡
Non-RoPE 架构的 cliff 行为diagnosis + 新架构2601.15300 Table 4 给了 ALiBi 70–80% 的 conjecture 但未实测 [2601.15300]
Dynamic context discovery × 长上下文 benchmarkcontext-management + diagnosis惰性加载能否改善 NoLiMa 有效长度?通过减少无关 token 提升 attention SNR
UniVideo + workflow 调度multimodal + scheduling多步视频生成 workflow(理解→生成→编辑)需要 agentic 调度,HexAGenT 的 DAG 模型天然适用

9. Practical recommendation #

场景推荐方案原因
7B-class 模型需要 32K 长上下文IN2-style 数据合成 + SFT [2404.16811]一次性训练投入后推理零开销,VaL 超 GPT-4-Turbo,已有开源 recipe
生产中 8K–32K 段快速提升,不能重训PCD 对比解码 [2506.08371]Training-free,~100 行 LogitsProcessor 即可实现,InfiniteBench +7%
长上下文模型选型评测NoLiMa [2502.05167] + RULER + 2601.15300 cliff 检测NoLiMa 测隐式召回有效长度,cliff 检测给出 stable context 上限
RAG 管道 evidence 排序Adjacent gold packing [2412.10079]多跳 QA 中证据聚簇相邻 +1–7 pp,零成本
大规模 DP decode 集群路由BalanceRoute F-score 两阶段 [2605.06113]吞吐 +15.4%,优势随 G 超线性增长,适合 G≥8 场景
异构集群 agentic workflow 调度HexAGenT projected-ratio [2605.16637]Workflow-level SLO,Req99 最大 -80.5%,对估计误差 robust
Agent 上下文膨胀Dynamic context discovery [blog-dynamic-context-discovery] + context budget 40% rule [2601.15300]惰性加载减 46.9% token;prompt 超 40% 标称长度时触发 RAG/分段
统一视频创作 agentUniVideo 双流架构 [2510.08377]唯一同时支持理解+生成+编辑+零样本泛化的统一模型

10. 参考 #

ID标题子主题日期
2404.16811Make Your LLM Fully Utilize the Context (FilM-7B / IN2)数据驱动 LITM 修复2024-04
2412.10079Lost in the Middle, and In-Between多跳位置偏置诊断2024-12
2502.05167NoLiMa: Long-Context Beyond Literal Matching隐式关联长上下文评测2025-02
2506.08371Positional Contrastive Decoding (PCD)Training-free 解码修复2025-06
2510.08377UniVideo: Unified Video Understanding/Generation/Editing统一多模态视频2025-10
2511.05850Retrieval Quality at Context Limit单针 LITM 消除验证2025-11
2601.15300Intelligence Degradation in Long-Context LLMs临界点量化 + 三瓶颈框架2026-01
2605.06113BalanceRoute: DP Load Balancing for LLM ServingBarrier-aware DP 路由2026-05
2605.16637HexAGenT: Workflow- and Heterogeneity-Aware SchedulingAgentic workflow DAG 调度2026-05
blog-dynamic-context-discoveryDynamic Context DiscoveryAgent 惰性上下文加载2025

Papers in algorithm (46)

2608.03893 · Synthesis
1706.03762 · Synthesis
2005.11401 · Synthesis
2110.14168 · Synthesis
2407.21783 · Synthesis
2505.09388 · Synthesis
2401.18059 · Synthesis
2402.06363 · Synthesis
2511.02237 · Synthesis
2604.27792 · Synthesis
2605.00529 · Synthesis
2605.03941 · Synthesis
2605.1209
2607.01224 · Synthesis
2607.03941 · Synthesis
2601.15709 · Synthesis
2601.21998 · Synthesis
2602.15922 · Synthesis
2603.08546 · Synthesis
2603.16666 · Synthesis
2606.01027 · Synthesis
2606.01164 · Synthesis
2606.15768 · Synthesis
2301.04104 · Synthesis
2606.18375 · Synthesis
2606.16533 · Synthesis
2605.19330 · Synthesis
2601.16175 · Synthesis
2602.11688 · Synthesis
2602.12675 · Synthesis
2507.20534 · Synthesis
2410.02367 · Synthesis
2412.14335 · Synthesis
2502.01563 · Synthesis
2502.05167 · Synthesis
2503.20215 · Synthesis
2505.11594 · Synthesis
2509.24006 · Synthesis
2510.08377 · Synthesis
2510.22200 · Synthesis
2511.02132 · Synthesis
2511.05850 · Synthesis
2602.02276 · Synthesis
2603.15031 · Synthesis
2604.14148 · Synthesis
blog-dynamic-context-discovery · Synthesis