Kimi K2.5: Visual Agentic Intelligence

algorithm 2602.02276
RLmultimodal-trainingagent-orchestrationzero-vision-SFTtoken-efficiency

Kimi K2.5: Visual Agentic Intelligence #

Kimi Team (Moonshot AI) | 2026-02 | Category: algorithm | Tags: RL, multimodal-training, agent-orchestration, zero-vision-SFT, token-efficiency

§1 TL;DR #

K2.5 提出四项训练算法创新:(1) 早期融合低比例 (10:90) 联合视觉-文本预训练;(2) 零视觉 SFT——仅用文本 SFT 激活视觉推理;(3) PARL——冻结子 agent + 编排器 RL 的去耦多 agent 训练;(4) Toggle——交替 budget/full-length 的 token 高效 RL。Agent Swarm 实现 3–4.5× 延迟降低。

§2 Q1 / Q2 / Q3 #

Problem Formulation #

Objective: K2.5 同时优化两个目标——(a) 多模态联合策略 $\pi_\theta$ 在文本和视觉任务上的奖励期望,(b) 多 agent 编排器的任务质量 $r_{\text{perf}}$ 在 CriticalSteps 约束下的最大化。

核心 RL 损失:

$$L_{\mathrm{RL}}(\theta) = \mathbb{E}_{x \sim \mathcal{D}}\left[\frac{1}{N}\sum_{j=1}^{K}\sum_{i=1}^{|y_j|} \mathrm{Clip}\left(\frac{\pi_\theta(y_j^i \mid x, y_j^{0:i})}{\pi_{\mathrm{old}}(y_j^i \mid x, y_j^{0:i})}, \alpha, \beta\right)(r(x, y_j) - \bar{r}(x)) - \tau\left(\log\frac{\pi_\theta(y_j^i \mid x, y_j^{0:i})}{\pi_{\mathrm{old}}(y_j^i \mid x, y_j^{0:i})}\right)^2\right]$$

PARL 编排器奖励:

$$r_{\mathrm{PARL}}(x,y) = \lambda_{1} \cdot r_{\text{parallel}} + \lambda_{2} \cdot r_{\text{finish}} + r_{\text{perf}}(x,y)$$

Assumptions: (1) 任务 $x$ 从 $\mathcal{D}$ i.i.d. 采样;(2) off-policy importance sampling 在 $[\alpha, \beta]$ 内有效;(3) 子 agent 输出视为环境观测(非可微分决策点);(4) Toggle 的 budget 基于前序正确 rollout 的长度分布(隐含稳态假设)。

I/O per step: 输入为问题 $x$ 与 $K$ 条 rollout $\{y_1, \ldots, y_K\}$(来自 $\pi_{\text{old}}$),输出为更新后策略 $\pi_\theta$。

Q1 痛点 #

  1. 晚期视觉注入是次优的:传统做法在训练后期以高比例(≥50%)注入视觉 token,实际上损害了文本能力且未提升视觉性能。
  2. 高质量视觉 SFT 数据稀缺且损害泛化:人工标注的视觉 CoT 轨迹多样性不足,直接加入 SFT 反而降低视觉 agentic 任务表现。
  3. 顺序执行的延迟瓶颈:单 agent 推理时间随任务复杂度线性增长(从 1.8× 到 7.0× 基线),在 wide-search 场景不可接受。
  4. Multi-agent RL 的 credit assignment 困难:端到端联合优化编排器和执行 agent 导致梯度信号模糊和训练不稳定。
  5. Q2 方法 #

    Innovation 1 — 早期融合低比例预训练:以 vision:text = 10:90 在 ~15T tokens 上从训练初期联合预训练,让模型自然发展平衡的多模态表征。

    Innovation 2 — 零视觉 SFT:仅使用文本 SFT 数据,通过 IPython 程序代理图像操作(binarization、像素计数、定位等)激活视觉能力。可行性源于联合预训练已建立的跨模态对齐。

    Innovation 3 — Token-level log-ratio RL:不同于 PPO 的 sign-dependent clipping,K2.5 在 log-ratio $\log(\pi_\theta / \pi_{\text{old}})$ 上施加 sign-agnostic 区间 $[\alpha, \beta]$ 剪裁,配合 GRPO 式 group-relative advantage $r(x,y_j) - \bar{r}(x)$ 和 squared log-ratio KL 惩罚。

    Innovation 4 — PARL (Parallel-Agent RL):编排器通过 RL 学习何时、如何并行化;子 agent 冻结为固定中间 checkpoint。三项奖励中辅助项 $r_{\text{parallel}}$(反序列坍缩)和 $r_{\text{finish}}$(反虚假并行)退火到 0,最终只剩任务奖励。CriticalSteps 度量约束并行分解的有效性。

    Innovation 5 — Toggle:交替 budget-constrained(Phase 0,仅当准确率 >$\lambda$ 时惩罚超预算 rollout)和 full-length(Phase 1)训练,~25–30% token 节省。

    核心技术壁垒 #

    零视觉 SFT 的可行性完全依赖于 10:90 联合预训练在 ~15T tokens 规模上已将视觉特征深度嵌入 LLM 表征空间。如果预训练规模或比例不对,text-only SFT 无法激活视觉能力——这是一个高资本壁垒,论文承认实验成本过高无法在多 scale 上验证。

    Q3 结果 #

    BenchmarkK2.5Best CompetitorDelta
    HLE-Full (w/ tools)50.2%Gemini 3 Pro 45.8%+4.4
    BrowseComp (Agent Swarm)78.4%GPT-5.2 Pro 77.9%+0.5
    WideSearch Item-F179.0%Claude Opus 4.5 76.2%+2.8
    Agent Swarm 延迟0.6–1.6×Single-agent 1.8–7.0×3–4.5× 降低
    AIME 202596.1%GPT-5.2 100%-3.9
    OCRBench92.3%Gemini 3 Pro 90.3%+2.0
    MathVista (mini)90.1%Gemini 3 Pro 89.8%+0.3

    跨模态迁移:视觉 RL 后文本指标提升——MMLU-Pro +1.7 (84.7→86.4),GPQA-Diamond +2.1 (84.3→86.4),LongBench v2 +2.2 (56.7→58.9)。

    §3 架构 / 方法图 #

    The Four Novel Mechanisms #

    K2.5 的架构(K2 MoE backbone + MoonViT-3D)继承自前作,不是本文创新。四项算法创新的 diff 如下:

    1. Vision injection strategy

    Before (conventional)After (K2.5)
    晚期注入(>50% 训练进度),vision:text ≥ 50:50从 0% 开始注入,全程 10:90
    视觉作为后置 add-on视觉与文本从头共优化

    2. Visual SFT activation

    Before (conventional)After (K2.5)
    人工标注视觉 CoT 轨迹做 SFTText-only SFT + IPython 程序代理图像操作
    需要视觉数据激活视觉能力零视觉数据即可激活

    3. RL policy optimization

    Before (PPO)After (K2.5)
    Sign-dependent clipping: $\min(r_t \hat{A}_t, \text{clip}(r_t, 1 \pm \epsilon) \hat{A}_t)$Sign-agnostic log-ratio clipping: Clip on $\log(r_t) \in [\alpha, \beta]$
    Value model 估计 advantageGroup-relative advantage $r - \bar{r}$ (GRPO 式)
    Adam optimizerMuonClip optimizer

    4. Multi-agent training

    Before (e2e co-optimization)After (K2.5 PARL)
    所有 agent 端到端联合优化子 agent 冻结,仅编排器 RL 训练
    Credit 在所有 agent 间分摊Credit 隔离到编排器决策
    预定义并行启发式通过 RL 探索学习何时/如何并行化

    Agent Swarm 架构 #

    Figure 3: Agent Swarm architecture with trainable orchestrator and frozen subagents

    Paper Figure 3, verbatim (caption: "An agent swarm has a trainable orchestrator that dynamically creates specialized frozen subagents and decomposes complex tasks into parallelizable subtasks for efficient distributed execution.").

    图中展示了 PARL 的核心去耦设计:编排器(蓝色)是唯一的可训练组件,通过 RL 学习任务分解和子 agent 调度策略。子 agent(灰色)从固定中间 checkpoint 实例化,其执行轨迹被排除在优化目标之外——这使得 credit assignment 仅作用于高层编排决策,而非底层执行细节。

    训练管线概览 #

    flowchart LR A["K2 Pretrain\n15T text tokens\nMuonClip"] --> B["ViT Stage\n~1T tokens\ncaption CE only"] B --> C["Joint Pretrain\n~15T tokens\n10:90 vision:text"] C --> D["Mid-train\n500B→200B\nseq 32K→262K\nYaRN 64×"] D --> E["Zero-Vision SFT\ntext-only + IPython"] E --> F["Joint Multimodal RL\nby-ability domains\nlog-ratio clip + KL"] F --> G["PARL\nAgent Swarm\n3-term reward\nannealing"]

    §4 作者证明 #

    无形式化作者证明 — 仅实证。论文无收敛定理、无方差界、无复杂度分析。所有主张均依赖实证结果。以下是对论文 4 个形式化等式的结构分析。

    Notation Table #

    SymbolDefinitionDomain
    $\pi_\theta, \pi_{\text{old}}$当前/上一轮策略参数空间 $\Theta$
    $K$每问题 rollout 数$K \geq 2$
    $N$总 token 数: $\sum_{j=1}^K \lvert y_j \rvert$正整数
    $\alpha, \beta$Log-ratio 剪裁边界$\alpha < 0 < \beta$
    $\tau$KL 惩罚系数$\tau > 0$
    $\bar{r}(x)$组内均值奖励: $\frac{1}{K}\sum_j r(x, y_j)$标量
    $\lambda_1, \lambda_2$PARL 辅助奖励权重(退火到 0)$\geq 0$
    $r_{\text{parallel}}$实例化奖励(反序列坍缩)类二值
    $r_{\text{finish}}$子 agent 完成率(反虚假并行)$[0,1]$
    $r_{\text{perf}}$任务级结果奖励任务相关
    $S_{\text{main}}^{(t)}, S_{\text{sub},i}^{(t)}$阶段 $t$ 中编排器/第 $i$ 子 agent 步数非负整数
    $m$Toggle 交替周期正整数
    $\rho$Budget 百分位(来自正确 rollout)$(0,1)$

    方程物理意义 #

    Eq. 1 — RL 策略损失 $L_{\text{RL}}$

    两项分解:

    • Clipped policy gradient: $\text{Clip}(\text{log-ratio}, \alpha, \beta) \cdot (r - \bar{r})$。Token 级梯度仅在 log importance ratio 落入 $[\alpha, \beta]$ 时传播;超出区间则梯度归零。作用:阻止 off-policy 发散。关键区别于 PPO 的 sign-dependent clipping——后者在 $\hat{A} > 0$ 和 $\hat{A} < 0$ 时施加不同方向的裁剪;K2.5 不区分 advantage 符号,仅约束 log-ratio 幅度。论文称此设计对多步 tool-use 推理场景的训练稳定性至关重要。
    • KL penalty: $-\tau (\log \text{ratio})^2$。Squared log-ratio 作为 trust region 正则化,效果类似标准 KL 散度但对大偏离惩罚更强(二次 vs 线性增长)。

    Eq. 2 — PARL 奖励 $r_{\text{PARL}}$

    三项分解:

    • $r_{\text{parallel}}$:鼓励编排器实例化子 agent 而非退化为顺序执行(序列坍缩是无辅助奖励时的局部最优——编排器发现单 agent 能获得正奖励后不再探索并行)。
    • $r_{\text{finish}}$:惩罚未完成的子 agent(防止 reward hacking:spawn 大量子 agent 获得 $r_{\text{parallel}}$ 但无实际分解)。
    • $r_{\text{perf}}$:任务级结果,是最终优化目标。辅助项 $\lambda_1, \lambda_2$ 退火到 0 确保最终策略仅优化任务质量。

    Eq. 3 — CriticalSteps

    $$\text{CriticalSteps} = \sum_{t=1}^{T}\left(S_{\mathrm{main}}^{(t)} + \max_{i} S_{\mathrm{sub},i}^{(t)}\right)$$

    类比计算图中的 critical path:每阶段延迟由最长子 agent 决定。用 CriticalSteps(而非 total steps)作为训练和评估度量,显式激励均衡的任务分解——单纯增加子 agent 数量但不缩短最长分支不会带来收益。

    Eq. 4 — Toggle 奖励 $\tilde{r}$

    $$\tilde{r}(x,y) = \begin{cases} r(x,y) \cdot \mathbb{1}[\lvert y \rvert \leq \text{budget}(x)] & \text{Phase 0} \\ r(x,y) & \text{Phase 1} \end{cases}$$

    交替阶段实现 bi-objective 优化:Phase 0 在准确率 >$\lambda$ 时惩罚超预算 rollout(推向短输出),Phase 1 允许最大 token 数(推向深度推理)。$\text{budget}(x) = \rho$-percentile of 前序正确 rollout 长度,动态适应问题难度。

    6 结构性检查 #

    #检查项结果
    1Sign-agnostic clipping 的正确性:当 advantage 为正但 log-ratio > β 时,梯度是否应被截断?合理:防止 off-policy 发散比利用正 advantage 更重要,特别是长 horizon 场景
    2$\bar{r}(x)$ 作为 baseline 的方差:相比 learned value function,group mean 的方差更高但无 bias论文未提供方差分析;GRPO 原论文有类似讨论
    3$\lambda_1, \lambda_2$ 退火到 0 后,$r_{\text{parallel}}$ 的初始信号是否足以跨越序列坍缩?实证有效(Fig. 4 显示并行度递增),但对初始 $\lambda_1$ 值和退火速率的敏感度未消融
    4CriticalSteps 是否低估实际延迟?(忽略通信开销、子 agent 启动时间)论文 Fig. 8 显示 Agent Swarm 延迟 0.6–1.6×,暗示开销已被摊销;但在更大并行度下可能成为瓶颈
    5Toggle 的 Phase 0 仅在准确率 >$\lambda$ 时激活:$\lambda$ 过低会过早压缩 token、$\lambda$ 过高则 budget 约束形同虚设论文称 ~25–30% token 节省,但未消融 $\lambda$ 的敏感度
    6零视觉 SFT 的前提条件:联合预训练比例/规模不足时是否退化?论文承认"实验成本太高"未在多 scale 验证,是硬假设

    期望但缺失的理论保证:(1) 收敛速率 as function of $K$, clipping bounds, $\tau$;(2) PARL 退火 schedule 的最优性条件;(3) CriticalSteps 与实际延迟的近似比。

    §5 实验与数据 #

    Training Recipe & Scale #

    StagePurposeDataTokensSeq LenLRBatchSpecial
    K2 Pretrain文本主干K2 corpus15T4K[论文未披露][论文未披露]MuonClip + QK-Clip
    ViT Stage编码器对齐alt-text, synth caption, grounding, OCR, video~1T4096[论文未披露][论文未披露]Caption CE only; 两步:先 ViT 后 projector
    Joint Pretrain多模态融合K2 mix + vision (10:90)~15T4096[论文未披露][论文未披露]Early fusion, DEP ~90% throughput
    Mid-train长上下文High-quality text + multimodal + long-CoT500B→200B32K→262K[论文未披露][论文未披露]YaRN factor=64
    Zero-Vision SFT激活视觉Text-only + IPython proxies[论文未披露][论文未披露][论文未披露][论文未披露]无视觉数据
    Joint Multimodal RL跨模态精炼Text + vision tasks (by ability)[论文未披露][论文未披露][论文未披露][论文未披露]Log-ratio clip + KL + GRM
    PARLAgent 编排Wide/deep search tasks[论文未披露][论文未披露][论文未披露][论文未披露]Frozen subagents, 3-term reward

    关键超参:

    • Clipping bounds $[\alpha, \beta]$: [论文未披露]
    • KL 系数 $\tau$: [论文未披露]
    • PARL $\lambda_1, \lambda_2$ 初始值与退火 schedule: [论文未披露]
    • Toggle 周期 $m$, 百分位 $\rho$, 准确率阈值 $\lambda$: [论文未披露]
    • Rollout group size $K$: [论文未披露]
    • GPU hours / MFU / 节点数 / 互联: [论文未披露]
    • 数值精度: [论文未披露](推测 BF16,K2 已用 FP8)
    • 稳定性技巧: MuonClip + QK-Clip(继承 K2),其余 [论文未披露]

    Key Results #

    Figure 1: Main benchmark comparison across reasoning, coding, vision, and agentic tasks

    Paper Figure 1, verbatim. K2.5 与 GPT-5.2、Claude Opus 4.5、Gemini 3 Pro、DeepSeek-V3.2 的全面对比。

    K2.5 在 agentic 任务(HLE-Full 50.2%,BrowseComp Swarm 78.4%)和视觉理解(OCRBench 92.3%,MathVista 90.1%)上达到 SOTA。在纯数学推理(AIME 96.1% vs GPT-5.2 100%)和代码(SWE-Bench 76.8% vs Claude 80.9%)上略低于最强 proprietary baseline。

    Figure 2: Vision RL training curves showing continuous improvement with scaled FLOPs

    Paper Figure 2, verbatim (caption: "Vision RL training curves on vision benchmarks starting from minimal zero-vision SFT. By scaling vision RL FLOPs, the performance continues to improve.").

    此图是 zero-vision SFT 可行性的核心证据:从纯文本 SFT 出发,仅通过 vision RL 即可持续提升视觉性能,无需视觉 SFT 数据。曲线形状接近对数增长,暗示 compute scaling 有效但收益递减。

    Figure 4: PARL training curves showing accuracy and parallelism increasing together

    Paper Figure 4, verbatim (caption: "In our parallel-agent reinforcement learning environment, the training accuracy increases smoothly as training progresses. At the same time, the level of parallelism during training also gradually increases.").

    关键观察:准确率和并行度同步上升,表明 PARL 的 3-term reward + 退火 schedule 成功地引导编排器从序列执行逐步过渡到并行执行,而非在初期就强制并行(这会导致任务失败)。

    Figure 8: Agent Swarm latency vs single-agent baseline at increasing F1 targets

    Paper Figure 8, verbatim (caption: "Agent Swarm achieves 3×–4.5× faster execution time compared to single-agent baselines as target Item-F1 increases from 30% to 70% in WideSearch testing.").

    Agent Swarm 的延迟几乎不随目标 F1 增加而增长(0.6–1.6×),而单 agent 的延迟从 1.8× 爆增到 7.0×。这是 CriticalSteps 度量和学习化并行分解的直接效果:编排器学会了将工作负载均匀分配到并行分支,使 critical path 保持短恒定。

    跨模态迁移实证 #

    BenchmarkBefore Vision-RLAfter Vision-RLΔ
    MMLU-Pro84.786.4+1.7
    GPQA-Diamond84.386.4+2.1
    LongBench v256.758.9+2.2

    视觉 RL 增强了结构化信息提取能力(计数、OCR、表格理解),该能力正向迁移到类似模式的文本推理任务。

    Agent Swarm 对比 #

    BenchmarkK2.5 SingleK2.5 Agent SwarmClaude Opus 4.5GPT-5.2 Pro
    BrowseComp60.678.4 (+17.8)77.9
    WideSearch Item-F172.779.0 (+6.3)76.2
    In-house Swarm Bench41.658.3 (+16.7)45.8

    增益在需要并行分解的任务上最为显著(In-house Swarm Bench +16.7),验证了 PARL 学到的不仅是简单的任务拆分,而是针对任务结构的自适应调度。

    Convergence & Stability #

    • 学习曲线形状: Vision RL 近对数增长(Fig. 2);PARL 训练平滑单调(Fig. 4),未观察到震荡或退化。
    • 超参敏感度: 论文未提供 $[\alpha, \beta]$, $\tau$, $\lambda_1$, $\lambda_2$ 的消融。Toggle 的 $\rho$, $\lambda$ 敏感度也未报告。
    • Reward hacking 信号: 论文识别了两类退化——序列坍缩(无 $r_{\text{parallel}}$ 时编排器默认单 agent)和虚假并行(spawn 大量子 agent 获取 $r_{\text{parallel}}$ 但无有效分解)。$r_{\text{finish}}$ 和退火共同抑制这两种 hacking。
    • RL vs SFT 的价值: 零视觉 SFT 提供 cold start activation,但视觉能力的持续提升完全依赖 RL(Fig. 2 曲线从 SFT baseline 持续攀升)。文本能力同样受益于视觉 RL 的正迁移(Table 2)。

    Dataset Analysis #

    • Composition: 联合预训练 ~15T tokens,vision:text = 10:90。视觉数据含 alt-text、合成 caption、grounding bbox、OCR、视频、OS 截图。文本域延续 K2 distribution 但增加 coding 权重。具体百分比 [论文未披露]。
    • Quality filters: 每数据源有 epoch 上限(防过拟合),其余 [论文未披露]。
    • Contamination: [论文未披露]。
    • Annotation: SFT 阶段使用 K2 + K2 Thinking + 专家模型合成 + 人工多阶段验证。人工标注规模/一致率 [论文未披露]。
    • Synthetic data: RL 的 visual puzzles 用 K2 作为 LLM verifier 合成;PARL prompts 合成为 wide-search / deep-search / real-world workloads,不显式指令并行化。

    §6 论证链 #

    StepClaimEvidenceValidityLink
    1早期低比例融合 (10:90) 优于晚期高比例 (50:50)Table 1 消融:Early 10:90 在所有 6 项指标上领先 Late 50:50 (Vision Knowledge 25.8 vs 24.2, Text Reasoning 58.5 vs 57.8 等)中等——消融仅 3 行,无中间比例(如 20:80 early)的数据点§2.1 → §2.2
    2零视觉 SFT 足以激活视觉能力Fig. 2: text-only SFT + RL 持续提升视觉性能;text+vision SFT 反而更差(定性声明,无具体数值对比表)中等——"更差" 的结论缺少定量差值;可能与 vision SFT 数据质量相关而非方法论本质§2.2 → §2.3
    3视觉 RL 正向迁移到文本Table 2: MMLU-Pro +1.7, GPQA-Diamond +2.1, LongBench v2 +2.2较强——三项独立 benchmark 一致提升,但缺少 confidence interval 和统计检验§2.3 → §5.1
    4PARL 去耦解决 credit assignmentAgent Swarm vs single-agent: BrowseComp 78.4 vs 60.6 (+17.8), WideSearch 79.0 vs 72.7 (+6.3)较强——大幅增益;但缺少与 e2e co-optimization baseline 的直接对比(仅 vs single-agent)§3 → §5.3
    5辅助奖励退火防止退化均衡论文描述序列坍缩和虚假并行两种 failure mode,声称退火有效较弱——仅定性描述,无消融曲线(如:保留 $\lambda_1$ 不退火时的性能对比)§3
    6CriticalSteps 激励均衡分解Fig. 8: Agent Swarm 延迟 0.6–1.6× 近恒定 vs single-agent 1.8–7.0× 线性增长较强——延迟曲线差异显著且趋势清晰§3 → §5.3

    §7 实现 cross-reference #

    代码引用 #

    SourcePathPurpose
    HF configmoonshotai/Kimi-K2.5/config.json所有架构维度的 ground truth (MLA ranks, MoE config, YaRN params)
    HF modelingmodeling_kimi_k25.KimiK25ForConditionalGeneration主模型实现 (trust_remote_code)
    SGLang modelsglang/python/sglang/srt/models/kimi_k25.py端到端多模态推理路径
    SGLang ViTsglang/python/sglang/srt/models/kimi_vl_moonvit.pyMoonViT-3D 共享组件
    SGLang LLMsglang/python/sglang/srt/models/deepseek_v2.pyMLA + MoE kernel 实现(复用 DeepSeek V2/V3)
    vLLM modelvllm/vllm/model_executor/models/kimi_k25.py多模态 processor + 集成
    vLLM ViTvllm/vllm/model_executor/models/kimi_k25_vit.pyMoonViT-3D, 2D RoPE, patchmerger

    训练代码(RL pipeline, PARL, Toggle, DEP):[实现未公开]。最接近的开源参考为 verl (GRPO-style RL) 和 OpenRLHF (PPO 变体),但均不支持 PARL 的去耦 multi-agent 训练。

    核心技术壁垒专述 #

    零视觉 SFT 是 K2.5 训练管线中最不可能被低成本复现的环节。其可行性的因果链为:(1) ~15T tokens 的 10:90 联合预训练将视觉 patch 投影到与文本 token 共享的高维表征空间,使 LLM 隐层对视觉 query 和文本 query 产生类似的激活模式;(2) 该对齐足够深,以至于 text-only SFT 中 IPython 程序操作图像的轨迹自动泛化到直接的视觉输入;(3) 后续 vision RL 在此 activation 上微调即可持续提升。打破链条中任何一环(预训练规模不足、比例失衡、IPython proxy 质量不够)都会导致零视觉 SFT 退化为普通 text SFT——无法激活视觉。

    关键实现细节 #

    1. PARL 辅助奖励必须退火到 0:保留非零 $\lambda_1$ 会导致编排器在顺序任务上也强制并行化(虚假并行),保留非零 $\lambda_2$ 则过度惩罚合理的长 subagent(截断有效分解)。退火速率是隐含的关键超参。
    2. Token-level log-ratio clipping 是 sign-agnostic 的:标准 PPO 的 sign-dependent clipping 在长 horizon agentic trace 中失效——因为 advantage 估计噪声大,sign 频繁翻转导致梯度信号碎片化。K2.5 的 $[\alpha, \beta]$ clipping 不区分 advantage 符号,仅约束 policy 偏移幅度,对 noisy advantage 更鲁棒。
    3. Reproducibility & Ecosystem #

      • 训练代码开源? 否。Post-trained checkpoint 已开源于 HuggingFace (moonshotai/Kimi-K2.5),但训练管线(RL、PARL、Toggle、DEP)均未公开。
      • 最接近开源参考: verl (GRPO RL), OpenRLHF (PPO variants), SGLang/vLLM (inference only)。均不支持 PARL 去耦 multi-agent 训练。
      • 社区复现: 截至 2026-05,尚无社区复现 PARL 或零视觉 SFT 的报告。模型权重可直接使用但训练 recipe 不可复现。
      • 后续使用: K2.5 的 Agent Swarm 概念已被 Kimi K2.6 继承扩展。零视觉 SFT 的思路可能影响后续多模态模型的训练策略设计。