| 相关实体 | 关系类型 | 关联理由 |
|---|---|---|
| AVO (2603.24517) | 同赛道竞品 | 同属 LLM-augmented evolutionary/RL 搜索优化 GPU kernel,AVO 用 agentic variation operator 在 B200 上优化 attention kernel,与 TTT-Discover 在 TriMul kernel 上的结果直接可比 |
| LoongFlow (2512.24077) | 前驱方法 | AlphaEvolve 系列的开源复现/扩展,是 AVO 的 predecessor;TTT-Discover 的搜索 baseline (OpenEvolve) 也属此系谱 |
| μCUTLASS + SOL-Guided (2603.29010) | 互补方法 | 同样用 LLM agent 优化 GPU kernel,但策略截然不同——DSL 抽象 + roofline guidance 而非 RL 训练;提供 kernel optimization 的另一条路线 |
| 维度 | TTT-Discover | AVO |
|---|---|---|
| 核心机制 | 在线 RL: entropic objective + PUCT reuse 训练 LLM 权重 | Agentic variation: LLM agent 自主循环 (edit→evaluate→diagnose),不更新权重 |
| 搜索空间 | 通用(math/kernel/algorithm/biology) | 专注 attention kernel (B200 CUDA) |
| 模型 | gpt-oss-120b (open) + LoRA rank 32 | Claude 3.7 Sonnet (closed) |
| 领域知识 | 无显式知识库——LLM 在 rollout 中隐式积累经验 | 显式知识库 $\mathcal{K}$: CUDA guide, PTX ISA, B200 spec, FA4 source [2603.24517] |
| 持续时间 | 50 steps × 512 rollouts ≈ 数小时, ~$500/problem [2601.16175] | 7 天持续进化 [2603.24517] |
| Kernel 结果 | TriMul H100: 1161μs(vs 1371μs 1st human, 15.3% faster)[2601.16175] | Causal MHA B200: 1668 TFLOPS BF16, 超越 cuDNN 3.5% / FA4 10.5% [2603.24517] |
核心 delta: TTT-Discover 的创新在于学习——通过 entropic objective 实际更新模型权重使其逐步理解问题结构,而 AVO 保持模型冻结但赋予其自主工程能力(查文档、运行 profiler、诊断编译错误)。两者代表 "learning at test time" vs "agentic engineering at test time" 的范式分歧 [2601.16175]。
| 维度 | TTT-Discover | μCUTLASS + SOL |
|---|---|---|
| 抽象层次 | Raw code generation (CUDA/Triton) | DSL (~170-line EBNF) + compiler [2603.29010] |
| 性能引导 | Reward signal (1/runtime) → entropic gradient | SOL roofline gap $g = t_\text{best}/t_\text{SOL}$ → MANTIS workflow [2603.29010] |
| 覆盖范围 | 单问题深度优化 | 59 KernelBench problems 广度覆盖 |
| 防作弊 | Correctness check against PyTorch reference | SOL ceiling + LLM game detector 防止跳过计算的虚假加速 [2603.29010] |
关键差异: μCUTLASS 通过 DSL 将 LLM 的认知负担从"生成正确 CUDA"压缩到"选择正确配置",是降低搜索空间维度的策略;TTT-Discover 是在高维空间中用 RL 学习的策略。SOL guidance 提供了 TTT-Discover 完全缺失的 headroom awareness [2603.29010]。
TTT-Discover 开辟了 test-time RL for discovery 的范式位置,与三条相邻路线形成对照:
| 范式 | 代表 | 模型改变 | 搜索机制 |
|---|---|---|---|
| Frozen-LLM evolutionary search | AlphaEvolve, LoongFlow, OpenEvolve | 冻结 | Prompt-driven mutation/crossover |
| Agentic engineering | AVO, μCUTLASS+SOL | 冻结 | Agent 自主循环 + 领域知识 |
| Test-time RL | TTT-Discover, ThetaEvolve, EvoTune | LoRA 热更新 | Entropic/standard RL + reuse |
| Test-time self-play | AlphaProof | Full fine-tune | Curriculum generation + RL |
TTT-Discover 的生态位优势在于compute-efficient discovery: 25,600 rollouts 预算下同时做搜索和学习,且仅用开源模型。但其采用门槛(需要 Tinker 级的 online RL 训练 API)目前限制了社区复现。