LLM agent Skill-leak Generation-time Scanner 2026-04-21
LLM Skill-Leak in Agent Workflows:机制、五层防御与根因
agent-based paper reader 反复在 notes 里 leak SKILL.md 定义里的 meta-language ("Scope of this file", "Stage 4 synthesis", "paper 无此图 Mermaid 补充" 等)。 诊断机制: LLM context 同时装着 paper 内容 + skill 内容, 它把两者混合输出—— 这不是疏忽, 是训练分布奖励 "tell reader about scope" 的结构性失效。 给出 L1 phrase list → L2 scanner gate → L3 two-pass → L4 stage-scoped context → L5 schema-bound output 的五层防御, 并论证 L1-L3 是 whack-a-mole, 根治需 L4/L5。 PrfaaS v3 实测 9 种不同 phrase surface 指向同一语义。
Router Cost Model Tier-Aware Agent 2026-04-21
Prefix-Cache-Aware Router 设计:从现有方案到 Tier-Aware Cost Model
系统调研 NVIDIA Dynamo kv-router、SGLang sgl-model-gateway 和 llm-d GAIE-EPP 三大开源 router 的索引/信号/决策/工程形态,对比各自 cost function 的精确数学形式与缺陷。 综合 Justitia (c=pd+d²/2)、ThunderAgent (recompute∝c²)、KVFlow (STE)、Pancake/Concur/PrfaaS 的 tier 与 workflow 结论,提出一个 6 项的 tier-aware + agent-aware 统一 cost model, 并给出 Dynamo selector 上的最小侵入实现路径与一个三-worker 路由数值算例。
Agent System CPU 2026-04-16
Agent System Architecture: CPU / GPU / Tool Call
Agent 系统全栈架构图:CPU 编排层(Orchestrator、Prompt Construction、Tokenizer、Scheduler)、 GPU 推理层(Prefill、Decode、KV Cache、Prefix Cache)、工具执行层(Code Sandbox、File I/O、Web Search、API Calls)。 包含单轮时序甘特图、数据流路径、CPU Overhead (15-40%)、GPU Active Ratio (12-82%)、Tool Pause (0.5-30s) 关键指标, 以及 CPU-Centric Perspective / TaxBreak / Agent.xpu / AgentOpt 四篇核心论文的洞察。
Serving Agent 2026-04-17
从标准 Serving 到 Agent Serving 的 Pareto 曲线推演
基于 AIConfigurator 的方法论,从第一性原理推演 Agent 系统的 throughput-latency Pareto 曲线。 覆盖封闭排队模型(Little's Law)、prefix cache 的杠杆效应、KV-cache 内存墙、 context 增长动态、MoE 模型特性,以及标准 serving → agent serving 的映射公式。 包含三种 Agent 场景的数值推演(Code Agent / Research Agent / Deep Reasoning)。