Hermes Agent: Self-Improving AI Agent with Closed Learning Loop

code NousResearch-hermes-agent — Cross-paper Synthesis

Hermes Agent — L3 Cross-Paper Synthesis #

1. 相关论文 #

相关实体关系关联理由
OpenAI Agents SDK (openai-openai-agents-python)竞品框架同为 Python agent 框架,但设计哲学根本不同——OpenAI SDK 是声明式编排 + 无状态 Runner,Hermes 是命令式循环 + 有状态自改进 [openai-openai-agents-python]
Claude Code (2604.14228)对标产品Hermes 的 run_agent.py 与 Claude Code 的 queryLoop 是同一设计模式(ReAct while-loop)的两个实现 [2604.14228],但 Hermes 增加了自改进闭环
Agent Interop Survey (2505.02279)协议参考Hermes 的 MCP 双向集成 + ACP 适配器直接映射到 interop survey 的 Stage 1(MCP)和 Stage 2(ACP)[2505.02279]
Qualixar OS (2604.06392)同类系统二者都在构建"agent OS"概念,但 Qualixar 走编排运行时路线(12 拓扑 + Forge),Hermes 走个人助理路线(技能闭环 + 多平台网关)[2604.06392]

2. 本篇 vs 相关论文的 delta #

Hermes vs OpenAI Agents SDK: 有状态 vs 无状态 #

维度Hermes AgentOpenAI Agents SDK
核心循环AIAgent.run_conversation 命令式 while-loop(10K 行单文件)[NousResearch-hermes-agent]Runner.run() 无状态静态类 + RunState 序列化 [openai-openai-agents-python]
状态管理双轨消息(messages + api_messages)持久化分离 [NousResearch-hermes-agent]RunState 可序列化 + human-in-the-loop 中断恢复 [openai-openai-agents-python]
自改进技能创建→使用→patch→改进闭环 [NousResearch-hermes-agent]无自改进机制
模型支持200+ 模型 via OpenAI-compat API [NousResearch-hermes-agent]OpenAI-first + LiteLLM/any-llm 扩展 [openai-openai-agents-python]
安全层无系统化安全机制Guardrails(输入/输出护栏,并行执行)[openai-openai-agents-python]
Multi-agent子代理委托Handoffs + Agent-as-Tool [openai-openai-agents-python]
平台20+ 平台网关 [NousResearch-hermes-agent]仅 API/SDK
代码质量10K 行单文件,Dict 传递87K LOC,dataclass + Generic[TContext] [openai-openai-agents-python]
追踪无内建 tracing内建 Tracing → OpenAI Dashboard [openai-openai-agents-python]
沙箱v0.14 新增 Sandbox(Docker/Local/E2B/Modal 等)[openai-openai-agents-python]

核心 delta: Hermes 的价值在于 跨会话知识积累——技能自改进 + 持久记忆 + 用户建模构成了一个闭合的学习循环 [NousResearch-hermes-agent]。OpenAI SDK 在这方面是空白,但其工程质量(类型系统、tracing、guardrails、sandbox)远高于 Hermes。

Hermes vs Claude Code (2604.14228): 开源复刻 vs 生产级工程 #

Hermes 的 AIAgent.run_conversation 与 Claude Code 的 queryLoop() 在概念上高度同构 [2604.14228]——都是 ReAct 模式的 while-loop + tool dispatch + 结果回传。但差距体现在基础设施深度:

Hermes 独有优势: 多平台网关(20+ 平台统一接入)[NousResearch-hermes-agent] 和 RL 训练管线(Atropos 集成 + 轨迹生成)[NousResearch-hermes-agent] 是 Claude Code 不具备的。前者使 Hermes 可作为 7×24 远程操控的个人助理,后者为下一代工具调用模型训练提供数据基础设施。

Hermes vs Agent Interop (2505.02279): 协议层映射 #

Hermes 的 MCP 双向集成(既是 MCP 客户端也是 MCP 服务端)[NousResearch-hermes-agent] 对应 interop survey 的 Stage 1(MCP 工具调用)[2505.02279]。ACP 适配器对应 Stage 2。但 Hermes 缺乏 Stage 3(A2A 企业协作)和 Stage 4(ANP 去中心化发现)。

Survey 指出 "协议组合是未解难题——同一 agent 如何同时参与 MCP/ACP/A2A/ANP 四层协议" [2505.02279]。Hermes 的 BasePlatformAdapter 抽象层已经在消息平台层面解决了类似的统一接入问题 [NousResearch-hermes-agent]——这一模式可以借鉴到协议层。

Hermes vs Qualixar OS (2604.06392): 个人助理 vs 编排运行时 #

维度Hermes AgentQualixar OS
定位个人 AI 助理Agent 编排 OS
拓扑单 agent + 子代理12 种执行拓扑 [2604.06392]
团队设计Forge LLM 驱动自动设计 [2604.06392]
质量保障8 模块流水线(Goodhart 检测 + JSD 漂移)[2604.06392]
自改进技能闭环有效自改进 $p=0.578$ 未达显著 [2604.06392]
模型路由200+ 模型简单选择三层 meta-learning 路由(bandit + 策略 + POMDP)[2604.06392]
持久记忆MEMORY.md + USER.md + HonchoSLM-Lite 认知记忆

有趣的对称性: Hermes 的技能自改进有效但缺乏质量保障,Qualixar OS 的质量保障完备但自改进循环无效($p=0.578$)。将 Qualixar 的 Goodhart 检测 + JSD 漂移监控引入 Hermes 的技能 patch 循环,可能产生一个既能自改进又能防 metric gaming 的系统。

3. 可攻击面 #

  1. run_agent.py 单文件 10K 行是架构债务: Hermes 将传输层、业务编排、错误恢复耦合在单个文件中 [NousResearch-hermes-agent]。对比 OpenAI SDK 的分层架构(run.py + run_state.py + run_loop.py + tool_execution.py 各司其职)[openai-openai-agents-python],Hermes 的可维护性风险实质性制约了其演进速度。任何对核心循环的修改都可能引发连锁回归。
    1. 技能自改进缺乏 Goodhart 防护: Hermes 的技能 patch 机制仅依赖 LLM 判断 "文档不足→自动改进" [NousResearch-hermes-agent]——没有独立的质量评估或漂移监控。Qualixar OS 的实践已证明自改进循环需要显式的 Goodhart 检测(cross-model entropy 等 4 信号)[2604.06392],否则 skill patch 可能退化为噪声注入。
      1. 安全层完全缺失: 在 20+ 平台网关上运行的 7×24 agent 缺乏系统化安全机制 [NousResearch-hermes-agent]。Claude Code 发现 93% 的权限批准率导致 approval fatigue [2604.14228],而 Hermes 连 approval 机制都没有。对于可以执行终端命令、读写文件、浏览网页的 agent,这是生产部署的根本阻碍。
        1. 双轨消息 vs RunState 的工程权衡: Hermes 的双轨消息设计虽然保持 prefix cache 稳定性 [NousResearch-hermes-agent],但复杂度显著高于 OpenAI SDK 的 RunState 序列化方案(支持 human-in-the-loop 中断恢复)[openai-openai-agents-python]。RunState 的可序列化特性使得分布式部署、多实例协调更加自然。
        2. 4. 生态位 #

          范式定位 #

          Hermes Agent 占据的独特生态位是 "开源 + 自改进 + 多平台 + 模型无关" 的交集。在 2026 Q2 的 agent 框架格局中:

          • Claude Code 在单模型深度和工程质量上无可匹敌,但闭源且单平台 [2604.14228]
          • OpenAI SDK 在框架设计和类型安全上领先,但无自改进、无多平台 [openai-openai-agents-python]
          • Qualixar OS 在编排完备性上最强,但自改进循环无效 [2604.06392]
          • Hermes 在跨平台个人助理场景下是唯一可用选项

          采纳证据 #

          从 OpenClaw fork 后快速迭代到 v0.8.0(8 个大版本)[NousResearch-hermes-agent],Nous Research 品牌在开源社区有影响力。MCP 双向集成 + agentskills.io 标准兼容 [NousResearch-hermes-agent] 为生态接入提供了基础。但缺乏 star/fork 等定量采纳数据。

          5. 未探索方向 #

          1. Hermes Skills + OpenAI Guardrails 混合体: Hermes 的技能自改进闭环 [NousResearch-hermes-agent] + OpenAI SDK 的 InputGuardrail/OutputGuardrail 并行检查 [openai-openai-agents-python]。在技能 patch 前后运行 guardrail 验证,可以在保持自改进能力的同时引入安全边界——当前无框架同时具备两者。
            1. Atropos RL 管线 + Agent 协议标准化: Hermes 的批量轨迹生成 + 轨迹压缩管线 [NousResearch-hermes-agent] 可以与 interop survey 提出的 MCP→ACP→A2A 分层协议 [2505.02279] 结合——在标准化协议上生成工具调用轨迹数据用于训练下一代模型,比在 ad-hoc API 上生成更有迁移价值。
              1. Claude Code 式 compaction + Hermes 持久记忆: Hermes 的 2 层压缩 [NousResearch-hermes-agent] vs Claude Code 的 5 层渐进 compaction [2604.14228]——将 microcompact(cache-aware deferred boundary)和 context collapse(read-time projection)引入 Hermes 的长程对话管理,可以显著延伸单次会话的有效深度。
                1. Qualixar OS 质量流水线的轻量移植: Qualixar 的 8 模块质量保障需要 ≥50 次评估窗口才能标定 [2604.06392]——对 Hermes 的个人助理场景过重。但 JSD 漂移监控的核心思想(tracking skill patch 前后的输出分布变化)可以轻量化实现为 skill-level 的 canary 检测。
                  1. run_agent.py 重构为状态机: 将 10K 行单文件按 OpenAI SDK 的分层模式(run → run_loop → tool_execution → turn_resolution)[openai-openai-agents-python] 重构为可独立测试的模块。这不是功能增强而是基础设施债务偿还——但对 Hermes 的长期演进至关重要。