来源:GitHub (★1162)
URL: https://github.com/modu-ai/moai-adk
精读日期:2026-08-12
模型:DeepSeek V4 Flash(AI 生成,人工未审校)
正文获取:全文
一、核心论点/事实
- MoAI-ADK 是一个针对 Claude Code 的 Agentic 开发 Harness,围绕三个轴设计:成本(Tokenomics)、自我改进(Agentic loop engineering)、质量控制(Agentic harness),单一 Go 二进制文件,支持 macOS/Linux/Windows,零依赖,支持 16 种语言。
- 核心论断:"模型是一个逐 token 工作的随机工人",它无法跨会话记住预算、质量标准和上次中断位置,因此必须由外部 Harness 强制执行这三者,而非每次靠 prompt 重新播种。
- 成本悖论:虽然模型单价下降(Linux Foundation 数据显示企业 AI 支出同期上升),但总体支出上升——Uber 部署 Claude Code 给 5000 名工程师后,4 个月烧完一年的编码预算,随后强制月度 token 限额;Meta、Amazon、Microsoft 均收回了无限 AI 政策。
- 成本由任务分配决定,而非单价:DeepSWE leaderboard(113 个任务)显示,同一 Claude 家族内,GLM 4.6 在 effort 评分上超过 Sonnet 5(58% vs 54%),但每任务成本仅为后者的 1/16($1.66 vs $26.40),原因是步骤数差异(268 步 vs 36 步)——重试循环而非 token 费率决定账单。
- 只优化成本是陷阱:单独压成本会静默侵蚀质量,导致返工和调试循环,而返工是最昂贵的 token 消耗;无学习循环的质量门会让相同错误每会话重演;无成本上限的自主循环会让单个失控任务耗尽配额。
- 质量门 TRUST 5 标准:Tested(85%+ 覆盖率)· Readable · Unified · Secured · Trackable,应用于每个变更,门评判验证而非评判 Agent。
二、方法/架构拆解
四阶段方法论:测量(measurement)→ 路由(routing)→ 节食(diet)→ 防御(defense)
路由(Routing):
- 按工作阶段(plan/run/sync)和 SPEC 大小(Tier S/M/L)声明式分配模型和推理深度(low/medium/high/max)
- 高推理模型部署到规划阶段(需深度推理),轻量模型部署到实现阶段(机械重复)
- 排除 Haiku 于路由集之外;Sonnet 低 effort 承担单次、输入主导的工作;Opus 承担所有多轮 agentic 任务
- 支持 Claude 领导(策略/规划/审计)+ GLM 工人(批量实现)的多模型协同模式
节食(Verification Economy):
- 将冗长验证输出重定向到磁盘文件,上下文中仅保留退出码和有界尾部(最多 50 行)
- Prompt-cache 复用(缓存读取成本 0.1×)
- 上下文节食策略:自动推荐阈值 1M 上下文 50% / 200K 上下文 90%
防御(Budget Defense):
- Token 断路器在硬限制(默认 90%)中止,保存进度到磁盘,生成可粘贴的恢复消息
- 状态栏持续显示上下文使用量、缓存命中率、速率限制消耗
自我改进轴(Agentic Loop Engineering):
- 声明完成条件,会话持续工作直到条件满足或达到轮次上限(默认 30)
- 无限目标模式:auto-compact 驱动的目标,受预算约束
- 并行扫描 LSP 诊断、AST-grep、linter,按级别分桶问题,持续运行直到队列清空
- 路由决策、门证据、重复修正被记录,下一会话从上次学习处开始
- 观察到的失败模式成为提议的规则变更,需审批而非静默应用
质量控制轴(Agentic Harness):
- SPEC 生命周期:plan → run → sync;Tier S/M/L 大小分类决定验证深度和 PR 路由
- GEARS 格式需求 + 验收标准,以证据判断完成
- 审计分离:MoAI 自定义 11 条 + 内置 Explore,规划和审计从一开始分离,防止作者方自我评分
- 扩展点:复制已验证模式用于项目特定复用
三、值得注意的局限/争议
作者承认的局限:
- 明确表示"只优化成本是陷阱",承认单一轴优化的失败模式
- 承认 GLM 在 API 计费下处于劣势,仅在 z.ai 包月制下有价值——多模型路由的价值高度依赖定价模型
AI 判断的局限:
- 85% 测试覆盖率作为 TRUST 门标准可能不适用于所有项目类型(如基础设施代码、配置类项目),单一覆盖率阈值缺乏项目类型区分
- 默认 90% token 断路器可能在高波动任务中过早中断,恢复机制依赖会话连续性,但跨会话上下文丢失问题未完全解决
- 规则变更需审批的机制可能成为瓶颈——在高速迭代场景下,人工审批延迟可能抵消自动化收益
- 多模型路由(Claude 领导 + GLM 工人)的协调开销未量化,跨模型上下文传递的 token 成本可能侵蚀节省
- 16 种语言支持但验证深度(LSP/AST-grep/linter)在不同语言生态中的可用性差异未讨论
四、与 RRLab 研究的关联
Harness 工程:
- 三轴设计(成本/自我改进/质量)可作为 RRLab Harness 架构的参考框架,特别是"外部强制而非 prompt 依赖"的核心哲学
- 四阶段方法论(测量→路由→节食→防御)可直接映射到 Harness 工程的分层设计
多模型协同:
- Claude 领导 + GLM 工人的模式验证了异构模型分工的可行性,DeepSWE 数据($1.66 vs $26.40)为模型路由决策提供了量化依据
- 按工作阶段(plan/run/sync)和任务复杂度(Tier S/M/L)分配模型的声明式路由策略值得借鉴
模型评测:
- DeepSWE leaderboard 的 per-effort 视角(成本/步骤数而非仅准确率)为 RRLab 评测体系提供了新维度——评测应包含 token 效率和步骤数
- "成本由任务分配决定而非单价"的结论提示评测需区分模型能力与任务匹配度
Agent 落地:
- Token 断路器(90% 硬限制 + 恢复机制)是生产环境 Agent 部署的关键安全阀,Uber 案例(4 个月烧完年度预算)是反面教材
- 验证输出重定向到磁盘(仅保留退出码 + 50 行尾部)是上下文管理的实用技巧
AI 原生产品:
- 三轴互相支撑的设计哲学(成本靠质量防返工、质量靠循环捕获经验、循环靠成本门防超支)可作为 AI 原生产品的系统设计原则
- 规则变更需审批而非静默应用的机制,平衡了自动化与可控性,适合企业级产品设计
本笔记由 DeepSeek V4 Flash 自动生成,未经人工审校。原文链接:https://github.com/modu-ai/moai-adk