来源:GitHub (★69)
URL: https://github.com/aws-samples/sample-agent-cost-bench
精读日期:2026-09-09
模型:DeepSeek V4 Flash(AI 生成,人工未审校)
正文获取:全文

一、核心论点/事实

  • agent-cost-bench 是一个基准测试框架,可在单次运行中同时衡量编码 Agent 的成本、质量和延迟,支持跨 CLI、跨模型、跨真实代码库的对比。
  • 核心问题:同一模型在不同编码 CLI(如 Kiro、Claude Code、Copilot、Codex)中的成本差异有多大?哪个模型在真实代码库上质量最优?
  • 目前支持的 CLI 包括:Kiro、Claude Code、GitHub Copilot、Cursor、OpenAI Codex、Antigravity、Devin(共 7 个)。
  • 成本以两种方式报告:USD 和原生单位(credits / AI Credits / tokens)。
  • 验证方式可插拔:支持 pytest、Docker 容器、自定义评分器、LLM-judge 评分标准;rubric 评分任务无需编写验证代码。
  • 框架支持自带 GitHub 仓库(公开或私有),自动克隆到任务工作区,交由模型处理并验证结果。
  • 运行基准测试会消耗用户账户的 credits/tokens/premium requests,全量运行资源消耗显著,建议先用小子集预估成本。

二、方法/架构拆解

  • 架构定位:工程基准测试框架,非学术研究;核心设计为"bring any model, any CLI, and any use case"。
  • 配置驱动:提供两类示例配置模板——CLI 对比(config.cli-compare.example.yaml)和模型对比(config.model-compare.example.yaml),用户复制后编辑路径、模型 ID 和定价。
  • 成本计算机制
  • 根据 CLI 二进制名称自动检测成本读取方式。
  • Kiro/Claude Code:从 CLI JSON 输出中读取成本数据。
  • Copilot:基于 AI-credit (AIU) 遥测数据,1 AIU = $0.01 USD,无需配置定价。
  • Cursor/Codex/Devin:按 token 计费,公式为 input_tokens × input_rate + cache_read_tokens × cached_rate + output_tokens × output_rate,需用户提供费率。
  • 公平性设计:Cursor、Devin、Antigravity 将推理努力级别编码在模型 slug 中(如 -thinking 后缀),而非独立 flag;harness 自动将任务的 effort level 附加到模型 ID 上,确保跨 CLI 对比时所有 runner 使用相同模型和相同推理努力级别。
  • 环境变量继承:各 CLI 从标准环境变量读取 API key,harness 继承父 shell 环境,无需逐 runner 配置。
  • 多语言任务支持:包含 C#/.NET、Java、TypeScript、Terraform、Helm 等多语言任务;构建镜像时需注意 Finch 在 macOS 上只能挂载 home 目录下的卷路径。
  • CLI 调用方式:通过命令行参数调用,如 ["-p", "{prompt}", "--output-format", "json", "{model}", "--dangerously-skip-permissions"],输出为单个 JSON 对象。
  • 认证方式:Devin 使用 devin auth login,无环境变量等价方式。

三、值得注意的局限/争议

作者承认的局限:

  • 定价费率易变,示例配置中的费率仅为撰写时参考,用户需自行核对当前订阅层级和厂商最新定价。
  • 运行基准测试消耗真实账户资源(credits/tokens/premium requests),全量运行成本可能很高。
  • 每个被基准测试的 CLI 都需要用户拥有有效的订阅或许可证。

AI 判断的局限/争议:

  • 成本对比的公平性受限于各 CLI 定价模型的透明度差异——Copilot 用 AIU 统一计价,而 Cursor/Codex 按 token 计费,两者在"成本"定义上存在口径不一致,跨 CLI 的 USD 对比可能隐含不可比因素。
  • 质量评估依赖用户自带的验证测试或 rubric,若验证集设计不当,结果可能偏向特定 CLI 或模型的输出风格。
  • 框架未提及对非英语任务、超长上下文任务或大规模 monorepo 的适配性,真实仓库的规模和复杂度可能影响结果稳定性。
  • 未涉及安全性和沙箱隔离问题——CLI 在真实仓库上运行可能执行任意代码,框架未说明如何防止恶意或意外修改。

四、与 RRLab 研究的关联

  • Harness 工程:agent-cost-bench 的"自动检测 CLI 二进制名 → 匹配成本读取逻辑"模式,以及"统一附加推理 effort 到模型 slug"的公平性处理,对 RRLab 构建多 Agent harness 有直接借鉴价值——尤其在统一不同工具链的调用约定和成本口径方面。
  • 多模型协同:框架支持同一 CLI 内多模型对比(如 Kiro 内 Opus vs Sonnet),可用于 RRLab 评估多模型路由策略中"成本-质量"的权衡曲线。
  • 模型评测:其"真实 GitHub 仓库 + 自带验证测试 + 可插拔评分器"的评测范式,比纯 benchmark 数据集更贴近实际落地场景,可作为 RRLab 模型评测体系的一个补充维度——尤其是 LLM-judge rubric 的引入,为无客观验证指标的任务提供了评测路径。
  • Agent 落地:框架暴露的"成本随 CLI 差异巨大"这一事实,提示 RRLab 在 Agent 产品化时需将"工具链选择"作为成本优化的关键变量,而非仅关注模型本身。
  • AI 原生产品:其配置驱动 + 示例模板 + 视频演示的文档方式,是典型的开发者工具产品化思路,可作为 RRLab 工具链对外输出的参考范式。

本笔记由 DeepSeek V4 Flash 自动生成,未经人工审校。原文链接:https://github.com/aws-samples/sample-agent-cost-bench