来源:HN (294pts)
URL: https://armature.tech/blog/which-tools-coding-agents-install
精读日期:2026-09-06
模型:DeepSeek V4 Flash(AI 生成,人工未审校)
正文获取:全文

一、核心论点/事实

1. Armature 对 16,893 次编码代理会话进行了大规模实验,覆盖 3 种编码代理(Claude Code、Codex、Cursor)、75 个代码仓库、10 种编程语言、1,163 种提示词变体,最终保留 5,292 个有效会话并公开全部追踪数据。

2. 实验发现:三种代理在仅 42% 的测试单元中选择相同的工具,例如在语音代理类别中,Claude Code 选择 Twilio,Codex 选择 OpenAI Realtime API,Cursor 选择其他方案。

3. 不同代理的信息来源差异显著:Cursor 在 2/3 的会话中依赖网络搜索;Codex 在 94% 的会话中使用网络搜索,且 90% 的查询使用 site: 等操作符聚焦可信域名;Claude Code 主要依赖先验知识,仅约 30% 的会话搜索网络,但搜索时浏览页面数是 Codex 的 3 倍。

4. 在较新领域(如沙箱服务)中,Claude Code 因先验知识较弱,网络搜索比例升至约 80%。

5. Vercel 报告显示,超过 30% 的部署由编码代理发起,较六个月前增长 1000%,表明代理选择对工具供应商的生存至关重要。

6. 实验采用“模拟人类”循环机制(由 Gemini 3.5 驱动),显著减少了代理偏向自建方案或默认选择云平台原生服务的倾向,例如对象存储实验中 Cloudflare R2 在加入该机制后开始胜出。

二、方法/架构拆解

  • 实验设计:从数千个公开 GitHub 仓库中提取编程语言、框架、第三方服务、部署平台、团队规模和代码库年龄等统计数据,基于公开数据去偏后构建理想面板分布,最终生成 75 个真实感仓库(含假公司名、假 git 历史、假 API 密钥和真实 lockfile)。
  • 人物角色设计:4 种用户画像——Vibe-coder(仅描述症状和理想状态)、初级工程师(提及期望状态和类别名)、高级工程师(明确需求和规避项)、大型企业工程师(详细约束、合规、采购要求)。
  • 提示词变体:共 1,163 种变体,其中 20-25% 的用例添加了成本或使用量等特定提及,以测试对最终选择的影响。
  • 沙箱环境:每个实验在独立临时沙箱中运行,轮换使用 3 家沙箱提供商(E2B、Blaxel、Daytona)以排除环境偏差。
  • 模拟人类机制:使用 Gemini 3.5 作为编排器模拟真实对话,代理先分析代码库并推荐方案,模拟人类接受 top 1 方案或要求代理自行选择并实现。
  • 会话验证与标注:使用 Gemini 3.5 Flash 双重角色——验证会话有效性(排除仓库预选偏差、确认实际选择了方案)和识别提及的每个玩家及最终赢家(通过对话和实际代码 diff 判断)。

三、值得注意的局限/争议

作者承认的局限:

  • 实验偏向科技初创公司(开源仓库更多),虽经过去偏处理但企业级代表性仍有限。
  • 10,000+ 次会话未在第一波发布中公开,可能包含额外洞察。
  • 仅提取了追踪数据中的部分学习成果,更多发现待后续挖掘。

AI 判断的局限/争议:

  • 模拟人类(Gemini 3.5)的行为模式可能与真实用户决策存在偏差,尤其在审批代理推荐时的判断标准上。
  • 实验环境为合成仓库,缺少真实生产环境的遗留代码、团队政治和既有技术债,可能影响代理的工具选择。
  • 代理选择受训练数据截止时间影响,新兴工具可能因先验不足而被忽略,实验未明确控制时间偏差。
  • 会话有效性筛选标准(如拒绝单独使用 OpenTelemetry)可能引入主观判断,影响最终排行榜的客观性。

四、与 RRLab 研究的关联

  • Harness 工程:实验的“模拟人类”循环机制和沙箱轮换设计,为构建可靠的代理评测 Harness 提供了方法论参考——特别是如何通过编排器模拟真实交互以减少代理自建倾向。
  • 多模型协同:使用 Gemini 3.5 作为编排器、Gemini 3.5 Flash 作为验证器的分层架构,展示了多模型分工(执行 vs 评估)的可行模式。
  • 模型评测:16,893 次会话的大规模评测框架(含人物角色矩阵、提示词变体、有效性筛选标准)为 RRLab 设计代理评测基准提供了可复用的实验范式。
  • Agent 落地:代理间工具选择分歧(仅 42% 一致)揭示了 Agent 决策的不确定性,对依赖 Agent 自动化的生产环境有重要警示意义。
  • AI 原生产品:工具供应商需针对代理的“选择逻辑”优化可发现性(如 Claude Code 依赖先验、Codex 依赖站点搜索),这对 AI 原生产品的 SEO 和文档策略有直接启示。

本笔记由 DeepSeek V4 Flash 自动生成,未经人工审校。原文链接:https://armature.tech/blog/which-tools-coding-agents-install