来源:HN (285pts)
URL: https://armature.tech/blog/which-tools-coding-agents-install
精读日期:2026-09-05
模型:DeepSeek V4 Flash(AI 生成,人工未审校)
正文获取:全文

一、核心论点/事实

1. Armature 公司通过 16,893 次真实编码代理会话实验,测量了 Claude Code、Codex 和 Cursor 在工具选择上的行为差异,这是迄今最大规模的同类实验。

2. 实验覆盖 1,163 个提示变体、75 个代码仓库、10 种编程语言、18 个行业领域,涉及 4 种用户画像(vibe-coder、初级工程师、高级工程师、企业工程师)。

3. 三个编码代理在 42% 的实验单元中选择相同工具;在语音代理类别中,Claude Code 选 Twilio、Codex 选 OpenAI Realtime API、Cursor 选择不同方案,分歧明显。

4. Vercel 数据显示,超过 30% 的部署由编码代理发起,较六个月前增长 1000%,工具供应商的生存将取决于能否被编码代理选中。

5. 实验最终保留 5,292 个有效会话(51 个代码库)作为第一波发布数据,其余 10,000+ 会话可能后续发布。

6. 引入"模拟人类"在环机制后,领导者与云平台原生解决方案的主导地位下降,结果更接近真实场景(例如对象存储中 Cloudflare R2 开始胜出 Amazon S3)。

二、方法/架构拆解

实验设计:

  • 先分析数千个公开 GitHub 仓库,提取语言/框架、第三方服务、部署平台、团队规模、代码库年龄等统计特征,再基于公开数据去偏,构建理想面板分布。
  • 由编码代理创建 75 个真实感仓库,使用假公司名、假 git 历史、假 API 密钥,但真实 lockfile 通过 npm 等包管理器注册表校验。
  • 生成变体时移除部分代码库及第三方服务实现,确保实验无预选偏差。

用户画像与提示设计:

  • Vibe-coder:仅描述症状和理想状态,很少提及工具类别名
  • 初级工程师:提及期望状态和类别名
  • 高级工程师:对需求和规避项更精确
  • 企业工程师:详细说明合规、采购等约束
  • 20-25% 的案例中额外添加成本或用量提示以测试影响

执行与验证:

  • 每个实验在独立临时沙箱运行,轮换 3 家沙箱提供商(E2B、Blaxel、Daytona)以排除环境偏差。
  • 使用 Gemini 3.7 Flash 作为编排器扮演"模拟人类",先让代理分析代码库并推荐方案,模拟人类选择 top 1 或要求代理自行决定并实施。
  • Gemini 3.7 Flash 还承担双重验证角色:评估会话有效性(排除预选偏差、确认实际选择方案)和识别提及的玩家及最终赢家(通过对话和实际代码 diff)。

关键行为差异:

  • Cursor:2/3 会话基于网页搜索做决策
  • Codex:94% 会话使用网页搜索,90% 查询使用 site: 等操作符聚焦可信域名或特定解决方案
  • Claude Code:主要依赖先验知识,仅 ~30% 会话搜索网页,但搜索时浏览页面数是 Codex 的 3 倍;在新兴领域(如沙箱)先验较弱时,搜索率升至 ~80%

三、值得注意的局限/争议

作者承认的局限:

  • 实验仅保留 5,292 个有效会话(约 31%),其余 10,000+ 会话未发布,可能存在系统性筛选偏差。
  • 开源仓库偏向科技初创公司而非大型企业,虽经去偏处理但无法完全消除。
  • 提示在 20-25% 案例中添加了成本或用量等特定提及,可能影响结论的普适性。

AI 判断的局限/争议:

  • Armature 自身销售开发者工具增长服务,研究动机是"如何影响编码代理的选择",存在明显的利益冲突,可能影响实验设计和结论偏向。
  • 使用 Gemini 3.7 Flash 作为"模拟人类"和会话验证器,其自身偏好可能渗透到实验流程中,形成循环偏差。
  • 实验环境(临时沙箱、模拟人类)与真实开发场景仍有差距,真实工程师的干预和上下文可能改变代理决策。
  • 仅覆盖 3 个编码代理,未包含 GitHub Copilot、Windsurf 等新兴代理,结论的时效性和代表性有限。

四、与 RRLab 研究的关联

模型评测:

  • 本文提供了评测编码代理工具选择能力的方法论参考:通过受控实验、多画像提示、模拟人类在环来系统评估模型决策质量,可借鉴其"有效会话筛选标准"设计评测指标。
  • 代理间分歧率(42% 一致)可作为评测多模型协同中"分歧检测"的基线参考。

多模型协同:

  • 三个代理在工具选择上的显著分歧(如语音代理类别)提示:多模型协同架构中需要引入"决策仲裁"机制,而非简单投票——不同代理的信息源(网页搜索 vs 先验知识)差异可互补。
  • Claude Code 先验强但搜索少、Codex 搜索多但深度浅、Cursor 居中,这种信息获取模式差异可用于设计协同策略中的任务分配。

Agent 落地:

  • "模拟人类在环"实验设计对 Agent 落地测试有直接参考价值:真实场景中 Agent 需要先分析再推荐、获得授权后实施,而非一次性自主完成。
  • 提示中显式提及成本/用量等约束会改变代理选择(20-25% 变体测试),说明 Agent 落地时需将业务约束显式注入提示工程。

AI 原生产品:

  • 工具供应商"被代理选中"的生存压力提示:AI 原生产品需优化"代理可发现性"——包括文档结构化程度、API 命名清晰度、与主流代理的兼容性测试。
  • 代理依赖网页搜索(Cursor 67%、Codex 94%)做决策,说明产品官网和技术文档是影响代理选择的关键触点,需针对代理爬取和解析优化。

Harness 工程:

  • 沙箱轮换(E2B、Blaxel、Daytona)和真实 lockfile 校验的方法,对 Harness 工程中测试环境标准化有借鉴意义。
  • 会话轨迹全公开(含提示、思考过程、代码 diff)的做法,可作为 Harness 工程中可观测性和可复现性的最佳实践参考。

本笔记由 DeepSeek V4 Flash 自动生成,未经人工审校。原文链接:https://armature.tech/blog/which-tools-coding-agents-install