来源:GitHub (★60)
URL: https://github.com/phuryn/bug-hunt-bench
精读日期:2026-09-15
模型:DeepSeek V4 Flash(AI 生成,人工未审校)
正文获取:全文

一、核心论点/事实

  • Bug Hunt Bench 在 2 个真实生产代码库中植入 105 个真实 bug,让前沿编码模型在各自厂商的 agentic CLI 中一轮内找出并修复,diff 由独立评审模型盲评。
  • 两个仓库:Repo 1 为约 28K 行 TypeScript VS Code 扩展(45 个植入 bug);Repo 2 为约 60K 行 React/TypeScript LMS,基于 Supabase Edge Functions 与 Clerk(60 个植入 bug)。
  • 截至 2026-09-14,共 84 行、98 次评分运行、28 个模型;105 个 bug 中有 36 个从未被任何模型修复。
  • 评分只计“评审在 diff 中验证已修复的植入 bug”,无部分分;模型自报修复不计分。
  • 固定配置下同一模型多次运行可差 9 分(满分 105);三次 Grok 4.5 同设置得分为 16、13、17,因此 1 分之差视为平局,5 分差才超出方差带。
  • 额外修复(Extras)是真实但未植入的缺陷,单独计数、不计入得分;有模型单轮发现 38 个。
  • 成本按公开列表价估算,且区分真实账单、token 估算、重建下限、免费四类,不可直接跨类比较。

二、方法/架构拆解

  • 任务设定:每个模型每个仓库一轮,无网络、无 git 历史,在厂商自带 CLI(Codex CLI、Claude Code、Grok CLI、Antigravity CLI 等)中运行。
  • 数据构造:Repo 2 全部 60 个 bug 是真实上线后修复的回归,从各自修复 commit 重新引入;Repo 1 中 16/45 为真实回滚修复,29 个按同风格编写。植入时保持测试套件全绿。
  • 评分机制:以 diff 为 ground truth,独立评审模型在不知道提交模型的情况下对照隐藏答案键评分;模型名在评审包中脱敏。
  • 评审隔离:OpenAI 系由 Grok 评审,其余由 GPT-5.5(经 Codex)评审;无模型评审自己或同实验室兄弟模型。早期 6 个 Repo 1 配置在第二家厂商评审下完全复现。
  • 指标维度:植入 bug 修复数(唯一计分项)、Extras、误报(报告称修复但 diff 未修)、成本、墙钟时间、effort 档位、每仓库分列。
  • 统计口径:多行取多次独立运行均值,单次运行不构成对模型的测量;被取代的重跑仍保留在 CSV 中。

三、值得注意的局限/争议

  • 作者承认:
  • 105 个 bug 是固定合成集合,只有“bug 集合”是合成的,代码库与任务本身真实。
  • 两个仓库难度不等(45 vs 60),故用绝对数而非百分比,且模型在两仓库排名不同。
  • 成本类型不可互换,列表价与实付可能背离(某聚合器运行标价 $1.26、实收 $5.54)。
  • 聚合器路径上 effort 参数常无效(HTTP 200 接受但不生效),部分 CLI 会静默降级到更低档位。
  • AI 判断:
  • 评审模型与被评模型存在厂商交叉,虽做了隔离与复现验证,但评审模型本身的能力上限可能影响对复杂修复的判定。
  • “零误报修复”的结论基于当前已记录数据,样本仍有限。
  • 单轮、无网络、无 git 历史的设定贴近但不等同真实开发流程,可能低估依赖历史上下文的修复能力。
  • 36/105 从未被修复,说明基准仍有较大区分空间,也提示部分 bug 可能超出当前模型能力或任务设定边界。

四、与 RRLab 研究的关联

  • Harness 工程:可直接借鉴其“同一模型 + 不同 CLI/harness + effort 档位”的对照设计,以及“请求档位 ≠ 实际服务档位”的探针验证思路。
  • 多模型协同:评审隔离机制(跨厂商评审、模型名脱敏、第二评审复现)可作为多模型互评与仲裁流程的参考模板。
  • 模型评测:以 diff 为 ground truth、拒绝自报修复、区分植入 bug 与 Extras、报告方差带与平局阈值,是构建可信评测基准的完整范式。
  • Agent 落地:真实生产仓库 + 保持测试全绿 + 无网络无 git 历史的设定,适合作为 Agent 代码修复能力的端到端验收场景。
  • AI 原生产品:成本四分类(真实账单/token 估算/重建下限/免费)与“列表价 vs 实付”的披露方式,可用于产品侧成本透明与定价可信度设计。

本笔记由 DeepSeek V4 Flash 自动生成,未经人工审校。原文链接:https://github.com/phuryn/bug-hunt-bench