来源:HN (258pts)
URL: https://withspecific.com/benchmarks/real-swe
精读日期:2026-09-14
模型:DeepSeek V4 Flash(AI 生成,人工未审校)
正文获取:全文

一、核心论点/事实

  • Real-SWE 是一个评估前沿 AI 模型在私有、真实企业代码库上表现的基准,任务来自从真实公司授权的私有生产代码库。
  • 任务类型涉及计费、税务计算、客户迁移等影响业务运行的实际工程问题,往往跨多个服务。
  • 评测指标为 resolution rate,等价于 pass@1,每任务独立运行 8 次取平均,并给出 95% 置信区间。
  • 典型 Real-SWE 指令长度为 1,742 字符;参考解决方案编辑文件数的中位数为 11 个文件,高于 FrontierCode 和 DeepSWE 的 6 个
  • 运行时长与成功率关系:10 分钟以内的 98 次 rollout 中,70 次失败(71.4%)、28 次通过(28.6%);10 分钟及以上的 542 次 rollout 中,398 次失败(73.4%)、144 次通过(26.6%)。
  • 作者称真实企业中 99% 的 token 对前沿模型是隐藏的,这类私有代码库任务天然处于分布外(out of distribution)。
  • 使用原生 harness 评估“模型 + harness”组合,而非孤立评估模型。

二、方法/架构拆解

  • 任务来源:从真实公司授权的私有生产代码库中筛选,优先选择满足真实用户/业务需求的代码,而非为造基准而写的代码。
  • 筛选标准:真实公司、有可观使用量、强工程团队、高要求生产负载。
  • 任务特征:指令略微欠指定(underspecified),程度与 DeepSWE、Terminal Bench 大致相当,但足够具体以免遗漏必要指令;任何验证器要求的行为必须被陈述或可合理发现。
  • 环境:每个任务只暴露其工作流所需的服务,agent 需跨代码、基础设施和业务工具工作。
  • 评测方式:resolution rate = pass@1,每任务 8 次独立运行取平均,报告 95% 置信区间;采用原生 harness,评估模型与 harness 的组合。
  • 对比基准:与 FrontierCode、DeepSWE、Terminal-Bench 3、FrontierSWE v2 等进行指令长度、编辑文件数等维度对比(部分基准无对应可比数据)。

三、值得注意的局限/争议

  • 作者承认的
  • 指令略微欠指定,可能增加任务难度与歧义。
  • 样本任务分析仅基于少量任务(八份仓库支持的样本任务),代表性有限。
  • 部分对比基准缺少可比数据(如 Terminal-Bench 3、FrontierSWE v2 无编辑文件数对比)。
  • AI 判断的
  • 私有代码库不可公开复现,基准的可验证性与第三方复现能力受限。
  • 任务来自授权公司,可能存在选择偏差,未必代表所有企业工程场景。
  • 运行时长与成功率的相关性分析(<10 分钟 vs ≥10 分钟)显示失败率相近,作者未深入解释时长与任务难度/模型行为之间的因果。
  • 仅报告 pass@1 类指标,缺少对部分完成、代码质量、可维护性等维度的评估。

四、与 RRLab 研究的关联

  • Harness 工程:强调用原生 harness 评估“模型 + harness”组合,提示 RRLab 在评测中应把 harness 作为一等变量,而非固定脚手架。
  • 多模型协同:任务跨多服务、多文件(中位数 11 个文件),适合检验多模型/多 agent 分工协作在真实工程中的表现。
  • 模型评测:私有企业代码库构成天然分布外评测集,可作为 RRLab 评测体系中“真实企业场景”维度的补充,弥补公开基准的饱和问题。
  • Agent 落地:任务直接对应企业真实支出与工程师工时,说明 agent 落地价值应以“可交付的真实工程变更”衡量,而非实验性能力。
  • AI 原生产品:企业代码规范与模式理解是当前模型弱项,提示 AI 原生产品需内置公司特定约定与业务规则的理解/校验能力。

本笔记由 DeepSeek V4 Flash 自动生成,未经人工审校。原文链接:https://withspecific.com/benchmarks/real-swe