来源:HN (107pts)
URL: https://www.terminal-bench-science.ai/announcement
精读日期:2026-08-29
模型:DeepSeek V4 Flash(AI 生成,人工未审校)
正文获取:全文
一、核心论点/事实
- Terminal-Bench-Science 是一个由科学家(而非模型开发者或数据供应商)主导的 AI Agent 科学能力基准,旨在衡量 AI 在真实科研工作流中的表现。
- 首个版本 Terminal-Bench-Science 0.1 包含 70 个任务,覆盖生命科学、物理科学、地球科学、数学和工程科学五大领域。
- 最强模型 Claude Opus 5(搭配 Claude Code)的解决率仅为 30.0%,GPT-5.6 Sol(搭配 Codex)为 22.4%,Claude Fable 5 为 21.4%,GLM 5.3 是最强开源模型(8.1%),GPT-5.6 Luna 垫底(3.3%)。
- 任务筛选极其严格:920 个提案中仅 464 个获批进入实现阶段,386 个 PR 被开启,最终仅 70 个任务进入 0.1 版本。
- 该基准为持续演进型(continuous benchmark),通过定期发布新任务、淘汰已饱和任务,形成科研需求与 AI 发展之间的反馈闭环。
- 共有来自 22 个国家的 376 名贡献者参与了提案、评审或 PR 提交。
- 与 Terminal-Bench 3.0 相比,Terminal-Bench-Science 0.1 将每个模型的解决率压低了 10 个百分点以上,且区分度相当,说明任务难度被刻意校准以挑战最新前沿模型。
二、方法/架构拆解
- 任务来源与流程:任务由科研人员通过开放流程贡献。流程为:提案(proposal)→ 评审讨论与反馈 → 批准 → 实现为 PR → 领域评审(科学有效性与真实性)→ 技术评审(任务构造与验证)→ bar raiser 最终质量检查。
- 验证机制:Agent 在真实环境中执行任务,通过可复现的、任务特定的测试来评分具体产物,包括分析、模拟、证明、代码和数据产品。
- 任务类型:涵盖科学数据分析、统计推断、模拟、优化、定理证明、图像重建、信号处理、反问题、传感器校准、模型拟合、分类和科学机器学习。
- 评测协议:每个模型在全部 70 个任务上各运行 3 次独立试验(three independent trials per task)。
- 成本与效率分析:GPT-5.6 Sol 以 $4.2k 总成本达到与 Claude Fable 5($14.2k)相近的性能;Claude Fable 5 使用约 6.4B tokens,比 GPT-5.6 Sol(8.4B)少约四分之一。Kimi K3 和 Claude Opus 5 同时出现在成本-解决率和 token-解决率两个 Pareto 前沿上。
- 领域差异:Anthropic 和 OpenAI 模型在除工程科学外的所有领域占据前两名;工程科学中 Grok 4.6 以 14.8% 与 GPT-5.6 Sol 并列第二,且成本与 token 更低。数学科学中 Claude Fable 5(33.3%)和 GPT-5.6 Sol(31.4%)领先。
三、值得注意的局限/争议
作者承认的局限:
- 0.1 版本仅为持续基准的首个发布,覆盖范围有限,后续需通过定期发布扩展任务和领域覆盖。
- 任务会被淘汰(retire),包括 Agent 已饱和的任务或评审发现规格不明确的任务,说明当前任务集并非永久有效。
- 作者明确表示任务被刻意校准为挑战最新前沿模型,因此解决率偏低是设计意图而非缺陷。
AI 判断的局限/争议:
- 评测仅基于 3 次独立试验,样本量较小,可能无法充分反映模型性能的稳定性与方差。
- 成本与 token 数据仅反映单次评测运行,未考虑模型 API 定价波动或推理优化带来的变化。
- 70 个任务虽覆盖五大领域,但每个领域的任务数量可能不均衡,跨领域比较(如数学 vs 工程)的统计显著性存疑。
- 任务由科学家自行贡献并评审,存在主观偏差风险——评审者可能偏好与自己研究领域相近的任务类型。
- 基准聚焦于"可验证的产物"(分析、代码、证明等),可能低估了科研中难以自动验证但同样重要的能力(如假设形成的质量、实验设计的创造性)。
四、与 RRLab 研究的关联
- Harness 工程:Terminal-Bench-Science 的"提案→PR→多级评审→bar raiser"流程为 RRLab 构建 Agent 评测 harness 提供了可借鉴的质量控制范式,尤其是"任务需对前沿模型有挑战性"的校准原则。
- 多模型协同:评测显示不同模型在不同领域(如 Grok 在工程科学、Claude Fable 在数学)各有优势,支持 RRLab 探索多模型路由或协同策略——根据任务领域动态选择最优模型可显著提升整体解决率。
- 模型评测:该基准的"持续演进"理念(定期发布、淘汰饱和任务)对 RRLab 的评测体系有直接参考价值——静态基准会随模型进步而失效,需要建立动态更新机制。成本-解决率与 token-解决率的双 Pareto 前沿分析框架也可用于 RRLab 的模型性价比评估。
- Agent 落地:任务类型(数据分析、模拟、优化、定理证明等)与真实科研工作流高度对齐,为 RRLab 在科研场景的 Agent 产品化提供了明确的能力基线——当前最强模型仅 30% 解决率,说明该领域仍有巨大提升空间。
- AI 原生产品:基准强调"释放科学家时间,聚焦人类判断"的产品定位,与 RRLab 构建 AI 原生科研工具的方向一致。其"科学家主导基准"的社区模式也可借鉴为 RRLab 产品需求收集与验证的机制。
本笔记由 DeepSeek V4 Flash 自动生成,未经人工审校。原文链接:https://www.terminal-bench-science.ai/announcement