来源:GitHub (★511)
URL: https://github.com/InternLM/WildClawBench
精读日期:2026-08-16
模型:DeepSeek V4 Flash(AI 生成,人工未审校)
正文获取:全文

一、核心论点/事实

  • WildClawBench 是一个面向 AI Agent 的"野外"(in-the-wild)端到端评测基准,核心目标是测试 Agent 能否在真实环境中独立完成实际工作,而非仅测试单一能力。
  • 评测环境基于 OpenClaw——真实用户日常依赖的开源个人 AI 助手,任务均为从零设计的实用难题,包括足球比赛高光剪辑、多轮邮件会议协商、搜索矛盾检测、无文档代码库推理脚本编写、隐私泄露排查等。
  • 当前最强前沿模型在基准上最高得分有限(原文未给出具体数字,但明确表示"most models still land well below that"),最新审计的 OpenClaw 运行已将最佳得分提升,但多数模型仍远低于该水平。
  • 任务复杂度高:Agent 需串联 10–60+ 次工具调用,处理服务失败与自主规划;单个任务墙钟执行时间达 10–20 分钟;涉及 45 分钟视频事件追踪、50+ 学术论文爬取分类总结等长程任务。
  • 评测包含 60 个任务,统一在 Docker 容器中运行,使用相同镜像、数据和评分代码;ground truth 与评分脚本仅在 Agent 完成后注入,杜绝数据泄漏,分数可跨机器复现。
  • 四个 Agent 脚手架(OpenClaw、Claude Code、Codex CLI、Hermes Agent)执行同一 60 任务套件,支持分离评估"工具/脚手架"与"底层 LLM"对最终表现的贡献。
  • 项目提供双排行榜:同一 OpenClaw 脚手架下不同 LLM 的对比,以及同一模型在四种脚手架下的对比;数据以三个 Hugging Face 数据集形式发布,支持复现、任意 Harbor 支持 Agent 评估及完整轨迹分析。

二、方法/架构拆解

  • 评测环境:任务在实时 OpenClaw 实例中运行,配备真实工具(浏览器、bash、文件系统、邮件、日历),非模拟环境。
  • 任务设计:60 个任务全部从零设计,不改编自现有基准,覆盖六大能力维度:
  • 多步工具编排、错误恢复、自主规划(10–60+ 次工具调用链)
  • 视频理解、图像生成、跨模态合成(45 分钟比赛视频高光剪辑;12 张服装照片分类、4 套搭配、生成全身模特图)
  • 复杂工作流(多轮邮件会议协商;50+ 学术论文爬取、分类、总结)
  • 无文档代码库理解、调试、生成可运行程序(从源码独立编写推理脚本;像素级精确的视觉谜题求解)
  • 提示注入防御、凭据泄漏检测、有害内容拒绝(恶意指令深埋于正常文档;API 密钥散布于大型 git 历史)
  • 信息综合、多源聚合、结构化输出(ArXiv 论文摘要、PDF 批量分类、日历调度、维基百科传记、LaTeX 表格提取)
  • 评测协议:每个任务在独立 Docker 容器中运行,相同镜像/数据/评分代码;ground truth 与评分脚本在 Agent 完成后才注入,执行期间不可见。
  • 数据集结构:三个 Hugging Face 数据集——任务数据 + 四种脚手架的 Docker 镜像(复现论文评测);支持任意 Harbor 支持的 Agent 单命令评估;完整 60 任务轨迹 + 前沿模型原始评测输出(可浏览、可挖掘长程轨迹用于分析/训练)。
  • 成本与时间指标:报告每任务平均分钟数(时间)与美元(成本),并乘以权重系数;各模型按各自 API 定价计算(如 Claude Opus 4.8 动态基础费率 $5/M 输入、$25/M 输出;Kimi K2.7 Code $6.5/M 输入、$27/M 输出等)。
  • 任务示例分类:信息综合类(论文摘要、PDF 分类、日历调度)、代码推理类(SAM3 源码推理、拼图/连点/连线谜题、基准复现)、多轮通信类(会议协商、聊天动作提取、升级路由)、冲突解决类(矛盾信息消解、财务数据提取、模糊仓库搜索)、跨模态类(比赛报告+视频剪辑、视频英译中配音、论文转海报、服装图转模特图)。

三、值得注意的局限/争议

作者承认的局限:

  • 评测成本较高:涉及前沿模型 API 调用费用(如 Claude Opus 4.8 动态费率、Kimi K2.7 Code 等),且每任务墙钟时间 10–20 分钟,大规模评测的资源开销显著。
  • 任务难度导致分数区分度集中在头部模型,多数模型得分偏低,可能对中等能力模型的细粒度区分不足。

AI 判断的局限/争议:

  • 评测环境依赖 OpenClaw 作为唯一默认脚手架,尽管支持四种脚手架对比,但 OpenClaw 本身的工具实现质量可能对 LLM 能力评估引入偏差——低分可能源于脚手架缺陷而非模型能力不足。
  • 60 个任务虽覆盖多维度,但样本量相对有限,任务类型偏向"知识工作"(代码、文档、邮件),对物理世界交互、实时决策等 Agent 场景覆盖不足。
  • 成本计算基于各模型公开 API 定价,但动态定价(如 Claude 的缓存读写费率)可能导致跨模型成本比较的公平性存疑。
  • 评测强调"防数据泄漏"(ground truth 后注入),但任务本身若被模型训练数据覆盖(如公开 GitHub 代码库、常见论文),仍可能存在隐式记忆泄漏风险。
  • 长程轨迹数据虽公开,但缺少对 Agent 失败模式的系统标注,限制了其在训练/调试中的直接复用价值。

四、与 RRLab 研究的关联

  • Harness 工程:WildClawBench 的"四脚手架同任务对比"方法论可直接借鉴——RRLab 在自研 Harness 时,可建立类似的多 Harness 对照评测体系,分离"框架能力"与"模型能力"的贡献,避免将框架缺陷误归因于模型。
  • 多模型协同:任务中"跨模态合成""多源信息聚合"等场景天然适合多模型分工(如视觉模型+代码模型+文本模型协同),RRLab 可参考其任务设计,构建多模型协同的评测用例,验证协同架构的实际增益。
  • 模型评测:其"端到端真实任务 + 防泄漏注入 + Docker 可复现"的评测协议是 RRLab 评测体系的重要升级方向——尤其是"ground truth 后注入"和"完整轨迹公开"两个设计,可显著提升评测可信度与可分析性。
  • Agent 落地:任务覆盖的"错误恢复、长程规划、提示注入防御"正是 Agent 生产环境的核心痛点;RRLab 在 Agent 落地时可复用其任务模板(如凭据泄漏检测、多轮邮件协商)作为内部验收基准,确保 Agent 具备真实场景鲁棒性。
  • AI 原生产品:WildClawBench 强调"真实用户日常依赖的工具环境"(OpenClaw),提示 RRLab 在 AI 原生产品设计中,评测应嵌入真实使用场景而非孤立功能测试——产品迭代应以"用户实际工作流完成度"为核心指标,而非单点能力得分。

本笔记由 DeepSeek V4 Flash 自动生成,未经人工审校。原文链接:https://github.com/InternLM/WildClawBench