来源:GitHub (★344)
URL: https://github.com/SeraphimSerapis/tool-eval-bench
精读日期:2026-09-16
模型:DeepSeek V4 Flash(AI 生成,人工未审校)
正文获取:全文

一、核心论点/事实

  • tool-eval-bench 是面向 LLM 服务栈的工具调用质量基准,包含 80+ 确定性场景(核心 69 个 + 19 个可选 Hard Mode),测试多轮编排、安全边界与结构化输出。
  • 支持 vLLM、SGLang、llama.cpp 等 OpenAI 兼容端点,并自动扫描常见 localhost 端口(含 LiteLLM、Ollama、TGI)。
  • 每个场景只观察单个 assistant 与 mock 工具的对话,不测量独立 agent、委派或 agent 间交接。
  • 本地化覆盖目前以德语为主;难度分级为作者主观估计。
  • 评分会剔除“测量服务环境而非模型”的场景(超时、连接错误、端点拒绝请求、llama.cpp sampler grammar 错误、端点不具备所需能力等),而非计零分;因此 69 个场景中只评了 60 个的运行结果不可与完整运行比较。
  • 排行榜按配置与部署元数据(引擎版本、量化、GPU 数、server slot 数、投机解码模式)分组,仅同组可比。
  • 提供吞吐基准(捆绑 llama-benchy),含 prefill/生成速度及深度与并发扫描。

二、方法/架构拆解

  • 场景分类 A–O:工具选择、参数精度、多步链、拒绝、错误恢复、本地化、指令遵循、安全与提示注入、52 工具命名空间、自主规划、结构化输出。
  • Hard Mode:19 个对抗性、有状态、事务性场景,面向已高分模型;--variant-seed 独立于模型采样种子选择版本化 mock 环境,16 个场景在 10 个 authoring package 间变化,其余为对照;变体包括干燥天气、延迟/失败任务、先澄清后行动、房间容量、事务结果、分页、标识符变更;私有 YAML 包不变。
  • 运行产物:每次完成运行写两个 artifact(Markdown 报告含每场景完整 trace + 终端摘要含综合分、星级、分类百分比)。
  • 关键指标:TC-88 独立评分可见数值约束(与推理通道可用性无关);TC-45 强制工具调用,端点不支持时排除;结构化输出诊断仅声明“请求了 schema 强制”,不断言后端实际执行。
  • 配置优先级:CLI flags > 环境变量 > 配置文件;支持 TOOL_EVAL_BASE_URLTOOL_EVAL_GEMINI_BASE_URLTOOL_EVAL_LOCAL_BASE_URL 等。
  • 安装:uv tool install git+...;性能版 tool-eval-bench[perf];快速运行 run --short --base-url http://localhost:8000(核心 15 场景,数分钟,无需配置文件)。
  • 安全判定:观察到的不安全行为或泄露即使发生在注入场景之外也上报;无害的未完成工作不算安全违规;有记录违规且安全组低于 50% 时触发相应处理。

三、值得注意的局限/争议

  • 作者承认:仅观察单 assistant 对话,不测独立 agent、委派、agent 间交接;本地化以德语为主;难度分级为作者估计;结构化输出诊断不验证后端是否真正执行 schema。
  • 作者承认:剔除服务环境导致的失败场景,导致不同运行的可评场景数可能不同,跨运行比较需谨慎。
  • AI 判断:剔除机制虽避免误判模型能力,但也可能掩盖服务栈稳定性问题,使“模型质量”与“部署质量”的边界模糊。
  • AI 判断:Hard Mode 变体与对照混合,若未严格控制变量,可能影响场景间可比性。
  • AI 判断:52 工具命名空间等场景对上下文长度敏感,可能同时测量长上下文能力而非纯工具调用质量。

四、与 RRLab 研究的关联

  • Harness 工程:可借鉴其“确定性场景 + mock 工具 + 完整 trace”的 harness 设计,以及剔除环境失败而非计零分的评分策略。
  • 多模型协同:当前基准不覆盖 agent 间交接与委派,正是 RRLab 可补足的空白,可扩展为多 agent 协同评测。
  • 模型评测:A–O 分类体系、Hard Mode 对抗场景、TC-88/TC-45 等细粒度指标,可作为工具调用能力评测的参考框架。
  • Agent 落地:安全与提示注入、错误恢复、拒绝、自主规划等场景直接对应生产级 agent 的可靠性要求。
  • AI 原生产品:排行榜按部署元数据分组、配置优先级设计、--short 快速冒烟测试,均可借鉴到产品化评测流程。

本笔记由 DeepSeek V4 Flash 自动生成,未经人工审校。原文链接:https://github.com/SeraphimSerapis/tool-eval-bench