来源:GitHub (★344)
URL: https://github.com/SeraphimSerapis/tool-eval-bench
精读日期:2026-09-16
模型:DeepSeek V4 Flash(AI 生成,人工未审校)
正文获取:全文
一、核心论点/事实
- tool-eval-bench 是面向 LLM 服务栈的工具调用质量基准,包含 80+ 确定性场景(核心 69 个 + 19 个可选 Hard Mode),测试多轮编排、安全边界与结构化输出。
- 支持 vLLM、SGLang、llama.cpp 等 OpenAI 兼容端点,并自动扫描常见 localhost 端口(含 LiteLLM、Ollama、TGI)。
- 每个场景只观察单个 assistant 与 mock 工具的对话,不测量独立 agent、委派或 agent 间交接。
- 本地化覆盖目前以德语为主;难度分级为作者主观估计。
- 评分会剔除“测量服务环境而非模型”的场景(超时、连接错误、端点拒绝请求、llama.cpp sampler grammar 错误、端点不具备所需能力等),而非计零分;因此 69 个场景中只评了 60 个的运行结果不可与完整运行比较。
- 排行榜按配置与部署元数据(引擎版本、量化、GPU 数、server slot 数、投机解码模式)分组,仅同组可比。
- 提供吞吐基准(捆绑 llama-benchy),含 prefill/生成速度及深度与并发扫描。
二、方法/架构拆解
- 场景分类 A–O:工具选择、参数精度、多步链、拒绝、错误恢复、本地化、指令遵循、安全与提示注入、52 工具命名空间、自主规划、结构化输出。
- Hard Mode:19 个对抗性、有状态、事务性场景,面向已高分模型;
--variant-seed独立于模型采样种子选择版本化 mock 环境,16 个场景在 10 个 authoring package 间变化,其余为对照;变体包括干燥天气、延迟/失败任务、先澄清后行动、房间容量、事务结果、分页、标识符变更;私有 YAML 包不变。 - 运行产物:每次完成运行写两个 artifact(Markdown 报告含每场景完整 trace + 终端摘要含综合分、星级、分类百分比)。
- 关键指标:TC-88 独立评分可见数值约束(与推理通道可用性无关);TC-45 强制工具调用,端点不支持时排除;结构化输出诊断仅声明“请求了 schema 强制”,不断言后端实际执行。
- 配置优先级:CLI flags > 环境变量 > 配置文件;支持
TOOL_EVAL_BASE_URL、TOOL_EVAL_GEMINI_BASE_URL、TOOL_EVAL_LOCAL_BASE_URL等。 - 安装:
uv tool install git+...;性能版tool-eval-bench[perf];快速运行run --short --base-url http://localhost:8000(核心 15 场景,数分钟,无需配置文件)。 - 安全判定:观察到的不安全行为或泄露即使发生在注入场景之外也上报;无害的未完成工作不算安全违规;有记录违规且安全组低于 50% 时触发相应处理。
三、值得注意的局限/争议
- 作者承认:仅观察单 assistant 对话,不测独立 agent、委派、agent 间交接;本地化以德语为主;难度分级为作者估计;结构化输出诊断不验证后端是否真正执行 schema。
- 作者承认:剔除服务环境导致的失败场景,导致不同运行的可评场景数可能不同,跨运行比较需谨慎。
- AI 判断:剔除机制虽避免误判模型能力,但也可能掩盖服务栈稳定性问题,使“模型质量”与“部署质量”的边界模糊。
- AI 判断:Hard Mode 变体与对照混合,若未严格控制变量,可能影响场景间可比性。
- AI 判断:52 工具命名空间等场景对上下文长度敏感,可能同时测量长上下文能力而非纯工具调用质量。
四、与 RRLab 研究的关联
- Harness 工程:可借鉴其“确定性场景 + mock 工具 + 完整 trace”的 harness 设计,以及剔除环境失败而非计零分的评分策略。
- 多模型协同:当前基准不覆盖 agent 间交接与委派,正是 RRLab 可补足的空白,可扩展为多 agent 协同评测。
- 模型评测:A–O 分类体系、Hard Mode 对抗场景、TC-88/TC-45 等细粒度指标,可作为工具调用能力评测的参考框架。
- Agent 落地:安全与提示注入、错误恢复、拒绝、自主规划等场景直接对应生产级 agent 的可靠性要求。
- AI 原生产品:排行榜按部署元数据分组、配置优先级设计、
--short快速冒烟测试,均可借鉴到产品化评测流程。
本笔记由 DeepSeek V4 Flash 自动生成,未经人工审校。原文链接:https://github.com/SeraphimSerapis/tool-eval-bench