来源:GitHub (★69)
URL: https://github.com/grafana/o11y-bench
精读日期:2026-08-25
模型:DeepSeek V4 Flash(AI 生成,人工未审校)
正文获取:全文
一、核心论点/事实
- o11y-bench 是 Grafana 团队推出的开源基准测试项目,用于评估 LLM Agent 在可观测性(Observability)和 SRE 任务上的表现。
- 项目基于 Harbor 构建,内置完整的 Grafana 技术栈(Prometheus、Loki、Tempo)作为合成可观测性环境。
- 每次基准运行会产出机器可读的工件(artifacts) 和 HTML 报告,支持单任务或完整基准运行。
- 基准测试流程包含三个核心步骤:启动 Harbor 任务容器及可观测性 sidecar 栈 → 依据确定性检查 + 评分标准(rubric)进行评分 → 写入任务工件和 HTML 报告。
- 每个运行会持久化一个场景时钟(scenario clock),确保重跑和重新评分对齐到相同的合成数据窗口。
- 支持多种 Agent 运行方式:仓库内置 Agent、Harbor 内置 Agent、自定义 Harbor Agent 类(通过 import path 引入)。
- 默认通过 mcp-grafana(MCP 工具) 让 Agent 与 Grafana 交互;也支持通过 gcx CLI 方式运行(需剥离 MCP 工具)。
- 项目当前 GitHub Star 数为 69。
二、方法/架构拆解
架构组成
- Harbor:任务容器与基准运行框架(场景定义、评分、工件管理的核心)。
- 可观测性 sidecar 栈:Grafana + Prometheus + Loki + Tempo 的 Docker 镜像与配置,提供合成监控数据环境。
- 场景定义:以 Harbor 为基准场景的 source of truth;生成输出不应手工编辑。
- Agent 接入层:
- 默认 Agent:
agents.langchain_o11y_agent:LangChainO11yBenchAgent(LangChain 实现的简单示例)。 - 可选 Agent:
agents.gcx_opencode_agent:GcxOpenCodeAgent(OpenCode + gcx + gcx skills,剥离 MCP 工具)。 - 任意可导入的 Harbor Agent 类均可通过
--agent-import-path指定。
运行机制
- 任务执行:
mise run bench:job -- --model <model> --task-name <task> --n-concurrent <n>,默认每个任务尝试 3 次。 - 任务恢复:若任务已存在且配置兼容,自动复用已完成工作并重跑失败部分;修改模型、推理强度或 Agent 配置会生成新的任务变体。
- 任务命名:自动生成,例如
openai-gpt-5-4-nano-off-agents-langchain-o11y-agent-langchaino11ybenchagent-k3。 - 环境要求:本地需安装完整工具链(mise 管理的 pinned toolchain + Python 环境),并配置模型提供商的 API 密钥(OpenAI 兼容端点)。
- 调试支持:可覆盖场景时钟(
--override-clock)、指定自定义输出目录/任务名(--jobs-dir、--job-name)、使用安静模式(bench:job:quiet)。
关键命令示例
# 默认 Agent 运行
mise run bench:job -- --model openai/gpt-5.4-nano --task-name query-cpu-metrics --n-concurrent 1
# 指定 Agent 运行
mise run bench:job -- --model openai/gpt-5.4-nano --task-name query-cpu-metrics --agent-import-path agents.langchain_o11y_agent:LangChainO11yBenchAgent
# gcx CLI 模式
mise run bench:job -- --model anthropic/claude-sonnet-4-6 --task-name query-cpu-metrics --agent-import-path agents.gcx_opencode_agent:GcxOpenCodeAgent
# 自定义输出
mise run bench:job -- --model openai/gpt-5.4-mini --jobs-dir /tmp/o11y-bench-jobs --job-name my-smoke-run
三、值得注意的局限/争议
作者承认的局限
- gcx Agent 模型限制:gcx 模式下的 Agent 只能运行 OpenCode 支持的模型,模型选择受限。
- gcx 变更测试依赖本地构建:测试 gcx 未发布到 main 的变更时,需使用本地构建的二进制文件,增加使用门槛。
AI 判断的局限/争议
- 场景覆盖度有限:当前仅内置少量任务(如
query-cpu-metrics),对真实 SRE 场景(如故障排查、告警响应、根因分析)的覆盖尚不充分,基准的代表性有待验证。 - 评分标准主观性:rubric 评分标准可能引入主观偏差,确定性检查与 rubric 的权重配比未公开,影响结果可复现性。
- 模型 API 依赖:运行依赖外部模型提供商 API,不同提供商的延迟、限流和版本差异可能影响基准结果的公平性和稳定性。
- Star 数较低(69):项目处于早期阶段,社区验证和生态成熟度有限,基准结果的外部可信度尚待积累。
- 合成数据 vs 真实数据:基于合成可观测性环境的评估结果,可能无法完全反映 Agent 在真实生产环境(数据噪声、异常模式、规模)中的表现。
四、与 RRLab 研究的关联
Harness 工程
- 可借鉴点:o11y-bench 的「场景时钟」机制——通过持久化时钟对齐合成数据窗口,确保重跑和重新评分的一致性。RRLab 的 Harness 工程可参考此设计,在 Agent 评测中引入「时间锚点」概念,保证多次运行的数据可比性。
- 可借鉴点:任务恢复与变体管理机制(相同配置复用已完成工作、不同配置生成独立变体),可优化 RRLab 评测流水线的资源利用率和结果追踪能力。
多模型协同
- 可借鉴点:o11y-bench 支持通过
--agent-import-path灵活切换不同 Agent 实现(LangChain、OpenCode/gcx 等),RRLab 可参考此插件化架构,构建多 Agent 协同评测框架,支持不同 Agent 策略的快速插拔对比。
模型评测
- 可借鉴点:o11y-bench 的「确定性检查 + rubric 评分」双轨评分体系,为 RRLab 的模型评测提供了可操作范式——确定性检查保证客观可复现,rubric 评分覆盖主观质量维度,两者结合可提升评测的全面性。
- 可借鉴点:机器可读工件 + HTML 报告的产物设计,RRLab 可参考此模式,建立标准化的评测输出格式,便于结果归档、对比分析和自动化集成。
Agent 落地
- 可借鉴点:o11y-bench 将 Agent 置于真实可观测性工具链(Grafana + Prometheus + Loki + Tempo)中评测,验证 Agent 在真实工程工具环境中的落地能力。RRLab 可参考此思路,在 Agent 落地评测中引入真实工具链集成,而非仅限模拟环境。
- 可借鉴点:MCP 工具与 CLI 工具(gcx)双通道交互模式的对比评测,为 RRLab 研究 Agent 与外部工具的最佳交互范式提供了实验设计参考。
AI 原生产品
- 可借鉴点:o11y-bench 定位为「可观测性领域的 Agent 基准」,是 AI 原生产品(AI for Observability)的评测基础设施。RRLab 可借鉴其「领域专用基准」思路,为自身 AI 原生产品线构建垂直领域的评测基准,提升产品的可信度和市场说服力。
本笔记由 DeepSeek V4 Flash 自动生成,未经人工审校。原文链接:https://github.com/grafana/o11y-bench