来源:GitHub (★103)
URL: https://github.com/prime-radiant-inc/superpowers-evals
精读日期:2026-08-21
模型:DeepSeek V4 Flash(AI 生成,人工未审校)
正文获取:全文

一、核心论点/事实

  • 项目定位:superpowers-evals 是一个行为评估实验室(Quorum),而非通用基准测试套件,专注于工作流合规性评估,包括技能触发、worktree 行为、子代理协调、验证反射、审查质量和成本塑形模式。
  • 驱动真实代理:通过 QA 代理(Gauntlet)驱动真实编码代理 CLI(Claude、Codex、Antigravity、Gemini、Hermes、Kimi、OpenCode、Pi、Copilot),并依据场景验收标准和确定性后置检查进行评分。
  • 双执行模式:Quorum 有两种截然不同的执行模式——静态/单元模式(不调用模型 API、不启动代理 CLI)和实时模式(启动真实代理 CLI,收集原始转录、工具调用等)。
  • 安全边界:公共 CI 必须保持在静态/单元侧,绝不添加 API 密钥、调用或危险模式代理启动;实时评估仅限可信本地环境或专用设备主机。
  • 实时评估权限:被测编码代理以广泛执行权限运行(如 --dangerously-bypass-approvals-and-sandbox),Pi 使用显式工具允许列表和 API 密钥认证,Copilot 使用隔离环境但非沙箱
  • 隔离机制:通过配置目录折叠(collapsed)实现无状态、可复现的评估,预置(Provisioning)将配置和 OAuth 凭据注入一次性 home 目录,避免运行时登录。
  • 成本与认证:Gauntlet-Agent 默认使用 Anthropic API 密钥认证,也可通过订阅登录(有交互使用上限,高并发批次可能触发限制)。

二、方法/架构拆解

  • 评估流程:场景定义 → 预置隔离环境 → 启动编码代理 CLI(实时模式)→ Gauntlet QA 代理驱动 → 收集原始转录/工具调用/会话状态 → 依据验收标准 + 确定性后置检查评分。
  • 场景示例scenarios/triggering-writing-plans(触发测试驱动开发),运行命令为 bun run quorum run scenarios/triggering-writing-plans --coding-agent claude
  • 代理支持矩阵:支持 Claude、Codex、Antigravity、Gemini、Hermes、Kimi、OpenCode、Pi、Copilot 等 9 种 CLI;不同代理有不同的认证和配置方式(如 Pi 用 API-key + 允许列表,Copilot 用 OAuth + 插件预置)。
  • 模型选择:可通过 --credential sonnet 指定 Claude 的 Sonnet 或 Haiku 模型,而非默认模型。
  • 隔离实现:每个代理的配置目录被折叠(collapsed),排除 home 相对状态、已安装插件、先前会话;预置阶段将配置和 OAuth 凭据注入一次性 home,Copilot 额外在运行目录写入 chmod-0600 的密钥文件。
  • 共享远程实时评估:设计为从可信设备主机运行,具备凭据捆绑、精确 repo/ref 溯源、主机锁、可恢复作业记录;目标接口在 docs/superpowers/specs/2026-06-18-shared-eval-appliance-design.md 中定义。
  • Docker 运行时:作为真实套件运行的主要方案,隔离评估检出、被测 Superpowers 检出、凭据和认证源。

三、值得注意的局限/争议

作者承认的局限:

  • 实时编码代理运行具有广泛文件系统和网络访问权限,隔离机制(如 Copilot 的 chmod-0600 密钥文件)缩小了爆炸半径但并非沙箱
  • 订阅认证(Claude 订阅)有交互使用上限,高并发批次可能触发限制,API 密钥更适合重负载。
  • 并非每个场景对所有代理都有效("Not every scenario is valid for every agent")。
  • 主机访问和特定提供商的 break-glass 流程有意保留在私有运维手册中,公共仓库不包含这些细节。

AI 判断的局限/争议:

  • 安全风险:实时模式以 --dangerously-bypass-approvals-and-sandbox 运行,即使有隔离措施,恶意或错误的代理行为仍可能造成本地环境破坏;"非沙箱"的声明暗示了残余风险。
  • 可复现性挑战:依赖 OAuth 凭据和外部 API,跨时间、跨环境的可复现性可能受凭据过期、API 版本变化影响。
  • 评估范围有限:专注于工作流合规性(流程正确性),而非代码质量或功能正确性,可能遗漏代理产出的实际质量维度。
  • 维护成本:支持 9 种代理 CLI,每种代理的配置、认证、隔离机制各异,维护和同步成本较高。

四、与 RRLab 研究的关联

  • Harness 工程:Quorum 的双模式设计(静态/单元 vs 实时)和隔离预置机制(配置折叠 + 一次性 home + 凭据注入)是 Harness 工程的高价值参考,可用于构建安全、可复现的代理测试基础设施。
  • 多模型协同:支持 9 种编码代理 CLI 的统一驱动和评分框架,为 RRLab 的多模型协同研究提供了跨代理评估范式——通过 QA 代理统一驱动不同模型,按统一标准评分。
  • 模型评测:Quorum 的工作流合规性评估(技能触发、子代理协调、验证反射)补充了传统基于输出的评测维度,可借鉴到 RRLab 的模型评测体系中,关注过程质量而非仅结果质量。
  • Agent 落地--dangerously-bypass-approvals-and-sandbox 的权限模型和隔离策略,为 Agent 在生产环境的安全落地提供了边界设计参考;Docker 运行时方案可用于构建可移植的 Agent 评估环境。
  • AI 原生产品:Gauntlet QA 代理驱动真实 CLI 的模式,展示了AI 驱动 AI 评估的产品化路径;共享设备主机 + 凭据捆绑 + 可恢复作业记录的设计,可作为 RRLab 构建企业级 AI 评估服务的架构蓝本。

本笔记由 DeepSeek V4 Flash 自动生成,未经人工审校。原文链接:https://github.com/prime-radiant-inc/superpowers-evals