来源:GitHub (★103)
URL: https://github.com/prime-radiant-inc/superpowers-evals
精读日期:2026-08-21
模型:DeepSeek V4 Flash(AI 生成,人工未审校)
正文获取:全文
一、核心论点/事实
- 项目定位:superpowers-evals 是一个行为评估实验室(Quorum),而非通用基准测试套件,专注于工作流合规性评估,包括技能触发、worktree 行为、子代理协调、验证反射、审查质量和成本塑形模式。
- 驱动真实代理:通过 QA 代理(Gauntlet)驱动真实编码代理 CLI(Claude、Codex、Antigravity、Gemini、Hermes、Kimi、OpenCode、Pi、Copilot),并依据场景验收标准和确定性后置检查进行评分。
- 双执行模式:Quorum 有两种截然不同的执行模式——静态/单元模式(不调用模型 API、不启动代理 CLI)和实时模式(启动真实代理 CLI,收集原始转录、工具调用等)。
- 安全边界:公共 CI 必须保持在静态/单元侧,绝不添加 API 密钥、调用或危险模式代理启动;实时评估仅限可信本地环境或专用设备主机。
- 实时评估权限:被测编码代理以广泛执行权限运行(如
--dangerously-bypass-approvals-and-sandbox),Pi 使用显式工具允许列表和 API 密钥认证,Copilot 使用隔离环境但非沙箱。 - 隔离机制:通过配置目录折叠(collapsed)实现无状态、可复现的评估,预置(Provisioning)将配置和 OAuth 凭据注入一次性 home 目录,避免运行时登录。
- 成本与认证:Gauntlet-Agent 默认使用 Anthropic API 密钥认证,也可通过订阅登录(有交互使用上限,高并发批次可能触发限制)。
二、方法/架构拆解
- 评估流程:场景定义 → 预置隔离环境 → 启动编码代理 CLI(实时模式)→ Gauntlet QA 代理驱动 → 收集原始转录/工具调用/会话状态 → 依据验收标准 + 确定性后置检查评分。
- 场景示例:
scenarios/triggering-writing-plans(触发测试驱动开发),运行命令为bun run quorum run scenarios/triggering-writing-plans --coding-agent claude。 - 代理支持矩阵:支持 Claude、Codex、Antigravity、Gemini、Hermes、Kimi、OpenCode、Pi、Copilot 等 9 种 CLI;不同代理有不同的认证和配置方式(如 Pi 用 API-key + 允许列表,Copilot 用 OAuth + 插件预置)。
- 模型选择:可通过
--credential sonnet指定 Claude 的 Sonnet 或 Haiku 模型,而非默认模型。 - 隔离实现:每个代理的配置目录被折叠(collapsed),排除 home 相对状态、已安装插件、先前会话;预置阶段将配置和 OAuth 凭据注入一次性 home,Copilot 额外在运行目录写入 chmod-0600 的密钥文件。
- 共享远程实时评估:设计为从可信设备主机运行,具备凭据捆绑、精确 repo/ref 溯源、主机锁、可恢复作业记录;目标接口在
docs/superpowers/specs/2026-06-18-shared-eval-appliance-design.md中定义。 - Docker 运行时:作为真实套件运行的主要方案,隔离评估检出、被测 Superpowers 检出、凭据和认证源。
三、值得注意的局限/争议
作者承认的局限:
- 实时编码代理运行具有广泛文件系统和网络访问权限,隔离机制(如 Copilot 的 chmod-0600 密钥文件)缩小了爆炸半径但并非沙箱。
- 订阅认证(Claude 订阅)有交互使用上限,高并发批次可能触发限制,API 密钥更适合重负载。
- 并非每个场景对所有代理都有效("Not every scenario is valid for every agent")。
- 主机访问和特定提供商的 break-glass 流程有意保留在私有运维手册中,公共仓库不包含这些细节。
AI 判断的局限/争议:
- 安全风险:实时模式以
--dangerously-bypass-approvals-and-sandbox运行,即使有隔离措施,恶意或错误的代理行为仍可能造成本地环境破坏;"非沙箱"的声明暗示了残余风险。 - 可复现性挑战:依赖 OAuth 凭据和外部 API,跨时间、跨环境的可复现性可能受凭据过期、API 版本变化影响。
- 评估范围有限:专注于工作流合规性(流程正确性),而非代码质量或功能正确性,可能遗漏代理产出的实际质量维度。
- 维护成本:支持 9 种代理 CLI,每种代理的配置、认证、隔离机制各异,维护和同步成本较高。
四、与 RRLab 研究的关联
- Harness 工程:Quorum 的双模式设计(静态/单元 vs 实时)和隔离预置机制(配置折叠 + 一次性 home + 凭据注入)是 Harness 工程的高价值参考,可用于构建安全、可复现的代理测试基础设施。
- 多模型协同:支持 9 种编码代理 CLI 的统一驱动和评分框架,为 RRLab 的多模型协同研究提供了跨代理评估范式——通过 QA 代理统一驱动不同模型,按统一标准评分。
- 模型评测:Quorum 的工作流合规性评估(技能触发、子代理协调、验证反射)补充了传统基于输出的评测维度,可借鉴到 RRLab 的模型评测体系中,关注过程质量而非仅结果质量。
- Agent 落地:
--dangerously-bypass-approvals-and-sandbox的权限模型和隔离策略,为 Agent 在生产环境的安全落地提供了边界设计参考;Docker 运行时方案可用于构建可移植的 Agent 评估环境。 - AI 原生产品:Gauntlet QA 代理驱动真实 CLI 的模式,展示了AI 驱动 AI 评估的产品化路径;共享设备主机 + 凭据捆绑 + 可恢复作业记录的设计,可作为 RRLab 构建企业级 AI 评估服务的架构蓝本。
本笔记由 DeepSeek V4 Flash 自动生成,未经人工审校。原文链接:https://github.com/prime-radiant-inc/superpowers-evals