来源:HN (114pts)
URL: https://alvins82.github.io/hangar-harness-model-tests/
精读日期:2026-09-09
模型:DeepSeek V4 Flash(AI 生成,人工未审校)
正文获取:全文
一、核心论点/事实
- 作者针对同一个 Three.js 任务(构建科幻机库场景),系统测试了 10 种“模型 + harness”组合,以评估哪种组合产出最佳结果。
- 测试任务要求生成一个自包含的 HTML 文件,包含:悬浮无人机、动画警示灯、自发光跑道条纹、体积雾平面、无人机编队切换开关、电影级相机路径。
- 测试数据包含:输入 token(含缓存输入)、输出 token(含推理 token,若 harness 单独报告推理则单列)、DSH 适配器不报告独立推理计数。
- DSH 时长统计为两轮对话中活跃 turn 的总时长,不含轮次间的暂停时间。
- 工具错误被记录为失败的工具事件;数据缺失或未报告时用破折号(—)表示。
- 该测试在 HN 上获得 114 分,说明社区对“模型 + harness 组合”的实际效果对比有较高关注度。
二、方法/架构拆解
- 测试方法:固定同一提示词(Three.js 机库场景),仅改变模型与 harness 组合,进行横向对比。
- 任务复杂度:提示词要求生成单文件 HTML,涵盖 3D 场景构建、动画系统、交互控制(编队切换)、相机动画、视觉效果(体积雾、发光材质)等多重能力。
- 评测维度:
- 输入 token 数(含缓存)
- 输出 token 总数(含推理 token)
- 推理 token 子集(若 harness 支持单独报告)
- DSH 活跃 turn 时长(不含轮间暂停)
- 工具错误次数(失败工具事件)
- Harness 类型:涉及 DSH 适配器(不报告推理 token 数)及其他多种 harness(可分离报告推理 token)。
- 数据记录规范:未报告或不可用的数据统一用破折号标记,保证表格可读性。
三、值得注意的局限/争议
作者承认的局限:
- DSH 适配器不报告独立推理计数,导致该组合的推理 token 数据缺失,无法与其他组合完全对齐比较。
- DSH 时长统计方式(仅活跃 turn 时间)与其他 harness 可能不一致,影响横向对比的公平性。
- 部分数据标记为“不可用或未报告”,说明某些 harness 的遥测能力有限。
AI 判断的局限/争议:
- 测试仅基于单一任务(Three.js 场景生成),结论可能无法泛化到其他类型的编码或 Agent 任务。
- 未提及模型版本的精确标识(如 GPT-4o-mini 还是完整版),可能导致复现困难。
- 缺少对输出质量的定性评估(如代码可运行性、视觉效果评分),仅依赖 token 和时长等定量指标,可能掩盖“生成质量差但 token 少”的情况。
- 未说明测试环境的硬件配置和网络条件,DSH 时长可能受外部因素影响。
- 样本量仅 10 组,且每组可能只跑一次,缺乏多次运行的方差分析。
四、与 RRLab 研究的关联
- Harness 工程:本文直接对比了不同 harness 的遥测能力(如推理 token 报告、时长统计),RRLab 在设计 harness 时需明确遥测字段的标准化,避免出现“DSH 适配器不报告推理计数”这类数据缺口。
- 多模型协同:测试表明不同模型在同一 harness 下的 token 消耗差异显著,RRLab 在多模型路由/协同场景中,可参考此方法建立“任务类型 × 模型 × harness”的效能矩阵,用于动态选择最优组合。
- 模型评测:本文提供了一个轻量级评测范式——用单一高复杂度任务 + 多维度定量指标(token、时长、错误率)快速筛选组合。RRLab 可借鉴此思路,构建更细粒度的评测集(如 3D 生成、代码修复、Agent 工具调用),并补充定性评分维度。
- Agent 落地:工具错误计数(失败工具事件)是 Agent 稳定性的关键指标,RRLab 在 Agent 落地评估中应显式记录工具调用失败率,并区分“模型决策错误”与“harness 执行错误”。
- AI 原生产品:测试任务本身(单文件 HTML 生成)是典型的 AI 原生编码产品用例,RRLab 若开发类似产品,可参考其“固定提示词 + 多组合对比”的验收流程,确保产品在不同后端组合下表现稳定。
本笔记由 DeepSeek V4 Flash 自动生成,未经人工审校。原文链接:https://alvins82.github.io/hangar-harness-model-tests/