来源:HN (167pts)
URL: https://quesma.com/blog/does-rtk-make-ai-coding-cheaper/
精读日期:2026-09-13
模型:DeepSeek V4 Flash(AI 生成,人工未审校)
正文获取:全文
一、核心论点/事实
- RTK(Rust Token Killer)宣称可削减 Claude Code 最多 60% 的 token、压缩最多 90% 的 bash 输出,但“减少终端输出”≠“降低 AI 编码成本”。
- 作者在 Terminal-Bench 2.1 上花费超 $1,500、共 1,740 次尝试(85 个 Fable 任务 + 89 个 DeepSeek 任务,各跑 5 次有/无 RTK)后发现:Fable 成本降 5%,DeepSeek 成本反升 5%。
- 通过率反而下降:Fable 降 1%,DeepSeek 降 2%。
- 按“每次通过的成本”算:Fable 便宜 3%,DeepSeek 贵 7%;按任务等权算:Fable 贵 1%(与 0 无显著差异),DeepSeek 贵 18%(剔除失败后仍为 18%)。
- Fable 几乎全部节省来自单个任务(RTK 下轮次减半),其余任务节省不足 1%;同一任务上 DeepSeek 却因 RTK 轮次更多而更贵。
- RTK 报告的“节省 token”是(原始输出字节 − 过滤后字节)/4 的估算,而非计费 token;445 次 DeepSeek RTK 尝试中,两次调用各虚报 1.205 亿 token 节省,占其报告节省的绝大部分。
- 终端输出本身只占账单小头:无 RTK 时,工具输出约占 Fable 输入 token 的 11%、DeepSeek 的 40%;且缓存后成本仅为常规输入的 1/10(Fable)和 1/30(DeepSeek)。
- DeepSeek 上 RTK 使终端输出字符减 9%,但 prompt token 反升 9%;平均每轮输入少 7%,但总轮次多 18%,导致总输入不降反升。
二、方法/架构拆解
- 被测工具:RTK 0.45.0,通过 Claude Code hook 匹配 Bash 调用、在 OpenCode 中重写 Git/测试/包管理/文件命令,返回更精简的同类输出。
- 基准:Terminal-Bench 2.1(刻意不用 3.0/4.0,因 2.1 任务大多能通过,而“成本只在通过的任务上才有意义”)。
- 模型/平台:Claude Code + Fable 5.0;OpenCode + DeepSeek V4 Pro 0813(经 OpenRouter)。
- 实验设计:每任务同模型路由、同平台、同任务超时下,各跑 5 次无 RTK / 5 次有 RTK;剔除 4 个 Fable 安全类拒答任务。
- 成本口径:分别用“总花费/通过数”“任务等权平均”“剔除失败尝试”三种方式交叉验证,结论一致。
- 工具链版本:RTK 0.45.0、Claude Code 2.1.220、OpenCode 1.18.25、Harbor 0.20,轨迹已公开。
三、值得注意的局限/争议
- 作者承认:仅测 Terminal-Bench 2.1(非 3.0/4.0),仅两个模型路线,RTK 只重写 shell 命令、不覆盖文件读取/搜索类独立工具;约半数 Claude Code Bash 调用本就用
head/tail自限输出。 - 作者承认:Fable 的节省高度依赖单一任务,属离群点;DeepSeek 的 18% 增幅在剔除该任务后仍成立。
- 作者结论:不推荐将 RTK 作为通用省钱工具,它更像“小众优化”,对旧模型可能更有用。
- AI 判断:样本仅 2 个模型、1 个基准,结论外推到其他模型/任务需谨慎;RTK 版本迭代快,0.45.0 的 hook 覆盖范围可能已变化。
- AI 判断:作者用“字节/4”估算 token 节省,本身也是近似,但恰好暴露了 RTK 同类估算的不可靠性——双方口径都非真实计费 token。
- AI 判断:缓存机制(1/10、1/30 折扣)是压低终端输出价值的关键变量,若缓存策略或定价变化,结论可能反转。
四、与 RRLab 研究的关联
- Harness 工程:RTK 的 hook 重写机制是典型 harness 层优化,但本文证明“压缩输入”必须与“轮次/缓存/通过率”联合评估,单点优化可能被轮次增加抵消——对 RRLab 的 harness 设计是重要反例。
- 多模型协同:同一优化(RTK)在 Fable 与 DeepSeek 上效果相反(-5% vs +5%),说明成本优化高度依赖模型行为,多模型路由需按模型分别做成本画像。
- 模型评测:本文的成本度量方法(总花费/通过数、任务等权、剔除失败)值得纳入 RRLab 评测框架;同时提示“报告节省”与“真实计费”必须区分。
- Agent 落地:终端输出仅占 Fable 输入 11%、DeepSeek 40%,且缓存后成本极低——说明优化重点应放在模型输出(占成本 56–57%)和轮次控制,而非输入压缩。
- AI 原生产品:RTK 79k stars 与实测结论的落差,是“指标好看≠产品有效”的典型案例,提醒 RRLab 在产品宣传与内部评估中坚持端到端成本口径。
本笔记由 DeepSeek V4 Flash 自动生成,未经人工审校。原文链接:https://quesma.com/blog/does-rtk-make-ai-coding-cheaper/