来源:GitHub (★115)
URL: https://github.com/PROrunner926/copilot-cache-scout
精读日期:2026-09-14
模型:DeepSeek V4 Flash(AI 生成,人工未审校)
正文获取:全文

一、核心论点/事实

  • 当前 token 定价模型忽略了“递归 token 税”(recursive token tax)——多轮对话中重复注入上下文带来的隐性成本。
  • 项目对比三种缓存策略:naive memory retention(全量历史拼接)、prompt-level caching(仅保留最近 N 轮 + 次级 agent 摘要)、librarian-pattern digest(动态语义摘要,对数增长)。
  • 在 Claude Opus 4.6 上,librarian-pattern 相比 prompt caching 将每轮 token 成本降低 27–41%。
  • naive retention 在对话超过 10–15 轮后出现 token 开销的二次爆炸(quadratic explosion)。
  • prompt caching 虽节省 token,但存在“驱逐税”(eviction tax)——重新解释被移除上下文的额外 token 消耗。
  • 工具支持 2 轮到 50 轮对话、3 到 7 个 agent 的代码审查模拟,可同时跑三种架构并输出并排成本矩阵。
  • 项目定位为独立分析框架,可替换为任意 OpenAI 兼容端点,不限于 GitHub Copilot 代理。

二、方法/架构拆解

  • 数据集/基准:无公开数据集;以 GitHub Copilot 的 Claude Opus 4.6 代理为默认基准,模拟多 agent 代码审查轮次(3–7 agent,2–50 轮)。
  • 关键实现
  • 代理层毫秒级插桩,记录每消息的输入/输出 token。
  • 三种缓存架构并行运行,输出累积 token 成本堆叠面积图、开销百分比表、digest 相似度分数。
  • librarian-pattern 维护动态“digest”:压缩语义地图,随轮次对数增长,并生成“mnemonic map”显示保留与压缩的语义块。
  • CLI 命令示例:python -m mindmirror.run --depth 30 --agents 5 --architectures all
  • 技术栈:Python 3.11+,D3.js 交互图表,支持 5 种语言(英、日、简中、德、法)。
  • 辅助组件:轻量支持服务器,可捕获崩溃堆栈、启发式修正异常数据(如负 token 数)、生成诊断工单。

三、值得注意的局限/争议

  • 作者承认的
  • 仅限伦理基准与研究用途,禁止逆向工程、绕过限流或逃避计费。
  • 软件按“原样”提供,不承担实验产生的 token 费用或滥用责任。
  • AI 判断的
  • 27–41% 的节省幅度仅基于 Claude Opus 4.6 单一模型,跨模型泛化性未验证。
  • “librarian-pattern digest”的语义压缩质量缺乏下游任务准确率指标,仅用 digest 相似度分数衡量,可能掩盖信息损失。
  • 支持服务器“启发式修正损坏数据”可能引入偏差,且未说明修正规则透明度。
  • 项目星标仅 115,社区验证规模有限,基准可复现性依赖 Copilot 代理配置。

四、与 RRLab 研究的关联

  • Harness 工程:代理层毫秒级 token 插桩、多架构并行对比、异常数据捕获与诊断工单,可直接借鉴为 RRLab 的评测 harness 设计模式。
  • 多模型协同:三种缓存策略对应不同上下文管理范式,librarian-pattern 的对数增长 digest 可为多 agent 协同中的记忆压缩提供参考。
  • 模型评测:递归 token 税、驱逐税等指标可纳入 RRLab 的模型评测维度,补充传统准确率/延迟之外的 token 经济学视角。
  • Agent 落地:代码审查场景的 3–7 agent 模拟与 2–50 轮深度扫描,为 Agent 落地中的成本控制提供可配置实验框架。
  • AI 原生产品:多语言 UI、D3.js 仪表盘、支持服务器等工程化组件,可迁移至 RRLab 的 AI 原生产品原型。

本笔记由 DeepSeek V4 Flash 自动生成,未经人工审校。原文链接:https://github.com/PROrunner926/copilot-cache-scout