来源:GitHub (★60)
URL: https://github.com/FedericoTs/quantprobe
精读日期:2026-08-07
模型:DeepSeek V4 Flash(AI 生成,人工未审校)
正文获取:全文
一、核心论点/事实
- 核心主张:quantprobe 可在任意硬件上预测 LLM 推理速度与显存适配性,并自动生成精确的 llama.cpp 运行命令,甚至全自动完成"检测→选型→下载→启动"全流程。
- 性能验证:在 13/13 个基准上实测速度 ≥0.90× 预测值,通常为 1.1–1.8× 更高;所有预测均在测量前预注册,失败案例与成功案例同等公开。
- 硬件门槛:宣称可在 16GB RAM 的 2016 年 PC 上运行 110B 参数模型,通过分层内存(VRAM/RAM/disk)调度实现。
- 校准机制:基于实测硬件常数(如 RAM 24.3 GB/s、disk 3.13 GB/s)而非规格表,支持用户锚定运行(anchor runs)校准 CPU/GPU 比率。
- 质量保障:推荐配置通过 ≥80% 机器可检查任务即视为业务可用;低于 60% 则所有速度数字被降级标注。2.5-bit 30B 模型在 16k 上下文下达到 85% 通过率(含 5 个初始失败的推理任务)。
- 反欺诈能力:可识别虚假速度声明——如某 70B 模型声称 5.5–7× 超过硬件带宽上限(273 GB/s 下理论极限 6.4 tok/s),判定为不可能的单流解码。
二、方法/架构拆解
- 分层内存定价模型:将推理路径按内存层级(VRAM→RAM→disk)建模,每个 token 的带宽消耗被精确追踪,输出"带宽受限"等绑定约束诊断。
- 放置策略枚举:系统评估所有放置方案——全 VRAM、混合(attention→VRAM, experts→RAM)、专家拆分(34%→VRAM)、纯 CPU、磁盘流式——并自动选择最优。
- 自校准流水线:首次运行自动检测硬件(如 vram 6GB@192, ram 16GB@48, disk 0.5 GB/s),通过两次基准运行和一次 GGUF 缩放测试校准所有预测;留一法(leave-one-out)中位误差 <5%(5 臂),全阶梯约 12%,且误差偏向低估。
- 量化感知质量保护:识别模型在压缩下易崩溃的层并保护,同文件大小下困惑度改善 9%;使用 KL 散度(llama.cpp 原生)评估全分布质量,因测量发现困惑度变化 23% 时模型有 27% 位置改变 token 选择。
- 任务套件(T3/T4):包含 JSON 提取、精确算术、单标签分类、可执行代码、确定性幻觉检查(任何不在源中的数字即失败);答案键由自测机械重算,逻辑谜题暴力验证唯一解。
- 反幻觉设计:思维模型截断被隔离并披露,不计为失败;0.6B 模型触发套件自毁规则(57.9% < 60%),证明仪器正确拒绝判定为业务可用。
- 诚实异常披露:5 房逻辑谜题被 0.6B 模型解决而更大模型失败——非单调能力曲线,被识别为训练数据记忆而非推理的签名,该任务被替换为生成式变体。
三、值得注意的局限/争议
作者承认的局限:
- 5 个任务在 4k 上下文窗口内推理中途失败,需 16k 上下文才能通过(其中一个需 7,417 token 思考)。
- 逻辑谜题存在训练数据记忆污染问题,已替换任务但原分数保留。
- 校准依赖用户锚定运行,未锚定时精度可能下降(--no-anchors 可禁用)。
AI 判断的局限:
- 速度预测的"典型 1.1–1.8× 更高"暗示系统性低估,可能源于保守的带宽模型,但未解释为何低估而非高估。
- 质量门槛(≥80%)是二元判定,未区分任务难度差异——简单任务可能拉高通过率。
- 对 VRAM 竞争的处理仅"拒绝比较",未提供动态调整策略,在多租户场景下实用性存疑。
- 全自动模式(quantprobe auto)的下载源安全性未说明,存在供应链风险。
四、与 RRLab 研究的关联
- Harness 工程:quantprobe 的"预注册预测 + 失败公开"方法论可直接借鉴——RRLab 评测 harness 可引入预测-验证闭环,提升基准可信度。
- 多模型协同:分层放置策略(专家拆分、混合注意力)为多模型共享硬件资源提供调度范式,可扩展到 RRLab 的多模型协同场景。
- 模型评测:T3/T4 任务套件的"确定性幻觉检查"和"答案键机械重算"是评测可靠性的最佳实践;非单调能力检测(训练数据记忆识别)可增强 RRLab 评测的鲁棒性。
- Agent 落地:自动检测硬件并生成最优命令的流水线,可嵌入 RRLab 的 Agent 部署工具链,降低非专家用户的使用门槛。
- AI 原生产品:"知道 tok/s 再下载"的决策前置理念,可转化为 RRLab 产品的预评估功能,提升用户信任度。
本笔记由 DeepSeek V4 Flash 自动生成,未经人工审校。原文链接:https://github.com/FedericoTs/quantprobe