来源:GitHub (★1697)
URL: https://github.com/SemiAnalysisAI/InferenceX
精读日期:2026-09-16
模型:DeepSeek V4 Flash(AI 生成,人工未审校)
正文获取:全文

一、核心论点/事实

  • InferenceX(前身 InferenceMAX)是开源持续推理基准研究平台,采用 Apache 2.0 许可,定位为“持续推理标准”,强调实时追踪推理性能进展而非一次性快照。
  • 核心论点:LLM 推理性能由硬件与软件两根支柱驱动——硬件每年带来阶跃式提升,软件则每日持续优化(kernel 优化、分布式推理策略、调度创新),因此固定时间点的基准会迅速过时。
  • 平台已覆盖主流开源模型:Kimi K3 2.8T、MiniMax M3、DeepSeek V4 Pro 1.6T、GLM5.3、Qwen3.5 397B,均标注“Day 0 起持续基准测试”。
  • 硬件对比覆盖 GB200 NVL72 vs MI355X vs B200 vs GB300 NVL72,并预告 TPUv6e/v7、Trainium2/3。
  • AgentX 被描述为“全球首个完全开源 Apache 2.0 的真实 100 万+长上下文、多轮基准”。
  • 声称被 OpenAI、Meta、Microsoft、Oracle 等“万亿美元级 token 工厂”运营方,以及 PyTorch Foundation、vLLM、SGLang、Tri Dao 等社区信任。
  • 官方结果仅存于本 repo,其他 fork 均为非官方,且非官方必须显式标注,否则可能因机器/云质量差异导致基准结果偏低。

二、方法/架构拆解

  • 工程定位:自动化基准平台,设计目标是跟上软件生态的迭代速度,提供公开免费 live dashboard。
  • 覆盖软件栈:SGLang、vLLM、TensorRT-LLM、CUDA、ROCm。
  • 模型覆盖策略:通过同架构模型复用(如 Kimi K2.5 与 Kimi 2.7-Code 同架构、GLM5 与 GLM5.1 同架构、MiniMax M2.5 与 M2.7 同架构)扩展测试面。
  • 硬件来源:AMD 提供 MI355X 与 CDNA3 GPU;NVIDIA 通过 OCI 提供 GB200 NVL72 机架与 B200 GPU;算力支持方包括 Crusoe、CoreWeave、Nebius、TensorWave、Oracle、TogetherAI。
  • 版本演进:v1 对比 NVIDIA Blackwell、AMD、Hopper;v2 延续该对比并加入 GB300 NVL72 持续基准。
  • 文档结构:repo 内含 maintainer 与 agent 文档地图,链接架构、配置、工作流、eval、runner、troubleshooting 参考;有 PR review flow 说明。

三、值得注意的局限/争议

  • 作者自己承认的:
  • 非官方 fork/repo 的机器与云质量可能不同,导致基准结果不达标,必须显式标注为 Unofficial。
  • 官方结果仅以本 repo 为准,暗示结果权威性依赖单一来源。
  • AI 判断的:
  • 正文以营销式标题与 emoji 堆叠为主,缺少具体性能数字(吞吐、延迟、tokens/s、成本),无法据此验证“持续领先”的实际幅度。
  • “Trusted by”与“万亿美元级 token 工厂”属背书性表述,未给出可核验的采用证据。
  • 模型版本命名存在不一致(标题写 Kimi K3 2.8T、DeepSeekv4、GLM5,正文又出现 Kimi K2.7-Code、DeepSeek V4 Pro 1.6T、GLM5.3),可能造成版本对应关系混淆。
  • “Day 0 起持续基准”依赖厂商及时提供权重与算力,存在选择性与可持续性风险。
  • 硬件对比涉及多家厂商赞助算力,需警惕利益相关对基准设计中立性的潜在影响。

四、与 RRLab 研究的关联

  • Harness 工程:其“持续基准 + 自动化 runner + PR review flow + 文档地图”的结构,可作为 RRLab 构建评测 harness 的参考模板,尤其是把架构、配置、工作流、eval、runner、troubleshooting 分层文档化。
  • 多模型协同:同架构模型复用策略(K2.5/K2.7-Code、GLM5/5.1、M2.5/M2.7)为多模型协同与路由评测提供了低成本扩展思路。
  • 模型评测:AgentX 的“100 万+长上下文、多轮”基准直接对应 Agent 场景评测需求,可借鉴其长上下文与多轮交互的评测维度设计。
  • Agent 落地:GLM5.3 的 continuous agentic benchmarks 表明评测正从单轮推理转向 agentic 连续任务,RRLab 可据此设计面向真实 agent 工作流的持续评测。
  • AI 原生产品:live dashboard + 免费公开 + 持续更新的模式,是 AI 原生评测产品的形态参考;同时其“官方 vs 非官方”标注机制可作为结果可信度分级的产品设计借鉴。

本笔记由 DeepSeek V4 Flash 自动生成,未经人工审校。原文链接:https://github.com/SemiAnalysisAI/InferenceX