来源:GitHub (★635)
URL: https://github.com/ai-dynamo/aiperf
精读日期:2026-09-05
模型:DeepSeek V4 Flash(AI 生成,人工未审校)
正文获取:全文

一、核心论点/事实

  • AIPerf 是一个面向生成式 AI 模型的综合基准测试工具,用于衡量用户所选推理服务的性能表现,支持命令行展示详细指标及导出基准报告。
  • 项目在 GitHub 上获得 635 颗星,支持 Linux x86_64、macOS 和 Windows 平台,可从预构建包安装;sdist 安装需 C 编译器。
  • 支持多种推理服务端点,包括 OpenAI chat completions、completions、embeddings、audio、images 等协议。
  • 提供可扩展的多进程架构,由 10 个服务通过 ZMQ 通信,支持并发、请求速率等多种压测模式。
  • 支持多种基准数据集与场景:AIMO 数学推理、MMStar 视觉问答、MMVU 视频理解、Chatbot Arena 视觉对话、SPEED-Bench 投机解码、InstructCoder 代码生成、LibriSpeech 等 ASR 数据集。
  • 示例基准输出显示:在 CPU-only 环境下,Time to First Token 平均 7,463.28 ms,Request Latency 平均 13,829.40 ms,Output Token Throughput 为 6.85 tokens/sec,请求吞吐 0.07 requests/sec(10 个请求)。
  • 支持配置驱动、SLA 边界发现、KV-cache 重置、服务器性能剖析、生产流量回放(Baseten Parquet、BurstGPT、SageMaker)等高级功能。

二、方法/架构拆解

架构与实现要点:

  • 可扩展多进程架构:10 个服务通过 ZMQ 通信,实现高并发压测与数据采集解耦。
  • 插件系统:支持端点(endpoints)、数据集(datasets)、传输层(transports)和指标(metrics)的扩展。
  • 配置驱动:支持从 YAML 配置文件驱动基准测试,而非仅依赖 CLI 参数。
  • 流量模型:支持 Fixed、Normal、Log-normal、Multimodal、Empirical 五种分布形状,用于模拟 ISL(输入序列长度)/OSL(输出序列长度)/轮次等。
  • 压测模式:并发模式、请求速率模式、平滑并发/速率爬坡(ramp-up)、单次运行的 SLA 边界发现与持续压测。
  • 剖析能力:支持 KV-cache 重置、服务器 profiler 集成(vLLM、SGLang、TensorRT-LLM 路径映射)、每用户速率限制(用于 KV cache 基准)。
  • 数据嵌入:支持在 YAML 配置中直接嵌入记录(单轮、多轮、多池随机池、trace 回放)。

数据集与基准覆盖:

  • 文本/代码:AIMO(NuminaMath-TIR/CoT/1.5、AIME)、InstructCoder、SpecBench、Blazedit。
  • 多模态:MMStar(视觉 QA)、MMVU(视频理解)、Chatbot Arena 视觉对话、多模态指令跟随数据。
  • 语音:LibriSpeech、VoxPopuli、GigaSpeech、AMI、SPGISpeech。
  • 生产 trace:Baseten Parquet、BurstGPT、SageMaker 端点回放。

输出指标(示例,CPU-only):

  • 延迟类:TTFT(avg 7,463.28 ms)、Time to Second Token(avg 68.73 ms)、Request Latency(avg 13,829.40 ms)、Inter Token Latency(avg 65.31 ms)。
  • 吞吐类:Output Token Throughput Per User(avg 15.60 tokens/sec/user)、Output Token Throughput(6.85 tokens/sec)、Request Throughput(0.07 requests/sec)。
  • 长度类:Output Sequence Length(avg 95.20 tokens)、Input Sequence Length(固定 550 tokens)。
  • 统计口径:avg/min/max/p99/p90/p50/std,支持 CSV/JSON/Log 导出。

三、值得注意的局限/争议

作者承认的局限:

  • 示例性能数据来自 CPU-only 运行,不代表官方基准结果(明确标注)。
  • sdist 安装需要 C 编译器,对部分环境(如无开发工具链的 Linux)安装门槛较高。

AI 判断的局限/争议:

  • 示例中请求数仅 10 个,统计显著性存疑,p99/p90 等极端分位数在小样本下波动较大(如 Request Latency max 27,905 ms vs avg 13,829 ms,std 高达 5,614 ms)。
  • 示例输入序列长度固定为 550 tokens,未体现真实生产环境的输入长度多样性,可能低估长上下文场景下的性能退化。
  • 多进程架构(10 个服务)本身会引入资源开销,在低配环境下可能干扰被测推理服务的性能数据。
  • 支持的数据集/端点覆盖面广,但未见对多模型协同(如路由、级联)场景的基准支持,更多聚焦单端点性能。

四、与 RRLab 研究的关联

  • Harness 工程:AIPerf 的插件化架构(端点/数据集/传输/指标四维扩展)和配置驱动模式,可作为 RRLab 测试 Harness 的参考设计,降低新增模型/数据集适配成本。
  • 模型评测:其多分布流量模型(Fixed/Normal/Log-normal/Multimodal/Empirical)和 SLA 边界发现机制,可用于 RRLab 评测体系中的压力测试与性能画像,补充现有评测维度的真实性。
  • Agent 落地:支持多轮 coding-agent trace 生成和 KV-cache 基准,对 RRLab 评估 Agent 长对话场景下的推理性能与缓存效率有直接借鉴价值。
  • AI 原生产品:AIPerf 的实时遥测流(live telemetry streaming)和 MLflow 上传能力,可启发 RRLab 构建面向产品的持续性能监控与回归预警体系。
  • 多模型协同:AIPerf 目前缺乏多端点/多模型协同压测能力,RRLab 可在此方向扩展,评估路由策略、模型级联等场景下的端到端性能。

本笔记由 DeepSeek V4 Flash 自动生成,未经人工审校。原文链接:https://github.com/ai-dynamo/aiperf