- 人工智能
- 大模型
- 模型评测
- Agent 评测
【免费下载链接】InferenceX
Open Source AI Accelerator Research Platform Standard / 开源推理研究平台
InferenceX 是一个开源推理研究平台,专注于 AI 推理基准测试:它持续对 vLLM、SGLang、TensorRT-LLM 等主流开源推理框架进行端到端性能测试,并覆盖算子、通信、功耗等更细粒度的维度,让从业者能够实时追踪大模型推理性能的真实变化。如果你想知道 AI 推理基准测试的行业标杆长什么样,这篇文章可以一次讲清楚。
为什么 AI 推理基准测试需要"持续进行"?
大模型推理性能由两大支柱驱动:硬件和软件。
- 🖥️硬件:每年通过新 GPU/XPU 的发布带来阶跃式提升(如 Hopper → Blackwell → Rubin 的演进);
- 🚀软件:SGLang、vLLM、TensorRT-LLM 等框架每天都在优化——内核级优化、分布式推理策略、调度创新,可能相隔仅数天就发布一次性能改进。
问题在于:固定时间点测得的基准测试数据很快就会过时,无法代表最新软件包的真实表现。这正是 InferenceX 想要解决的核心挑战——用自动化、可重复的基准测试流水线,让性能数据"永远保鲜"。
InferenceX 平台架构:五大子项目一览
InferenceX 采用模块化设计,每个子目录对应一个独立的基准测试项目:
| 子项目 | 定位 | 状态 |
|---|---|---|
inferencex-e2e/ | 🚀 端到端推理服务基准测试(核心项目) | 稳定 |
collectivex/ | 🌐 网络与集合通信基准测试 | 实验性 Beta |
operatorx/ | ⚙️ 算子与内核级基准测试 | 实验性 Beta |
power_model/ | ⚡ 开源系统级功耗建模 | Beta |
experimental/ | 🧪 其余实验性探索 | 实验性 |
这种"分层测量"的思路很清晰:从整条推理服务链路,到单个算子、单次通信,再到整机功耗,逐层拆解性能瓶颈。
核心子项目逐个拆解
InferenceX-e2e:端到端推理服务基准测试
这是整个平台的基石,位于inferencex-e2e/,包含完整的模型服务基准测试、配置、启动器、Python 工具链与性能历史。
它的运行逻辑可以简化为一条流水线(详见 inferencex-e2e/docs/architecture.md):
- 声明式配置:用 YAML 主配置描述"测什么"——模型、镜像、框架、场景、拓扑与搜索空间,例如 inferencex-e2e/configs/nvidia-master.yaml;
- 矩阵生成与校验:通过严格的 Pydantic 校验把配置展开成可执行的测试矩阵;
- 自动分发执行:workflow 把矩阵扇出到真实 GPU 集群(支持 Slurm 调度),在容器内拉起推理服务并压测;
- 结果收集与入库:每个任务产出标准 JSON 制品,最终汇入 InferenceX-app 的开源实时仪表盘。
配套的 perf-changelog.yaml 是一份"追加式"变更日志——任何可能影响性能改动都要登记,保证每次结果都可追溯。
CollectiveX:MoE 专家并行的通信基准
位于collectivex/,专门测量 MoE 模型专家并行(EP)场景下的 dispatch、combine 及往返延迟,横向对比 DeepEP、MoRI、UCCL-EP、NCCL EP、FlashInfer EP 等通信库在 NVIDIA 与 AMD 平台上的表现。其完整测量方法论写在 collectivex/docs/methodology.md。
OperatorX:算子与内核级基准测试
位于operatorx/,"一次测一个算子"——gemm、attention、moe、collectives 等,覆盖 NVIDIA / AMD / TPU / Trainium 四大平台,每次运行输出一个标准 JSON 结果文件。它帮你回答:"到底是哪个算子拖慢了我的推理?"
power_model:系统级功耗建模
位于power_model/。现实是多数集群只能拿到 GPU 级功耗遥测,这个模型结合实测 GPU 功耗,估算风扇、CPU/内存、网络、电源与机房开销等其余组件的耗电,最终给出完整的机架/集群功耗账本,支持按机箱输出功耗分解。
官方支持的硬件阵容
InferenceX 覆盖了当前主流与最新的 AI 加速硬件,这也是其"行业标杆"地位的重要来源:
| 硬件 | 状态 | 硬件 | 状态 |
|---|---|---|---|
| Vera Rubin NVL72 | ✅ | MI300X | ✅ |
| GB300 NVL72 | ✅ | H200 | ✅ |
| GB200 NVL72 | ✅ | H100 | ✅ |
| MI355X / MI325X | ✅ | TPUv7x Ironwood | ✅ |
| B300 / B200 | ✅ | RTX PRO 6000 Server | ✅ |
MI455、Rubin NVL8 等更新平台也已在支持计划中。跨 NVIDIA Blackwell、AMD 与 Hopper 的多平台横评能力,是 InferenceX v2 的重要卖点之一。
谁在信任这套基准?
根据 README.md 的介绍,InferenceX 受到 OpenAI、Meta、Microsoft、Oracle 等"万亿美元级 Token 工厂"运营商的信赖,同时得到 PyTorch 基金会、vLLM、SGLang 社区及 Tri Dao 等核心开发者的认可。AMD 与 NVIDIA 均提供了 GPU 资源支持这一免费开源项目。
如何快速上手 InferenceX?
整个仓库采用 Apache 2.0 许可,clone 后即可运行本地工具链:
git clone https://gitcode.com/gh_mirrors/in/InferenceX cd InferenceX/inferencex-e2e uv sync --locked之后即可在inferencex-e2e/目录下用uv run --locked python -m infx...调用矩阵生成、结果收集等模块。完整的文档导航从 inferencex-e2e/docs/index.md 开始,它集中链接了架构、配置、评测、Runner 与故障排查等参考文档;如果想为已有服务单独跑 AgentX 压测(无需 CI 或 Slurm),可参考 inferencex-e2e/docs/agentx-standalone.md。
总结:InferenceX 凭什么成为行业标杆?
- 🔄持续而非快照:自动化流水线让基准结果随软件生态同步演进,实时反映最新框架的真实性能;
- 📊多层级覆盖:从端到端服务、通信、算子到功耗,逐层定位性能瓶颈;
- 🌍多平台横评:NVIDIA / AMD / TPU / Trainium 统一方法论,结果中立可对比;
- 🔍全程可追溯:追加式性能变更日志 + 严格校验 + 标准 JSON 制品,每个数据点都能溯源;
- 🎁完全开源:Apache 2.0 许可,配套开源实时仪表盘免费向公众开放。
无论你是选型推理框架、评估新硬件,还是追踪社区优化进展,InferenceX 都是一份值得收藏的 AI 推理基准测试参考。参与贡献的规范见 CONTRIBUTING.md,欢迎提交 PR。
- 人工智能
- 大模型
- 模型评测
- Agent 评测
【免费下载链接】InferenceX
Open Source AI Accelerator Research Platform Standard / 开源推理研究平台
相关推荐
为什么AlpaSim是自动驾驶研究的理想测试平台?
为什么AlpaSim是自动驾驶研究的理想测试平台? 自动驾驶技术正在快速发展,但如何安全有效地测试和验证这些系统一直是行业面临的重大挑战。AlpaSim作为一款
自动驾驶科研5步拿到无水印视频:res-downloader 资源嗅探下载器与视频号解密教程
5步拿到无水印视频:res downloader 资源嗅探下载器与视频号解密教程 想把视频号、抖音的无水印视频存进电脑,传统做法是开 Fiddler、Charl
桌面应用网络音视频为什么InferenceX的测试哲学值得所有AI基准项目借鉴:AGENTS.md行为测试清单完整解读
为什么InferenceX的测试哲学值得所有AI基准项目借鉴:AGENTS.md行为测试清单完整解读 InferenceX 是一个持续在 GPU 集群上基准测试
人工智能大模型模型评测Agent 评测
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考