InferenceX硬件支持全景图:H100到GB300 NVL72、MI355X全平台AI推理性能大比拼

📅 发布时间:2026/10/11 10:50:51
InferenceX硬件支持全景图:H100到GB300 NVL72、MI355X全平台AI推理性能大比拼
人工智能大模型模型评测Agent 评测【免费下载链接】InferenceXOpen Source AI Accelerator Research Platform Standard / 开源推理研究平台项目地址https://gitcode.com/gh_mirrors/in/InferenceX点击查看免费下载InferenceX原名 InferenceMAX是一个开源的 AI 推理性能研究平台持续对主流推理框架SGLang、vLLM、TensorRT-LLM 等在真实集群上进行基准测试。它的核心看点之一就是覆盖了从 H100、H200 到 GB300 NVL72以及 AMD MI355X 在内的全平台 AI 推理硬件让不同加速器的性能对比有了统一、可复现的参照系。本文带你快速看懂 InferenceX 支持哪些硬件、分别怎么测、结果去哪儿看。 为什么需要跨平台的 AI 推理基准大模型推理性能由硬件 软件两根支柱共同决定硬件每代带来阶跃式提升新 GPU/XPU、新机架系统软件SGLang、vLLM、ROCm、CUDA 等每天都在迭代持续抬高性能前沿。固定时间点的基准很快会过时。InferenceX 的思路是自动化 持续运行把软件生态的进步近实时地记录成一条可查询的性能曲线相当于给 AI 推理性能装了一块实时仪表盘。项目的官方结果仅由主仓库产出所有 fork 都属于非官方结果机器质量与测试环境可能有差异。这一声明在 README.md 中有明确标注。 官方支持的硬件一览12 款已支持7 款在路上这是 InferenceX 在 README.md 中公布的官方支持硬件清单是目前最权威的硬件支持全景图硬件 SKU支持状态Vera Rubin NVL72✅ 已支持GB300 NVL72✅ 已支持GB200 NVL72✅ 已支持MI355X✅ 已支持B300 / B200✅ 已支持MI325X / MI300X✅ 已支持H200 / H100✅ 已支持TPUv7x Ironwood Ghostfish✅ 已支持RTX PRO 6000 Server✅ 已支持MI455 UALoE72、Rubin NVL8 及数款新芯片 即将支持可以看到平台同时覆盖了 NVIDIAHopper / Blackwell / Rubin 三代机架 数据中心卡、AMD InstinctCDNA3 到 CDNA4、Google TPU 等多条技术路线这在开源推理基准中相当少见。 NVIDIA 阵营从 H100 到 GB300 NVL72各 NVIDIA 平台的架构、互联与组网差异可以直接在 collectivex/configs/platform_config.json 中查到下面是最关键的差异对比平台架构每节点 GPU节点内互联Scale-up节点间网络Scale-outH100DGXC 8 卡sm908NVLinkConnectX-7 2×200GbETomahawk4 交换H200DGXC 8 卡sm908NVLinkConnectX-7 400GQuantum-2 InfiniBandB200sm1008NVLink8×400G InfiniBand railsB300sm1038NVLinkAWS EFA每节点 16×400GGB200 NVL72sm1004MNNVL72 GPU 域NVLink NVL72不走 scale-outGB300 NVL72sm1034MNNVL72 GPU 域NVLink NVL72不走 scale-outH100 / H200跨代对比的基准锚点Hopper 平台是存量最大的数据中心卡InferenceX 在其上跑了完整的 EP8/EP16 专家并行通信测试覆盖 DeepEP V2、UCCL-EP、NCCL-EP 三类后端。由于软件迭代快H100 上的数据也常被用作新硬件的对照基线。B200 / B300Blackwell 两代节点机B200 与 B300 都是 8 卡节点但网络环境不同——B300 跑在 AWS EFA 网络上。值得注意的是B300 上部分后端如 DeepEP 的 IBGDA 路径已知存在兼容性问题operatorx/CLUSTERS.md 中专门记录了在 B300 上排除 DeepEP的原因这种如实记录坑点的态度正是该平台可信度的一部分。GB200 / GB300 NVL7272 张 GPU 一个互联域GB200/GB300 NVL72 最大的不同在于MNNVL整个机架内 72 张 GPU 通过 NVLink 构成一个 scale-up 域测试时甚至不需要走 scale-out 网络。这也是 GB300 NVL72 自 2026 年 2 月加入 InferenceX 后被持续跟踪的重点对象SGLang 维护者的官方博客曾专门撰文介绍。 AMD Instinct 阵营MI300X、MI325X、MI355XAMD 侧的三张主力卡都已支持硬件细节同样来自 collectivex/configs/platform_config.json平台架构每节点 GPU节点内互联节点间网络MI300Xgfx9428XGMI单节点无 scale-outMI325Xgfx9428XGMI单节点无 scale-outMI355Xgfx9508XGMIPollara 400GbETomahawk551.2TAMD 平台的通信测试使用MoRI与 UCCL-EP 后端MoRI 在 MI355X 上支持 EP8/EP16 及低时延 decode 路径。README 中特别鸣谢了 AMD 团队对 MI355X/CDNA3 GPU 的提供与联调支持——开源基准能持续跑在 AMD 硬件上离不开厂商的资源投入。 其他加速器TPU 与 Trainium除了 GPUoperatorx/ 目录还覆盖了两条加速器路线Google TPUv6e1×1 / 2×2 / pod 切片以及清单中的 TPUv7x Ironwood GhostfishAWS Trainiumtrn3 整机16 个 Neuron 设备每设备 144 GiB HBM。这些平台的算子级基准GEMM、Attention、MoE、集合通信由 OperatorX 直接产出 JSON 结果帮助读者在GPU 之外看到 AI 推理性能的完整图景。微基准内存带宽、GPC 查询、SM/L2 距离则沉淀在 ubenchX/ 目录ubenchX/README.md 说明其已积累 H100/H200/B200/B300/GB200/MI300X/MI325X/MI355X 的实测数据。️ 三层基准体系端到端、通信、算子InferenceX 不是一个跑个脚本的工具而是一套分层体系不同层回答不同的问题子项目回答的问题入口InferenceX-e2e真实模型服务下整机吞吐/延迟是多少inferencex-e2e/CollectiveX多卡/多机通信MoE 专家并行 dispatch/combine有多快collectivex/OperatorX单个算子GEMM/Attention/MoE在各后端下的性能operatorx/power_model系统/机架级功耗是多少power_model/experimentalKV Cache 传输、单节点纯 decode、逐 token SLO 等实验experimental/端到端层以 DeepSeek V4-Pro 1.6T、Qwen3.5-397B、Kimi K3、MiniMax M3、GLM 系列等旗舰模型为测试负载从新模型发布第 0 天就开始持续跟踪见 inferencex-e2e/docs/MODELS.md并在 inferencex-e2e/configs/runners.yaml 中管理 H100/H200/B200/B300/GB200/GB300/MI300X/MI325X/MI355X 各集群上百台 runner 的调度配置通信层CollectiveX 固定一套真实 MoE 负载DeepSeek-V4-Pro 结构384 个路由专家、top-k 6对每个后端/拓扑跑固定剖面输出中位数与 p90/p95/p99并内置独立 oracle 做正确性校验。完整测量方法论见 collectivex/docs/methodology.md算子层OperatorX 按一次只测一个算子的方式计时NVIDIA/AMD/TPU/Trainium 四大平台统一接口operatorx/testlists/ 下是各算子的测试用例清单。 如何开始三步跑通你的第一组测试如果你想在本地复现或扩展测试只需三步以端到端工具链为例来自 inferencex-e2e/README.md克隆仓库git clone https://gitcode.com/gh_mirrors/in/InferenceX安装依赖进入inferencex-e2e目录后执行uv sync --locked生成测试配置uv run --locked python -m infx.matrix.generate test-config --config-files configs/nvidia-master.yaml --config-keys key集群接入与调度细节可参考 operatorx/CLUSTERS.md 和 collectivex/docs/methodology.md两者分别说明了算子基准的集群路由规则与通信基准的测量合同。 结论一张图看懂硬件 × 软件的性能演进InferenceX 的价值可以用一句话概括让 H100 到 GB300 NVL72、MI355X 全平台的 AI 推理性能处在同一个坐标系下被持续度量。它的亮点在于✅ 覆盖面广NVIDIA 三代机架 AMD CDNA3/CDNA4 TPU Trainium12 款硬件已支持✅ 方法透明测量方法论、后端成熟度production/candidate、已知坑点全部写进文档✅ 持续更新新模型发布Day 0即开测结果在官方公开仪表盘上可查询✅ 分层可下钻从整机吞吐一路下钻到单算子、单条网络传输定位性能差距不靠猜。对于选型工程师、基础设施负责人或是单纯想搞清楚现在哪款卡跑大模型推理最快的读者InferenceX 目前可能是开源世界里硬件支持最全、更新最勤的 AI 推理性能参照系。赞分享人工智能大模型模型评测Agent 评测【免费下载链接】InferenceXOpen Source AI Accelerator Research Platform Standard / 开源推理研究平台项目地址https://gitcode.com/gh_mirrors/in/InferenceX点击查看免费下载相关推荐Paddle Lite 硬件支持全景指南从 ARM CPU 到 15 大 AI 加速平台的选型与部署Paddle Lite 硬件支持全景指南从 ARM CPU 到 15 大 AI 加速平台的选型与部署 本篇技术指南以 Paddle Lite飞桨高性能深度学人工智能推理引擎深度学习边缘计算嵌入式模型优化超强PaddlePaddle性能实测五大硬件平台全面对比超强PaddlePaddle性能实测五大硬件平台全面对比 你还在为选择深度学习硬件平台而烦恼吗不知道CPU、GPU还是ARM架构更适合PaddlePaddl人工智能深度学习机器学习大模型分布式训练预训练Manim渲染性能大比拼6款硬件平台实测从入门到精通的配置指南Manim渲染性能大比拼6款硬件平台实测从入门到精通的配置指南 你还在为Manim动画渲染速度慢而烦恼吗同样的代码在不同电脑上运行为何有的秒出结果有的图形学教育创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考