MI300X 的升级型号,将 HBM3e 显存提升至 256GB 并提高带宽,进一步强化大模型推理与长上下文处理的性价比。
AMD Instinct MI325X 是 AMD 在 2024 年推出的旗舰级数据中心加速器,定位为 MI300X 的升级型号。其核心改进在于将高带宽内存(HBM3e)容量提升至 256GB,并同步提高内存带宽,旨在直接回应大语言模型(LLM)推理与长上下文窗口场景下对显存容量与吞吐的硬性需求。
核心规格与关键升级
| 参数 | MI300X | MI325X |
| --- | --- | --- |
| 内存类型 | HBM3 | HBM3e |
| 内存容量 | 192 GB | 256 GB |
| 内存带宽 | 5.2 TB/s | 6.0 TB/s |
| 峰值算力 (FP16) | 1.3 PFLOPS | 1.3 PFLOPS (维持) |
- 显存容量提升 33%:256GB 的统一内存池可容纳更大规模的模型权重或 KV Cache,减少多卡张量并行带来的通信开销。
- 带宽提升 15%:6.0 TB/s 的带宽直接加速 Transformer 解码阶段的访存瓶颈,对长序列生成尤为关键。
- 算力保持不变:计算核心(CDNA 3 架构)未做改动,意味着性能提升主要来源于内存子系统优化,而非算力堆叠。
适用场景与优势分析
1. 大模型推理(LLM Serving)
- 长上下文处理:128K 甚至 1M token 的上下文窗口下,KV Cache 占用随序列长度线性增长。256GB 显存允许在单卡内驻留更大的缓存,避免因显存溢出而被迫降低批处理大小(batch size)。
- 成本效率:在相同并发需求下,单卡即可承载更多用户请求,降低单位 Token 的推理成本,尤其在 70B 以上参数模型场景中优势明显。
2. 模型微调与训练(PEFT)
- 对于 LoRA 等参数高效微调方法,更大显存可容纳更大的批处理量,加快收敛速度。全参数微调场景下,256GB 也能支撑中等规模模型(如 13B-34B)的完整权重更新。
3. 混合推理部署
- 在单节点内,MI325X 与 MI300X 可混合使用(需依赖 ROCm 的显存池化能力),但需注意两者算力一致、仅内存规格不同,软件调度层面无需额外适配。
软件生态与兼容性
- ROCm 6.2+:官方支持 PyTorch、TensorFlow、JAX 主流框架,并提供 vLLM、SGLang 等推理引擎的优化后端。
- 关键注意点:当前主流 AI 框架(如 CUDA 生态)迁移至 ROCm 仍需一定工程成本。若现有代码依赖 CUDA 专属库(如 cuDNN、cuBLAS),需评估替换为 MIOpen、rocBLAS 的兼容性。
采购与部署建议
- 适用对象:已有 ROCm 技术栈积累的团队,或正在构建纯 AMD 集群的新项目。
- 不适用场景:若团队深度绑定 CUDA 生态且无迁移计划,MI325X 的硬件优势难以转化为实际效率。
- 性价比考量:相比 MI300X,MI325X 定价增幅低于显存容量增幅,对内存敏感型负载(如 RAG、代码生成)的投资回报率更高。
结论
MI325X 并非算力跃升,而是精准的内存扩容升级。对于以 LLM 推理为绝对主力的业务,256GB HBM3e 能有效缓解显存墙问题,提升吞吐与长文本处理能力。但最终选择仍需结合现有软件生态与迁移成本综合判断,而非单纯看硬件参数。
常见问题
AMD Instinct MI325X 是什么?
MI300X 的升级型号,将 HBM3e 显存提升至 256GB 并提高带宽,进一步强化大模型推理与长上下文处理的性价比。
AMD Instinct MI325X 的官方网站是什么?
AMD Instinct MI325X 的官方网站是 https://www.amd.com/en/products/accelerators/instinct/mi300/mi325x.html,可直接在浏览器中打开使用。