英国 Graphcore 的智能处理单元,采用大规模并行架构与片上分布式内存,面向图计算与 AI 训练推理负载。
Graphcore 是一家总部位于英国布里斯托尔的半导体公司,其核心产品 IPU(Intelligent Processing Unit,智能处理单元)并非传统意义上的 GPU 替代品,而是专为机器智能负载设计的全新处理器架构。官网 graphcore.ai 是了解其技术路线、产品矩阵与软件生态的官方入口。
核心定位:为图计算与 AI 负载重构硬件
IPU 的设计出发点与 GPU 有本质差异:
- 大规模并行架构:单个 IPU 包含 1,472 个独立处理器核心,可同时运行 14,784 个线程,强调“多核并行”而非 GPU 的“单指令多数据”模式。
- 片上分布式内存:每个核心拥有独立且与处理器紧耦合的本地 SRAM(总计约 900MB),无需依赖外部显存带宽。这一设计直接针对图神经网络(GNN)、推荐系统等内存密集型负载——这类任务中,数据访问模式高度稀疏且不规则,传统 GPU 的显存层级会成为瓶颈。
- BSP 执行模型:采用 Bulk Synchronous Parallel(批量同步并行)计算模式,所有核心按“计算-同步-通信”的节奏协同,避免 GPU 中常见的线程发散与缓存未命中问题。
产品与软件栈
| 层级 | 具体内容 |
|------|----------|
| 硬件 | Colossus MK2 GC200 IPU(单卡 8 颗,整机 64 颗) |
| 系统 | M2000 IPU-Machine(1U 机箱,含 4 颗 IPU)、Bow IPU(液冷版本) |
| 软件 | Poplar SDK(底层编译器与运行时)、PopART(推理引擎)、Graphcore TensorFlow / PyTorch 插件 |
| 云服务 | 通过 AWS、Azure、Paperspace 等提供云端 IPU 实例 |
软件栈是实际落地的关键。Poplar 编译器将 TensorFlow/PyTorch 计算图映射为 IPU 的静态执行图,开发者无需重写模型,但需注意:
- 支持主流框架,但部分算子(如动态 shape、稀疏注意力)需适配或使用自定义算子。
- 官方提供约 30 个预训练模型示例(ResNet、BERT、ViT、GNN 等),可作为迁移起点。
适用场景与边界
优势场景:
- 图神经网络(GNN)训练与推理(如社交网络、分子结构、推荐系统)
- 需要高吞吐、低延迟推理的 NLP 模型(BERT 类)
- 嵌入表极大、显存放不下的推荐模型
不适用场景:
- 传统 CNN 图像分类(与 GPU 相比无明显优势,性价比偏低)
- 需要动态控制流或稀疏不规则计算的模型(IPU 静态图模型限制较多)
- 已有 CUDA 深度优化代码的迁移成本高
可执行结论
- 若你的负载涉及 GNN、大规模稀疏嵌入或高并发推理,IPU 值得在云上小额试测,对比延迟与吞吐。
- 若以标准 CNN 或通用 HPC 为主,IPU 不是当前最优选择。
- 关注
graphcore.ai的开发者文档与Paperspace的按小时计费 IPU 实例,这是最低成本的评估路径。
简言之,Graphcore IPU 是一套为特定 AI 负载定制的、架构激进的硬件方案,其价值取决于你是否有匹配的数据访问模式,而非通用计算能力。
常见问题
Graphcore IPU 是什么?
英国 Graphcore 的智能处理单元,采用大规模并行架构与片上分布式内存,面向图计算与 AI 训练推理负载。
Graphcore IPU 的官方网站是什么?
Graphcore IPU 的官方网站是 https://www.graphcore.ai/,可直接在浏览器中打开使用。
