基于 RISC-V 与 Tensix 核心的 AI 加速卡厂商,提供开源软件栈与可扩展架构,面向训练推理一体化场景。
Tenstorrent 是一家面向 AI 计算场景的硬件与软件栈供应商,其核心产品 Tensix 加速卡采用自研 Tensix 核心架构,并基于 RISC-V 指令集构建控制与数据处理通路。该产品定位并非单纯替代 GPU 的通用加速器,而是面向训练与推理一体化场景,提供可扩展、可编程且软件栈开放的算力方案。
核心架构:Tensix 与 RISC-V 的组合逻辑
Tensix 加速卡的关键设计在于其计算单元——Tensix Core。每个 Core 内部集成了:
- RISC-V 控制处理器:负责指令调度、内存管理与同步,避免依赖外部主机 CPU 进行细粒度控制
- 矩阵计算引擎:面向密集矩阵乘加运算(GEMM),支持 FP32 / BF16 / FP16 / INT8 等多精度
- 向量处理单元:处理非矩阵类算子(如激活、归一化、注意力机制中的逐元素运算)
- 片上 SRAM 与 NoC 互联:每个 Core 拥有本地内存,通过片上网络(Network-on-Chip)实现低延迟数据交换
这一架构的直观结果是:计算、控制、通信在同一芯片内闭环,减少了对 PCIe 带宽和主机内存的频繁依赖,在长序列、大 batch 训练场景中具备延迟优势。
软件栈:开源路径而非专有锁定
相比多数加速卡厂商依赖闭源 CUDA 生态,Tenstorrent 提供了一套开源软件体系,核心组件包括:
| 组件 | 作用 |
|------|------|
| TT-Metal | 底层编程框架,允许直接操作 Tensix Core 资源(内存、计算、通信) |
| TT-NN | 神经网络算子库,提供常用层(Attention、MLP、Conv 等)的优化实现 |
| TT-MLIR | 基于 MLIR 的编译器,支持从 PyTorch / ONNX 模型图到低层指令的自动映射 |
| TT-Buda | 更高层编译器,面向 PyTorch 模型直接部署,自动完成算子拆分与流水线编排 |
对于开发者而言,这意味着:
- 可以使用 PyTorch 原生接口进行模型移植,无需重写算子
- 需要深度优化时,可下探到 TT-Metal 层手动控制数据布局与同步
- 不存在“黑盒算子”,性能瓶颈可定位到指令级
可扩展性:从单卡到多卡集群
Tensix 加速卡支持通过以太网(Ethernet)或专用高速互联(Tensix 内部 NoC 对外扩展)构建多卡集群。其扩展逻辑并非简单通过 PCIe Switch 堆叠,而是将多张卡视为一个统一的分布式内存计算系统:
- 每张卡上的 Tensix Core 可被远程访问,实现跨卡算子切分
- 支持数据并行、张量并行、流水线并行三种常见分布式训练模式
- 开源软件栈(TT-Metal 的通信原语)允许自定义集合通信逻辑,而非依赖厂商闭源 NCCL 替代品
这种设计使得用户从 1 卡扩展到 8 卡或更大规模时,不需要更换软件接口,仅调整拓扑配置即可。
适用场景与选型建议
Tensix 加速卡并非面向所有 AI 负载的“万能卡”,其优势集中在以下场景:
- 大模型微调与推理一体化部署:无需在训练卡和推理卡之间迁移模型,单卡即可承载 LoRA 微调 + 低延迟推理
- 多租户推理服务:RISC-V 控制核心可独立分配资源,支持细粒度 QoS 隔离
- 对数据主权敏感的私有化部署:开源软件栈便于审计与二次开发,不依赖云端闭源服务
若你的业务主要依赖 PyTorch 生态且需要长期控制硬件成本,建议先通过其官方 GitHub 仓库(tenstorrent/tt-metal)评估算子覆盖度,再决定是否采购硬件。对于仅使用标准 CNN 或小型 Transformer 的场景,现有 GPU 生态可能仍是更稳妥的选择。
常见问题
Tenstorrent Tensix 加速卡 是什么?
基于 RISC-V 与 Tensix 核心的 AI 加速卡厂商,提供开源软件栈与可扩展架构,面向训练推理一体化场景。
Tenstorrent Tensix 加速卡 的官方网站是什么?
Tenstorrent Tensix 加速卡 的官方网站是 https://tenstorrent.com/,可直接在浏览器中打开使用。
