国产高性能分布式文件存储,针对 AI 训练场景优化小文件与高并发读写性能,广泛用于自动驾驶和大模型训练平台。
焱融科技(YRCloudFile)是一家聚焦于高性能分布式存储的国产厂商,其核心产品面向 AI 训练、自动驾驶、HPC 等重 I/O 场景。与通用分布式存储不同,YRCloudFile 的定位非常明确:解决传统存储在大规模并发读写、小文件密集访问时的性能瓶颈,尤其针对 GPU 集群训练时的数据吞吐需求做了深度优化。
核心能力拆解
YRCloudFile 的价值主张可以归纳为三个关键维度:
- AI 训练场景的针对性优化:针对模型训练中常见的 checkpoint 写入、海量小样本读取、日志写入等混合负载,通过元数据管理架构和缓存策略,减少训练过程中的 I/O 等待时间,提升 GPU 利用率。
- 高并发与带宽扩展:支持横向扩展,通过多节点并行读写聚合带宽,满足千卡级 GPU 集群对数据加载速度的要求。在自动驾驶场景中,其处理海量传感器数据(图像、点云)的吞吐能力较为突出。
- 国产化与生态兼容:作为国产存储方案,其兼容性覆盖主流信创硬件平台(如鲲鹏、海光)及操作系统,同时在软件层面支持 POSIX、S3 等标准接口,便于对接 Kubeflow、PaddlePaddle 等主流训练框架。
典型适用场景
根据其技术特征,YRCloudFile 在以下两类场景中应用价值较高:
| 场景类型 | 具体痛点 | YRCloudFile 的应对 |
| :--- | :--- | :--- |
| 大模型训练平台 | 模型参数频繁保存、数据集版本迭代快、多节点共享同一份数据 | 通过高并发元数据操作和智能缓存加速 checkpoint 读写,减少训练中断时间 |
| 自动驾驶数据闭环 | 原始数据量大(PB 级)、小文件数量多(千万级)、需要高吞吐回放 | 优化小文件聚合读写策略,支持数据冷热分层,降低海量小文件检索延迟 |
部署与运维要点
从实际落地角度看,使用 YRCloudFile 时需关注以下实施细节:
- 网络规划:高性能依赖 RDMA(RoCE/InfiniBand)网络,需提前确认交换机与网卡支持情况。
- 容量规划:建议根据训练任务峰值并发数(而非平均负载)设计节点规模,避免热点瓶颈。
- 监控集成:存储集群的延迟和带宽指标需接入现有监控体系(如 Prometheus),便于快速定位训练慢节点是否由存储引起。
结论与选型建议
若你的业务属于以下情况,YRCloudFile 值得纳入评估范围:
- 已有或规划建设 GPU 集群,且训练任务对数据加载时间敏感
- 现有存储方案在并发读写时出现明显性能下降,且无法通过简单扩容解决
- 有国产化替代要求,需满足信创合规性
建议先进行 POC 测试,重点验证:单目录下百万级小文件的并发创建速度、多节点同时读取同一大文件时的带宽稳定性,以及与现有训练框架(如 PyTorch DDP)的兼容性。相比通用存储方案,其性能优势通常需要结合具体业务负载才能获得量化结论。
常见问题
焱融科技 YRCloudFile 是什么?
国产高性能分布式文件存储,针对 AI 训练场景优化小文件与高并发读写性能,广泛用于自动驾驶和大模型训练平台。
焱融科技 YRCloudFile 的官方网站是什么?
焱融科技 YRCloudFile 的官方网站是 https://www.yanrongyun.com/,可直接在浏览器中打开使用。
