9月1日,MLCommons 正式发布 MLPerf? Storage Benchmark 3.0(简称 MLPerf Storage)基准测试结果。XSKY 星辰天合旗下 MeshFS 首次参赛,即在并行文件存储赛道一举拿下九项第一,全面领跑 AI 存储性能榜单。
九项第一
性能效率、硬件成本全面领跑
MeshFS 这次取得的九项第一,分布在小文件训练吞吐,Unet3D、RetinaNet 与 405B Checkpoint 测试项,围绕每客户端读带宽,训练场景的单位性能成本,以及容量效率等指标。体现了 MeshFS 能够支撑更多训练客户端并发访问,在更少节点、更低硬件投入下提供更高训练带宽,并通过更快的 Checkpoint 读写缩短模型保存与故障恢复时间。
XSKY MeshFS 九项第一总览
三节点 EC 配置
一套硬件覆盖全场景测试
从 Training 到 Checkpoint,存储端始终是同一套符合实际生产会使用的硬件配置,整体成本可控。
MLPerf Storage 3.0 所用测试环境
测试场景逐项拆解
无短板的硬核表现
Unet3D · 大文件训练读取 双项第一
RetinaNet · 海量小文件训练 三项第一
海量小文件是最能拉开存储厂商差距的场景。RetinaNet 包含 7540 万个、平均约 315 KiB 的小文件,高并发下会同时对元数据处理与小 I/O 通路造成巨大压力。 测试通过模拟 675 个 B200 训练 I/O 负载,MeshFS 训练吞吐达 96.13 GiB/s,每客户端带宽 10.68 GiB/s,每 GiB/s 硬件成本 4,163 美元,三项指标全部位列第一,充分验证了 MeshFS 分布式元数据引擎在元数据密集与海量小文件高并发场景下的架构优势。
RetinaNet 训练吞吐与效率
Llama3 405B · Checkpoint 读写 双项第一
大模型训练中,Checkpoint 直接影响训练连续性与容错能力,既要定期写入保存状态,也要在故障恢复时快速读回。Llama3 405B 单次检查点文件大小达 5292 GB,对存储读写双向能力要求极高。 测试结果显示,MeshFS 读取每客户端带宽为 47.49 GiB/s,位列第一;每 GiB/s 硬件成本为 1,053 美元,同样位列第一; Checkpoint 写入时每客户端带宽达 13.34 GiB/s,可充分保障大模型检查点的快速保存与恢复。
不同参测方案的硬件成本评估
参测方案的硬件投入构成
此次测试表现背后的技术积淀与展望
MeshFS 在这次 MLPerf Storage 基准测试结果获得优异成绩的背后,是 XSKY 在架构创新与上游硬件深度协同的共同支撑,核心体现在三点:
硬件级算力卸载:依托英特尔? 至强? 6 处理器内置 QAT/DSA 硬件加速引擎,结合 ISA-L 纠删码加速,将数据搬运、EC 编解码等密集型任务卸载至硬件完成,释放 CPU 核心专注业务处理,同时缩短数据重构、磁盘重建耗时。
全栈带宽释放:凭借 PCIe 5.0 原生通道实现 NVMe SSD 直连,无转接损耗;搭配 FlexPath 智能网络引擎与一跳 IO 直读优化,配合高速 RDMA 网络,端到端消除带宽瓶颈与中转延迟。
架构原生优势:Shared-Everything 全共享架构搭配 MDShard 分布式元数据引擎,面向 AI 训练中的海量小文件场景,提供高性能元数据访问能力,解决元数据瓶颈拖慢业务的行业痛点,保障海量小文件高并发访问;同时具备故障秒级切换能力,容量与性能可随节点线性扩展,适配不同业务阶段需求。
此次参与 MLPerf Storage 3.0 验证了 MeshFS 面向真实 AI 训练负载的架构方向。未来,XSKY 将继续围绕更高吞吐、更优成本效率和更稳定的训练连续性打磨产品,让 XSKY 不断成为 AI 基础设施中可靠、可扩展的存储底座。
引用说明:MLPerf Storage Benchmark Suite Results
(https://mlcommons.org/2026/09/mlperf-storage-v3-0-results/)
