首页 > 最新动态 > 【数字赋能·第816期】XSKY MeshFS 亮相全球 AI 存储基准测试 MLPerf Storage 3.0,斩获九项第一
最新动态
【数字赋能·第816期】XSKY MeshFS 亮相全球 AI 存储基准测试 MLPerf Storage 3.0,斩获九项第一
2026-09-034
图片

9月1日,MLCommons 正式发布 MLPerf? Storage Benchmark 3.0(简称 MLPerf Storage)基准测试结果。XSKY 星辰天合旗下 MeshFS 首次参赛,即在并行文件存储赛道一举拿下九项第一,全面领跑 AI 存储性能榜单。

MLPerf Storage 是全球公认的 AI 存储权威基准,用于验证存储系统对训练数据读取、模型状态读写的支撑能力。作为最新 3.0 版本,此次测试场景更贴合当下大模型训练的真实业务形态:覆盖了 Unet3D 大文件训练、RetinaNet 海量小文件训练和 Llama3 8B 到 405B Checkpoint 读写。三项负载的 I/O 形态各不相同,能够从不同维度去衡量存储性能,使得测试结果更加全面。
本届测试共吸引全球 19 家厂商、23 款产品参评,其中并行文件系统赛道达 14 家,汇聚了 PureStorage、WEKA、浪潮存储、Alluxio 等一众国内外主流存储厂商同场竞技,此次测试结果可以作为当下 AI 存储选型的参考。
MeshFS 是 XSKY 设计的新一代高性能并行文件系统,专为 AI 大模型训练、推理及高性能大规模数据处理设计。它基于自研的 Shared-Everything 全闪存架构,可以充分利用 NVMe 与 RDMA 硬件能力,提供微秒级 I/O 延迟和 TB/s 级聚合带宽。

九项第一

性能效率、硬件成本全面领跑

MeshFS 这次取得的九项第一,分布在小文件训练吞吐,Unet3D、RetinaNet 与 405B Checkpoint 测试项,围绕每客户端读带宽,训练场景的单位性能成本,以及容量效率等指标。体现了 MeshFS 能够支撑更多训练客户端并发访问,在更少节点、更低硬件投入下提供更高训练带宽,并通过更快的 Checkpoint 读写缩短模型保存与故障恢复时间。

图片

XSKY MeshFS 九项第一总览

三节点 EC 配置

一套硬件覆盖全场景测试

从 Training 到 Checkpoint,存储端始终是同一套符合实际生产会使用的硬件配置,整体成本可控。

每个存储节点配置双路英特尔? 至强? 6530P 处理器、512 GB 内存和 4 个 200*2 Gb/s ConnectX-7 网卡。6530P 属于搭载 P-core(性能核)的英特尔? 至强? 6 处理器家族。三节点共使用 48 块 7.68 TB 忆联 UH812a TLC SSD;集群采用 EC 4+2:1 数据保护,可提供 223.5 TiB 受保护可用容量。
客户端共准备 9 台节点,通过 POSIX 客户端 和 RDMA 网络访问存储。
图片

MLPerf Storage 3.0 所用测试环境

测试场景逐项拆解

无短板的硬核表现

此次 MeshFS 参与的三类负载分别对应截然不同的 I/O 压力。Unet3D 侧重大文件连续读取,RetinaNet 考验海量小文件并发和元数据处理能力,Llama3 405B Checkpoint 则要求存储同时承受大模型状态的高强度读写。同一套系统支撑三类负载,既能验证系统的单一负载峰值能力,也能检验不同 I/O 路径之间有没有明显短板。

Unet3D · 大文件训练读取 双项第一

Unet3D 在 MLPerf Storage 中主要考察存储能否持续、稳定地满足训练端持续读取大文件的需求。测试结果显示,MeshFS 每客户端带宽达 67.73 GiB/s,位列第一;每 GiB/s 硬件成本仅 1,053 美元,同样位列第一,实现性能与成本的双重领先

RetinaNet · 海量小文件训练 三项第一

海量小文件是最能拉开存储厂商差距的场景。RetinaNet 包含 7540 万个、平均约 315 KiB 的小文件,高并发下会同时对元数据处理与小 I/O 通路造成巨大压力。 测试通过模拟 675 个 B200 训练 I/O 负载,MeshFS 训练吞吐达 96.13 GiB/s,每客户端带宽 10.68 GiB/s,每 GiB/s 硬件成本 4,163 美元,三项指标全部位列第一,充分验证了 MeshFS 分布式元数据引擎在元数据密集与海量小文件高并发场景下的架构优势

图片

RetinaNet 训练吞吐与效率

Llama3 405B · Checkpoint 读写 双项第一

大模型训练中,Checkpoint 直接影响训练连续性与容错能力,既要定期写入保存状态,也要在故障恢复时快速读回。Llama3 405B 单次检查点文件大小达 5292 GB,对存储读写双向能力要求极高。 测试结果显示,MeshFS 读取每客户端带宽为 47.49 GiB/s,位列第一;每 GiB/s 硬件成本为 1,053 美元,同样位列第一; Checkpoint 写入时每客户端带宽达 13.34 GiB/s,可充分保障大模型检查点的快速保存与恢复

不同参测方案的硬件成本评估


在典型的高性能测试用例中,由于各个厂商提供的硬件方案差异巨大,简单评估数值很容易陷入数字游戏。在当前存储成本高企的背景下,成本和性能的平衡已经成为核心选型考虑。
XSKY 基于 2026 年 Q3 的硬件渠道价格对所有参与的并行文件系统厂商(排除双品牌重复提交 1 个、存储侧配置无法核实 2 个)硬件进行了量化,以下为成本结果:
图片

参测方案的硬件投入构成

从上图可以看到,不同厂商的硬件成本差异巨大,部分厂商的 DRAM 成本占比异常的高,显露出某些厂商为了峰值带宽不计成本引入内存作为写缓存的情况。而 MeshFS 用同一套三节点硬件配置跑通全场景并在硬件成本效率上保持绝对的领先。

此次测试表现背后的技术积淀与展望


MeshFS 在这次 MLPerf Storage 基准测试结果获得优异成绩的背后,是 XSKY 在架构创新与上游硬件深度协同的共同支撑,核心体现在三点:

  • 硬件级算力卸载:依托英特尔? 至强? 6 处理器内置 QAT/DSA 硬件加速引擎,结合 ISA-L 纠删码加速,将数据搬运、EC 编解码等密集型任务卸载至硬件完成,释放 CPU 核心专注业务处理,同时缩短数据重构、磁盘重建耗时。

  • 全栈带宽释放:凭借 PCIe 5.0 原生通道实现 NVMe SSD 直连,无转接损耗;搭配 FlexPath 智能网络引擎与一跳 IO 直读优化,配合高速 RDMA 网络,端到端消除带宽瓶颈与中转延迟。

  • 架构原生优势:Shared-Everything 全共享架构搭配 MDShard 分布式元数据引擎,面向 AI 训练中的海量小文件场景,提供高性能元数据访问能力,解决元数据瓶颈拖慢业务的行业痛点,保障海量小文件高并发访问;同时具备故障秒级切换能力,容量与性能可随节点线性扩展,适配不同业务阶段需求。

此次参与 MLPerf Storage 3.0 验证了 MeshFS 面向真实 AI 训练负载的架构方向。未来,XSKY 将继续围绕更高吞吐、更优成本效率和更稳定的训练连续性打磨产品,让 XSKY 不断成为 AI 基础设施中可靠、可扩展的存储底座。

引用说明:MLPerf Storage Benchmark Suite Results

https://mlcommons.org/2026/09/mlperf-storage-v3-0-results/


往期推荐



点我访问原文链接