技术进展

OpenLake存储刷新MLPerf基准读写性能

Heooo 09月06日01时58分 9 阅读

「MLCommons发布MLPerf Storage v3.0结果,OpenLake的Infinity Core I/O引擎在Llama 3.1 8B检查点基准中实现写入6.72 GiB/s、读取11.55 GiB/s,位居已发布S3结果首位。该成绩借助io_uring与GPUDirect Storage架构实现,凸显高带宽存储在AI训练中的关键作用。」

MLCommons正式发布了MLPerf Storage v3.0基准测试结果。作为评估存储系统在典型AI训练与推理负载下性能的行业标准,MLPerf Storage此次引入的检查点写入与读取工作负载引起了广泛关注。在Llama 3.1 8B模型的检查点基准测试中,OpenLake凭借其Infinity Core I/O引擎实现了6.72 GiB/s的写入带宽和11.55 GiB/s的读取带宽,成为已发布S3接口结果中读写性能最高的提交。

OpenLake是一个面向AI工作负载的高性能存储系统,底层基于io_uring与GPUDirect Storage技术构建。其异步I/O引擎旨在为大规模模型训练提供低延迟、高吞吐的存储服务。此次提交的配置使用了一个客户端节点,通过400 Gb/s InfiniBand网络连接至NVMe后端网关。在数据路径中,OpenLake充分利用io_uring的非阻塞内核操作、固定执行线程、细粒度I/O合并、XFS文件系统及针对工作负载的存储调优,最终通过S3 API接口完成了检查点的高效写入与读取。

MLPerf Storage的检查点工作负载模拟了从8B到1.25万亿参数规模的Llama 3模型族。针对Llama 3.1 8B配置,测试使用八个进程通过16个文件进行检查点的写入与读取,整个流程执行10次连续写入和10次连续读取,最终报告平均性能。该测试旨在模拟训练进程保存模型状态或故障后恢复时,存储系统在满负荷条件下的实际表现。OpenLake的成绩来自五份公开的Closed division结果,这些结果均采用了同样的检查点工作负载、S3 API接口、Llama 3.1 8B模型、单客户端节点和单数据并行实例,因此具有高度可比性。

MLCommons存储工作组在发布结果时表示,随着AI系统规模持续扩大,存储性能对训练生产力和效率的影响日益显著。OpenLake参与MLPerf Storage v3.0,特别是全新的检查点工作负载,有助于社区推动AI训练基础设施的升级。可靠且经过验证的结果能够帮助用户选择更合适的存储解决方案,并优化其基础设施部署。

从技术实现来看,OpenLake的Infinity Core I/O引擎通过保持I/O操作持续在途,显著减少了调度和CPU开销。在检查点场景中,这种设计使存储系统能够高效接受并行写入,持久化提交每个检查点,并在恢复阶段快速提供相同的数据。这一架构对于运行时间长达数周、跨越数百或数千个GPU的大规模训练任务至关重要,因为检查点频率和恢复速度直接影响训练时间和成本。此次MLPerf Storage v3.0的成绩不仅展现了OpenLake的技术实力,也反映出AI存储领域正从传统文件系统向更契合GPU直接数据访问和高并发I/O需求的方向演进。

# MLPerf Storage # OpenLake # AI存储 # LLM训练

来源:Heooo AI工具导航