正文内容 评论(0

阿里云发布新一代自研存储:为百万卡加速 AI存储成本大降69%
2026-09-22 18:05:52  出处:快科技 作者:随心 编辑:随心     评论(0)点击可以复制本篇文章的标题和链接复制对文章内容进行纠错纠错

快科技9月22日消息,2026云栖大会上,阿里云正式推出面向下一代AI训练集群的新一代高性能存储CPFS(Cloud Parallel File Storage)

该存储可提供高达百TB/s级吞吐和亿级IOPS,单文件系统规模提升5倍至100PiB,为百万卡模型训练加速,支撑大规模模型训练和多模态数据处理。

在实际训练中,可将模型启动平均耗时降低50%、峰值算力利用率提升30%、AI存储成本降低69%,业务承载能力翻倍。

阿里云发布新一代自研存储:为百万卡加速 AI存储成本大降69%

随着大模型训练进入规模化阶段,数据集由文本扩展至图片、视频和语音,规模可增长50倍甚至百倍;模型参数规模增长约10倍,Checkpoint保存也更加频繁。海量小文件并发读取和 Checkpoint 突发写入由此成为新瓶颈,存储如果无法跟上,昂贵的GPU集群就会因数据供给不足而空转。

针对这一问题,新一代CPFS采用数据服务与元数据服务分离架构,实现容量和性能的水平扩展。GPU、CPU节点通过EFC弹性客户端和虚拟存储通道,接入分布式元数据和数据服务;结合飞天盘古的分布式持久化存储底座和高性能存储网络,形成从客户端、协议处理到数据落盘的全链路自研链路。

据悉,新一代CPFS文件系统容量规模提升5倍、元数据性能提升10倍、文件数量规模提升100倍,单文件系统可扩展至百PiB并承载万亿级文件。企业无需为不同训练阶段反复拆分或迁移数据,即可在统一文件系统中管理训练语料、模型参数、Checkpoint和实验结果,并随GPU集群同步扩展容量与吞吐。

针对冷热数据长期并存带来的成本压力,CPFS还提供智能生命周期管理和冷热分层存储,使不同访问频率的数据自动匹配合适的存储介质,在保障训练性能的同时,整体存储成本最高降低69%。

以Qwen大模型训练为例,采用新一代CPFS后,模型启动平均耗时降低50%,峰值算力利用率提升30%,业务承载能力翻倍。

阿里云发布新一代自研存储:为百万卡加速 AI存储成本大降69%

面向大模型推理,阿里云同时推出KVCache加速引擎——KVCacheStore。它位于GPU显存、主机内存与远端共享存储之间,是基于近计算部署、高性能网络和弹性共享存储构建的新型G3.5存储层,以“存储换计算”承接长上下文、多轮对话和复杂Agent任务产生的大量缓存。

KVCacheStore支持与算力亲和部署,单计算节点吞吐达到40GB/s,通过Batch接口实现百万QPS,单实例可满足千亿级KV存储规模,实测缓存命中率提升20%以上。

“每一次模型的跃迁,都是云存储自我革新的最佳契机。”阿里云存储产品负责人蒋江伟表示,阿里云将持续推进算、网、存协同创新,让数据更快进入计算、GPU得到更充分利用,为大模型训练和AI应用提供高性能、可扩展且成本可持续优化的存储底座。

【本文结束】如需转载请务必注明出处:快科技

责任编辑:随心

文章内容举报

  • 支持打赏
  • 支持0

  • 反对

  • 打赏

文章价值打分

当前文章打分0 分,共有0人打分
  • 分享好友:
  • |
本文收录在
#GPU#高性能#阿里云

  • 热门文章
  • 换一波

  • 好物推荐
  • 换一波

  • 关注我们

  • 微博

    微博:快科技官方

    快科技官方微博
  • 今日头条

    今日头条:快科技

    带来硬件软件、手机数码最快资讯!
  • 抖音

    抖音:kkjcn

    科技快讯、手机开箱、产品体验、应用推荐...