正文内容 评论(0

国产GPU首入CNCF国际开源生态!沐曦携手密瓜智能完成llm-d适配:单卡吞吐5773 tokens/s
2026-09-08 16:04:14  出处:快科技 作者:红茶 编辑:红茶     评论(0)点击可以复制本篇文章的标题和链接复制对文章内容进行纠错纠错

快科技9月8日消息,近日,云原生分布式推理开源项目llm-d正式纳入沐曦曦云C系列GPU支持,这是llm-d官方支持的加速器名单中首次出现国产GPU。

llm-d由Red Hat发起,构建于vLLM、SGLang等推理引擎与Kubernetes之上,目前已交由CNCF(云原生计算基金会)托管。

该项目聚焦前缀缓存感知路由、负载感知调度与Prefill/Decode分离等关键能力,GitHub已获超4400 Star。英伟达GPU、谷歌TPU、AMD GPU、英特尔XPU等主流算力平台均已在该社区形成部署指南。

沐曦股份此次与密瓜智能(Dynamia AI)合作,率先完成曦云C系列GPU在llm-d社区的完整适配,实现了基于曦云C系列GPU硬件环境下的单卡、多卡及Prefill/Decode分离推理部署验证。

大模型从可运行到可规模化服务,算力芯片本身只是起点。芯片能否顺畅接入云原生推理调度体系,才是决定落地效率的关键。

此前,此类国际开源项目的默认配置多以国外芯片为假设前提,国产GPU即便已能运行主流推理引擎,用户仍需自行摸索大量隐性适配细节。

本次适配打通了从芯片到生产级推理系统的最后一公里,为曦云C系列GPU提供了三条开箱即用的部署路径:

优化基线单卡路径:以Qwen3-14B、张量并行TP=1为配置,验证曦云C系列在llm-d标准模型服务栈下的基础推理能力。

优化基线八卡路径:以DeepSeek-R1-Distill-Llama-70B、张量并行TP=8为配置,验证单机八卡下的大参数量模型服务能力。

Prefill/Decode分离路径:以Prefill+1 Decode拓扑运行Qwen3-14B,基于vLLM NixlConnector与llm-d路由Sidecar打通KV缓存跨实例传输链路。

性能标定方面,团队在曦云C系列GPU上完成了llm-d推理路由器的实测:Qwen3-14B单卡配置下测得峰值Prefill吞吐5773 tokens/s,DeepSeek-R1-Distill-Llama-70B八卡配置下测得5468 tokens/s。

两组数据已并入llm-d社区公开标定矩阵,国内用户在沐曦平台部署时可直接引用来自真实硬件的性能基线。

国产GPU首入CNCF国际开源生态!沐曦携手密瓜智能完成llm-d适配:单卡吞吐5773 tokens/s

【本文结束】如需转载请务必注明出处:快科技

责任编辑:红茶

文章内容举报

  • 支持打赏
  • 支持0

  • 反对

  • 打赏

文章价值打分

当前文章打分0 分,共有0人打分
  • 分享好友:
  • |
本文收录在
#沐曦#国产GPU#Tokens

  • 热门文章
  • 换一波

  • 好物推荐
  • 换一波

  • 关注我们

  • 微博

    微博:快科技官方

    快科技官方微博
  • 今日头条

    今日头条:快科技

    带来硬件软件、手机数码最快资讯!
  • 抖音

    抖音:kkjcn

    科技快讯、手机开箱、产品体验、应用推荐...