正文内容 评论(0)
快科技9月10日消息,寒武纪今日宣布已基于vLLM推理框架完成对DeepSeek最新开源模型V4.1 Flash的Day 0适配。这意味着DeepSeek V4.1 Flash发布当天即可在寒武纪芯片上稳定运行。
DeepSeek V4.1 Flash是DeepSeek全新模型结构系列中尺寸最小的一款,总参数552B的MoE模型。该模型采用全新的Causal-Encoder-Decoder结构,输入侧激活仅8B参数,输出侧激活16B参数,原生具备多模态视觉理解能力。官方称其成本显著低于已知同尺寸模型。
值得关注的是,V4.1 Flash在KV缓存压缩上实现了重大突破。新模型对HBM的需求降至上一代的1/4,对SSD的需求降至1/8。相对初代模型,KV缓存已缩小437倍。
在性能优化上,寒武纪利用自研高性能融合算子库Torch-MLU-Ops对Engram、Compressor等模型结构进行专项加速,并利用BangC高性能编程语言编写稀疏/压缩Attention等热点算子的优化Kernel。
在推理框架优化层面,寒武纪在vLLM中全面支持TP/PP/SP/DP/EP 5D混合并行、通信计算并行、低精度量化以及PD分离部署等优化技术,显著提升端到端推理效率。
寒武纪此次快速适配的背后,是NeuWare软件生态的长期积累。就在两天前的9月8日,寒武纪正式加入PyTorch基金会,成为最高级别的白金成员,将在基金会管理委员会拥有一个席位。与Meta、AMD、AWS、Google Cloud、Microsoft和NVIDIA等全球巨头处于同一级别。
截至目前,寒武纪已完成GLM、DeepSeek、Qwen、Kimi、MiniMax五大国产主流大模型的推理适配,分别对应智谱、深度求索、阿里、月之暗面、MiniMax五家模型厂商。

- 热门文章
- 换一波
- 好物推荐
- 换一波
- 关注我们
-
微博:快科技官方
快科技官方微博 -
今日头条:快科技
带来硬件软件、手机数码最快资讯! -
抖音:kkjcn
科技快讯、手机开箱、产品体验、应用推荐...
