正文内容 评论(0

Qwen3.8-27B开源即用!昇腾0Day适配:270亿参数推理效率拉满
2026-08-15 22:24:02  出处:快科技 作者:红茶 编辑:红茶     评论(0)点击可以复制本篇文章的标题和链接复制对文章内容进行纠错纠错

快科技8月15日消息,阿里巴巴旗下千问大模型团队于8月14日晚间正式开源Qwen3.8-27B模型。昇腾在模型开源后同步完成0Day适配,通过vLLM-Ascend开源推理引擎实现Qwen3.8-27B在Atlas 800 A3、Atlas 850E超节点上的高效推理部署。

Qwen3.8-27B是一款原生多模态稠密(Dense)模型,参数量270亿。模型原生支持262K tokens上下文长度,通过YaRN技术可外推至1M tokens。

在架构上,Qwen3.8-27B采用混合线性注意力设计,64层中48层为Gated DeltaNet线性注意力、16层为Full Attention。这种设计打破了长序列下O(n²)的计算复杂度,兼顾了长序列处理效率与上下文建模能力。

在性能表现上,Qwen3.8-27B在编程和办公场景中显著超越前代Qwen3.6-27B,整体水平优于Qwen3.7-Plus。

该模型在Agentic terminal coding测试中得分73.0(前代63.4),在SWE-bench Pro测试中得分61.7(前代53.5)。模型新增了reasoning_effort功能,可根据任务难度动态调节思考深度以节省计算资源。

针对Qwen3.8-27B的结构特点,昇腾采用多项关键技术进行优化。在Prefill阶段采用GDN融合算子,以Chunk方式高效处理长序列,减少中间数据搬运和算子调度开销。

vLLM-Ascend支持W8A8量化部署,将权重与激活值从BF16量化至8-bit,充分发挥昇腾NPU的INT8/MXFP8算力。

同时利用Qwen3.8的MTP投机推理能力,通过MTP模块预测后续Token、主模型并行校验,减少主模型调用次数。Decode阶段支持将计算捕获为设备侧执行图(ACLGraph),消除重复调度开销。

目前Qwen3.8-27B已在Hugging Face和魔搭社区(ModelScope)同步上线。昇腾已提供基于该模型的部署指导,用户可通过vLLM-Ascend开源推理引擎快速完成推理部署。

Qwen3.8-27B开源即用!昇腾0Day适配:270亿参数推理效率拉满

【本文结束】如需转载请务必注明出处:快科技

责任编辑:红茶

文章内容举报

  • 支持打赏
  • 支持0

  • 反对

  • 打赏

文章价值打分

当前文章打分0 分,共有0人打分
  • 分享好友:
  • |

  • 热门文章
  • 换一波

  • 好物推荐
  • 换一波

  • 关注我们

  • 微博

    微博:快科技官方

    快科技官方微博
  • 今日头条

    今日头条:快科技

    带来硬件软件、手机数码最快资讯!
  • 抖音

    抖音:kkjcn

    科技快讯、手机开箱、产品体验、应用推荐...