正文内容 评论(0)
快科技8月15日消息,阿里巴巴旗下千问大模型团队于8月14日晚间正式开源Qwen3.8-27B模型。昇腾在模型开源后同步完成0Day适配,通过vLLM-Ascend开源推理引擎实现Qwen3.8-27B在Atlas 800 A3、Atlas 850E超节点上的高效推理部署。
Qwen3.8-27B是一款原生多模态稠密(Dense)模型,参数量270亿。模型原生支持262K tokens上下文长度,通过YaRN技术可外推至1M tokens。
在架构上,Qwen3.8-27B采用混合线性注意力设计,64层中48层为Gated DeltaNet线性注意力、16层为Full Attention。这种设计打破了长序列下O(n²)的计算复杂度,兼顾了长序列处理效率与上下文建模能力。
在性能表现上,Qwen3.8-27B在编程和办公场景中显著超越前代Qwen3.6-27B,整体水平优于Qwen3.7-Plus。
该模型在Agentic terminal coding测试中得分73.0(前代63.4),在SWE-bench Pro测试中得分61.7(前代53.5)。模型新增了reasoning_effort功能,可根据任务难度动态调节思考深度以节省计算资源。
针对Qwen3.8-27B的结构特点,昇腾采用多项关键技术进行优化。在Prefill阶段采用GDN融合算子,以Chunk方式高效处理长序列,减少中间数据搬运和算子调度开销。
vLLM-Ascend支持W8A8量化部署,将权重与激活值从BF16量化至8-bit,充分发挥昇腾NPU的INT8/MXFP8算力。
同时利用Qwen3.8的MTP投机推理能力,通过MTP模块预测后续Token、主模型并行校验,减少主模型调用次数。Decode阶段支持将计算捕获为设备侧执行图(ACLGraph),消除重复调度开销。
目前Qwen3.8-27B已在Hugging Face和魔搭社区(ModelScope)同步上线。昇腾已提供基于该模型的部署指导,用户可通过vLLM-Ascend开源推理引擎快速完成推理部署。
- 热门文章
- 换一波
- 好物推荐
- 换一波
- 关注我们
-
微博:快科技官方
快科技官方微博 -
今日头条:快科技
带来硬件软件、手机数码最快资讯! -
抖音:kkjcn
科技快讯、手机开箱、产品体验、应用推荐...


