Qwen3.8-27B开源即用!�N腾0Day适配:270亿参数推理效率拉满

2026-08-15 22:30:31 0点赞 0收藏 0评论

快科技8月15日消息,阿里巴巴旗下千问大模型团队于8月14日晚间正式开源Qwen3.8-27B模型。昇腾在模型开源后同步完成0Day适配,通过vLLM-Ascend开源推理引擎实现Qwen3.8-27B在Atlas 800 A3、Atlas 850E超节点上的高效推理部署。

Qwen3.8-27B是一款原生多模态稠密(Dense)模型,参数量270亿。模型原生支持262K tokens上下文长度,通过YaRN技术可外推至1M tokens。

在架构上,Qwen3.8-27B采用混合线性注意力设计,64层中48层为Gated DeltaNet线性注意力、16层为Full Attention。这种设计打破了长序列下O(n²)的计算复杂度,兼顾了长序列处理效率与上下文建模能力。

在性能表现上,Qwen3.8-27B在编程和办公场景中显著超越前代Qwen3.6-27B,整体水平优于Qwen3.7-Plus。

该模型在Agentic terminal coding测试中得分73.0(前代63.4),在SWE-bench Pro测试中得分61.7(前代53.5)。模型新增了reasoning_effort功能,可根据任务难度动态调节思考深度以节省计算资源。

针对Qwen3.8-27B的结构特点,昇腾采用多项关键技术进行优化。在Prefill阶段采用GDN融合算子,以Chunk方式高效处理长序列,减少中间数据搬运和算子调度开销。

vLLM-Ascend支持W8A8量化部署,将权重与激活值从BF16量化至8-bit,充分发挥昇腾NPU的INT8/MXFP8算力。

同时利用Qwen3.8的MTP投机推理能力,通过MTP模块预测后续Token、主模型并行校验,减少主模型调用次数。Decode阶段支持将计算捕获为设备侧执行图(ACLGraph),消除重复调度开销。

目前Qwen3.8-27B已在Hugging Face和魔搭社区(ModelScope)同步上线。昇腾已提供基于该模型的部署指导,用户可通过vLLM-Ascend开源推理引擎快速完成推理部署。

Qwen3.8-27B开源即用!昇腾0Day适配:270亿参数推理效率拉满Qwen3.8-27B开源即用!昇腾0Day适配:270亿参数推理效率拉满

编辑:红茶

【本文结束】如需转载请务必注明出处:快科技

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
0
扫一下,分享更方便,购买更轻松