Qwen3.8-27B开源即用!昇腾0Day适配:270亿参数推理效率拉满

站长吧8月15日消息,阿里巴巴旗下千问大模型团队于8月14日晚间正式开源Qwen3.8-27B模型。昇腾在模型开源后同步完成0Day适配,通过vLLM-Ascend开源推理引擎实现Qwen3.8-27B在Atlas 800 A3、Atlas

站长吧8月15日消息,阿里巴巴旗下千问大模型团队于8月14日晚间正式开源Qwen3.8-27B模型。昇腾在模型开源后同步完成0Day适配,通过vLLM-Ascend开源推理引擎实现Qwen3.8-27B在Atlas 800 A3、Atlas 850E超节点上的高效推理部署。

Qwen3.8-27B是一款原生多模态稠密(Dense)模型,参数量270亿。模型原生支持262K tokens上下文长度,通过YaRN技术可外推至1M tokens。

在架构上,Qwen3.8-27B采用混合线性注意力设计,64层中48层为Gated DeltaNet线性注意力、16层为Full Attention。这种设计打破了长序列下O(n²)的计算复杂度,兼顾了长序列处理效率与上下文建模能力。

在性能表现上,Qwen3.8-27B在编程和办公场景中显著超越前代Qwen3.6-27B,整体水平优于Qwen3.7-Plus。

该模型在Agentic terminal coding测试中得分73.0(前代63.4),在SWE-bench Pro测试中得分61.7(前代53.5)。模型新增了reasoning_effort功能,可根据任务难度动态调节思考深度以节省计算资源。

针对Qwen3.8-27B的结构特点,昇腾采用多项关键技术进行优化。在Prefill阶段采用GDN融合算子,以Chunk方式高效处理长序列,减少中间数据搬运和算子调度开销。

vLLM-Ascend支持W8A8量化部署,将权重与激活值从BF16量化至8-bit,充分发挥昇腾NPU的INT8/MXFP8算力。

同时利用Qwen3.8的MTP投机推理能力,通过MTP模块预测后续Token、主模型并行校验,减少主模型调用次数。Decode阶段支持将计算捕获为设备侧执行图(ACLGraph),消除重复调度开销。

目前Qwen3.8-27B已在Hugging Face和魔搭社区(ModelScope)同步上线。昇腾已提供基于该模型的部署指导,用户可通过vLLM-Ascend开源推理引擎快速完成推理部署。

Qwen3.8-27B开源即用!昇腾0Day适配:270亿参数推理效率拉满

本文来自投稿,不代表互联网观察员立场,如若转载,请注明出处:https://www.hlwgcy.com/info/4256.html

(0)
的头像
苹果折叠屏将冲击行业TOP3:和三星华为形成三足鼎立之势
上一篇 6天前
微信鸿蒙版又补齐一波功能!聊天发实况图片、自定义视频来电铃声全量上线
下一篇 6天前

相关推荐

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

联系我们

400-800-8888

在线咨询: QQ交谈

邮件:admin@example.com

工作时间:周一至周五,9:30-18:30,节假日休息

关注微信