阿里千问Qwen3.8-Flash开源发布,模型效率与性价比全球领先
在人工智能领域掀起新一轮技术浪潮,阿里巴巴集团于8月26日晚正式发布了其最新一代大语言模型Qwen3.8-Flash,并同步开源。这款模型凭借创新的架构设计和高效的训练方案,在性能、成本和效率方面均实...
在人工智能领域掀起新一轮技术浪潮,阿里巴巴集团于8月26日晚正式发布了其最新一代大语言模型Qwen3.8-Flash,并同步开源。这款模型凭借创新的架构设计和高效的训练方案,在性能、成本和效率方面均实现了突破性进展。
作为一款多模态混合专家(MoE)模型,Qwen3.8-Flash采用了全新的下一代(Next)模型架构。其核心亮点在于:Transformer参数总量达125B,但仅激活6B即可实现卓越性能,这一设计使其在多个基准测试中超越了Claude Opus4.6,接近Opus4.8的水平。值得注意的是,Qwen3.8-Flash的基础模型在通用能力、数学推理和编程等基础任务上,已经超过了3倍参数规模的前代产品Qwen3.7-Plus。
在具体应用场景中,Qwen3.8-Flash展现出显著优势。在智能体编程任务SWE-bench Pro评测中,该模型领先Opus4.6多达9.1分;在专业办公任务JobBench评测中,超出Opus4.6近20分;在移动端智能体AndroidWorld评测中,比Opus4.6高出22.5分。此外,在视觉推理解决数学问题的MathVision任务中,Qwen3.8-Flash超出25.1分,在具身智能ERQA任务中领先31.5分,整体多模态能力表现更为突出。
这些优异表现得益于Qwen3.8-Flash在架构设计上的多项创新。在注意力机制方面,引入独特的QSA(Qwen Sparse Attention)机制,形成与GDN高效融合的混合注意力架构,可显著降低计算开销,在高缓存命中的1M Tokens长上下文实际场景中提速8倍以上。在信息传递方面,采用自研的Gated Residual方法,将传统Transformer的1条信息主通道扩展为4条,让模型可根据需求动态调整信息读写,既提高了信息传递效率,又增强了训练稳定性。在参数扩展方面,引入51B的N-gram Embedding参数,为模型提供更高效的查表寻址方式,以极少资源消耗实现大规模"记忆指南手册"功能。同时,模型结构与训练优化协同进行,大幅提升了收敛效率和训练吞吐量。
在成本控制方面,Qwen3.8-Flash同样表现出色。与上一代Qwen3.7-Plus相比,尽管性能相近,但训练资源使用量仅为九分之一,训练成本骤降90%。推理时,每百万Tokens输入成本低至1元,输出成本3元,是Claude Opus4.6的3%,DeepSeek-V4-Flash闲时价格的2/3、忙时价格的1/3。这一成本优势使得Qwen3.8-Flash成为目前市场上性价比最高的大型语言模型之一。
Qwen3.8-Flash不仅在技术层面取得突破,其开源策略也备受关注。当前,Qwen3.8-Flash-Next模型权重已在Hugging Face、魔搭社区全面开源,交由全球AI开源社区检验。这标志着阿里云在推动AI技术普惠化方面迈出重要一步,也为下一代千问大模型Qwen4的研发奠定了基础。
随着Qwen3.8-Flash的发布,阿里云旗下的千问办公平台也同步上线了该模型的标准模式。据官方介绍,通过标准模式,用户可以以更低的成本完成日常办公任务,预计95%的日常办公需求可通过该模式满足,仅5%的复杂任务需要使用高级模式。这一举措将进一步提升企业用户的使用体验,推动AI技术在办公场景的普及应用。