千问新架构,目标降低AI成本
千问发布了Qwen3.8-Flash-Next。它最值得关注的地方,是用一套面向Qwen4的新架构,重新分配大模型的计算、内存和参数。
模型主体有1250亿参数,另加510亿N-gram嵌入参数,每个Token只激活60亿参数。训练团队称它训练所需计算量约为Qwen3.7-Plus的九分之一,编码和办公任务表现还更好。
这说明:模型继续扩大,单位任务调用的计算可以下降。
核心变化有三层。稀疏注意力把长上下文切成微块,只选择重要区域;Gated DeltaNet压缩历史,减少反复扫描全文;N-gram嵌入把一部分知识容量放进可查询、可卸载到主机内存的表中。计算集中到当前需要的部分,参数规模与每Token计算量由此逐渐分开。
这会改变模型的竞争。总参数、榜单分数仍有意义,开发者更该核算完成整项任务的Token数、延迟、重试次数和部署资源。
不过,即便只有6B激活参数,也不等于普通电脑能运行。FP8权重约180GB,推荐配置仍是多张数据中心GPU;即便把51B亿嵌入参数卸载到内存里,也要占用51GB主机内存。
所以,这次发布更像是Qwen4下一阶段的工程路线图:算力不再平均花在所有参数和所有上下文上,内存、稀疏路由与系统调度成为新的竞争点。
