云霞资讯网

5090 Qwen3.8 不严谨测试能跑但被MoE惯坏了 运行系统:Ubuntu

5090 Qwen3.8 不严谨测试能跑但被MoE惯坏了
运行系统:Ubuntu 20.04.5 LTS
系统内存:64G
显卡:RTX 5090 32G单卡

框架:docker运行的llama.cpp
模型:Qwen3.8-27B-UD-Q4_K_XL.gguf
架构:27B稠密模型
并发:双路
上下文:双路共享131072,单路约65536
显存占用:约25.7G

实测:

1000字:首字657ms|每秒73 tokens
10000字:首字575ms|每秒71 tokens

模型顺利跑起来了,第一感受就是:慢!真的比Qwen3.6慢太多了!

之前的Qwen3.6-35B-A3B,短内容能跑到每秒212 tokens,10000字也有150 tokens。Qwen3.8只有71~73 tokens,实际使用时体感差距非常明显。

主要还是架构原因。Qwen3.6虽然总参数35B,但属于MoE模型,每次只激活约3B参数;Qwen3.8则是27B稠密模型,每个Token基本都要完整计算。看起来参数更小,实际每个Token的计算量反而大得多。

上下文还有一个坑:

双路总上下文设置262144时,每路约131072,速度直接掉到每秒7~10 tokens,几乎不能用。

改成双路总131072、每路约65536后,速度马上恢复到70 tokens左右。内网NewAPI实际跑OpenClaw和Cursor,也能稳定在每秒59~71 tokens。

llama.cpp占用约25.7G显存,机器上另一个VLLM服务还占了4.8G,总显存已经来到30.5G。如果停掉VLLM,应该还能继续尝试Q5/Q6量化。

Qwen3.8还原生支持图片理解,加载mmproj就能直接看图。后面继续测试它在Cursor、OpenClaw和复杂Skills里面的表现。

目前结论:5090单卡能跑,双路也能用,但总上下文建议控制在131072。每秒70 tokens其实不算慢,只是被Qwen3.6的MoE速度惯坏以后,真的感觉龙虾都变迟钝了。

qwen38 qwen3_8 Qwen 本地大模型 本地部署 rtx5090 llamacpp ai