云霞资讯网

我必须立刻本地部署qwen3.8-27B 梁圣已经原地退化为牢梁了,deepse

我必须立刻本地部署qwen3.8-27B
梁圣已经原地退化为牢梁了,deepseek api原地涨价五倍。这个价格不能说完全没有性价比吧,但也导致了成本激增,尤其是写代码的话随随便便几兆几十兆的token消耗,蚁多咬死象,地主家也没有余粮。

然后呀然后,qwen3.8-27B终于是在一个小时前开放权重了,这不叫巧了么小梁?

从github拉取最新的llama-cpp
cmake -B build -DGGML_CUDA=ON -DCMAKE_CUDA_COMPILER=/usr/local/cuda/bin/nvcc
cmake --build build --config Release -j 24

去hf-mirror拉取qwen3.8-27B unsloth UD-Q6K_XL的权重,modelscope暂时还没找到,抱脸虫的话外网下载太慢。我的话因为显存只有40G,所以用的Q6K,只开了200K上下文给claude code用。相信在座的各位都是人手一张RTX PRO 6000 96G的,可以考虑一下fp8的权重,然后开满262k的上下文。

我用了一张3090和一张4080s,启动命令如下
/home/sunbird/demo/llama.cpp/build/bin/llama-server -fa on --spec-type draft-mtp --spec-draft-n-max 2 --temp 0.6 --top-p 0.95 --min-p 0.0 --top-k 20 -t 6 --webui --host 0.0.0.0 --port 11432 -ngl 99 -np 1 -ts 30,17 -mg 1 --cache-ram 32768 --model /home/sunbird/data/models/llm/Qwen3.8-27B-UD-Q6_K_XL.gguf --alias "Qwen3.6-27B" -c 200000 --reasoning-preserve

输出速度约50 tokens/s,完全够用

顺便吐槽下,qwen现在的思维链终于是中文的了,3.5和3.6纯英文思维链,笑死

评论列表

银砖
银砖 1
2026-08-22 08:49
AI烧钱A:国内这几个头部AI“啃老族”每年的“零花钱”给您拉个清单。 1. 字节跳动(豆包):最财大气粗的“爹” 字节跳动虽然没上市,但花钱最猛。为了支撑豆包大模型,字节在2026年全年的AI基础设施投入预算直接上调到了 2000亿元(其中光买AI芯片就花了850亿)。 2. 阿里巴巴(千问):疯狂搞基建的“爹” 阿里在2026年全年的AI投入约为 1500亿元,资金主要砸在阿里云的智算机房和服务器采购上。 3. 华为(盘古大模型):全产业链自研的“爹” 华为2026年全年的AI全链条投入约为 1150亿元,主要砸在昇腾芯片研发和智算集群落地上。 4. 腾讯(元宝):稳扎稳打的“爹” 腾讯2026年全年的AI投入约为 920亿元,主要用于自建AI机房和国产服务器采购。 5. 百度(文心一言):老牌AI的“爹” 百度2026年全年的AI投入约为 310亿元,主要投向文心大模型迭代和自有算力配套。 如果把国内这五大头部AI(阿里、腾讯、字节、华为、百度)的“爹妈”加在一起,2026年这一年,他们总共为AI大模型投入了 5880亿元。.。爹妈财力跟不上的。最先爆雷