云霞资讯网

视觉编码器终于卷起 MoE 了

🔥 MoE(混合专家,一次只激活一小部分参数)在 LLM 圈早玩透了,视觉编码器却还在硬堆密集参数。Meta 这篇把路走通了。

一句话说:把 CLIP 视觉塔的 MLP 换成细粒度 MoE,最大的 MoE-ViE-H 只激活 1.1B 参数,就追平了大它 1.7 倍的密集 SOTA 编码器,延迟只有 76%。

关键有两点。专家切得更碎,每个只有原 MLP 的四分之一宽,一层塞 32 个,另外留几个共享专家常驻兜住全局;常规 MoE 只是微涨,切碎后才明显。负载均衡不用辅助损失,改成给路由器加偏置并按失衡程度缩放。

很实用的一课是:MoE 省的是理论算力,不等于省延迟,自研 Triton kernel 才把朴素实现提速 2.5 倍以上。视频微调也值得抄,冻住专家再用图像模型做逐帧蒸馏,就不会学了视频忘图像。

在做多模态 VLM,可以尝试拿这套配方替换现有 dense 视觉塔,显存吃紧又想要强表征的场景也更适合。

视觉编码器的稀疏扩容也许才刚开始,做多模态的同学值得研读。

📚 论文地址:https://arxiv.org/pdf/2608.17402
🧑‍💻 代码地址:https://github.com/facebookresearch/moe_vie

#人工智能就业 #大模型学习 #深度学习 #计算机视觉cv #论文