RL 训练最贵的不是算力,是跑了两周才发现结果是错的。
Miles v0.1 开源了,面向大模型和多模态模型的 RL 框架。rollout 引擎用 SGLang,训练侧接 Megatron-LM 和 FSDP。
RL 后训练要模型先自己生成一批回答再打分更新,生成那步就是 rollout。框架本质是推理和训练两套引擎缝在一起,任何一处不对齐,结果就悄悄跑偏。
配图里写了 72 位贡献者、85 个 GPU CI 测试。RL 的难点不在启动,在排查,能把正确性做进 CI 才是稀缺的。
这条推来自 SGLang 的开发方,是组件方口径,不是第三方实测。选 RL 框架等于选它绑定的后端,迁移成本不在 API 层面。只做 SFT 或单卡微调的可以先放着。
#人工智能就业 #大模型 #ai #强化学习 #开源
