云霞资讯网

1326次提交换来的开源RL框架

一个刚发 v0.1 的开源项目,背后是 9 个月、72 位贡献者、1326 次提交,还有 85 个跑在真实 GPU 上的端到端测试。

Miles 是给大模型和多模态模型做强化学习训练的框架。RL 训练跑起来容易、出问题难查,它想接住的就是这段:确认训练是对的,硬件别浪费,规模上去还稳得住。

官方说,和 Periodic Labs 合作把 rollout 吞吐提了 3 倍、权重同步 10 倍;也支持超大模型上的 LoRA,靠 SGLang 集成只同步适配器权重。

我的判断:这更像工程成绩单,不是算法突破。受益的是有多卡集群、做长链路 agent 训练的团队;只写提示词的可以放放。

提醒一句,那些倍数是项目方自述口径,不是第三方复测,版本号停在 v0.1。

#人工智能就业 #大模型 #ai #开源 #程序员