NVIDIA发布Molt:极简agentic RL训练框架
NVIDIA NeMo实验室开源的PyTorch原生RL框架,整个RL路径只有约8600行代码,却能通过FSDP2的TP/EP/CP并行扩展到DeepSeek-V3这类1T级MoE模型。
它把Agent当作程序本身:奖励就是你在Env或ChatAgent里写的任意Python,支持多轮工具调用、VLM环境和LLM-as-judge,运行时只靠Ray、vLLM和NVIDIA AutoModel三个组件实现全异步训练。
对研究者来说,一个下午能读完全部梯度相关代码,从8B到1T规模无需重写脚本。
项目地址:
显示更多