QbitAI星尘发布 SmoothRL,让在线强化学习跟上大模型异步推理星尘智能基座模型团队发布可异步执行的在线强化学习框架 SmoothRL解决机器人训练中「不能停下来等模型」的实时性难题让在线强化学习与大模型异步推理更好协同1 个月前访问原文链接
HackerNewsPrime Intellect发布大规模Agent强化学习框架:36.5万个环境并行Prime Intellect推出大规模Agent RL训练框架,可并行运行36.5万个环境覆盖SWE编程、终端操作和网页搜索三大Agent核心场景项目旨在解决Agent训练中数据稀缺和样本效率低的问题2 个月前访问原文链接