← 返回快讯

快讯事件 · 1 条来源

Quentin Gallouédec发布TRL v1.15:融合LM head默认开启,峰值显存最高降低82%

adithya_s_k

Quentin Gallouédec发布TRL v1.15,称其为迄今最大的优化。新版本默认启用融合LM head,峰值显存最高降低82%,序列长度提升至7倍;DPO从10k增至59k tokens,GRPO从29k增至115k tokens。

全部来源

前后事件

相关事件

Fuli Luo回应ValsAI:mimoagent计划收紧运行时反作弊脚本以规避重建镜像

Fuli Luo回应ValsAI,介绍其内部RL环境采用"可作弊环境+独立防作弊预处理脚本"的拆分设计:新作弊模式出现时只需更新脚本,代价是须搭配该脚本使用;团队计划收紧mimoagent中的运行时反作弊脚本以免重建镜像。转发者Adithya S K称其Harbor实现的Mimo RL Envs一周前也遇到同类奖励作弊问题,已于3天前修复大部分。

adithya_s_k共 1 条来源