← 返回快讯

快讯事件 · 1 条来源

Hugging Face 推出 RL Environment Explorer,汇集超 1200 万条强化学习任务条目

ClementDelangue

作者称 Hugging Face Hub 现有超过 1200 万条强化学习任务条目,并推出 RL Environment Explorer,可在一个平台中浏览、可视化和运行多个 RL 环境,包括 OpenEnv、Harbor、MiMo、Verifiers 和 NeMo Gym。该内容为 Hugging Face 联合创始人 Clement Delangue 的转发。

全部来源

前后事件

相关事件

TRL v1.15发布:默认启用融合LM头,最长训练序列最高提升6.9倍

TRL v1.15发布,SFT、DPO、KTO、GRPO、RLOO和蒸馏默认启用融合LM头:通过Triton内核直接计算token级量,避免实例化巨大的[batch, seq, vocab] logits张量。以Gemma 3 1B(262k词表)为例,相同GPU下各算法最大序列长度最高提升6.9倍,8k上下文峰值显存降低52-82%,训练速度最高快约11%。发布方Lysandre表示,此优化无需额外启用,已是v1.15默认行为;该版本还包含SFT选择性激活检查点、视觉数据集assistant-only loss等更新。

ClementDelangue共 1 条来源