快讯事件 · 1 条来源
TRL v1.15发布:默认启用融合LM头,最长训练序列最高提升6.9倍
TRL v1.15发布,SFT、DPO、KTO、GRPO、RLOO和蒸馏默认启用融合LM头:通过Triton内核直接计算token级量,避免实例化巨大的[batch, seq, vocab] logits张量。以Gemma 3 1B(262k词表)为例,相同GPU下各算法最大序列长度最高提升6.9倍,8k上下文峰值显存降低52-82%,训练速度最高快约11%。发布方Lysandre表示,此优化无需额外启用,已是v1.15默认行为;该版本还包含SFT选择性激活检查点、视觉数据集assistant-only loss等更新。
全部来源
前后事件
相关事件
Remi Fabre展示Microduck情绪功能早期设计,对比仿真与实体机器人表现
Remi Fabre表示已重新拿到Microduck机器人,得以回放情绪并对比仿真与实体的表现;其称目前仍为早期设计,还有很大提升空间。相关代码托管于pollen-robotics的microduck_emotions仓库。
OpenAI数学问题开源为RL环境,Ofir Press推测其借Lean形式化规模化构建
Adithya S K表示,OpenAI数学问题现已开源为强化学习环境。Ofir Press推测,OpenAI或为数学问题创建了大量带Lean形式化的RL环境:起初手工构建较简单的环境,待模型能自主创建环境后,再基于arXiv论文扩展问题数量。
Matthieu Lapeyre:Microduck以定制主板解决原型过热降频问题
Matthieu Lapeyre介绍,Microduck此前基于Radxa的原型存在热管理问题,运行仅20分钟就会降频并过热关机;团队通过新的定制主板解决了该问题,并让Microduck漫游以测试实际续航。ClementDelangue转发并评论"love the building in public"。
Whistle语音转文字模型走红Hugging Face Hub:16.9 MB对标Whisper base,主打端侧运行
据Victor M介绍,Hugging Face Hub上的Whistle模型仅16.9 MB,语音转文字能力可对标Whisper base,适合在端侧设备上运行。该帖由ClementDelangue转发。
Perplexity发布开放权重决策模型pplx-decider-v1.1-27b
Perplexity Developers发布开放权重多模态决策模型pplx-decider-v1.1-27b,称其在新的@huggingface Decision Index 0.3基准得分最高,输入价为0.02美元/百万token。Maziyar PANAHI称,该模型在669项临床决策中答对643项,高于Jev的628项,单次成本低42%、速度相近。