快讯事件 · 1 条来源
Hugging Face团队发布多harness强化学习指南
adithya_s_k与Hugging Face团队发布多harness强化学习指南。文章指出同一模型、同一权重在不同agent harness中得分可从33%到62%不等;发帖者称其为今年最实用的RL写作之一,且相关内容全部开放。
全部来源
前后事件
上一篇:Fuli Luo回应ValsAI:mimoagent计划收紧运行时反作弊脚本以规避重建镜像下一篇:Kling AI将于10月14日在LA Tech Week举办小组讨论,探讨AI视频企业级落地
相关事件
Adithya S K重发博客:探讨RL环境中编码智能体的奖励作弊问题与防范设计
Adithya S K表示近期关于RL环境奖励作弊的讨论增多,因此重发其此前撰写的相关博客。博客涵盖编码智能体利用公共开源代码构建的环境的常见作弊方式,以及设计环境以避免这些奖励作弊的实用方法。
Quentin Gallouédec发布TRL v1.15:融合LM head默认开启,峰值显存最高降低82%
Quentin Gallouédec发布TRL v1.15,称其为迄今最大的优化。新版本默认启用融合LM head,峰值显存最高降低82%,序列长度提升至7倍;DPO从10k增至59k tokens,GRPO从29k增至115k tokens。
Georgia Channing发布Carbon-A模型与Carbon Annotation Database,发现5.66亿个新基因候选
Georgia Channing发布Carbon Annotation Database及其背后的模型Carbon-A。该模型在22,617个物种中发现5.6634亿个新基因候选,并与Active Site和UCSD合作,在猫、鸡和拟南芥等研究较充分的物种中对部分新基因完成湿实验验证。