快讯事件 · 1 条来源
Georgia Channing发布Carbon-A模型与Carbon Annotation Database,发现5.66亿个新基因候选
Georgia Channing发布Carbon Annotation Database及其背后的模型Carbon-A。该模型在22,617个物种中发现5.6634亿个新基因候选,并与Active Site和UCSD合作,在猫、鸡和拟南芥等研究较充分的物种中对部分新基因完成湿实验验证。
全部来源
前后事件
上一篇:Georgia Channing发布Carbon-A模型与Carbon Annotation Database下一篇:Cogent推出Attack Path Analysis,用自研网络模型追踪AI智能体攻击路径
相关事件
Adithya S K重发博客:探讨RL环境中编码智能体的奖励作弊问题与防范设计
Adithya S K表示近期关于RL环境奖励作弊的讨论增多,因此重发其此前撰写的相关博客。博客涵盖编码智能体利用公共开源代码构建的环境的常见作弊方式,以及设计环境以避免这些奖励作弊的实用方法。
Quentin Gallouédec发布TRL v1.15:融合LM head默认开启,峰值显存最高降低82%
Quentin Gallouédec发布TRL v1.15,称其为迄今最大的优化。新版本默认启用融合LM head,峰值显存最高降低82%,序列长度提升至7倍;DPO从10k增至59k tokens,GRPO从29k增至115k tokens。
Fuli Luo回应ValsAI:mimoagent计划收紧运行时反作弊脚本以规避重建镜像
Fuli Luo回应ValsAI,介绍其内部RL环境采用"可作弊环境+独立防作弊预处理脚本"的拆分设计:新作弊模式出现时只需更新脚本,代价是须搭配该脚本使用;团队计划收紧mimoagent中的运行时反作弊脚本以免重建镜像。转发者Adithya S K称其Harbor实现的Mimo RL Envs一周前也遇到同类奖励作弊问题,已于3天前修复大部分。
Hugging Face团队发布多harness强化学习指南
adithya_s_k与Hugging Face团队发布多harness强化学习指南。文章指出同一模型、同一权重在不同agent harness中得分可从33%到62%不等;发帖者称其为今年最实用的RL写作之一,且相关内容全部开放。