快讯事件 · 1 条来源
观点:后训练与RL时代开启,专用模型和数据飞轮比AGI更关键
作者omarsar0发文称,越来越多的公司和开发者开始意识到强化学习带来的商业机会;他认为对许多真实世界任务而言,并不需要AGI,而是需要合适的专用模型、运行框架(harness)和数据飞轮,并表示一个富有成果的后训练新时代正在到来,这一趋势正在全栈AI公司中发生并将持续增长。文中还引述Vincent Weisser的观点称"后训练/RL与推理正在接管算力"。以上为作者观点,未经独立核实。
全部来源
前后事件
相关事件
Tinker下调长上下文价格最高70%,GLM-5.3-Flash与DeepSeek-v4.1-Flash上线
Tinker表示已将效率提升带来的成本节约转为用户降价,长上下文RL相关价格下调最高70%,长上下文prefill与采样现价与短上下文相同;GLM-5.3-Flash和DeepSeek-v4.1-Flash也已上线,面向高性价比长上下文任务。发帖者omarsar0评论称,这将降低agentic RL中长rollout的token成本,使专门化模型更实用。
微软发布Microsoft-Decision-1,聚焦快速决策任务
Satya Nadella介绍,Microsoft-Decision-1面向快速决策,在结构化决策任务上表现领先,并在延迟和质量上超过其他LLM及决策模型;omarsar0表示会将其纳入评估,并称一致性与复杂决策仍是此类模型的短板。
OpenAI Codex测试版新增composer predictions功能,向Pro用户开放
OpenAI Developers宣布,Codex面向Pro用户测试composer predictions功能,可根据对话内容及用户沟通方式建议下一条消息。发帖者omarsar0表示,其自研agent编排器中已有类似的预测工具,并使用Haiku、Luna等较小模型。
StepFun推出Step 5 Preview,上线次日登顶OpenRouter热门榜首
Step 5 Preview发布次日登上OpenRouter Trending榜首,已接入Kilo Code、Cline、Hermes Agent和OpenCode。omarsar0实测称其能自我检查、任务完成后停止,适合长时间自主运行的工程任务;模型为600B总参数、每token激活27B的稀疏MoE,上下文窗口达1M tokens,开放权重将于10月15日放出。
StepFun Step 5 Preview发布次日登顶OpenRouter趋势榜,10月15日开放权重
StepFun的Step 5 Preview在发布一天后登上OpenRouter趋势榜榜首,已接入Kilo Code、Cline、Hermes Agent和OpenCode。转发者elvis称其能自查并在任务完成时停止,支持根据截图、原型或PRD生成可用网页,上下文窗口100万token、输出上限100万token,底层为600B总参数、每token激活27B的稀疏MoE;开放权重计划10月15日推出。