← 返回快讯

快讯事件 · 1 条来源

观点:后训练与RL时代开启,专用模型和数据飞轮比AGI更关键

omarsar0

作者omarsar0发文称,越来越多的公司和开发者开始意识到强化学习带来的商业机会;他认为对许多真实世界任务而言,并不需要AGI,而是需要合适的专用模型、运行框架(harness)和数据飞轮,并表示一个富有成果的后训练新时代正在到来,这一趋势正在全栈AI公司中发生并将持续增长。文中还引述Vincent Weisser的观点称"后训练/RL与推理正在接管算力"。以上为作者观点,未经独立核实。

全部来源

前后事件

相关事件

Tinker下调长上下文价格最高70%,GLM-5.3-Flash与DeepSeek-v4.1-Flash上线

Tinker表示已将效率提升带来的成本节约转为用户降价,长上下文RL相关价格下调最高70%,长上下文prefill与采样现价与短上下文相同;GLM-5.3-Flash和DeepSeek-v4.1-Flash也已上线,面向高性价比长上下文任务。发帖者omarsar0评论称,这将降低agentic RL中长rollout的token成本,使专门化模型更实用。

omarsar0共 1 条来源

StepFun推出Step 5 Preview,上线次日登顶OpenRouter热门榜首

Step 5 Preview发布次日登上OpenRouter Trending榜首,已接入Kilo Code、Cline、Hermes Agent和OpenCode。omarsar0实测称其能自我检查、任务完成后停止,适合长时间自主运行的工程任务;模型为600B总参数、每token激活27B的稀疏MoE,上下文窗口达1M tokens,开放权重将于10月15日放出。

omarsar0共 1 条来源

StepFun Step 5 Preview发布次日登顶OpenRouter趋势榜,10月15日开放权重

StepFun的Step 5 Preview在发布一天后登上OpenRouter趋势榜榜首,已接入Kilo Code、Cline、Hermes Agent和OpenCode。转发者elvis称其能自查并在任务完成时停止,支持根据截图、原型或PRD生成可用网页,上下文窗口100万token、输出上限100万token,底层为600B总参数、每token激活27B的稀疏MoE;开放权重计划10月15日推出。

omarsar0共 1 条来源