← 返回快讯

快讯事件 · 1 条来源

NVIDIA 论文 VERA:构建可重启沙箱环境,让模型与 harness 协同进化

omarsar0

作者介绍 NVIDIA 论文 VERA:将基准轨迹转化为 9,000 多个可重启沙箱,用 rubric 评分,仅保留能运行且可评分的环境。系统同时更新模型权重与 harness:harness 修改需通过自测且开发集提升至少 5 分,模型检查点得分下降超 20% 则被拒。作者称 9B agent 在 AutoCoWorkBench 和 AutoMedBench 上分别比最强单基线高 10.3 和 13.0 分,27B 版本达 71.6 分,高于 Claude Opus 4.8。环境语料已开源。

全部来源

前后事件

相关事件

Tinker下调长上下文价格最高70%,GLM-5.3-Flash与DeepSeek-v4.1-Flash上线

Tinker表示已将效率提升带来的成本节约转为用户降价,长上下文RL相关价格下调最高70%,长上下文prefill与采样现价与短上下文相同;GLM-5.3-Flash和DeepSeek-v4.1-Flash也已上线,面向高性价比长上下文任务。发帖者omarsar0评论称,这将降低agentic RL中长rollout的token成本,使专门化模型更实用。

omarsar0共 1 条来源

StepFun推出Step 5 Preview,上线次日登顶OpenRouter热门榜首

Step 5 Preview发布次日登上OpenRouter Trending榜首,已接入Kilo Code、Cline、Hermes Agent和OpenCode。omarsar0实测称其能自我检查、任务完成后停止,适合长时间自主运行的工程任务;模型为600B总参数、每token激活27B的稀疏MoE,上下文窗口达1M tokens,开放权重将于10月15日放出。

omarsar0共 1 条来源

StepFun Step 5 Preview发布次日登顶OpenRouter趋势榜,10月15日开放权重

StepFun的Step 5 Preview在发布一天后登上OpenRouter趋势榜榜首,已接入Kilo Code、Cline、Hermes Agent和OpenCode。转发者elvis称其能自查并在任务完成时停止,支持根据截图、原型或PRD生成可用网页,上下文窗口100万token、输出上限100万token,底层为600B总参数、每token激活27B的稀疏MoE;开放权重计划10月15日推出。

omarsar0共 1 条来源