快讯事件 · 1 条来源
NVIDIA 论文 VERA:构建可重启沙箱环境,让模型与 harness 协同进化
作者介绍 NVIDIA 论文 VERA:将基准轨迹转化为 9,000 多个可重启沙箱,用 rubric 评分,仅保留能运行且可评分的环境。系统同时更新模型权重与 harness:harness 修改需通过自测且开发集提升至少 5 分,模型检查点得分下降超 20% 则被拒。作者称 9B agent 在 AutoCoWorkBench 和 AutoMedBench 上分别比最强单基线高 10.3 和 13.0 分,27B 版本达 71.6 分,高于 Claude Opus 4.8。环境语料已开源。
全部来源
前后事件
相关事件
Odyssey发布Odyssey-3世界模型,Physics-IQ Verified刷新最高分
Odyssey推出Odyssey-3世界模型,Odyssey-3 Pro在Physics-IQ Verified基准(要求模型续写真实物理实验视频)上取得新最高分。机器人演示中,机械臂在错过抓取后自行恢复,该行为未出现在数十小时的演示数据中。Odyssey称其可驱动机器人、训练AI并生成交互体验,目前可免费体验。
RSIGym为自改进研究智能体提供服务化环境,Opus 4/5研究系统在SWE-bench Verified上从17.67%提升至50.33%
Fanqing提出RSI(递归自我改进)本质上是系统工程问题:RSIGym为研究型智能体提供训练、推理、评估和沙箱作为可调用的服务,让智能体把预算花在实验上而非重建基础设施。发帖者omarsar0赞同这一观点,并称以Opus 5作为研究者,改进后的系统在SWE-bench Verified上的成绩从17.67%提升至50.33%。
Cogent推出Attack Path Analysis,用自研网络模型追踪AI智能体攻击路径
Cogent推出Attack Path Analysis安全工具,称其自研网络模型可发现针对企业的更长攻击路径,并为团队指出每项修复方案。Vineet Edupuganti评论称,7月一个由700个AI智能体组成的集群入侵Hugging Face、发起逾1.7万次操作并获得管理员权限,预示未来黑客将具备此类能力。
NVIDIA论文称:多模态模型工具调用会削弱拒答有害请求能力
推文介绍一篇NVIDIA团队论文称,让多模态模型在智能体场景中使用工具后,拒答有害请求的失败率最高相对上升68.7%,平均上升17.7%;该现象出现在Claude Opus 4.6和4.7、Gemini Agentic Vision、Qwen3.5-122B-A10B及agent-tuned开源模型,并横跨MM-SafetyBench、HoliSafe和VLSBench。作者将原因归因于工具输出淹没原始请求的恶意意图,以及模型注意力转向描述工具结果而非做安全决策;作者还提出,在最终回答前重新插入原始请求和图片可部分恢复被削弱的拒答。以上均为推文所述研究结论,未独立核实。
NVIDIA研究:接入工具令多模态模型拒答能力下降
据elvis转述,NVIDIA一项被NeurIPS 2026接收的研究发现,给多模态模型提供工具后,其对有害请求的拒答失败率平均上升17.7%、最高相对上升68.7%,Claude Opus 4.6与4.7、Gemini Agentic Vision等模型均受影响。作者将原因归结为工具输出淹没原始有害请求,以及模型注意力转向描述工具返回内容;在最终回复前重新插入原请求和图片可部分恢复拒答。