NVIDIA 研究团队推出 PivotOPD:教 AI agent 避免早期错误并自我恢复
NVIDIA AI 官方账号发文介绍其研究团队提出的 PivotOPD 方法。据正文,该方法针对 AI agent 在任务早期犯错后一路沿错误方向继续的问题,在训练过程中由教师模型向 agent 展示更好的动作,并演示如何在后续几步内回到正确轨道。推文附论文与演示链接。
共 2 条快讯 · 门户最近更新
NVIDIA AI 官方账号发文介绍其研究团队提出的 PivotOPD 方法。据正文,该方法针对 AI agent 在任务早期犯错后一路沿错误方向继续的问题,在训练过程中由教师模型向 agent 展示更好的动作,并演示如何在后续几步内回到正确轨道。推文附论文与演示链接。
作者推荐 NVIDIA 论文 VERA,称其将基准轨迹转化为 9000 多个可重启沙箱并附评分 rubric,只保留可运行且能从可观察证据打分的环境,同时更新模型权重与 harness:harness 修改须通过自测且开发集提升至少 5 分才保留,模型 checkpoint 分数降超 20% 则拒绝。作者称 9B 协同演化智能体在 AutoCoWorkBench、AutoMedBench 上分别比最强单维基线高 10.3、13.0 分;27B 在 AutoCoWorkBench 得 71.6 分,高于 Claude Opus 4.8;环境语料已开源。以上为作者声称,未经独立核实。