← 返回

NEWS · 快讯

标签:论文

查看带有该精确标签的快讯。

订阅此筛选 RSS

共 4 条快讯 · 门户最近更新

研究称 agent 框架差异主要源于 token 消耗:精简提示词与工具最高可省 3 倍成本

作者称在 SWE-bench Verified 上用同一模型运行 Claude Code、mini-SWE-agent 和 OpenCode:Claude Code 与 mini-SWE-agent 在 447 个任务上得分相差 5 分以内,高难度 45 任务子集上各有 13% 结果翻转。成本差异来自每步重复发送的系统提示词与工具 schema,作者建议精简两者,称可在不降准确率的前提下将成本削减最高 3 倍。

dair_ai查看原文 ↗

研究:模型不变时,agent harness 可带来最高 3 倍成本差异

作者称在 SWE-bench Verified 上用同一模型运行了 Claude Code、mini-SWE-agent 和 OpenCode:前两者在 447 个任务上得分相差不超过 5 分,更换 harness 的影响约等于重跑一次(45 题困难子集上各有 13% 结果翻转)。成本差异主要来自每一步重复发送的 system prompt 和 tool schema;精简 harness 提示词和工具可在不降低准确率的情况下最多降本 3 倍。

omarsar0查看原文 ↗

NVIDIA 论文 VERA:基准轨迹转为 9000+ 可重启沙箱,协同训练智能体模型与 harness

作者推荐 NVIDIA 论文 VERA,称其将基准轨迹转化为 9000 多个可重启沙箱并附评分 rubric,只保留可运行且能从可观察证据打分的环境,同时更新模型权重与 harness:harness 修改须通过自测且开发集提升至少 5 分才保留,模型 checkpoint 分数降超 20% 则拒绝。作者称 9B 协同演化智能体在 AutoCoWorkBench、AutoMedBench 上分别比最强单维基线高 10.3、13.0 分;27B 在 AutoCoWorkBench 得 71.6 分,高于 Claude Opus 4.8;环境语料已开源。以上为作者声称,未经独立核实。

omarsar0查看原文 ↗

NVIDIA 论文 VERA:构建可重启沙箱环境,让模型与 harness 协同进化

作者介绍 NVIDIA 论文 VERA:将基准轨迹转化为 9,000 多个可重启沙箱,用 rubric 评分,仅保留能运行且可评分的环境。系统同时更新模型权重与 harness:harness 修改需通过自测且开发集提升至少 5 分,模型检查点得分下降超 20% 则被拒。作者称 9B agent 在 AutoCoWorkBench 和 AutoMedBench 上分别比最强单基线高 10.3 和 13.0 分,27B 版本达 71.6 分,高于 Claude Opus 4.8。环境语料已开源。

omarsar0查看原文 ↗

#论文 · AI快讯 · Portal