快讯事件 · 1 条来源
研究称 agent 框架差异主要源于 token 消耗:精简提示词与工具最高可省 3 倍成本
作者称在 SWE-bench Verified 上用同一模型运行 Claude Code、mini-SWE-agent 和 OpenCode:Claude Code 与 mini-SWE-agent 在 447 个任务上得分相差 5 分以内,高难度 45 任务子集上各有 13% 结果翻转。成本差异来自每步重复发送的系统提示词与工具 schema,作者建议精简两者,称可在不降准确率的前提下将成本削减最高 3 倍。
全部来源
前后事件
上一篇:LangChain Interrupt London下周二举行,设Deep Agents与Engine实践工作坊下一篇:研究:模型不变时,agent harness 可带来最高 3 倍成本差异
相关事件
DAIR.AI发布递归自我改进(RSI)研究论文合集
DAIR.AI发布新的递归自我改进(RSI)研究论文合集,供读者追踪该领域的重要研究。其引述elvis的观点称,RSI是当前AI最热门的话题之一,目前仍处于早期阶段。
DAIR.AI 推出 MCP 工具,可接入 Codex / Claude Code / Grok Bot 浏览精选 AI 论文
DAIR.AI(@dair_ai)作者 elvis 宣布推出一套新的 MCP 工具:将其接入 Codex、Claude Code 或 Grok Bot 后,即可发现与浏览每周精选的顶级 AI 论文。作者称论文经过团队精心筛选,索引收录了过去数年间其在 X 上推荐过的全部论文。以上为团队自述,未独立核实。
Google 与 MIT 报告推出 Coco:面向软硬件协同设计的智能体平台
dair_ai 援引 Google 与 MIT 的报告介绍 Coco——一个供 TPU 架构师用于硬件与模型协同设计的智能体平台。报告称,每次设计决策依赖数百 GB 训练前未见过的全新仿真扫描数据;Coco 将每次扫描登记到规范化的关系数据库中,智能体报告的每个数字均可通过 SQL 查询溯源。智能体可自主组合类型化工具、运行对比相同执行配置下系统等重复性分析,并读取 UI 导航状态作为上下文。报告称短期目标是将架构师搭建仿真和获取洞察的时间减半。论文链接:arxiv.org/abs/2610.02376。