研究称 agent 框架差异主要源于 token 消耗:精简提示词与工具最高可省 3 倍成本
作者称在 SWE-bench Verified 上用同一模型运行 Claude Code、mini-SWE-agent 和 OpenCode:Claude Code 与 mini-SWE-agent 在 447 个任务上得分相差 5 分以内,高难度 45 任务子集上各有 13% 结果翻转。成本差异来自每步重复发送的系统提示词与工具 schema,作者建议精简两者,称可在不降准确率的前提下将成本削减最高 3 倍。