快讯事件 · 1 条来源
研究:模型不变时,agent harness 可带来最高 3 倍成本差异
作者称在 SWE-bench Verified 上用同一模型运行了 Claude Code、mini-SWE-agent 和 OpenCode:前两者在 447 个任务上得分相差不超过 5 分,更换 harness 的影响约等于重跑一次(45 题困难子集上各有 13% 结果翻转)。成本差异主要来自每一步重复发送的 system prompt 和 tool schema;精简 harness 提示词和工具可在不降低准确率的情况下最多降本 3 倍。
全部来源
前后事件
相关事件
微软发布Microsoft-Decision-1,聚焦快速决策任务
Satya Nadella介绍,Microsoft-Decision-1面向快速决策,在结构化决策任务上表现领先,并在延迟和质量上超过其他LLM及决策模型;omarsar0表示会将其纳入评估,并称一致性与复杂决策仍是此类模型的短板。
OpenAI Codex测试版新增composer predictions功能,向Pro用户开放
OpenAI Developers宣布,Codex面向Pro用户测试composer predictions功能,可根据对话内容及用户沟通方式建议下一条消息。发帖者omarsar0表示,其自研agent编排器中已有类似的预测工具,并使用Haiku、Luna等较小模型。
StepFun推出Step 5 Preview,上线次日登顶OpenRouter热门榜首
Step 5 Preview发布次日登上OpenRouter Trending榜首,已接入Kilo Code、Cline、Hermes Agent和OpenCode。omarsar0实测称其能自我检查、任务完成后停止,适合长时间自主运行的工程任务;模型为600B总参数、每token激活27B的稀疏MoE,上下文窗口达1M tokens,开放权重将于10月15日放出。
Meta超级智能实验室提出"智能体可塑性":按每美元学习收益衡量自我改进模型
Meta Superintelligence Labs的研究人员提出"agent plasticity"指标,在模型权重冻结、每次运行从全新上下文开始的条件下,衡量智能体在留出任务上每美元学习投入的得分增益。研究发现,表现最好的模型往往与学习效率最高的模型不同:在国际象棋、围棋和Hex中,Claude Fable 5取得最高最终得分,而GPT-5.6 Sol的单位美元增益最大;在NetHack中,仅Claude Opus 5.5显著提升66个归一化点,学习成本约1073美元。研究还发现,学习较慢的智能体常忽略自己已写下的产物,而学习更快的智能体会复用这些产物,但产物质量低时仍会失败。
Victor Riparbelli宣布Syren Video上线并可免费试用,支持提示词生成与对话式编辑
Victor Riparbelli表示,Syren Video现已上线并可免费试用:通过提示词生成视频、再以对话方式修改,由Opus 5.5和具备3D支持的Syren渲染器驱动,可在浏览器或通过Claude MCP使用。发帖者omarsar0称其可从素材库学习用户的图形、动作和剪辑节奏偏好,并表示正探索将其用于教育场景。