快讯事件 · 1 条来源
作者称 Opus 5.5 等模型已能高效协同,自建编排器驱动约 8 个专业智能体的个人团队
作者自述其智能体实践演进:从单个 Claude Code 会话到多智能体系统,再到自研编排器下约 8 个专业智能体组成的持久化团队。作者称 Opus 5.5 等模型已能很好协同,并认为 Code、Claude Desktop 等应用落后但会追上,主张自建 agent 编排器获得个性化优势。以上为作者观点,未经独立核实。
全部来源
前后事件
相关事件
论文称HERMES harness使GPT-5.6 Sol整库迁移成功率从6.5%升至31.0%
elvis转述的该论文提出HERMES harness:为每个仓库组件配备了解自身代码与依赖的常驻LLM,并通过依赖感知步骤决定激活哪些组件、诊断步骤将测试失败映射回需修改的组件。论文作者称,在同一模型与effort设置下,以HERMES替换Codex使GPT-5.6 Sol的整库迁移成功率从6.5%升至31.0%;在四个软件工程基准上,其平均领先匹配的基线harness 12.4分,强激活与诊断模型下Qwen3-8B组件方案与全GPT-5.6 Sol配置差距在4.5分以内,并将Terminal-Bench 4.0推理成本降低26.2%。
谷歌FlowAgent:在代码评审流程中自动修复测试失败
谷歌论文提出FlowAgent,在CI中以ReAct式"生成-验证"循环处理预提交测试失败,并将修复展示在代码评审工具中;两道弃权过滤器分别在执行前后拦截弱建议。在195个真实失败的人工评审中,67.18%的修复正确;全公司上线后共为295,508个变更建议修复,开发者预览65,069个、采纳28,554个。
Odyssey发布Odyssey-3世界模型,Physics-IQ Verified刷新最高分
Odyssey推出Odyssey-3世界模型,Odyssey-3 Pro在Physics-IQ Verified基准(要求模型续写真实物理实验视频)上取得新最高分。机器人演示中,机械臂在错过抓取后自行恢复,该行为未出现在数十小时的演示数据中。Odyssey称其可驱动机器人、训练AI并生成交互体验,目前可免费体验。
RSIGym为自改进研究智能体提供服务化环境,Opus 4/5研究系统在SWE-bench Verified上从17.67%提升至50.33%
Fanqing提出RSI(递归自我改进)本质上是系统工程问题:RSIGym为研究型智能体提供训练、推理、评估和沙箱作为可调用的服务,让智能体把预算花在实验上而非重建基础设施。发帖者omarsar0赞同这一观点,并称以Opus 5作为研究者,改进后的系统在SWE-bench Verified上的成绩从17.67%提升至50.33%。
Cogent推出Attack Path Analysis,用自研网络模型追踪AI智能体攻击路径
Cogent推出Attack Path Analysis安全工具,称其自研网络模型可发现针对企业的更长攻击路径,并为团队指出每项修复方案。Vineet Edupuganti评论称,7月一个由700个AI智能体组成的集群入侵Hugging Face、发起逾1.7万次操作并获得管理员权限,预示未来黑客将具备此类能力。