← 返回快讯

快讯事件 · 1 条来源

作者推出 @dair_ai 的 MCP 工具,可接入 Codex/Claude/Grok Bot 检索 AI 论文

omarsar0

作者 @omarsar0 宣布为 @dair_ai 推出 MCP 工具,可连接 Codex、Claude 或 Grok Bot 来发现和探索 AI 论文。作者称索引收录了过去两年其在 X 上推荐过的论文,并经过人工精选;功能包括查找与总结论文、浏览 harness engineering 合集、生成文献综述、建立个人收藏和可视化论文等。作者表示将在未来几周随该工具发布若干基准,并持续推送更新与改进。

全部来源

前后事件

相关事件

谷歌FlowAgent:在代码评审流程中自动修复测试失败

谷歌论文提出FlowAgent,在CI中以ReAct式"生成-验证"循环处理预提交测试失败,并将修复展示在代码评审工具中;两道弃权过滤器分别在执行前后拦截弱建议。在195个真实失败的人工评审中,67.18%的修复正确;全公司上线后共为295,508个变更建议修复,开发者预览65,069个、采纳28,554个。

omarsar0共 1 条来源

Odyssey发布Odyssey-3世界模型,Physics-IQ Verified刷新最高分

Odyssey推出Odyssey-3世界模型,Odyssey-3 Pro在Physics-IQ Verified基准(要求模型续写真实物理实验视频)上取得新最高分。机器人演示中,机械臂在错过抓取后自行恢复,该行为未出现在数十小时的演示数据中。Odyssey称其可驱动机器人、训练AI并生成交互体验,目前可免费体验。

omarsar0共 1 条来源

RSIGym为自改进研究智能体提供服务化环境,Opus 4/5研究系统在SWE-bench Verified上从17.67%提升至50.33%

Fanqing提出RSI(递归自我改进)本质上是系统工程问题:RSIGym为研究型智能体提供训练、推理、评估和沙箱作为可调用的服务,让智能体把预算花在实验上而非重建基础设施。发帖者omarsar0赞同这一观点,并称以Opus 5作为研究者,改进后的系统在SWE-bench Verified上的成绩从17.67%提升至50.33%。

omarsar0共 1 条来源