← 返回快讯

快讯事件 · 1 条来源

DAIR.AI 推出 MCP 工具,可接入 Codex / Claude Code / Grok Bot 浏览精选 AI 论文

dair_ai

DAIR.AI(@dair_ai)作者 elvis 宣布推出一套新的 MCP 工具:将其接入 Codex、Claude Code 或 Grok Bot 后,即可发现与浏览每周精选的顶级 AI 论文。作者称论文经过团队精心筛选,索引收录了过去数年间其在 X 上推荐过的全部论文。以上为团队自述,未独立核实。

全部来源

前后事件

相关事件

NVIDIA论文:用“决定性编辑”预测基座模型后训练后的编码智能体表现

NVIDIA一篇论文提出在为编码智能体做后训练之前,对基座模型checkpoint进行排名的新方法。研究者指出基座模型难以直接在智能体编码任务上评估:六个基座模型在SWE-bench Verified上运行,五个解决的任务数为零。新方法改为回放强后训练智能体的代码编辑步骤,找到让测试通过的“决定性编辑”,再考察基座模型能否写出或识别该修复。三种评分方式在十组基座与后训练模型对上,与后训练的SWE-bench Verified得分高度吻合。

dair_ai共 1 条来源

研究称 agent 框架差异主要源于 token 消耗:精简提示词与工具最高可省 3 倍成本

作者称在 SWE-bench Verified 上用同一模型运行 Claude Code、mini-SWE-agent 和 OpenCode:Claude Code 与 mini-SWE-agent 在 447 个任务上得分相差 5 分以内,高难度 45 任务子集上各有 13% 结果翻转。成本差异来自每步重复发送的系统提示词与工具 schema,作者建议精简两者,称可在不降准确率的前提下将成本削减最高 3 倍。

dair_ai共 1 条来源

Google 与 MIT 报告推出 Coco:面向软硬件协同设计的智能体平台

dair_ai 援引 Google 与 MIT 的报告介绍 Coco——一个供 TPU 架构师用于硬件与模型协同设计的智能体平台。报告称,每次设计决策依赖数百 GB 训练前未见过的全新仿真扫描数据;Coco 将每次扫描登记到规范化的关系数据库中,智能体报告的每个数字均可通过 SQL 查询溯源。智能体可自主组合类型化工具、运行对比相同执行配置下系统等重复性分析,并读取 UI 导航状态作为上下文。报告称短期目标是将架构师搭建仿真和获取洞察的时间减半。论文链接:arxiv.org/abs/2610.02376。

dair_ai共 1 条来源