← 返回

NEWS · 快讯

账号:@omarsar0

查看该账号发布的公开快讯。

订阅此筛选 RSS

共 11 条快讯 · 门户最近更新

NVIDIA论文称:多模态模型工具调用会削弱拒答有害请求能力

推文介绍一篇NVIDIA团队论文称,让多模态模型在智能体场景中使用工具后,拒答有害请求的失败率最高相对上升68.7%,平均上升17.7%;该现象出现在Claude Opus 4.6和4.7、Gemini Agentic Vision、Qwen3.5-122B-A10B及agent-tuned开源模型,并横跨MM-SafetyBench、HoliSafe和VLSBench。作者将原因归因于工具输出淹没原始请求的恶意意图,以及模型注意力转向描述工具结果而非做安全决策;作者还提出,在最终回答前重新插入原始请求和图片可部分恢复被削弱的拒答。以上均为推文所述研究结论,未独立核实。

omarsar0查看原文 ↗

研究:模型不变时,agent harness 可带来最高 3 倍成本差异

作者称在 SWE-bench Verified 上用同一模型运行了 Claude Code、mini-SWE-agent 和 OpenCode:前两者在 447 个任务上得分相差不超过 5 分,更换 harness 的影响约等于重跑一次(45 题困难子集上各有 13% 结果翻转)。成本差异主要来自每一步重复发送的 system prompt 和 tool schema;精简 harness 提示词和工具可在不降低准确率的情况下最多降本 3 倍。

omarsar0查看原文 ↗

观点:后训练与RL时代开启,专用模型和数据飞轮比AGI更关键

作者omarsar0发文称,越来越多的公司和开发者开始意识到强化学习带来的商业机会;他认为对许多真实世界任务而言,并不需要AGI,而是需要合适的专用模型、运行框架(harness)和数据飞轮,并表示一个富有成果的后训练新时代正在到来,这一趋势正在全栈AI公司中发生并将持续增长。文中还引述Vincent Weisser的观点称"后训练/RL与推理正在接管算力"。以上为作者观点,未经独立核实。

omarsar0查看原文 ↗

作者分享个人 Agent 团队实践:自建编排器驱动约8个专职 Bot 协同工作

作者称自己低估了 Opus 5.5 等模型的智能体协调能力,并回顾了约一年内个人设置的演进:从单独 Claude Code 会话,到子代理并行工作的多智能体系统,再到两个月前搭建的类似 Grok Bot 的持久化 Agent 团队——通过自有编排器管理约8个专职 Bot(CFO、CSO、CTO、CMO、CCO、CoS 等),一个月前又开始尝试带个人 Agent 的 agent-to-agent 通信。作者表示仍需在自动化、Webhook、系统提示词和工具等方面调优,并认为 Code、Claude Desktop 等应用“远远落后”但终会赶上,建议自建编排器。以上均为作者个人陈述,未经独立核实。

omarsar0查看原文 ↗

作者称 Opus 5.5 等模型已能高效协同,自建编排器驱动约 8 个专业智能体的个人团队

作者自述其智能体实践演进:从单个 Claude Code 会话到多智能体系统,再到自研编排器下约 8 个专业智能体组成的持久化团队。作者称 Opus 5.5 等模型已能很好协同,并认为 Code、Claude Desktop 等应用落后但会追上,主张自建 agent 编排器获得个性化优势。以上为作者观点,未经独立核实。

omarsar0查看原文 ↗

NVIDIA 论文 VERA:基准轨迹转为 9000+ 可重启沙箱,协同训练智能体模型与 harness

作者推荐 NVIDIA 论文 VERA,称其将基准轨迹转化为 9000 多个可重启沙箱并附评分 rubric,只保留可运行且能从可观察证据打分的环境,同时更新模型权重与 harness:harness 修改须通过自测且开发集提升至少 5 分才保留,模型 checkpoint 分数降超 20% 则拒绝。作者称 9B 协同演化智能体在 AutoCoWorkBench、AutoMedBench 上分别比最强单维基线高 10.3、13.0 分;27B 在 AutoCoWorkBench 得 71.6 分,高于 Claude Opus 4.8;环境语料已开源。以上为作者声称,未经独立核实。

omarsar0查看原文 ↗

NVIDIA 论文 VERA:构建可重启沙箱环境,让模型与 harness 协同进化

作者介绍 NVIDIA 论文 VERA:将基准轨迹转化为 9,000 多个可重启沙箱,用 rubric 评分,仅保留能运行且可评分的环境。系统同时更新模型权重与 harness:harness 修改需通过自测且开发集提升至少 5 分,模型检查点得分下降超 20% 则被拒。作者称 9B agent 在 AutoCoWorkBench 和 AutoMedBench 上分别比最强单基线高 10.3 和 13.0 分,27B 版本达 71.6 分,高于 Claude Opus 4.8。环境语料已开源。

omarsar0查看原文 ↗

smallest_AI 的 Pulse 登顶 Voice Arena 说话人分离 + ASR 榜单,DER 24.4%

作者称,smallest_AI 的 Pulse 在 Voice Arena 的 Diarization Bench 之 Diarization + ASR 赛道排名第一,DER(说话人日志错误率)为 24.4%,该赛道下一名系统得分为 40.7%。正文说明该赛道共有七个系统参评,DER 为错误率,数值越低越好。推文末尾在冻结正文中被截断,相关细节以原文已给出的信息为准。

omarsar0查看原文 ↗

作者推出 @dair_ai 的 MCP 工具,可接入 Codex/Claude/Grok Bot 检索 AI 论文

作者 @omarsar0 宣布为 @dair_ai 推出 MCP 工具,可连接 Codex、Claude 或 Grok Bot 来发现和探索 AI 论文。作者称索引收录了过去两年其在 X 上推荐过的论文,并经过人工精选;功能包括查找与总结论文、浏览 harness engineering 合集、生成文献综述、建立个人收藏和可视化论文等。作者表示将在未来几周随该工具发布若干基准,并持续推送更新与改进。

omarsar0查看原文 ↗

@omarsar0 · AI快讯 · Portal