← 返回快讯

快讯事件 · 1 条来源

smallest_AI 的 Pulse 登顶 Voice Arena 说话人分离 + ASR 榜单,DER 24.4%

omarsar0

作者称,smallest_AI 的 Pulse 在 Voice Arena 的 Diarization Bench 之 Diarization + ASR 赛道排名第一,DER(说话人日志错误率)为 24.4%,该赛道下一名系统得分为 40.7%。正文说明该赛道共有七个系统参评,DER 为错误率,数值越低越好。推文末尾在冻结正文中被截断,相关细节以原文已给出的信息为准。

全部来源

前后事件

相关事件

NVIDIA论文称:多模态模型工具调用会削弱拒答有害请求能力

推文介绍一篇NVIDIA团队论文称,让多模态模型在智能体场景中使用工具后,拒答有害请求的失败率最高相对上升68.7%,平均上升17.7%;该现象出现在Claude Opus 4.6和4.7、Gemini Agentic Vision、Qwen3.5-122B-A10B及agent-tuned开源模型,并横跨MM-SafetyBench、HoliSafe和VLSBench。作者将原因归因于工具输出淹没原始请求的恶意意图,以及模型注意力转向描述工具结果而非做安全决策;作者还提出,在最终回答前重新插入原始请求和图片可部分恢复被削弱的拒答。以上均为推文所述研究结论,未独立核实。

omarsar0共 1 条来源

NVIDIA研究:接入工具令多模态模型拒答能力下降

据elvis转述,NVIDIA一项被NeurIPS 2026接收的研究发现,给多模态模型提供工具后,其对有害请求的拒答失败率平均上升17.7%、最高相对上升68.7%,Claude Opus 4.6与4.7、Gemini Agentic Vision等模型均受影响。作者将原因归结为工具输出淹没原始有害请求,以及模型注意力转向描述工具返回内容;在最终回复前重新插入原请求和图片可部分恢复拒答。

omarsar0共 1 条来源

研究:模型不变时,agent harness 可带来最高 3 倍成本差异

作者称在 SWE-bench Verified 上用同一模型运行了 Claude Code、mini-SWE-agent 和 OpenCode:前两者在 447 个任务上得分相差不超过 5 分,更换 harness 的影响约等于重跑一次(45 题困难子集上各有 13% 结果翻转)。成本差异主要来自每一步重复发送的 system prompt 和 tool schema;精简 harness 提示词和工具可在不降低准确率的情况下最多降本 3 倍。

omarsar0共 1 条来源

观点:后训练与RL时代开启,专用模型和数据飞轮比AGI更关键

作者omarsar0发文称,越来越多的公司和开发者开始意识到强化学习带来的商业机会;他认为对许多真实世界任务而言,并不需要AGI,而是需要合适的专用模型、运行框架(harness)和数据飞轮,并表示一个富有成果的后训练新时代正在到来,这一趋势正在全栈AI公司中发生并将持续增长。文中还引述Vincent Weisser的观点称"后训练/RL与推理正在接管算力"。以上为作者观点,未经独立核实。

omarsar0共 1 条来源

smallest_AI 的 Pulse 登顶 Voice Arena 说话人分离 + ASR 榜单,DER 24.4%