← 返回

NEWS · 快讯

标签:多模态模型

查看带有该精确标签的快讯。

订阅此筛选 RSS

共 18 条快讯 · 门户最近更新

NVIDIA论文称:多模态模型工具调用会削弱拒答有害请求能力

推文介绍一篇NVIDIA团队论文称,让多模态模型在智能体场景中使用工具后,拒答有害请求的失败率最高相对上升68.7%,平均上升17.7%;该现象出现在Claude Opus 4.6和4.7、Gemini Agentic Vision、Qwen3.5-122B-A10B及agent-tuned开源模型,并横跨MM-SafetyBench、HoliSafe和VLSBench。作者将原因归因于工具输出淹没原始请求的恶意意图,以及模型注意力转向描述工具结果而非做安全决策;作者还提出,在最终回答前重新插入原始请求和图片可部分恢复被削弱的拒答。以上均为推文所述研究结论,未独立核实。

omarsar0查看原文 ↗

Liquid AI 发布 Open d1:两款开放权重多模态决策模型,可在边缘设备实时运行

Liquid AI 宣布发布 Open d1,即其 d1 决策模型家族中的两个开放权重多模态模型:d1-3B 支持文本与视觉,d1-omni-600M 支持文本加图像或文本加音频。官方称模型可实现"随时随地实时决策",部署范围从数据中心(如 NVIDIA DGX)、RTX 工作站到边缘端 Jetson 设备。转发者 Dmitry Sokolowski 称,新模型在小型 NVIDIA Jetson Orin Nano 上回答一个问题约需 50 毫秒,无需云端往返、决策在设备本地完成。

liquidai查看原文 ↗

Liquid AI 发布 Open d1 开放权重多模态模型:d1-3B 与 d1-omni-600M,覆盖边缘到数据中心

Liquid AI 宣布发布 Open d1 系列两款开放权重多模态模型:d1-3B 支持文本与视觉,实验性的 d1-omni-600M 仅 600M 参数,支持文本+图像或文本+音频输入。官方表示这些模型可在数据中心(如 NVIDIA DGX)、RTX 工作站和边缘端 Jetson 上实时决策。转发者称此类本地决策无需云端往返,且权重可自行微调。以上均为作者与官方声称,未经独立核实。

liquidai查看原文 ↗

Perplexity Decider v1.1 上线 OpenRouter:开放权重多模态决策模型

OpenRouter 称,Perplexity Decider v1.1 已上线 OpenRouter;该开放权重多模态决策模型可接收文本、JSON 或图像,并返回带概率的类型化答案,输入定价为 0.02 美元/百万 token,输出免费。Perplexity Developers 表示,更新后的 pplx-decider-v1.1-27b 已可用,并在新的 Hugging Face Decision Index 0.3 基准上得分最高;其输入价格较 v1 减半。

OpenRouter查看原文 ↗

Scale Labs 推出 Humanity’s Sixth Sense 视觉推理基准:人类得分 93.1%,最强模型仅 53.6%

Scale Labs 宣布推出名为 Humanity’s Sixth Sense(HSS)的新基准,用于测试日常依赖的直觉式视觉推理。据其介绍,该基准包含 522 个开放式任务,覆盖图像与视频,考察空间推理、因果推理到社会理解等能力。团队称人类平均得分为 93.1%,最强模型 GPT-6-astra 为 53.6%,而模型中位数仅 30.9%。上述数字与结论均为发布方自述,尚未独立核实。

scale_AI查看原文 ↗

Liquid AI 发布 Open d1:两个开放权重多模态决策模型

Hugging Face 官方账号转发 Viviana Márquez 的消息:Liquid AI 宣布发布 Open d1,为其 d1 决策模型家族中的两个开放权重多模态模型。其中 d1-3B 支持文本+视觉,d1-omni-600M 支持文本+图像或文本+音频。团队表示这些模型可在 NVIDIA DGX 数据中心、RTX 工作站到 Jetson 边缘设备上实现实时决策。以上型号、能力与部署说法均来自作者/团队原文,未独立核实。

huggingface查看原文 ↗

Liquid AI 开源 d1 系列两个多模态模型:3B 支持文本+视觉,600M 支持文本+图像/音频

Liquid AI 宣布发布 Open d1,开放权重的 d1 决策模型家族中新增两个多模态模型:d1-3B 支持文本+视觉,d1-omni-600M 支持文本+图像或文本+音频。公司称这些模型支持实时决策,可在从 NVIDIA DGX 数据中心到 RTX 工作站再到边缘端 Jetson 的多种设备上运行。

liquidai查看原文 ↗

开发者称 Liquid AI d1-omni 发布 47 分钟后即在浏览器中跑通

开发者 Jakub Chmura 表示,Liquid AI 发布 d1-omni 仅 47 分钟后,他便与 Claude 一起通过 ruNNtime 让该模型在浏览器中运行,并称其目标之一是让 AI 模型移植到浏览器的过程无摩擦且适合智能体操作。其转发的 Liquid AI 官方公告称,Open d1 系列包含两个开放权重多模态模型:d1-3B(文本+视觉)和 d1-omni-600M(文本+图像或文本+音频),官方称可覆盖从数据中心到 RTX 工作站再到 Jetson 边缘设备的实时决策场景。

liquidai查看原文 ↗

Liquid AI 发布 Open d1:两款开源权重多模态模型 d1-3B 与 d1-omni-600M

Liquid AI 宣布推出 Open d1,包含其 d1 决策模型家族的两款开源权重多模态模型:d1-3B 支持文本加视觉,d1-omni-600M 支持文本加图像或文本加音频。公司称这些模型可实现"实时决策",部署范围从 NVIDIA DGX 数据中心到 RTX 工作站再到 Jetson 边缘设备。转发者 Piotr Mazurek 表示该模型也已获得 sgl_project 的支持。

liquidai查看原文 ↗

Liquid AI 开源 d1 决策模型家族:d1-3B 视觉语言模型与 d1-omni-600M 多模态模型

Liquid AI 宣布开源 Open d1 系列两个开放权重多模态决策模型:d1-3B 支持文本+视觉,d1-omni-600M 支持文本+图像或文本+音频。官方称这些模型可用于实时决策,部署范围从 NVIDIA DGX 数据中心到 RTX 工作站再到 Jetson 边缘设备。相关表述均为作者/团队声称,未经独立核实。

liquidai查看原文 ↗

Liquid AI 发布 Open d1:d1-3B 与 d1-omni-600M 两个开放权重多模态决策模型

Liquid AI 宣布发布 Open d1:其 d1 决策模型家族中的两个开放权重多模态模型。官方称 d1-3B 支持文本+视觉,d1-omni-600M 支持文本+图像或文本+音频,可在从 NVIDIA DGX 数据中心、RTX 工作站到 Jetson 边缘设备上实时运行。转发者表示 d1-3B 小得可以在 MacBook 上运行,并用其为穿搭打分演示多模态视频输入,更多演示见其 Hugging Face Space(链接未展开)。

liquidai查看原文 ↗

#多模态模型 · AI快讯 · Portal