← 返回

NEWS · 快讯

标签:多模态

查看带有该精确标签的快讯。

订阅此筛选 RSS

共 9 条快讯 · 门户最近更新

Liquid AI 发布 Open d1:两个开源多模态决策模型

Liquid AI 宣布发布 Open d1,推出 d1 决策模型家族的两个开源权重多模态模型:d1-3B 支持文本加视觉,d1-omni-600M 支持文本加图像或文本加音频。官方称模型面向实时决策,可部署于从 NVIDIA DGX 数据中心、RTX 工作站到 Jetson 边缘设备等多种环境。转发者表示 d1-3B 在 RTX 4090 上据称延迟为 8 毫秒,并称其为"一次前向传播输出结果、零输出 token"的决策模型;这些性能数据来自作者转述,未经独立核实。

liquidai查看原文 ↗

实测:RTX 3060 单卡跑 Liquid AI 开源模型 d1-3B,BoolQ 88.4%、MMLU-Pro 44.5%

作者称在单张 RTX 3060(12GB 显存)上运行 Liquid AI 新发布的开源多模态决策模型 d1-3B:BoolQ 3,270 题全量验证集得分 88.4%(高于官方卡片 86.7),MMLU-Pro 12,032 题得分 44.5%,GPQA 29.8% 接近随机,与其知识是最弱项的定位一致;约 43ms p50 每次决策、每秒 21-23 次决策、占 5GB 显存。推文并引用 Liquid AI:Open d1 发布 d1-3B(文本+视觉)与 d1-omni-600M(文本+图像或文本+音频)两个开源权重模型。

liquidai查看原文 ↗

Liquid AI 发布 Open d1 系列两个开源权重多模态决策模型

Liquid AI 宣布发布 Open d1:其 d1 决策模型家族的两个开源权重多模态模型。团队表示,d1-3B 支持文本+视觉,d1-omni-600M 支持文本+图像或文本+音频;转发者称在 NVIDIA GeForce RTX 4090 上 8 毫秒即可完成决策,官方称可从 NVIDIA DGX 数据中心到 RTX 工作站再到 Jetson 边缘设备实现实时决策。

liquidai查看原文 ↗

Liquid AI 发布 Open d1:零输出 Token 的开放权重决策模型

作者称 Liquid AI 发布 Open d1 系列两个开放权重决策模型 d1-3B 与 d1-omni-600M,直接输出校准概率,输出 token 恒为 0。d1-3B 在 Decision Index v0.2.1 得 48.57,为 10B 以下最佳,超过 Decider 35B-A3B(47.11),但 Knowledge 项落后 Winnow-12B。单问题延迟 8–50 毫秒(视硬件而定)。以上为作者声称,未经独立核实。

liquidai查看原文 ↗

Perplexity 开源 pplx-embed-v2-late 多向量嵌入模型,支持文本与图像共享嵌入空间检索

Aravind Srinivas 宣布开源 pplx-embed-v2-late,一对用于文本和图像的多向量(late-interaction)嵌入模型,提供 9B 和 0.6B 两种规模,并在同一共享嵌入空间中工作。作者称,可用 9B 模型索引多模态数据、再用 0.6B 模型在端侧查询,且无需 OCR 即可搜索 PDF 页面;他表示该模型在 MADQA 上得分 92.4%,在 BrowseComp+ 上得分 64%。权重已在 Hugging Face 上线。

ClementDelangue查看原文 ↗

Google Gemini 3.8 Live 端到端语音模型亮相

DeepLearningAI 介绍,Google 的 Gemini 3.8 Live 模型采用语音到语音架构,在一个系统中完成聆听、推理和回应。推文称,Extended Thinking 版本在 Artificial Analysis 的 Speech to Speech Index 中排名第一;标准版在真人盲评现场对话中排名第二,输入音频价格为每小时 0.84 美元,为该指数最低。两个版本还支持图像和视频输入。

DeepLearningAI查看原文 ↗

#多模态 · AI快讯 · Portal