Liquid AI 发布 Open d1:两款开放权重多模态决策模型
Liquid AI 宣布推出 Open d1,包含其 d1 决策模型家族中的两款开放权重多模态模型:d1-3B 支持文本+视觉,d1-omni-600M 支持文本+图像或文本+音频。官方表示这些模型可实现实时决策,部署范围从 NVIDIA DGX 数据中心到 RTX 工作站再到 Jetson 边缘设备。
共 20 条快讯 · 门户最近更新
Liquid AI 宣布推出 Open d1,包含其 d1 决策模型家族中的两款开放权重多模态模型:d1-3B 支持文本+视觉,d1-omni-600M 支持文本+图像或文本+音频。官方表示这些模型可实现实时决策,部署范围从 NVIDIA DGX 数据中心到 RTX 工作站再到 Jetson 边缘设备。
团队表示,Liquid AI 今日发布 Open d1 系列,包含两个开源权重的多模态模型:d1-3B(文本+视觉)和 d1-omni-600M(文本+图像或文本+音频)。团队称这些模型支持实时决策,可从 NVIDIA DGX 数据中心部署到 RTX 工作站,再到 Jetson 边缘设备。
Liquid AI 宣布发布 Open d1,推出 d1 决策模型家族的两个开源权重多模态模型:d1-3B 支持文本加视觉,d1-omni-600M 支持文本加图像或文本加音频。官方称模型面向实时决策,可部署于从 NVIDIA DGX 数据中心、RTX 工作站到 Jetson 边缘设备等多种环境。转发者表示 d1-3B 在 RTX 4090 上据称延迟为 8 毫秒,并称其为"一次前向传播输出结果、零输出 token"的决策模型;这些性能数据来自作者转述,未经独立核实。
作者称在单张 RTX 3060(12GB 显存)上运行 Liquid AI 新发布的开源多模态决策模型 d1-3B:BoolQ 3,270 题全量验证集得分 88.4%(高于官方卡片 86.7),MMLU-Pro 12,032 题得分 44.5%,GPQA 29.8% 接近随机,与其知识是最弱项的定位一致;约 43ms p50 每次决策、每秒 21-23 次决策、占 5GB 显存。推文并引用 Liquid AI:Open d1 发布 d1-3B(文本+视觉)与 d1-omni-600M(文本+图像或文本+音频)两个开源权重模型。
作者称,其团队的又一 PR 被合并进 llama.cpp:此前周一发布的快速 Metal 内核原先只覆盖 10 种权重格式,本次 PR 补齐其余 16 种,使内核覆盖 Mac GPU 运行的全部 26 种权重格式,包括 BF16、MXFP4、Q2_K、Q3_K 及 IQ 系列量化格式。作者表示,在 M3 Ultra 上,当模型同时校验多个 token 时,矩阵乘法最高可提速 4.4 倍,并感谢 @ggerganov 提出需求并在一天内完成合并。相关 PR 见 ggml-org/llama.cpp/pull/30065(未独立核实)。
作者表示,Liquid AI 发布 Open d1 系列的两款开源权重多模态决策模型:d1-3B(文本 + 视觉)与 d1-omni-600M(文本 + 图像或文本 + 音频)。团队称模型可在多种环境进行实时决策,从 NVIDIA DGX 数据中心到 RTX 工作站再到 Jetson 边缘设备。
Liquid AI 宣布发布 Open d1,开放权重的 d1 决策模型家族中新增两个多模态模型:d1-3B 支持文本+视觉,d1-omni-600M 支持文本+图像或文本+音频。公司称这些模型支持实时决策,可在从 NVIDIA DGX 数据中心到 RTX 工作站再到边缘端 Jetson 的多种设备上运行。
作者称 Liquid AI 发布 Open d1 系列两个开放权重决策模型 d1-3B 与 d1-omni-600M,直接输出校准概率,输出 token 恒为 0。d1-3B 在 Decision Index v0.2.1 得 48.57,为 10B 以下最佳,超过 Decider 35B-A3B(47.11),但 Knowledge 项落后 Winnow-12B。单问题延迟 8–50 毫秒(视硬件而定)。以上为作者声称,未经独立核实。
作者介绍 Paradee TTS:称该模型由 Kokoro-82M 蒸馏而来,仅 8M 参数、单语音单语言权重约 9MB。作者表示它可在单条 CPU 线程上实现快于实时的语音合成,并已在 Hugging Face Spaces 上线演示。上述性能与规模均为作者及项目方表述,未经独立核实。
作者介绍名为 Paradee 的文本转语音(TTS)模型,称为对 Kokoro-82M 的蒸馏版本,参数量为 800 万、权重仅 9 MB,并声称可在单条 CPU 线程上实现快于实时的合成速度。模型已在 Hugging Face Spaces 上线。以上均为作者声称,未经独立核实。
作者援引 NVIDIA Robotics 的祝贺消息称,Liquid AI 推出 Open d1,包含两款开源权重决策模型,可在单次前向传播中给出答案,并支持在 NVIDIA Jetson Thor、Jetson AGX Orin 和 Orin Nano 上运行;NVIDIA 方面同时给出在 Jetson 上运行 d1-3B 模型的教程入口。
Liquid AI 宣布开源 Open d1 系列两个开放权重多模态决策模型:d1-3B 支持文本+视觉,d1-omni-600M 支持文本+图像或文本+音频。官方称这些模型可用于实时决策,部署范围从 NVIDIA DGX 数据中心到 RTX 工作站再到 Jetson 边缘设备。相关表述均为作者/团队声称,未经独立核实。
Liquid AI 宣布发布 Open d1:其 d1 决策模型家族中的两个开放权重多模态模型。官方称 d1-3B 支持文本+视觉,d1-omni-600M 支持文本+图像或文本+音频,可在从 NVIDIA DGX 数据中心、RTX 工作站到 Jetson 边缘设备上实时运行。转发者表示 d1-3B 小得可以在 MacBook 上运行,并用其为穿搭打分演示多模态视频输入,更多演示见其 Hugging Face Space(链接未展开)。
Aravind Srinivas 宣布开源 pplx-embed-v2-late,一对用于文本和图像的多向量(late-interaction)嵌入模型,提供 9B 和 0.6B 两种规模,并在同一共享嵌入空间中工作。作者称,可用 9B 模型索引多模态数据、再用 0.6B 模型在端侧查询,且无需 OCR 即可搜索 PDF 页面;他表示该模型在 MADQA 上得分 92.4%,在 BrowseComp+ 上得分 64%。权重已在 Hugging Face 上线。
作者称,AI 成本冲击已成为美国企业界的焦点话题。Fireworks 和 OpenRouter 等初创公司正在切入这一市场,通过开源模型帮助企业削减最高 90% 的成本。该内容为一篇福布斯报道的转发推介,"最高 90% 降本"为文中声称,未经独立核实。
作者 Rashi Shrivastava 在福布斯发布报道称,AI 成本冲击("sticker shock")已成为美国企业界的焦点话题,Fireworks 和 OpenRouter 等初创公司正介入其中,通过使用开源模型帮助企业将成本最高削减 90%。相关数字与结论均为作者报道内容,尚未独立核实。
作者转发 Lewis Tunstall 对 Beam 发布的评论,称其附图是发布中最重要的内容,并认为中国模型表现很好但 token 效率糟糕(作者建议用最大推理预算跑一次评测体会)。随附 Reflection 部分表示,Beam 在其模型类别中推理效率领先:比 GLM 5.2 效率高 3-4 倍,比领先的西方开源模型高 4 倍以上,意味着 Beam 能更快、更低成本地完成任务。以上效率和倍数均为原文/Reflection 部分的表述,未经独立核实。
作者称,一批新型初创公司正在涌现,帮助企业更智能、更低成本地使用AI,正转向开放的中国模型,并与OpenAI和Anthropic等巨头竞争。正文附有福布斯报道链接,未提供该趋势的具体数据或案例细节。
Command Code 宣布将在 SF Tech Week 期间参加由 Novita AI 主办的 "Open Source AI Stack: Models, Inference, and Agent Harness" 活动并设展。据主办方介绍,Command Code 是一款面向开源模型的编程代理,直接在终端中运行,并会随时间持续学习用户的编码偏好。推文还提到参展商包括 MiniMax,但相关介绍在正文中被截断。
作者宣布 EmbeddingGemma 2 发布,称其为首个基于 Gemma 4 构建的原生多模态嵌入模型,采用 Apache 2.0 许可。模型可将 100 多种语言及代码、图像、音频、视频嵌入同一向量,上下文 8,192,提供 740M 全模态、440M 文本+视觉、570M 文本+音频、270M 纯文本版本,作者称在 MTEB Code 上提升 14%,并已在 Sentence Transformers 和 LiteRT-LM 可用。