Liquid AI 发布 Open d1:两个开源多模态决策模型
团队表示,Liquid AI 今日发布 Open d1 系列,包含两个开源权重的多模态模型:d1-3B(文本+视觉)和 d1-omni-600M(文本+图像或文本+音频)。团队称这些模型支持实时决策,可从 NVIDIA DGX 数据中心部署到 RTX 工作站,再到 Jetson 边缘设备。
共 9 条快讯 · 门户最近更新
团队表示,Liquid AI 今日发布 Open d1 系列,包含两个开源权重的多模态模型:d1-3B(文本+视觉)和 d1-omni-600M(文本+图像或文本+音频)。团队称这些模型支持实时决策,可从 NVIDIA DGX 数据中心部署到 RTX 工作站,再到 Jetson 边缘设备。
Liquid AI 宣布发布 Open d1,推出 d1 决策模型家族的两个开源权重多模态模型:d1-3B 支持文本加视觉,d1-omni-600M 支持文本加图像或文本加音频。官方称模型面向实时决策,可部署于从 NVIDIA DGX 数据中心、RTX 工作站到 Jetson 边缘设备等多种环境。转发者表示 d1-3B 在 RTX 4090 上据称延迟为 8 毫秒,并称其为"一次前向传播输出结果、零输出 token"的决策模型;这些性能数据来自作者转述,未经独立核实。
作者称在单张 RTX 3060(12GB 显存)上运行 Liquid AI 新发布的开源多模态决策模型 d1-3B:BoolQ 3,270 题全量验证集得分 88.4%(高于官方卡片 86.7),MMLU-Pro 12,032 题得分 44.5%,GPQA 29.8% 接近随机,与其知识是最弱项的定位一致;约 43ms p50 每次决策、每秒 21-23 次决策、占 5GB 显存。推文并引用 Liquid AI:Open d1 发布 d1-3B(文本+视觉)与 d1-omni-600M(文本+图像或文本+音频)两个开源权重模型。
Liquid AI 宣布发布 Open d1:其 d1 决策模型家族的两个开源权重多模态模型。团队表示,d1-3B 支持文本+视觉,d1-omni-600M 支持文本+图像或文本+音频;转发者称在 NVIDIA GeForce RTX 4090 上 8 毫秒即可完成决策,官方称可从 NVIDIA DGX 数据中心到 RTX 工作站再到 Jetson 边缘设备实现实时决策。
作者表示,Liquid AI 发布 Open d1 系列的两款开源权重多模态决策模型:d1-3B(文本 + 视觉)与 d1-omni-600M(文本 + 图像或文本 + 音频)。团队称模型可在多种环境进行实时决策,从 NVIDIA DGX 数据中心到 RTX 工作站再到 Jetson 边缘设备。
作者称 Liquid AI 发布 Open d1 系列两个开放权重决策模型 d1-3B 与 d1-omni-600M,直接输出校准概率,输出 token 恒为 0。d1-3B 在 Decision Index v0.2.1 得 48.57,为 10B 以下最佳,超过 Decider 35B-A3B(47.11),但 Knowledge 项落后 Winnow-12B。单问题延迟 8–50 毫秒(视硬件而定)。以上为作者声称,未经独立核实。
Aravind Srinivas 宣布开源 pplx-embed-v2-late,一对用于文本和图像的多向量(late-interaction)嵌入模型,提供 9B 和 0.6B 两种规模,并在同一共享嵌入空间中工作。作者称,可用 9B 模型索引多模态数据、再用 0.6B 模型在端侧查询,且无需 OCR 即可搜索 PDF 页面;他表示该模型在 MADQA 上得分 92.4%,在 BrowseComp+ 上得分 64%。权重已在 Hugging Face 上线。
Perplexity 宣布推出 pplx-embed-v2-late,两个 late-interaction 嵌入模型,可在共享嵌入空间中检索文本、图像和页面,并支持跨模态查询。团队表示两个模型均达到前沿性能(frontier performance),现已在 Hugging Face 公开发布。
DeepLearningAI 介绍,Google 的 Gemini 3.8 Live 模型采用语音到语音架构,在一个系统中完成聆听、推理和回应。推文称,Extended Thinking 版本在 Artificial Analysis 的 Speech to Speech Index 中排名第一;标准版在真人盲评现场对话中排名第二,输入音频价格为每小时 0.84 美元,为该指数最低。两个版本还支持图像和视频输入。