快讯事件 · 1 条来源
Liquid AI 发布 Open d1:两款开放权重多模态决策模型
Liquid AI 宣布推出 Open d1,包含其 d1 决策模型家族中的两款开放权重多模态模型:d1-3B 支持文本+视觉,d1-omni-600M 支持文本+图像或文本+音频。官方表示这些模型可实现实时决策,部署范围从 NVIDIA DGX 数据中心到 RTX 工作站再到 Jetson 边缘设备。
全部来源
前后事件
相关事件
Liquid AI 发布 Open d1:两款开放权重多模态模型
Liquid AI 表示今日发布 Open d1,为其 d1 决策模型家族中的两款开放权重多模态模型:d1-3B(文本+视觉)和 d1-omni-600M(文本+图像或文本+音频)。团队称这些模型支持实时决策,可从数据中心(如 NVIDIA DGX)到 RTX 工作站再到边缘端 Jetson 运行。转发的 Song 还提到在本地运行这些模型意味着从"看见世界"走向"实时与之交互",并点名 NVIDIA Robotics。
Liquid AI 发布 d1-omni-600M:可在浏览器内自动分类语音笔记的实验性多模态模型
Liquid AI 介绍其实验性模型 d1-omni-600M,用于文本+图像或文本+音频任务。团队表示,该模型由 LFM2.5-Encoder-350M 结合视觉与音频编码器构成,并在毒性检测和复述识别两项文本基准对比中领先。作者称,该模型可在约 160 毫秒内将语音内容自动归类为提醒、清单、消息、出行、问题或音乐,全程在浏览器中通过 WebGPU 运行,无需转录文本,仅输出结构化 JSON,语音数据不离开当前页面。模型已提供 Hugging Face 演示空间及 ONNX 版本(支持文本、视觉、音频)。
Liquid AI 发布 Open d1 系列开源多模态决策模型,覆盖 d1-3B 与 d1-omni-600M
Liquid AI 宣布发布 Open d1:d1 决策模型系列中的两个开源权重多模态模型。d1-3B 支持文本+视觉,d1-omni-600M 支持文本+图像或文本+音频。团队表示这些模型可在从 @nvidia DGX 数据中心到 RTX 工作站再到 Jetson 边缘设备上实现实时决策。转发者 Derya Unutmaz 称此类单次前向完成决策的模型对机器人、自主实验室、医疗设备和物理 AI 具有重大意义。
Liquid AI 发布 Open d1:两个开源多模态决策模型
团队表示,Liquid AI 今日发布 Open d1 系列,包含两个开源权重的多模态模型:d1-3B(文本+视觉)和 d1-omni-600M(文本+图像或文本+音频)。团队称这些模型支持实时决策,可从 NVIDIA DGX 数据中心部署到 RTX 工作站,再到 Jetson 边缘设备。
Liquid AI 发布 Open d1:两个开源多模态决策模型
Liquid AI 宣布发布 Open d1,推出 d1 决策模型家族的两个开源权重多模态模型:d1-3B 支持文本加视觉,d1-omni-600M 支持文本加图像或文本加音频。官方称模型面向实时决策,可部署于从 NVIDIA DGX 数据中心、RTX 工作站到 Jetson 边缘设备等多种环境。转发者表示 d1-3B 在 RTX 4090 上据称延迟为 8 毫秒,并称其为"一次前向传播输出结果、零输出 token"的决策模型;这些性能数据来自作者转述,未经独立核实。