← 返回快讯

快讯事件 · 1 条来源

Liquid AI 发布 Open d1:两个开放权重多模态决策模型

liquidai

团队表示今日发布 Open d1,包含 d1-3B(文本 + 视觉)和 d1-omni-600M(文本 + 图像或文本 + 音频)两个开放权重多模态模型;并称其支持实时决策,可从 @nvidia DGX 数据中心扩展到 RTX 工作站及 Jetson 边缘设备。

全部来源

前后事件

相关事件

Liquid AI 发布 Open d1:两款开放权重多模态模型

Liquid AI 表示今日发布 Open d1,为其 d1 决策模型家族中的两款开放权重多模态模型:d1-3B(文本+视觉)和 d1-omni-600M(文本+图像或文本+音频)。团队称这些模型支持实时决策,可从数据中心(如 NVIDIA DGX)到 RTX 工作站再到边缘端 Jetson 运行。转发的 Song 还提到在本地运行这些模型意味着从"看见世界"走向"实时与之交互",并点名 NVIDIA Robotics。

liquidai共 1 条来源

Liquid AI 发布 d1-omni-600M:可在浏览器内自动分类语音笔记的实验性多模态模型

Liquid AI 介绍其实验性模型 d1-omni-600M,用于文本+图像或文本+音频任务。团队表示,该模型由 LFM2.5-Encoder-350M 结合视觉与音频编码器构成,并在毒性检测和复述识别两项文本基准对比中领先。作者称,该模型可在约 160 毫秒内将语音内容自动归类为提醒、清单、消息、出行、问题或音乐,全程在浏览器中通过 WebGPU 运行,无需转录文本,仅输出结构化 JSON,语音数据不离开当前页面。模型已提供 Hugging Face 演示空间及 ONNX 版本(支持文本、视觉、音频)。

liquidai共 1 条来源

Liquid AI 发布 Open d1 系列开源多模态决策模型,覆盖 d1-3B 与 d1-omni-600M

Liquid AI 宣布发布 Open d1:d1 决策模型系列中的两个开源权重多模态模型。d1-3B 支持文本+视觉,d1-omni-600M 支持文本+图像或文本+音频。团队表示这些模型可在从 @nvidia DGX 数据中心到 RTX 工作站再到 Jetson 边缘设备上实现实时决策。转发者 Derya Unutmaz 称此类单次前向完成决策的模型对机器人、自主实验室、医疗设备和物理 AI 具有重大意义。

liquidai共 1 条来源