Liquid AI 发布 d1-omni-600M:可在浏览器内自动分类语音笔记的实验性多模态模型
Liquid AI 介绍其实验性模型 d1-omni-600M,用于文本+图像或文本+音频任务。团队表示,该模型由 LFM2.5-Encoder-350M 结合视觉与音频编码器构成,并在毒性检测和复述识别两项文本基准对比中领先。作者称,该模型可在约 160 毫秒内将语音内容自动归类为提醒、清单、消息、出行、问题或音乐,全程在浏览器中通过 WebGPU 运行,无需转录文本,仅输出结构化 JSON,语音数据不离开当前页面。模型已提供 Hugging Face 演示空间及 ONNX 版本(支持文本、视觉、音频)。