快讯事件 · 1 条来源
Sayak Paul 发布长文:flow 模型图像生成中的 KV 缓存
Hugging Face 转发 Sayak Paul 的署名文章。作者称该文提前于情人节发布,主题为 flow 模型图像生成中的 KV 缓存,内容包括直觉讲解、评论、实现细节、基准测试以及一些趣味实验。文章链接见原帖。
全部来源
前后事件
相关事件
JetBrains 发布 Mellum2.1:面向智能体编程工作流的开源代码模型
作者(Nikita Pavlichenko)宣布发布 Mellum2.1,称其为 6 月开源的 Mellum2 的重大更新,通过扩大 RL 后训练规模以支持智能体编程(agentic coding)工作流。作者表示该模型在与其速度相比的情况下取得智能体编程基准的最高分数,并已在 Hugging Face 和 GGUF 两种格式下开放权重,MTP 支持将在随后几天推出。
Liquid AI 发布 Open d1:两个开放权重多模态决策模型
Hugging Face 官方账号转发 Viviana Márquez 的消息:Liquid AI 宣布发布 Open d1,为其 d1 决策模型家族中的两个开放权重多模态模型。其中 d1-3B 支持文本+视觉,d1-omni-600M 支持文本+图像或文本+音频。团队表示这些模型可在 NVIDIA DGX 数据中心、RTX 工作站到 Jetson 边缘设备上实现实时决策。以上型号、能力与部署说法均来自作者/团队原文,未独立核实。
Liquid AI 发布 d1-3B 及实验性 d1-omni-600M 决策模型,支持本地部署
据 Liquid AI(经 Hugging Face 转发)介绍,该团队推出 d1-3B 决策模型,适用于高质量文本与视觉决策;另提供实验性的 d1-omni-600M,面向对资源占用敏感的场景。用户可下载模型权重,进行微调并在本地部署。相关资源包括官方博客、Hugging Face 权重页面及文档。
MiMo 2.6 Flash 实测:跨 RTX 6000 与 M5 笔记本异构运行,40 tokens/sec
作者 Pedro Cuenca 发文称,他可以在 RTX 6000 GPU 和 M5 笔记本电脑之间跨异构硬件运行 MiMo 2.6 Flash,速度达 40 tokens/sec,通过 10 GbE 连接。他称使用的是该模型的原生 mxfp4 权重,并已被 llama.cpp 开箱支持。以上为作者自述的实测结果,未经独立核实。
EmbeddingGemma 2 发布:基于 Gemma 4 的原生多模态嵌入模型
作者宣布 EmbeddingGemma 2 发布,称其为首个基于 Gemma 4 构建的原生多模态嵌入模型,采用 Apache 2.0 许可。模型可将 100 多种语言及代码、图像、音频、视频嵌入同一向量,上下文 8,192,提供 740M 全模态、440M 文本+视觉、570M 文本+音频、270M 纯文本版本,作者称在 MTEB Code 上提升 14%,并已在 Sentence Transformers 和 LiteRT-LM 可用。