快讯事件 · 1 条来源
作者称可在 RTX 6000 与 M5 笔记本异构硬件上经 10 GbE 以 40 tokens/sec 运行 MiMo 2.6 Flash
Pedro Cuenca 转发帖称,他能通过 10 GbE 网络在 RTX 6000 GPU 与 M5 笔记本组成的异构硬件上以约 40 tokens/sec 运行 MiMo 2.6 Flash,使用的是该模型的原生 mxfp4 权重,并称 llama.cpp 开箱即支持此方案。上述性能数字与硬件组合均为作者个人声称,未获独立核实。
全部来源
前后事件
上一篇:MiMo 2.6 Flash 实测:跨 RTX 6000 与 M5 笔记本异构运行,40 tokens/sec下一篇:LangChain 提醒:Harrison Chase 的 Interrupt London 主题演讲将于 10 月 13 日直播
相关事件
调查 11 个编程 harness:共 380 个集成工具,仅 124 个为独有
作者 younes 称,团队在探索如何改进 coding harness 的过程中,首先考察了各 harness 的集成工具情况:在 11 个 harness 中共发现 380 个工具,其中仅有 124 个是唯一的。作者表示将通过 thread 分享具体是哪些工具及相关发现。上述数字均为作者自述,尚未独立核实。
EmbeddingGemma 2 发布:740M 参数多模态嵌入模型,可在浏览器本地运行
作者转发 Xenova 的推文称,EmbeddingGemma 2 已在 Hugging Face 发布,可将文本、图像、视频和音频映射到统一的嵌入空间。据介绍,该模型仅有 740M 参数,可通过 Transformers.js 在浏览器中基于 WebGPU 完全本地运行。以上为作者/团队声称,未经独立核实。