← 返回

NEWS · 快讯

标签:mxfp4

查看带有该精确标签的快讯。

订阅此筛选 RSS

共 3 条快讯 · 门户最近更新

llama.cpp 支持通过 ggml RPC 后端在异构设备间分布式推理

llama.cpp 作者 ggerganov 介绍,llama.cpp 可通过 ggml RPC 后端将推理分布到异构设备上,目前属于高级设置,但作者表示随着时间推移会让普通用户更容易上手。Pedro Cuenca 称,他能在 RTX 6000 GPU 和 M5 笔记本上联合运行 MiMo 2.6 Flash,通过 10 GbE 网络达到 40 tokens/sec,且使用的是该模型原生 mxfp4 权重,该能力在 llama.cpp 中开箱即用。

ggerganov查看原文 ↗

作者称可在 RTX 6000 与 M5 笔记本异构硬件上经 10 GbE 以 40 tokens/sec 运行 MiMo 2.6 Flash

Pedro Cuenca 转发帖称,他能通过 10 GbE 网络在 RTX 6000 GPU 与 M5 笔记本组成的异构硬件上以约 40 tokens/sec 运行 MiMo 2.6 Flash,使用的是该模型的原生 mxfp4 权重,并称 llama.cpp 开箱即支持此方案。上述性能数字与硬件组合均为作者个人声称,未获独立核实。

LysandreJik查看原文 ↗

#mxfp4 · AI快讯 · Portal