llama.cpp支持异构设备分布式推理:MiMo 2.6 Flash跨RTX 6000与M5笔记本运行
Georgi Gerganov介绍,llama.cpp可通过ggml RPC后端在异构设备上分布式推理,他预计该高级设置会逐步面向普通用户开放。Pedro Cuenca演示:通过10 GbE网络在RTX 6000 GPU与M5笔记本上以每秒40 tokens运行MiMo 2.6 Flash的原生mxfp4权重,开箱即用。
共 1 个事件 · 门户最近更新
Georgi Gerganov介绍,llama.cpp可通过ggml RPC后端在异构设备上分布式推理,他预计该高级设置会逐步面向普通用户开放。Pedro Cuenca演示:通过10 GbE网络在RTX 6000 GPU与M5笔记本上以每秒40 tokens运行MiMo 2.6 Flash的原生mxfp4权重,开箱即用。