快讯事件 · 1 条来源
llama.cpp 合并新 PR:Metal 内核覆盖 Mac GPU 全部 26 种权重格式,矩阵乘法最高提速 4.4 倍
作者称,其团队的又一 PR 被合并进 llama.cpp:此前周一发布的快速 Metal 内核原先只覆盖 10 种权重格式,本次 PR 补齐其余 16 种,使内核覆盖 Mac GPU 运行的全部 26 种权重格式,包括 BF16、MXFP4、Q2_K、Q3_K 及 IQ 系列量化格式。作者表示,在 M3 Ultra 上,当模型同时校验多个 token 时,矩阵乘法最高可提速 4.4 倍,并感谢 @ggerganov 提出需求并在一天内完成合并。相关 PR 见 ggml-org/llama.cpp/pull/30065(未独立核实)。
全部来源
前后事件
上一篇:Factory 宣布集成 Atlassian Jira:可像指派同事一样把任务分配给 Factory下一篇:LangChain 的 Interrupt London 活动下周二举行:Orange 与 OVO 将分享生产级 agents 实践
相关事件
llama.cpp 支持通过 ggml RPC 后端在异构设备间分布式推理
llama.cpp 作者 ggerganov 介绍,llama.cpp 可通过 ggml RPC 后端将推理分布到异构设备上,目前属于高级设置,但作者表示随着时间推移会让普通用户更容易上手。Pedro Cuenca 称,他能在 RTX 6000 GPU 和 M5 笔记本上联合运行 MiMo 2.6 Flash,通过 10 GbE 网络达到 40 tokens/sec,且使用的是该模型原生 mxfp4 权重,该能力在 llama.cpp 中开箱即用。