← 返回

NEWS · 快讯

标签:推理加速

查看带有该精确标签的快讯。

订阅此筛选 RSS

共 1 条快讯 · 门户最近更新

llama.cpp 合并新 PR:Metal 内核覆盖 Mac GPU 全部 26 种权重格式,矩阵乘法最高提速 4.4 倍

作者称,其团队的又一 PR 被合并进 llama.cpp:此前周一发布的快速 Metal 内核原先只覆盖 10 种权重格式,本次 PR 补齐其余 16 种,使内核覆盖 Mac GPU 运行的全部 26 种权重格式,包括 BF16、MXFP4、Q2_K、Q3_K 及 IQ 系列量化格式。作者表示,在 M3 Ultra 上,当模型同时校验多个 token 时,矩阵乘法最高可提速 4.4 倍,并感谢 @ggerganov 提出需求并在一天内完成合并。相关 PR 见 ggml-org/llama.cpp/pull/30065(未独立核实)。

ggerganov查看原文 ↗

#推理加速 · AI快讯 · Portal