果核Pulse
📡 X 信号

oMLX 0.7.0rc1发布,苹果M5 Max运行大模型更快

oMLX 0.7.0rc1 已发布!这个版本带来了更快的 Qwen 预填与生成、MiMo V2.6、Ternary Bonsai 2,以及部分块缓存。

DFlash 现在可以同时处理并发请求,Lightning MTP 实现了更快的批量解码!

以下是在搭载 128 GB 内存的 M5 Max 上的性能表现(预填,oQ4e 量化):Qwen3.8-Flash-Next 在 16K 上下文下,从 1,522 tok/s 提升至 2,007 tok/s(+32%)。

(解码,批量大小=4,oQ4e 量化)
- 搭配 DFlash2 的 Qwen3.8-27B:56.9 -> 131.5 tok/s(+131%)
- 搭配 Lightning MTP 的 Qwen3.8-27B:88.9 -> 136.9 tok/s(+54%)

完整基准测试细节请查看发布说明。

新模型与新功能:
- 由 @ashxhart 贡献,支持 Mac + CUDA 部署的 MCDMA RDMA。
- 部分块缓存。无需因为数千个 token 没有填满完整缓存块而重新处理它们。在一次测试中,下一轮预填从 1,174 个 token 降至 37 个。
- Ternary Bonsai 2 支持文本和视觉。
- MiMo V2.6 支持图像、视频和音频理解,此外针对兼容检查点提供 Lightning MTP 和 DFlash。
- 更广泛的 MoE 专家卸载,包含 DeepSeek V4.1 和 GLM-5.3-Flash 的专家卸载,搭配 Lightning MTP。

这个 RC 版本还包含了开发版中的改进,包括 Cluster v2、来自社区基准测试的一键模型设置,以及可自定义控制面板。

GDN 预填内核改编自 @ddalcu 出色的 mlx-serve!
经过短暂测试后,我会发布稳定版并继续推进开发!

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

📬 订阅 果核Pulse

每日早间更新,不错过重要信号

▲ 回到顶部