业内人士分析苹果MLX问题及端侧AI竞争格局
我对 MLX 的看法:(下文是很长的吐槽/我的个人观点)我认为苹果设备上的本地 AI 发展受阻,背后存在多个相互交织的问题。
1) 苹果缺乏实际投入(老问题了)。苹果甚至都没把 MLX 仓库放在自己的命名空间下。它是 Mac 设备上运行本地推理的主要方式,但自从 Awni 年初加入 Anthropic 后,MLX 基本上就被抛弃了,也没有做真正的工作交接。
苹果放任这么重要的项目陷入休眠,只维护模式、偶尔有几个小提交,没有真正的创新投入,说实话真的很不光彩。早在四月份 GGUF 出现之前,我就把 MTP 移植到了 Mac 上,当时还有另一个开发者 AirRunner 尝试把一个简单版本的 MTP 移植到 MLX LM。直到今天!这个提交都没合并进仓库。那个分支花了三个月的工作,至今都没合并。
Nvidia 受人喜爱不是因为硬件,是因为 CUDA 做得足够好。单论纯硬件算力,DeepSeek V4 flash 在 M3 Ultra 上不借助 D-Spark 应该也能跑到 80+ TPS,但现在只有 30-40 TPS。为什么?因为没有成熟的内核,MLX 就是蛮荒西部,像我这样的开发者只能自己写自定义内核,写了也永远不会被合并,最后只能变成独立项目。
Nvidia 大力投入并激励 CUDA 的生态发展,这就是为什么两块垃圾 DGX spark 跑 DeepSeek V4 flash 都比一块 M3 Ultra 快!两块 spark,不对,三块 spark 的总带宽,哪怕不算 RDMA TP 的延迟,都还不如一块 M3 Ultra。这太荒谬了。
这事可以和游戏类比:MacBook 本来完全能成为游戏巨兽,高效的 ARM 架构加上不错的 GPU,但苹果在吸引游戏工作室把游戏移植到 ARM 上做得糟透了。Nvidia 出 spark 笔记本的时候,发售当天就有 Bond、Fortnite 等多款游戏支持。因为 Jensen 明白生态合作的重要性,而苹果在这方面历来做得极差,也一直不重视。
如果苹果能正式接手 MLX,给项目配工程师,激励开发者,接受并审核贡献,MLX 肯定会比现在好得多。苹果现在居然低估软件和固件的重要性,真的让我惊讶。本地 AI 性价比最高的硬件,就因为糟糕的开发者关系和糟糕的落地被限制住了。
2) 硬件问题。浮点支持缺失。苹果设备没有低位浮点精度的硬件支持,而低比特浮点在低量化水平下保留精度的表现要好得多。这种支持 Nvidia 早在几年前就有了 FP8,现在已经出了 NVFP4。这个问题会在明年 M7 发布后得到解决。
现在开发者被迫手动调优单独的层,从 INT4 到 INT8 再到 BF16,才能同时保留质量和速度,避免模拟仿真带来的性能损耗。但也有不少开发者随便放出劣质量化,根本不在乎精度。我就犯过这个错:我用了 MLX 社区的 4 位平权量化做 3.6 Optimized Speed 的基底,那个量化的 KLD 差得离谱,结果永远给 MTPLX 留下了「质量更差」的坏名声。这也是资源不足导致的,想学这些东西真的不容易。Nvidia 会发布 NVFP4 的指南,还放出他们自己的 NVFP4 模型,苹果什么都不做。
最后总结:未来几年本地 AI 领域的走向会非常有意思。苹果和 Nvidia 各有各的劣势。苹果:AI 硬件和内存带宽都很棒,但固件、软件和内核都很差。Nvidia:纯算力很强,固件和内核都很棒,但硬件上吝啬小气,省了内存总线的钱,毁了带宽。
要么苹果升级开发者关系,投入资金改进生态,要么 Nvidia 不再吝啬,用上 512 位内存总线和/或更新的统一内存。谁先做到其中一件事,谁就能拿下本地 AI。
在我看来,AMD 的处境还要更糟。他们唯一的护城河就是价格,或者快速创新。带宽比 spark 还低,还没有 CUDA 带来的生态优势。他们的主要优势是,要么 A)大力打价格战,现在他们已经更便宜了,但我觉得还没便宜到值得放弃 spark 去买 Ryzen Halo 的程度;要么 B)创新,通过硬件、内核或固件,做出真正能提升用户体验的改进。他们做的第一件明智的事就是推出了 192GB 版本的 Halo。他们需要更多这样的想法才能有竞争力。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖