有人刚抱着M5 Max蹲完Ollama升级,转头就刷到了新的速度记录。
开发者团队Inco AI发布了面向Apple Silicon开发的开源推理引擎Inco Splash,在M5 Max上运行通义千问Qwen3.8-27B模型,能达到144 tok/s(每秒输出token数,一个token大概对应0.75个汉字)的解码速度。
对比目前主流方案,Splash的速度可达Ollama的3倍、oMLX的2倍,在AI代理拆分子代理的多任务场景下,速度更是接近原来的4倍。
@inco_ai 认为:这是专门为苹果芯片和大模型重构的推理引擎,而非通用适配。
@lmstudio 表示:已经和Inco AI合作,在LM Studio中第一天就上架了Splash引擎,用户现在就能下载体验。
就在一个月前,同一款芯片同一款模型,最好成绩还是DFlash 2跑出的70 tok/s,现在速度直接翻了一倍。这个成绩放在三个月前,Ollama切换MLX框架后同芯片跑出的最好成绩是112 tok/s,比Splash慢了22%。
2026年苹果硅端侧大模型推理生态已经不再是早期实验阶段:MLX框架达到生产成熟度,Ollama已经切换到MLX后端,vLLM也有适配版本。现在Splash又把速度推到了新高度。
对于需要在Mac本地运行大模型做开发、跑工作流的人来说,同样配置下能获得更快的输出速度,多任务场景下体验提升更明显。
现在开源社区已经把推理速度卷到这个程度,下一个突破会是功耗优化吗?