果核Pulse
📡 X 信号

两年前用两台Mac跑大模型如今愿景成真 桌面本地AI实现

两年前,ExoLabs达成了首个重要里程碑:将两台MacBook集群化,成功运行Llama 405B大模型。当时行业普遍认为,运行这个规模的模型只能在数据中心完成,他们在消费级硬件,也就是两台M3 Max MacBook Pro上实现了这一点。

当时大多数人都觉得这只是噱头,模型运行速度仅为每秒2个token。但团队相信,软件、硬件和模型本身的改进会产生叠加效应。他们预判,几年后软件、硬件、模型各实现10倍提升,整体就能达到千倍性能,愿景是让前沿AI在个人桌面安静运行。

如今这个愿景成为现实。苹果M5 Ultra相比最初集群使用的M3 Max,性能实现了10倍跨越式提升。再结合雷电RDMA、MTP、更优内核等软件改进,以及Qwen 3.8 27B这类高密度智能模型,现在本地AI性能相比起步时已经提升了1000倍。

感谢苹果内部少数认同这个愿景的团队,他们早早推动了相关项目,目前才刚刚起步。借助M5 Ultra Mac Studio,用户可以在桌面获得API级速度的无限制token生成,边际成本几乎为零,运行安静功耗极低,几乎不会被察觉。本地AI现在已经足够好用。

特别致谢公开支持该项目的Gill Verd。他早在团队起步时就公开表态支持,没有从ExoLabs获得任何经济利益,也不持有任何股份。

查看 X 原帖

📬 订阅 果核Pulse

每日早间更新,不错过重要信号

▲ 回到顶部