果核Pulse
📡 X 信号

16GB统一内存M1 MacBook Pro成功部署通义千问27B大模型

开发者@Lonely__MH发布实测报告,在16GB统一内存的丐版M1 MacBook Pro上,成功本地部署Qwen 3.8-27B大模型。实测运行时模型输出速度较慢,呈现类似打字机的逐字输出效果,但模型推理能力正常。

本次部署的是经过Unsloth Dynamic 3.0 UD-Q2_K_XL量化压缩的模型,文件大小为9.15GB。模型全部网络层通过Metal框架卸载到GPU运行,内存占用稳定在11GB左右,首个Token输出延迟约850毫秒。

实测预填充速度为每秒10到12.5个Token,生成速度约为每秒4个Token。开启投机采样后,生成代码和结构化文本时,速度可提升到每秒5.5个Token以上。

M1芯片的运行瓶颈主要来自内存带宽,M1的内存带宽为每秒68GB,每生成一个Token都需要通读一遍9.15GB的模型权重,当前速度已经用满了M1物理带宽60%的极限。

Qwen 3.8原生自带深度思考链,可以根据场景切换模式:日常对话可以通过调参关闭思考,直接输出答案,输出体验更流畅;编写复杂算法时开启深度思考,仍能保证逻辑推导正常。

结论是老款M1 MacBook Pro还可以继续使用三年。测试演示视频经过2倍加速处理,完整参数可查看视频。

查看 X 原帖

📬 订阅 果核Pulse

每日早间更新,不错过重要信号

▲ 回到顶部