DeepSeek v4.1 Flash实测:单M5 Max 128GB加载仅需8秒
DeepSeek v4.1 Flash(第二季度版本)在单颗M5 Max 128GB设备上运行时,加载程序从固态硬盘流式读取专家权重缓存到完整驻留编码器(50%)块仅用时8秒,这些块可轻松容纳在内存中。完成加载后,预填充速度可达到每秒800个token。
DwarfStart采用三层加载策略:对小型预填充任务,采用单token路径和专家缓存,类似解码过程;对较大型预填充任务,采用层主预填充,第N+1层的加载隐藏在第N层的处理过程中;对超大型预填充任务,则使用完整驻留编码器。开发者认为,该策略目前来看是最优的。
这套策略在合理的切换层级下才能良好运行。完整驻留解码器会覆盖专家缓存,但由于固态硬盘流式读取的新实现能够很好地隐藏加载延迟,仅需数秒就能完成补偿,因此影响不大。
核心结论是,采用共享键值缓存架构的DeepSeek v4.1 Flash编解码器不仅能在大语言模型预填充阶段减少计算量,还能在本地低内存推理配置下实现超大型预填充的高速运行。
不过,如果显卡算力不足(比如本次测试的M5 Max),完整驻留方案的速度可能不会比层主预填充更快,还会覆盖固态硬盘流式读取的专家缓存。因此第三层策略可能更适合DGX Spark平台,后续还需进一步验证。