开发者分享适用于64GB MacBook本地推理的Qwen方案设计
510亿n-gram可存储在SSD盘中,采用2位量化的Qwen 3.8 Flash Next,或许是在64GB容量MacBook上获得顶级本地推理体验的最佳DwarfStar方案。antirez表示已知晓@ivanfioravanti会抽出时间跟进这项实现,静待后续进展。
Qwen 3.8 Flash Next的n-gram机制会在第二层利用一张510亿参数的表和一个门控单元,丰富当前的token表征。第一层处理完成的时间,足够从SSD中读出16个小向量,隐藏了加载等待时间。
这种设计的思路是为模型主干节省大量权重,原本主干需要存储如何处理“纽约”“计算机科学”“三体问题”这类关联文本的信息。从510亿参数数据库中检索出的约2500个向量为稀疏结构,用于处理冲突问题。
具体流程为:第一层处理时,提取最近的两个和三个token,从n-gram表中获取16个小向量,再将它们组合成一个更大的向量,经过门控处理后,用于在第二层丰富当前token的表征。
这样一来,“纽约”短语中的“约克”token,会被“新+约克”的语义嵌入丰富,让后续层可以更直接地处理这个更高层级的概念。
理解这个设计作用的一种方式:试想大语言模型如果把输入序列拆成单个字符处理,第一层就要消耗大量空间和算力,才能把a、p、p、l、e组合成“apple”的语义,学习过的嵌入可以解决这个问题。
现在,学习过的n-gram在更高层级完成同样的工作,就像刚才例子里单个字符对应单个token一样。这种机制针对大量常见的两token组和三token组生效。由于二元组、尤其是三元组数量过多,索引时使用了压缩哈希处理。
这些概念本身并不复杂。但现在即便是论文,也几乎从来不用简单的方式解释内容,哪怕底层思路其实很简单。似乎没人在意这一点,但antirez希望Opus 5行话带来的反感能给实验室们一点教训。