果核Pulse
📡 X 信号

开源35B参数MoE大模型,普通PC也能跑

很多人都给我留言同意我的看法:我们需要新的35B模型。Qwen3.6-35B之所以这么受欢迎,是因为它是一个MoE模型,我们很多人都有足够内存来卸载专家层,这让它能在我们的设备上运行。盼着它能重新火起来。

不过这篇推文不是说这件事,我是想回应我现在越来越常看到的一些疑问和担忧,澄清几个误解。

“你只能装得下低位量化,所以它基本上没法用。”这完全取决于你有多少内存,以及你怎么运行这个模型。我用自己的3060 + 64GB内存跑Qwen3.6-35B跑了很长时间。35B的Q4、Q5甚至Q6我都换着用,虽然很多人告诉我别用Q6,但我还是用了。我会根据任务和我需要的上下文长度来选择量化等级。

“你没法运行高上下文窗口”“你必须降低KV缓存”“你跑起来速度会非常慢,根本没法用”。让我通过解释我是怎么运行这个模型,以及我实际用它做了什么来回答这些问题。

从5月到7月,我用Qwen3.6-35B从头搭建了一个完整的Three.js开放世界游戏。我的主要目标是展示哪怕只有这个模型和3060,效果也能很好。对于这个编码工作流,我的要求是:
- KV缓存用q8_0
- 最小128k上下文。Pi + auto compact的效果非常好
- 20+ token/秒的解码速度。用了MTP之后,我能达到30-40 token/秒

那么我用的是什么量化等级?Q5或Q6。我根据需要切换量化等级,用我手头的硬件搞定了所有事情。顺便说,所有这些都记录在我的仓库里,里面Qwen-3.6-35B被提到了很多次。

真不敢相信ISTA-DASLab Qwen3.8-flash-next GSQ-RSO在HF上已经有140万次下载了。当之无愧。

我在我的3090 + 64GB RAM(IQ3_XXS)上跑它,在@coldniko Strata的帮助下,解码速度能达到50+ token/秒。

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

📬 订阅 果核Pulse

每日早间更新,不错过重要信号

▲ 回到顶部