果核Pulse
📡 X 信号

主流大模型跑分不适用消费级本地运行的玩家

3090(或显存24GB)用户,这条内容是为你们准备的!我已经消耗了足够多的token,花了足够多的时间在我的3090上对比测试了新款Qwen3.8-Flash-Next和Qwen3.8-27B,现在我可以很自信地说清楚哪个模型适合什么场景,以及什么时候该用哪个。

哪怕用我能塞进去运行的更低量化等级,相同量化等级下Qwen3.8-Flash-Next的表现确实比Qwen3.8-27B更好。这点毫无疑问。

如果是 overnight 或是长时间运行的任务,你更看重质量而非速度,那就把这些任务交给Qwen3.8-Flash-Next。

如果是快速迭代任务,你需要平均40t/s的解码速度,还有700t/s的快速预填充,那就选Qwen3.8-27B。

如果你选择只留用27B,你也不会错过太多,至少在我们得到搭配MTP、DFLASH2和其他量化方案等优化更好的Qwen3.8-Flash-Next运行版本之前是这样。

太长不看版:不,这就是我为什么要自己做基准测试和评估的原因。所有主流基准测试都是以最大权重或全权重运行模型的。我们这些玩本地大语言模型的人是在消费级硬件上跑量化版本。不是所有人都能跑FP8。趋势是对得上的,但原始数值并不对……

所以我在自己的硬件上搭建并运行了自己的基准测试和评估,然后把我得到的所有结果分享给这里很棒的社区。这就是我们有@LottoLabs Localmaxxing的主要原因😎

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

📬 订阅 果核Pulse

每日早间更新,不错过重要信号

▲ 回到顶部