270亿参数大模型在16GB显存RTX 5070 Ti本地运行生成游戏
参数规模270亿、上下文窗口96K的大模型,在一块显存16GB的RTX 5070 Ti上以每秒75个token的速度本地生成了一个实际可运行的游戏。这不是性能基准测试,而是一个能正常运行的村民模拟游戏。
本次运行的硬件与配置环境如下:显卡为16GB显存的RTX 5070 Ti,使用Qwen3.8-27B模型,格式为UD-Q3_K_XL GGUF,全部运算卸载至GPU完成,采用beellama.cpp加上Kvarn优化,多令牌预测(MTP)n=2,使用Kvarn3键值缓存,上下文长度为96256。生成速度最高可达每秒75个token,预填充速度最高可达每秒1700个token,运行系统为Windows。
模型逐步生成了一个基于浏览器的村庄模拟,包含房屋建筑、天气与季节变化、昼夜循环、饥饿机制、资源系统、村民死亡机制、障碍物避让、自动寻路村民等功能。
用户特意选择Q3_K_XL量化模型+高度压缩的键值缓存,让整个27B模型、多令牌预测和约96K上下文都能容纳在16GB显存中,不需要把权重溢出到CPU存储。
用户认为,当不选择量化就只能把运算卸载到CPU并导致速度大幅下降时,不需要畏惧Q3量化模型或是激进的键值量化。
本次运行使用的是beellama.cpp/Kvarn,并非标准版llama.cpp。相关讨论可查看Reddit板块LocalLLaMA的对应帖子。