本地大模型的显存壁垒,今天被正式宣告物理终结了,
单张 24G 的 RTX 4090,竟然真把 125B 的 Qwen 3.8 Flash Next 给跑起来了,
而且上下文直接拉到了 25 万,解码速度稳在每秒 21 个词
以前跑这种百亿千亿级的巨无霸,动辄要租几张 A100 数据中心集群,
但这次海外极客在 Ubuntu 上用一张普通 4090 加 110G 白菜价 DDR4 内存,
硬生生跑出了生产级的速度:
预填充每秒 364 词,解码每秒 21 词,
最狠的是没开 MTP、没开 dflash,连 KV 缓存都没做任何量化
很多人好奇 24G 显存怎么塞得下 125B 还带 25 万上下文,
核心全靠 llama.cpp 最新分支里一个叫 -cmoe 的物理外挂:
它把 512 个专家层全部扔给廉价的系统内存,
把最吃计算的注意力机制留在 4090 显存里,
显存占用瞬间从 24G 暴跌到 11.6G,而且解码速度几乎毫无损耗
空出来的整整 12G 显存,全被拿去放上下文,
直接把窗口一路顶到了 250,000 的绝对上限,跑完甚至还剩 5 个多 G 的显存余量
再加上把 batch 设到 4096,提示词处理速度直接翻倍狂飙,
以前大家觉得消费级显卡只能跑跑 7B 到 27B 的小模型,
现在 MoE 架构加上内存卸载,直接把数据中心级别的智能焊死在了家用电脑里
本地折腾私有大模型和超长 Agent 的时代,
真的被这套组合拳给彻底砸开大门了啊
显示更多