Unsloth 给 Qwen3.6-27B 做了一套支持 MTP 的 GGUF 量化包,让这个 27B 级别的模型可以更方便地在本地通过 llama.cpp 运行。
官方说 MTP 能让 Qwen3.6 的生成速度提升约 1.4到 2.2 倍,并称 Qwen3.6-27B MTP 版本可在约 18GB 内存下运行。
显示更多
Qwen3.6 now runs 2x faster with MTP GGUFs! Run locally on just 18GB RAM. ⚡️
MTP enables Qwen3.6 to generate ~1.4–2.2× faster with no accuracy change.
Qwen3.6-27B MTP runs at 160 tokens/s. 35B-A3B reaches 240 t/s.
GGUFs:
Guide:
显示更多