我现在在 Mac 上用的是 MTPLX 版 Qwen3.6-27B,它走 MLX/Safetensors 路线,主要是为 Apple Silicon 优化本地推理和 MTP 加速。
Unsloth 这个版本走 llama.cpp/GGUF 生态,更通用,也更容易被 Ollama、LM Studio 等本地工具加载。
显示更多
Unsloth 给 Qwen3.6-27B 做了一套支持 MTP 的 GGUF 量化包,让这个 27B 级别的模型可以更方便地在本地通过 llama.cpp 运行。
官方说 MTP 能让 Qwen3.6 的生成速度提升约 1.4到 2.2 倍,并称 Qwen3.6-27B MTP 版本可在约 18GB 内存下运行。
显示更多