PrismML发布Bonsai 27B:27B级大模型装进iPhone
一个27B模型在FP16精度下约占54GB,即使不错的4-bit量化也要18GB,手机和多数笔记本根本装不下;传统量化压到4-bit以下时,模型会在AIME数学、LiveCodeBench代码和Agent任务上选择性崩溃。Bonsai 27B基于Qwen3.6-27B,把权重压到1~2 bit还保住了智力。
你现在可以在手机上本地跑一个27B模型:1-bit版仅3.9GB,iPhone 17 Pro能运行,保留FP16约89.5%的能力;三值(Ternary)版5.9GB,保留94.6%,普通笔记本轻松运行。
RTX 5090上最高163 tok/s,M5 Max上87 tok/s,iPhone 17 Pro Max约11 tok/s。
模型:
显示更多