我靠!Unsloth 团队太牛了。
将DeepSeek V4 Flash本地推理又被提速了,最高能到120 tokens/s。
Unsloth推出DSpark优化,让V4-Flash-0731的GGUF版本生成速度提升约1.4到2倍,而且不影响精度。
配合之前的量化,现在本地跑这个模型已经能达到相当可观的速度。
开源模型一边在能力上追赶,一边在本地推理效率上持续被社区压榨性能。
速度和精度能同时保住,对真正想本地部署的人来说意义很大。
地址见评论区👇
显示更多
DeepSeek-V4-Flash can now run 2× faster locally with DSpark! ⚡️
DSpark enables V4-Flash-0731 GGUFs to generate ~1.4–2× faster with no accuracy change.
DeepSeek-V4-Flash-0731 can reach at 120 tokens/s.
GGUFs:
Guide:
显示更多