发现一个开源小模型,在GitHub上已经斩获 5w star,还登上了Trending榜单。
用它可以让你只用3块钱、花两个小时,就能训练出一个仅有25.8M参数的超小语言模型。
主打极致轻量化,最小版本体积只有 GPT-3 的 1/2700。
而且还开源了 tokenizer 分词器训练,包含 Pretrain、SFT等全过程训练代码,甚至拓展了视觉多模态的MiniMind-V。
所有训练脚本均为 PyTorch 原生实现,兼容MoE混合专家模型架构,基本实现了对大语言模型全阶段的开源复现
显示更多