看完 Karpathy 这段 State of GPT,终于能把 ChatGPT 的底层逻辑讲清楚了。
1. 预训练
先吃掉海量互联网文本,学会预测下一个 token。
这一阶段最贵,吃掉 99% 训练算力。
2. 监督微调
把模型从“会续写文字”,调成“会按人类指令回答”。
3. 奖励模型
让人类去比较多个回答,告诉模型哪个更好。
4. RLHF
用强化学习,让模型更接近人类喜欢的回答方式。
所以你平时用的 ChatGPT,不是原始 base model。
它是被一步步训练成“助手”的模型。
显示更多