注册并分享邀请链接,可获得视频播放与邀请奖励。

Easycompany (@Easycompany333) “看完 Karpathy 这段 State of GPT,终于能把 ChatGPT 的底层逻辑讲清楚了。 1. 预训练” — TopicDigg

Easycompany 的个人资料封面
Easycompany 的头像
Easycompany
@Easycompany333
把事情做对和始终做对的事 就相当不容易了
加入 November 2010
402 正在关注    3.9K 粉丝
看完 Karpathy 这段 State of GPT,终于能把 ChatGPT 的底层逻辑讲清楚了。 1. 预训练 先吃掉海量互联网文本,学会预测下一个 token。 这一阶段最贵,吃掉 99% 训练算力。 2. 监督微调 把模型从“会续写文字”,调成“会按人类指令回答”。 3. 奖励模型 让人类去比较多个回答,告诉模型哪个更好。 4. RLHF 用强化学习,让模型更接近人类喜欢的回答方式。 所以你平时用的 ChatGPT,不是原始 base model。 它是被一步步训练成“助手”的模型。
显示更多
0
12
135
31
转发到社区