Andrej Karpathy 谈 Deep Dive into LLMs like ChatGPT:大语言模型通俗导论从预训练到推理模型,像 ChatGPT 这样的大语言模型,本质上是一个经过海量训练的文字预测系统;它先把互联网文本切成一个个 Token,然后反复练习“看到前面的文字,猜下一个最可能出现的文字”,通过这个过程学会语言、知识和各种表达模式,这一步叫预训练,得到的只是一个会续写互联网文本的 Base Model;之后再用人类写好的问答对话训练它,让它学会像助手一样回答问题,这叫有监督微调;再进一步,通过强化学习让它自己尝试解数学、写代码、检查错误,奖励做得好的思路,于是出现了更会“思考”的推理模型。可以把它类比成一个学生:先疯狂读完整个图书馆,学会世界上大概有什么知识;再看优秀老师怎么回答问题,学会说话方式;最后不断刷题、改错、总结,慢慢变得更会推理。但它仍然不是万能的,因为它记住的是统计规律,不是可靠数据库,所以会编造事实、算错简单问题、被 Token 切分影响拼写和计数;正确用法是把它当成一个很强的助手和工具,让它帮你起草、分析、找思路、写代码,但重要结论仍然要自己核查。
显示更多