把视频扫了一遍,模型架构的部分基本上就是中国开源模型大拼盘,连讲师都自嘲今年已经好多了,去年这门课几乎就是在介绍 DeepSeek,要不是有中国这些模型这门课都开不下去了。海外 OpenAI 从 GPT-3, Meta 从 LLaMA 3 之后就没什么公开的技术报告了,只能从中国的这些模型去讲大模型的进展。
身在这个过程中没觉得有什么异常,但是想了想我在学校的 7 年里,所有基础课和计算机专业课都想不到有任何一个知识点有来自中国的贡献。而现在在前沿领域课程,没有来自中国的贡献就几乎开不下去了,时代还是潜移默化的发生变化了。
显示更多
Stanford 的 LLM from scratch 看作业从 tokenizer 一直做到了后训练 RL,还有视频和教案,看上去可以去做做。