最近发现 Stanford Online 把研究生课程 CS329A:Self-Improving AI Agents 的完整课程录像放到 YouTube 了,一共 9 讲。
这门课基本围绕一个问题展开:AI Agent 怎么通过和环境不断交互,持续改进自己的能力。
内容从 Test-Time Compute、Verifier 和 RL 讲起,后面会进入工具/代码反馈、多步推理与规划、Deep Research、自我改进,以及 Agent 的长时任务评测。
我觉得比较好的地方是,它把现在很多散落在论文里的方向串到了一起:从「怎么让 Agent 多思考」,一路讲到「怎么验证结果、从反馈学习,再把这些能力放进更长的任务里」。
最近在关注 Agent 自进化的话,这套课很适合系统补一遍。
YouTube:
显示更多