前 Google 工程师用 20 分钟讲清楚了 AI Agent 的核心玩法。
说真的,比一堆 500 美元的课有用多了。
关键就一句:
trace every run → 用 LLM judge → diagnose → fix → ship
每一次运行都记录下来。
然后让 LLM 去评判结果。
再定位问题,修掉,继续发。
Agent 能不能越跑越好,靠的就是这个 loop。
不是天天手搓 prompt,等结果,看 diff,再继续手搓。
那套太原始了。
真正该搭的是:
Agent loops
memory
harness
evals
这几个东西放一起,才像个能持续进化的 agent 系统。
很多人还停留在“我会写 prompt”。
但真正有差距的地方,已经变成:
你会不会设计一个能自己跑、自己评估、自己修的 loop。
看完有点扎心。
感觉不是 agent 不行,是我们还在拿遥控器手动开飞机。
显示更多