注册并分享邀请链接,可获得视频播放与邀请奖励。

Xudong Han 的个人资料封面
Xudong Han 的头像

Xudong Han (@Xudong07452910)

@Xudong07452910
0 正在关注    0 粉丝
最近恰逢秋季开学,我也连续推荐了好几门北美顶尖高校新开的 Agent 课程,一个信号越来越明显: Agent Engineering 开始大量被正式写进顶尖高校的课程体系了。 这次是 CMU 新开的 11-768《AI Agents》,看完 syllabus 后感觉内容真的很贴近现在一线在做的东西。 Tool Use、Context、Skills、Memory、Planning,往后还有 Coding Agent、GUI、Deep Research、SFT/RL、Sandboxing 和安全。 作业设计是我更看重的部分。 这个课程要求先自己搭 Agentic Harness,再做 Agent Eval,然后需要用 RL 去训练 Agent,最后做一个研究项目。 这个顺序其实挺能说明 2026 年高校开始怎么理解 Agent 了,会调用模型已经很基础,接下来要学的是怎么把 Agent 搭出来、测明白、训练好,再让它可靠地跑下去。 而且课程资料会公开,视频也刚刚开始上传。 最近想系统补 Agent 的,很推荐跟着这门课学。 课程官网: 课程 Schedule: 课程 Assignments: youtubu 视频:
显示更多
0
46
938
250
转发到社区
推荐一个维护 AGENTS.md 的思路,觉得还蛮实用的。 题目也很吸引人:AGENTS.md其实是一个神经网络。 很多人的做法都是 Agent 犯一次错,就往 AGENTS.md 里补一条规则。 时间久了文件越来越长,旧规则没删,新规则继续加,最后 Agent 每次都要读一堆已经没什么用的东西。 这篇文章换了个思路: 把项目级 AGENTS.md 当成一个需要「训练」的神经网络。 每一次 Claude Code / Codex session 都是一次 forward pass。 Agent 走过的弯路和被你纠正的地方就是 loss,再定期从这些真实 session 里提取问题,小幅更新 AGENTS.md,相当于做一次 backward pass。 而且要给它固定 Token budget,新增一条规则,就要考虑删掉或移走什么。 作者还直接开源了一个 backpass 工具来自动做这件事。 我还是很喜欢这个思路的。 AGENTS.md 真的不该靠感觉越写越长,而是应该根据 Agent 真正干过的活,一点点「训」出来。 文章
显示更多
0
79
582
90
转发到社区
恭喜 Junyang Lin 正式官宣创业。 离开 Qwen 之后,他在上海成立了 Pragmatik(语用科技 / p7k Labs),方向也很有意思:研究同时面向数字世界和物理世界的下一代 Agent。 从 Qwen 到 Agent,很期待林俊旸这次能做出一些真正不一样的东西。 也祝新公司一切顺利,期待早日看到产品。
显示更多
a life update: i started a new company called Pragmatik (p7k) Labs (语用科技) in shanghai, focusing on the research of next-generation agents across digital and physical worlds. thanks to Gaorong Ventures and HSG (红杉中国 & 高榕创投) for co-leading this round, and to Tencent (腾讯) and Shanghai Engine Fund (上海未来产业基金) for the support. @pragmatik_labs ·
显示更多
0
12
95
6
转发到社区
最近发现 Stanford Online 把研究生课程 CS329A:Self-Improving AI Agents 的完整课程录像放到 YouTube 了,一共 9 讲。 这门课基本围绕一个问题展开:AI Agent 怎么通过和环境不断交互,持续改进自己的能力。 内容从 Test-Time Compute、Verifier 和 RL 讲起,后面会进入工具/代码反馈、多步推理与规划、Deep Research、自我改进,以及 Agent 的长时任务评测。 我觉得比较好的地方是,它把现在很多散落在论文里的方向串到了一起:从「怎么让 Agent 多思考」,一路讲到「怎么验证结果、从反馈学习,再把这些能力放进更长的任务里」。 最近在关注 Agent 自进化的话,这套课很适合系统补一遍。 YouTube:
显示更多
0
43
677
164
转发到社区
最近发现一个很适合系统补机器学习基础的网站: Richard Xu 把自己过去十多年积累在 GitHub 上的几十份讲义,重新整理成了一套交互式学习教程。 内容从回归、贝叶斯、决策树和神经网络,一直延伸到 EM、MCMC、变分推断、NTK、PAC-Bayes、Transformer 和扩散模型,基础课程与研究级内容都有覆盖。 相比直接面对一堆公式密集的 PDF,网页形式更适合按主题慢慢学习,也更容易把原本零散的知识串起来。 现在很多教程都在追最新模型,这套资源更愿意把概率、优化、推断和学习理论讲清楚。模型会不断换名字,真正帮助我们理解它们的基础却没有那么容易过时。 交互式网站: 原始讲义:
显示更多
0
25
740
167
转发到社区
我们之前设想的「强模型规划、弱模型执行」,可能本身就有一些问题。 现在常见的做法,是让前沿模型先读代码、写一份 plan.md,再交给便宜模型执行。听起来很合理,实际却可能更贵,因为执行模型拿到的只是一份几千 Token 的计划,后续要重新读取几十万 Token 的代码,前面的理解过程几乎又要在做一遍。 作者提出的 /prewalk 换了一种交接方式: 先让强模型探索项目、建立 TODO,并完成第一次有效修改。等方案真正接触过代码后,保留整个上下文,直接切换到便宜模型继续完成。 在 SWE-bench Pro 上,这种方式保留了 GPT-5.6 Sol 约 97% 的通过率,同时把成本降低了约 39%。 文章里有句话我很喜欢:交接时应该传递一段走过的轨迹,而不是一份描述旅程的明信片。 这对多 Agent 协作也很有启发。未来模型之间有价值的交接物,可能不只是计划文档,还包括它读过什么、排除了什么、当前做到哪里,以及已经验证过的第一步。 文章链接:
显示更多
0
23
147
11
转发到社区
这是一个很幸福的时刻。 杨植麟的 CMU 导师 Russ Salakhutdinov 发帖祝贺 Kimi K3。能收到导师这样的公开祝贺,应该是一件特别开心的事。 Russ 教授不仅是 Hinton 的亲传弟子,也是苹果首任 AI 总监。 他在帖子里专门祝贺了自己的学生,还回忆起两人在 CMU 一起做出 XLNet 和 Transformer-XL 的那段经历。看得出来,他也一直以杨植麟为傲。
显示更多
Congratulations to Zhilin Yang, founder and CEO of @Kimi_Moonshot, on the latest Kimi release. What a huge win for the open-source community! It feels like just yesterday Zhilin was graduating from my lab at CMU, jointly co-advised with William Cohen. Not only did he complete his Ph.D. in just four years, but he also made truly fundamental contributions to ML during his time at CMU. What a spectacular career! Congrats again Zhilin, and thank you and the entire Kimi team for everything you're doing for the open-source community.
显示更多
0
11
61
5
转发到社区
有没有想过:Claude Code 或 Codex 跑完一个任务,它到底「看」了哪些文件、忽略了哪些? Mindwalk 把这个问题可视化了,它把 Claude Code 和 Codex 的会话日志,投射到代码库的 3D 地图上回放。仓库是一张夜间俯瞰图,agent 搜索、读取、编辑过的文件会发光,没碰到的区域保持黑暗,让你一眼看清 agent 对任务的理解范围。 单个 Go 二进制文件,所有数据完全本地处理,不会离开机器。文件触达状态分四级:未访问、已查看、已读取、已编辑,还有上下文压缩事件、子 agent 启动、错误节点的时间轴标记。 这个工具提供了一个直觉:agent 的工作范围和你以为的往往不一样。当它跑了 30 分钟,你以为它读遍了整个仓库,但地图可能告诉你它根本没碰到关键目录。 如果你在用 Claude Code 跑复杂任务,这是个值得装一下的调试工具。可以用它检查 agent 是否真的理解了任务范围,而不是靠最后的输出结果猜测。
显示更多
0
25
109
19
转发到社区
现在很多人学 AI Agent,还停留在「能不能跑一个 demo」。 但真正难的可能是:这个东西上线之后,能不能长期稳定地跑。 CMU 2026 春季这门 MLiP / AI Engineering 课程,我觉得很值得关注。它讲的不是怎么训练一个模型,也不是怎么写几个 prompt,而是怎么把 ML、LLM 和 Agent 变成真正的生产系统。 里面会讲部署、测试、监控、MLOps、安全、隐私、公平性、可解释性,也包括 Agents 相关的很新的工程内容。 这个课程项目不是做一个玩具 demo,它想让学生在相对真实的生产条件下,构建、部署、评估并维护一个面向 100 万活跃用户的推荐系统。 这其实很符合接下来 AI 的发展方向。 Agent 能写代码、能调用工具、能完成任务,已经不算最稀奇的部分了。真正有门槛的是:它犯错怎么办?怎么监控?怎么回滚?怎么评估?怎么控制成本?怎么在高负载下稳定运行? AI 工程的核心,正在从「模型能力」走向「系统可靠性」。 如果你想理解 Agent 怎么从 demo 走向真实产品,这门课可能比很多单纯追热点的 Agent 课更值得看。
显示更多
0
8
123
33
转发到社区
这个是真有意思呀 研究中国新儒家思想,特别是阳明心学的美国教授加入了Anthropic了。 他去 Anthropic 做的就是 alignment(对齐),就是让 AI 的行为符合人类的价值观,并且负责塑造 AI 的性格。 阳明心学讲的就是知行合一,希望Anthropic 可以做到。
显示更多
I've joined @AnthropicAI to work on alignment and character. I'll still teach at @nyuniversity; I'm on leave from @UTAustin.
CMU 这门 NLP 课最硬核的地方:第一份作业就让你从零手搓一个 LLaMA。 卡内基梅隆大学公开了 2026 春季《Advanced NLP》课程,教授是 Sean Welleck。整套资源包括完整课程主页、课件、视频和配套代码,内容从 Tokenizer、Transformer、语言模型基础,一路讲到 RAG、多模态、RLHF、MoE、长上下文和 test-time scaling。 这门课最有价值的地方,不仅是教你怎么调用大模型 API,而且把大模型能力背后的工程路径也拆开给你看。 从「Build Your Own LLaMA」这种手搓模型作业,到后面的推理、效率、评测和 Agent,它训练的其实是一种更底层的能力:你能不能理解模型为什么能工作,为什么会变强,为什么有时会失败。 这也很符合现在 AI 的技术拐点。 过去大家更关心参数规模,谁的模型更大;现在越来越多关键进展,开始发生在推理侧、效率侧和系统侧:怎么让模型更会思考,怎么调度专家,怎么检索外部知识,怎么在有限算力下获得更好的输出。 所以这门课不只是 NLP 进阶课,更像一份 2026 年大模型研究者的训练路线图。 AI 时代真正的分水岭,可能不只是会不会使用模型。 更关键的是: 你停在应用层,还是愿意继续往下走到架构层。 Home: Youtubu: Code:
显示更多
0
4
124
30
转发到社区
Kimi K2.7 code 是唯一被微软纳入Copilot御用模型列表中的中国模型,而不是Qwen 或者 GLM。 之前 cursor 也是拿 kimi 来做基模进行后训练得到 Composer 2.5,性能也很优秀。 Kimi 的多模态真是它的优势,就是上下文长度弱一些。
显示更多
0
17
69
5
转发到社区
Hacker News 上有一篇评论区火了的文章:Qwen 3.6 27B 是本地开发的理想选择。 核心发现是:密集参数模型、原生支持 256k 上下文,在 MacBook Max M5 上跑 Q8_0 量化版能达到 30 tokens/s,RTX 5090 上能到 50 tokens/s。 作者称它为「首个真正具备通用智能的本地模型」,以前本地模型总有木桶短板,这次用一个提示同时完成创意写作和生成六边形扫雷游戏,两件事都做得不错。 这个评价背后是一个更大的趋势:云端大模型多年打磨出的工程积累,正在开始向本地 scale down。隐私优先、延迟可控、离线可用,这三个以前要互相妥协的需求,现在开始可以同时满足。 现在「足够好的本地模型」这条线,正向我们靠近。如果 30B 级别的模型真能达到通用水准,日常开发和轻量 Agent 任务不依赖 API 调用这件事,可能比大多数人想象的近。
显示更多
0
34
148
18
转发到社区
这几天看了好多这样的新闻,希望这个是真的吧。 Claude Fable 5 赶紧回来吧。
🚨 NEWS: Commerce is expected to lift export controls on Fable tonight, a senior White House official tells me.
分享一下智谱创始人唐杰老师 @jietang 昨天刚在WB上发的文章吧 AI 时代:认知 > 格局 > 技术 > 管理
0
6
329
56
转发到社区
推荐一本免费的 AI 书:《Agentic AI 漫游指南》。 我刚开始读,感觉它和很多「AI 入门指南」不太一样。 虽然也有基础知识,但作者明显没有把主要篇幅放在那些已经被反复讲过的概念上,而是一路讲到强化学习 RL、推理 Reasoning、评测 Evaluation,最后才进入 Agentic AI。 所以它更像一本帮你理解 AI 工作机制的书,而不是一本教你「怎么用 AI 工具」的操作手册。 如果你已经不满足于只会用 ChatGPT、Claude、Cursor,想进一步理解 AI 为什么能推理、怎么被训练、如何被评测,以及 Agent 到底是怎么跑起来的,这本书挺值得收藏。
显示更多
0
8
148
33
转发到社区
昨天跟一个在英国读本科的同学聊天,问他平时怎么用 AI 辅助写作业。 他说学校现在对 AI 作业管得挺严,一旦老师觉得你的文字太学术或者太正式,就可能直接给低分。 然后他说了一个他的解决方案: 「请用雅思 5.5 分的水平,帮我润色这段文字。」 之前大家用 AI,还是想着想把文字变得更高级一点。 现在为了不被怀疑用 AI,反而要让 AI 主动写得没那么高级。 现在对学生来说,写得太差,分数低;写得太好,也很危险。 最安全的,可能是刚好像自己写的。
显示更多
这一篇关于 Agent Memory 的长文很值得推荐。 它最打动我的地方,是没有把 memory 简化成「存聊天记录」。 在很多人的理解里,Agent Memory 好像就是把过去的对话存下来,下次再喂给模型。但这篇文章讲得更清楚:真正成熟的 Agent Memory,其实是一整套状态架构。 长上下文解决的是「这一轮能看见多少」。 RAG 解决的是「需要时能查到什么」。 Memory 解决的是「下一轮醒来时,还能不能继承上一次的判断、经验、规则和未完成状态」。 这也是为什么 coding agent、research agent、personal agent 一旦开始跨 session 工作,就一定会遇到 memory 问题。 有些东西应该写进 CLAUDE.md / AGENTS.md,成为长期规则。 有些东西应该常驻,比如用户偏好、项目不变量、agent 的身份。 更多历史则应该按需召回,而不是每次都塞进上下文。 更关键的是,memory 还要记录证据链、权限边界、风险红线和状态变化。 否则一次错误总结、一次过期信息、一次被污染的网页内容,都可能变成 agent 以后反复继承的「错误经验」。 所以我很认同这篇文章的判断: Agent Memory 的价值不在于记住更多,而在于让 agent 少犯同样的错,更快复用做对过的事。 长上下文让 agent 在当前任务里看得更全。 Memory 则让 agent 在下一次任务里起点更高。 这可能是 Agent 从「单次调用工具」走向「持续工作的系统」时,最容易被低估的一层基础设施。
显示更多
0
3
70
12
转发到社区
最近读 Paul David 1990 年那篇经典文章《The Dynamo and the Computer》,反而更能理解今天很多人的 AI 焦虑。 当年电力出现后,工厂生产率没有立刻暴涨。 原因很简单:很多工厂只是把蒸汽机换成电动机,但整套生产方式、机器布局、管理流程,仍然停留在旧时代。 真正的变化,要等到工厂重新设计,机器独立驱动,流程重新组织之后,才慢慢释放出来。 这和今天的 AI 很像。 很多人焦虑,是因为模型进步太快了。新模型、新 Agent、新工具,每隔几天就刷屏一次。于是我们很容易产生一种错觉: 技术已经冲到未来了,我却还停在原地。 但问题可能没有那么简单。 AI 的真正影响,不会只来自「模型更聪明」。它还要等工作流、组织结构、教育方式、协作模式一起变化。 现在很多公司和个人,其实还在把 AI 塞进旧流程里。 以前写周报,现在让 AI 写周报。 以前开很多会,现在让 AI 总结会议。 以前复制粘贴资料,现在让 AI 帮你复制粘贴得更快。 这当然有用,但还没有真正改变「工厂」。 所以 AI 时代的核心问题,也许不是「我会不会被替代」,而是: 我现在的工作方式,有多少还停留在旧的皮带轴系统里? 焦虑不能完全消失,但它可以被重新理解。 如果 AI 真的像电力一样是通用技术,那我们现在经历的,可能不是终局,而是混乱的重组期。 真正值得关注的,不只是下一个模型有多强,而是谁能先学会重新设计自己的工作流。 个人如此,公司也是如此。
显示更多
0
19
186
57
转发到社区
最近读到一篇很喜欢的文章:Zen and the Art of AI Research。 它最打动我的观点是: 做 AI research,很多时候拼的不是天赋,而是一种研究气质。 能不能长期泡在一个问题里,能不能接受实验失败和对好的结果保持怀疑,能不能在别人发了好 paper 之后,不只是焦虑,而是反过来问自己:我有没有在同样的深度上思考? 文章里有个很好的类比:做研究有点像打坐。 有灵感的时候,继续坐。 没有灵感的时候,也继续坐。 很多真正重要的想法,不是刷几篇热门论文就突然冒出来的,而是在反复阅读、动手构建、失败、debug、重新理解里慢慢长出来的。 这篇文章还提醒了一个很现实的问题:coding agents 会让研究跑得更快,但也会让人更容易失去对系统细节的掌控。 它可能帮你改了 prompt,缩短了 sequence length,换了 config,跑了一个看起来差不多、其实已经不一样的实验。 工程上这可能只是小问题,科研上就是大问题。 因为一个很小的改动,就可能改变整篇论文的结论。 所以 AI 时代的研究能力会变得更矛盾: 你要会用 AI 加速,但不能把理解外包给 AI。 你要跑得更快,但不能失去慢下来检查的能力。 你要拥抱 agents,但仍然要知道每个结果是怎么来的。 优秀的研究者需要在工具越来越强之后,依然能保持耐心、怀疑和清醒的人。
显示更多
0
27
179
31
转发到社区