现在用 Coding Agent,最累的部分是你得一直盯着它
Agent 确实写了很多代码,但整个任务能不能继续往前走,往往还是取决于你有没有坐在电脑前。
Romain Huet 这次演示的新 Codex,开始处理这些代码之外的工作。
一个任务可以拆给多个 subagents,有的负责 Debug,有的做前端,有的补文档。
Codex 可以自己打开浏览器检查结果,操作 iPhone Simulator,根据截图和视觉批注继续修改。
任务做到一半,人离开电脑,也可以在手机上查看进度,或者通过 SSH 连接远程 devbox 接着处理。
代码完成后,它还能继续创建 PR、检查 CI、处理 review comments,最后把是否合并的决定交还给开发者。
看完整段演示,我的理解是:
Coding Agent 过去主要帮我们减少写代码的时间。
新 Codex 想进一步减少的,是等待、切换工具、重复检查,以及不停催着 Agent 继续下一步的时间。
这对经常使用 Codex、Claude Code 或 Cursor 的人来说,应该很熟悉。
我们想要的是,在目标和边界明确之后,它能把一个开发任务持续推进到可以检查、可以交付的状态。
开发者依然需要做判断,哪些需求值得做,结果是否正确,风险能不能接受,代码最终要不要合并,这些责任不会消失。
只是以后,我们可能不需要再全程守在 Agent 旁边,手动推动每一步了。
如果这套工作流真的稳定下来,一个人能够同时推进的事情,会比现在多很多!
显示更多
看完 Charlie Guo 用 GPT-5.6 + Codex 做卡牌游戏,我对前几天那篇文章里的判断更确定了!
他没有先写一份很长的 PRD,也没有把任务拆成几十个 tickets。
只是给了 Codex 一个相对开放的目标,GPT-5.6 就开始自己设计玩法、编写代码、生成美术,并交付了一个可以运行的版本。
之后再追加关卡、机制、配乐和美术要求,它也能继续沿着原来的项目往下推进,甚至会自己判断什么时候需要调用 sub-agents,把不同任务并行完成。
这段演示真正值得看的是,它展示了一种新的协作方式:
你不再需要提前规定模型每一步该怎么思考、怎么拆任务、怎么执行。
你需要把真正重要的事情说清楚,然后让模型在工具和项目环境中持续推进。
这也正是我在这篇文章里想讲清楚的问题:
《GPT-5.6 Prompt 到底该怎么写?OpenAI 官方指南,一篇讲透!》
很多人升级模型之后,仍然沿用过去那套很长、很重、充满过程控制的 Prompt。
模型变了,Prompt 的重心也应该跟着改变。
Charlie 的演示给出了一个很直观的答案,而文章里我把背后的官方建议、改写方法和可直接复用的 Prompt 框架完整整理了出来。
正在使用 GPT-5.6、Codex,或者准备搭建 Agent Workflow 的人,可以把视频和文章放在一起看。
显示更多
Anthropic 官方团队把 Claude Code 从底层原理到真实项目实战,完整讲了一遍!
如果你只是会让 Claude Code 写代码,却还没搞懂它如何读取文件、调用工具、管理权限、调度 subagents,这个视频值得收藏!
我整理了重点时间线:
00:00|Claude Code 底层如何工作
04:51|Permissions:哪些操作允许、询问或拒绝
10:46|如何把 Code Review、部署流程做成 Skills
15:08|Intent-driven development 到底怎么做
22:40|用语音 Prompt 从零构建 3D 游戏
32:55|用 Branch、Draft PR 和 GitHub CLI 控制交付
38:15|Auto Mode 如何减少重复授权
40:48|用 Dynamic Workflows 并行调度多个 Subagents
46:53|从 Demo 走向 Production 的工程原则
55:33|Claude Code 如何用于研究、数据和媒体处理
我认为最值得看的是 Lydia Hallie 拆解了 Claude Code 的真实运行方式:模型本身没有长期状态。
文件内容、终端输出、Git 分支、工具调用结果和会话历史,都是由外层的 Agent Harness 维护,再在每一轮重新组装给模型。
这也解释了为什么真正影响 Claude Code 效果的,不只是 Prompt,还有:CLAUDE.md、Skills、Permissions、Verification、Git Workflow、Subagent 编排!
视频最后还有一个很重要的提醒:AI 能一次生成大量代码,不代表这些代码都应该被合并。
架构、验证、安全、Review 和最终质量,依然由人负责。
这可能是目前理解 Claude Code 最完整的一小时。
建议先收藏,再跟着时间线看!
显示更多
你可能一直在用旧方法 Prompt GPT-5.6。OpenAI 其实已经发布了最新版官方指南。
这份指南里,OpenAI 已经把任务描述、约束条件、工具调用、输出格式,以及常见误区讲得很清楚。
我把整份官方文档读完,整理成了一篇中文通俗版:
1. GPT-5.6 到底变了什么?
2. Prompt 应该怎么写、
3. 官方推荐的结构、
4. 可以直接复制的模板和案例、
5. 哪些旧方法已经不适用了、
不用自己啃开发者文档,看这一篇就够了👇
显示更多
Wow!Claude Code 高级用法:给 Agent 搭一套能干活的工程环境!
Daisy Holman 这场 Beyond Claude Code Basics 讲的重点更接近生产级工程:
Agent 要真正参与软件工程,需要三样东西:
Access:能看到设计文档、CI/CD、runbook、监控和历史讨论。
Knowledge:通过 CLAUDE.md、Skills、文档检索注入项目规则。
Tooling:用 Hooks、LSP、lint、test 建立即时反馈。
举个例子:
你让 Claude Code 修一个 CI failure。
如果它只能看到代码和 terminal,它可能只能反复猜。
但如果它能看到 CI log、测试命令、相关 PR 历史、runbook、项目规则,并且改完后自动收到 lint / test feedback,它就更接近真实工程师的工作状态。
所以最简单的实践方法是:
记录一天里,你每次离开 Claude Code 去查什么。
查 Slack、看文档、翻 CI、找 runbook、复制 dashboard、跑内部 CLI。
这些动作,就是最值得优先接给 Agent 的能力缺口!
显示更多
看完这张疑似 Anthropic 内部优化的 Fable 5 Prompt 结构,我才意识到:大多数人写 Prompt,其实一开始方向就错了!
很多人以为好 Prompt = 更长、更复杂、更多技巧、更多角色设定。
但这张图给出的结构非常简单:
Context:背景是什么
Request:你到底要模型做什么
Output Format:结果要怎么交付
Constraints:哪些不能假设、不能越界
Checkpoint:什么时候停下来问你
但对 Fable 5、Claude、Codex 这类更强的模型来说,真正关键的不要“教模型怎么思考”,要把任务边界讲清楚!
尤其是最后这个 Checkpoint 很重要:
只有在三种情况下才暂停:
1. 涉及不可逆操作
2. 任务范围发生变化
3. 需要用户提供信息
其他情况,模型应该继续完成任务,最后再汇报。
这才是 Agent 时代的 Prompt 写法。
模型越强,越不需要你写一堆废话。
它需要的是目标、边界和验收标准。
以后写复杂任务前,先检查这 5 个部分:Context 、Request、Output Format 、Constraints 、Checkpoint
显示更多
Holy Shit! 很多人只会把 YTSage 当成一个 YouTube 下载器!
但如果你已经在用 Codex / Claude Code / Skills 做内容自动化,它真正的价值远不止是“下载视频”。
把视频素材变成 AI Agent 可以接管的本地输入层。
我之前写过一篇长文:
《用 Codex + Skills 搭一套本地视频自动化工作流》
里面讲的是:如何用 Codex 编排 FFmpeg、WhisperX、Skills,把一个视频处理任务拆成可复用的本地自动化流水线。
现在再加上 YTSage,整个流程就更完美了!
我的理解是:
1. YTSage = 素材入口、
2. Codex = 工作流编排器、
3. Skills = 专业能力插件、
4. WhisperX = 字幕与转写、
5. FFmpeg = 最终成片处理
完整链路应该是:YouTube /公开视频
→ YTSage 下载 video / audio / subtitle / thumbnail / description
→ Codex 读取本地目录
→ WhisperX 生成高质量字幕
→ FFmpeg 加水印、硬字幕、裁剪、压缩
→ 输出 final.mp4
→ 再生成 X 长文 / Thread / 视频脚本
这套思路的关键是你开始把内容生产拆成标准模块:
1. 素材获取层
2. 本地文件结构
3. Agent 执行规范
4. 字幕处理
5. 视频处理
6. 内容复用
然后让 Codex 按 AGENTS.md 执行:只读取inputs/raw,不覆盖原始素材,WhisperX 重新生成字幕,FFmpeg 负责水印、硬字幕、压缩,输出最终视频和 X 内容草稿
这才是 真正有价值的地方是让 AI 帮你沉淀一套可以重复执行的生产系统!
如果你也在用 Codex 做本地自动化,建议不要只停留在“让 AI 帮我写代码”。
可以从一个具体场景开始:比如视频处理。
我之前那篇《用 Codex + Skills 搭一套本地视频自动化工作流》,就是按这个思路拆的。
现在再配合 YTSage,刚好补齐“素材获取层”。
工具本身不稀缺,能把工具串成稳定 Workflow,才是 AI Agent 时代真正拉开差距的地方。
显示更多
Cursor / Codex / Claude Code 用户,这个仓库能帮你快速配好免费模型!
open-free-llm-api/awesome-freellm-apis
它把各种免费 LLM API 的信息整理成一张清晰的表,省去了自己到处翻找的麻烦。
平时想找免费模型用,得一个 provider 一个 provider 去搜,注册账号,查有没有免费额度,要不要绑信用卡,找 base URL、model ID,还得看 rate limit,最后手动配到 Cursor、Codex、Claude Code 这些工具上。挺折腾的。
这个仓库直接把这些全整理好了:
哪些 provider 有免费 tier,像 Groq、Gemini、NVIDIA NIM、Mistral、Cohere、Hugging Face、OpenRouter 这些,都列得明明白白。
哪些不用绑信用卡,个人开发者用着更省心。
每个模型的 context window 和 rate limit 也写清楚了,能快速判断适合短任务、长文档、代码生成还是批量测试。
每个 provider 的 base URL 和 API Key 获取方式,都写得清清楚楚,直接告诉你怎么接。
还针对 Cursor、Codex、Claude Code、Aider 这些 AI Coding 工具,准备了对应的配置方法。
用这个仓库,就是把免费模型当成一个模型池来用。简单的事情,比如代码解释、README 总结、写测试用例、打 prompt 草稿、生成小工具,交给免费模型处理。真正重要的活儿,像架构设计、复杂重构、安全审查、生产级代码决策,还是留给主力模型。
这样一来,AI Coding 的整体成本就能明显降下来。
当然,免费 API 到底还是有局限的。rate limit 会变,模型可能突然下架,tool calling 也未必稳定。别把私有代码、API Key、数据库结构、客户数据这些敏感信息往免费 provider 扔。
我把它定位成 AI Coding 的低成本实验层,适合平时试东西、跑简单任务。如果你正在用 Cursor、Codex、Claude Code 这些工具,这个仓库值得收藏。
它帮你省下的,主要是你在几十个 provider 文档里反复搜索、注册、试错的时间!
显示更多
我发现 AI Agent 真正的瓶颈是它拿不到实时数据、不会自己查 Reddit / GitHub,一旦离开模型知识库,就开始脑补。
所以我最近找到一个工具:AgentKey。
定位很简单:给 AI Agent 一把统一的外部数据钥匙。
你可以把它理解成:Claude Code / Codex / Cursor 的
API Gateway + MCP 工具层 + 数据路由器。
以前你想让 Agent 做真实研究,可能要分别配置:
Tavily、Firecrawl、Brave Search、Reddit API、X API、
Finance API、Crypto API、GitHub 数据源、电商数据源
每个都有自己的 key、额度、参数、失败处理。
AgentKey 的思路是:用一个 master key,把这些外部数据能力统一接到 Agent 里。
它最适合做的是这几类任务:
1. 发现热点
让 Agent 去 Reddit、GitHub、Product Hunt 找最近被讨论的 AI 工具。
2. 验证项目
读取 README、Docs、Issues、Release,看一个开源项目到底有没有价值。
3. 做竞品研究
抓官网、定价页、评论、用户吐槽,判断一个 SaaS 机会是不是真需求。
4. 做内容选题
把看到一个工具升级成多源验证后再写一篇高质量长文。
5. 做投资辅助研究
查价格、技术指标、宏观数据、crypto on-chain、社交叙事,但不直接给买卖建议。
我认为它真正有价值的地方是:让 Agent 从生成器变成研究员,以前的 AI Coding 工作流大多是:你给信息 → Agent 写代码。
更高级的工作流应该是:
Agent 自己找信息 → 验证信息 → 形成判断 → 再写代码 / 写报告 / 写内容。
这才是 Agent 工作流的分水岭。
但也有几个坑:
第一,不要把外部数据当真理。
Reddit、网页内容都有噪音,AgentKey 只是取数,不负责判断。
第二,不要把 master key 放前端。
这种 key 应该只放在本地 CLI、后端、Serverless、私有 Agent worker。
第三,不要一上来做复杂自动化。
先做 3 个固定场景就够了:GitHub 项目研究、X/Reddit 热点发现、SaaS 竞品与用户痛点分析
如果你正在用 Claude Code / Codex / Cursor 搭 Agent 工作流,AgentKey 值得研究。
它像是给 Agent 装上了外部世界的传感器。
未来真正强的 AI Coding 系统是能自己发现问题、收集证据、验证假设、再交付结果。
显示更多
最近发现一个5 万 Star开源项目 ,非常适合内容创作者研究选题使用!
MediaCrawler,我觉得它真正值钱的地方,是帮内容创作者建立一套“选题雷达”!
它支持小红书、抖音、快手、B站、微博、贴吧、知乎等平台的公开内容研究。
真正靠谱的用法是:用少量公开样本,判断一个选题到底值不值得写。
比如你想写:Claude Code、AI 副业、Codex、独立开发、
出海 SaaS、AI Agent 工作流!
多数人的做法是:看到一个热点 → 凭感觉写 → 发完没人看 → 以为是自己标题不行!
但有经验的人会先看评论区,因为评论区才是真实需求!
用户不会直接告诉你“我要一篇 3000 字深度教程”。
他们只会问:
1. “不会代码能不能用?”
2. “Claude Code 和 Codex 到底怎么选?”
3. “做出来的小工具怎么上线?”
这些问题,就是天然的文章大纲。
我的使用思路是:选 3 个关键词、比如:Claude Code / AI 副业 / 独立开发,每个平台只看少量公开样本,
不要追求全量,只看高互动内容和评论,把评论整理成 4 类:痛点、疑问、反对意见、购买/行动意图
用 AI 做二次分析,提炼高频问题、情绪关键词、可写角度,最后输出内容选题,长文、Thread、教程、案例拆解!
一个简单公式:公开评论 → 高频问题 → 用户痛点 → 内容选题 → 高转化长文
这才是 MediaCrawler 对内容创作者最有价值的地方。
合规边界也要记住:只分析公开内容、只做小样本研究、
不做用户画像、不批量采集、不用于商业爬取、尊重平台规则和项目许可证!
所以这类工具最值得用的地方是让你在发内容之前,先验证一件事:这个问题,是不是已经有人在评论区反复问过,有人问,才值得写,没人问,再漂亮的选题,也可能只是自嗨。
显示更多