我身边有个同事,技术能力很强,AI Coding 也用得特别多。
不过他有个特点,就是不太舍得花钱。
从免费的 Kimi 开始,一路买各种套餐。Kimi Coding Plan、Trae、OpenCode、阿里百炼……基本都试了一圈。最后得出的结论特别朴素:哪个便宜用哪个。
便宜确实是便宜。
但是便宜也有代价,很多最新的模型都没有,像 Kimi K3、GLM 5.2、Claude、GPT Codex 这些,他基本都体验不到。
他属于那种特别会过日子的工程师。
模型不给力,那就拼命榨模型。
前几天他写了一个 Skill,想根据一套 C++ 代码自动反推出详细设计文档。整个 Skill 十几 K,几乎全是提示词。
我拿内网模型跑了一遍。
五分钟结束。
吐出来一份二十 K 左右的“详细设计”。
我看完以后,总觉得哪里不对。
不是提示词的问题,而是感觉整个活儿都压在一个 Agent 身上了。
于是我几乎没改提示词,就是把流程拆了一下。让一个 Agent 负责规划,再分几个 Sub Agent 去写不同章节,最后回来汇总、补充、检查。
还是那个内网模型。
最后硬是跑出来一份一百五十 K 的详细设计。
说实话,质量还是一般,离 Claude 和 GPT Codex 那种效果还有距离。
但是我突然发现一个挺有意思的现象。
同样都在用 Agent。
他研究的是怎么把一段 Prompt 写得越来越长。
我研究的是怎么让几个 Agent 少聊天、多干活。
到底谁对,我现在也不敢下结论。
没准再过一年,模型聪明到一句话就全干完了,什么 Skill、什么提示词工程、什么工作流,统统都成了历史包袱。
不过至少今天,尤其是在内网这些能力没那么强的模型上,我还是觉得,Workflow 比 Prompt 更值钱一点。
以前写程序,总有人喜欢把三千行代码塞进一个函数里,也总有人喜欢拆成几十个小函数。
现在回头看,AI 好像也开始走这条路了。
显示更多
我以前一直觉得,代理能用就行,一年 10 刀,访问 GPT 也没觉得有什么问题。直到最近换成了 RackNerd 一年 21 刀的 VPS,当代理用,才发现完全不是一回事。Hermes + GPT 5.5 基本不重试,长任务一次没断过,整个体验顺得离谱。现在又开始惦记 Dmit 的 VPS 了。很多东西都是这样,没体验过好的,总觉得差不多;一旦体验过,就很难再回去了。就像 API 一样,从便宜模型一路换到 DeepSeek,再到 Claude、GPT 5.5,不知不觉嘴就养刁了。吃过细糠,再回去吃粗粮,是真有点难。
显示更多
最近发现了一个特别有意思的用法。我把 GPT 和 DeepSeek V4 Pro 当高级工程师用,负责写 SOP、写 CI/CD 流程、设计方案。然后把这些东西一股脑丢给 Hermes Agent 里的 Minimax M3 去执行。
正常情况下,ChatGPT 一个小时能搞定,DeepSeek 两个小时也差不多了。M3 呢?已经干了一上午,四个小时过去了,还在和 CI 测试死磕。日志刷得飞快,错误改了一轮又一轮,就是过不了。
但神奇的是,我居然没有生气,反而越来越期待。
因为我突然意识到,M3 最有价值的地方可能不是干活,而是验收文档。
如果 GPT 写的 SOP,DeepSeek 写的流程,最后连 M3 这种级别的“小白员工”都能一步一步照着执行成功,那说明这个文档是真的写明白了。反过来,如果 M3 卡住了,大概率不是它一个人的问题,而是流程里还有默认知识、隐藏前提和作者自己都没意识到的经验依赖。
以前测试用户手册,要找新人。
现在测试用户手册,直接找最笨的 Agent。
某种意义上说,M3 已经从生产工具变成了质检工具。
它就像公司刚入职的新同事。能力可能一般,效率可能不高,但凡是文档里写得不清楚的地方,它一定能精准踩坑给你看。
AI 时代最好的测试工程师,未必是最聪明的模型。
有时候恰恰是最笨的那个。
显示更多
今天突然想再买一台小服务器。之前买过一个巴掌大的小主机,16G 内存、500G 硬盘,1300 多块钱。里面跑软路由,再开个 Ubuntu 虚拟机,稳得一批。用了一段时间体验特别好,想着再买一个也不贵。
结果上网一查,好家伙,差不多的配置,2800。
我默默关掉了网页,继续折腾手里这台老机器去了。
以前总觉得 AI 烧的是云上的钱,跟自己关系不大。现在才发现,AI 不光在卷模型,也在卷存储、卷内存、卷硬件。这一波算力需求带来的消费升级,已经开始从数据中心一路传导到我的钱包了。
显示更多
今天看到一种说法,说 Claude Fable 5 之所以这么强,并不完全是模型本身变聪明了,而是后台可能给每个用户偷偷配了一个 Claude Code。用户每提一个问题,后台先跑一遍 Agent、查资料、验证、推演,最后再把结果返回给你。
我第一反应是:卧槽,好像有点道理。第二反应是:那 Claude Fable 5 突然就没那么神秘了。
但仔细想想,这反而是个好消息。因为如果真是这样,那说明突破点未必是模型本身,而是模型、Agent、工具调用和长链路执行组合出来的系统能力。
模型能力不好追,工程能力反而更容易追。某种意义上,这甚至给国产模型指了一条路。
最可怕的从来不是别人比你聪明,最可怕的是别人找到了正确的系统架构。
显示更多
半年前,MiniMax 和 GLM 还像双胞胎兄弟,发版本一起发,开源一起开,节奏都差不多。半年后再看,GLM 5.2 一飞冲天,MiniMax M3 一路拉到天边。AI 圈真是残酷,有些行业五年看不出差距,有些行业半年过去,同学聚会都快认不出来了。
显示更多
“Prompt 该退环境了,未来属于 Loop Engineering”这条我非常认同。手搓 prompt 还是聊天时代的残留。Agent 时代真正重要的是心跳任务、worktree 隔离、项目知识、MCP、子 Agent、验收标准。很多人还在写咒语,另一批人已经开始设计生产线了。
显示更多
Gemma 4 12B Coder GGUF 出来了,把 Fable 5 的推理链蒸馏到本地 12B,12GB 显卡甚至 CPU 都能跑。这个方向我很喜欢。云端神模型当然爽,但进内网、控成本、长期跑,最后还得靠本地小钢炮。专家模型负责开天门,小模型负责搬砖。数字员工也开始有师徒制了。
显示更多
我把本地一个中型项目的知识库搭建好了。把 Hermes Agent 接入到知识库里边。今天上午在公司开了一上午的会,用飞书妙记。开完会以后,把飞书妙记转成文本,扔给 Hermes Agent。让它基于我的项目知识库生成会议纪要。出来的会议纪要把我震惊了,特别牛逼。简直就是项目里边的一个全能项目助手,它记的会议纪要比我们自己还懂自己。我坚信,这就是以后 AI workflow 的方式。我的一个目标就是把这套牛逼的方式给铺开到我们整体的团队乃至公司。狠狠的震惊一下他们。
显示更多
今天有个特别赛博朋克的瞬间。
Claude Code 连不上网了。
我折腾半天没搞定。
最后打开 DeepSeek 网页版,让它一步一步指导我排查 Claude Code 的网络问题。
最后修好了。
修好以后,我立刻关掉 DeepSeek,继续回 Claude Code 干活。
那一瞬间我突然想到马斯克那句话:
“人类文明,可能只是硅基文明的引导程序。”
然后我发现:
DeepSeek 对我来说,
已经像 Claude Code 的引导程序了。
它自己不是终点。
它存在的意义,
是帮助另一个更强的 Agent 系统顺利运行。
显示更多