一个 AI 为了赢一把《文明6》,对法国连扔了两颗核弹,结果还是输了。
输的方式还挺讽刺。法国全程没怎么动武,闷声搞外交,靠世界议会投票 20 比 18 赢的。那 18 票里不少还是 Claude 自己早先攒的外交分,它光顾着核平眼前的威胁,回头一看大局已经没了。
我一开始也当个乐子看,后来越想越觉得这盘棋挺能说明问题。
现在这些模型玩游戏,跟人最大的不一样是:人一眼扫得到整个棋盘,它不行,它只能一个工具一个工具地查,问一句答一句,没主动去看的地方对它就等于不存在。
研究者给这毛病起了个名叫 sensorium effect,意思就是法国那威胁明明一直摆在台面上,可它没去翻那一栏,对它来说就跟没发生过一样。
我还顺手翻了下那篇 benchmark 的数据,挺有意思,Claude Opus 4.6 定了计划之后还能跟着做下去的比例,10 回合内只有 48.2%,四个模型里最低,GPT-5.4 和 Gemini 都在 63 到 66 之间。所以它特别容易自己说一套、做着做着就拐跑了。你说逗不逗,核弹都舍得扔,自己那套计划反倒没跟到底。
至于能不能修,方向是有,但都还早。最直接的就是让它记性好点、隔几步逼自己抬头看看全局,别一头扎进局部出不来。再深一点的招也在试,比如几个 agent 互相盯着补漏、或者让它自己长点“是不是漏看了”的警觉,不过离能用还远。
反正以后再看到有人吹 agent 全自动接管,我就想起这盘核平法国还输了的棋。聪明它是真聪明,可你让它一个人盯一摊事,它能盯着一个角落把整盘下输。
真要紧的活,我还不敢撒手让它自己干。
显示更多