注册并分享邀请链接,可获得视频播放与邀请奖励。

Max For AI (@MaxForAI) “刚刚,一篇可能会引起大模型圈地震的论文发表了! 研究人员第一次系统性地从 OpenAI、” — TopicDigg

Max For AI 的个人资料封面
Max For AI 的头像
Max For AI
@MaxForAI
加入 September 2023
0 正在关注    0 粉丝
刚刚,一篇可能会引起大模型圈地震的论文发表了! 研究人员第一次系统性地从 OpenAI、Anthropic、Google 的闭源模型里,大规模“偷”出了真正的隐藏思维链。 然后,他们顺手拿这些思维链去研究了 Kimi K3、GLM-5.2、DeepSeek 等一批开源模型。 结果非常有意思。 01|原来闭源模型的 CoT,真的可以被“偷”出来 现在 OpenAI、Anthropic、Google 都越来越不愿意把完整思维链交给用户。 原因也很好理解:最终答案可以抄,真正值钱的是模型“怎么想”。 一旦完整 CoT 被批量拿走,就可以直接拿去做蒸馏,训练自己的模型。 所以现在很多 API 的做法,是把模型的 reasoning 加密以后返回给客户端。你看不到内容,但下一轮请求可以把这坨加密数据再交回模型,让它继续思考。 结果研究者发现了一个很离谱的漏洞: 这些加密思维链,在同一家厂商的不同用户、Session,甚至不同模型之间,居然可以互相兼容。 于是攻击方法简单得有点荒谬: 让最强模型思考 → 拿到加密 CoT → 扔给同厂更弱、更容易越狱的模型 → 让小模型把它解出来。 比如 Claude Opus 4.8 的隐藏思维链,可以交给 Haiku 去“念”出来。 你甚至不需要攻破 Opus,找它的小弟Haiku就行。 论文最终在 Claude、GPT、Gemini 三套 API 上都实现了隐藏 reasoning 的提取,等于直接绕过了厂商原本用来防止 CoT 蒸馏的那层保护。
显示更多
We can finally talk about it: We found a way to extract hidden reasoning of frontier models using a vulnerability in the APIs of every frontier AI company. We verified that our reasoning token count matches billed API thinking tokens 1:1 for most of the prompts we queried.
显示更多
0
15
173
20
转发到社区