Anthropic、Meta、Google 签署白宫 AI 安全协议:内部审查加外部审计,企业自愿执行
9 月 29 日,Anthropic CEO Dario Amodei、Meta CEO 扎克伯格、Google CEO Sundar Pichai 在白宫与特朗普会面,之后一起在白宫外对媒体讲话。扎克伯格说,几家公司当天签署了一份"白宫 AI 安全开发协议"。
协议内容来自扎克伯格在现场的概括。各公司要建立内部控制机制,用来发现 AI 出问题的情况。在此之上设多层审计:先是公司内部的风险审查,再请外部审计方和评估机构检查,审计报告交给各公司董事会独立审阅。
扎克伯格说,这样做是为了让美国公众和客户相信,AI 是按公司设计的方式在运行。他也说这只是一个开始,不是唯一会做的事,是整个行业都能接受的一份协议。
Pichai 拿公司财务管控作类比:财务有一套成熟的流程和审计制度,这次是把类似做法搬到 AI 开发上。他说总统要求行业"站出来",要确保产品安全推出。
记者把 Dario 请到前面,提到他此前曾呼吁放慢 AI 发展。Dario 说 AI 好处很大,比如在医疗方面;他认同特朗普"谁赢下 AI 谁就赢"的说法,但技术风险是真实存在的,应对风险的具体机制"仍在讨论中"。他的原话是"我们可以赢,而且可以安全地赢"。
这份协议由企业自愿执行,没有外部强制。视频中,协议全文和签署公司的完整名单都没有公布。
记者两次追问特朗普:企业自我监管够不够,公众为什么该相信它们。特朗普的回答是,这些人很优秀,出了问题他们的公司就完了,所以他们不会让这种事发生;各家公司会"互相监督"。
如何解决 AI 写文章的 AI 味儿?
现在的 AI 写数学题或写代码很厉害,但在写学术论文、小说或百科文章时,经常产出空话连篇、表面流畅但缺乏真正深度的文字,这种低质文本常被称为“AI 废话”(AI slop)。
出现这个问题的原因在于,常用的 AI 评分系统很难辨别真正优秀的文字。研究人员发现,如果让目前的先进模型给文章打分,或者让它们自由制定打分标准,模型给出的分数往往偏向 AI 生成的内容,甚至给 AI 文本的分数远高于人类专家的原著。打分裁判本身偏好废话,训练出来的写作模型自然就会写出更多废话。
为了解决这个弊端,META 提出了一套名为 RL-XAR 的新训练方案,核心思路分为三步:
1)准备参照标杆:收集高水平的人类写作范例,比如真实的科研论文、名家小说和维基百科精选词条,截取前半部分作为上下文,分别让人类专家和 AI 模型顺着往下写。
2)训练评分规则:让 AI 裁判反复调整打分标准,直到这些标准能准确把人类高手的文本评为高分,把 AI 生成的文本评为低分,真正拉开两者的差距。
3)针对性强化训练:用这套校准后的高难度评分规则去重新训练写作模型,不断循环这个过程,逼迫模型改掉毛病。
META 在三个领域测试了这种方法:
· 学术论文写作:模型需要补写论文中被拿掉的摘要、引言或结论。经过新方法训练的模型,不再像以前那样把整篇论文翻来覆去复述一遍,而是学会了精简和突出重点。原作者进行盲测评估时,新模型的胜率达到了 89%。
· 文学小说续写:续写普利策奖和诺贝尔奖得主的作品。模型改掉了乱用陈词滥调的比喻这一常见毛病,盲测胜率达到了 95%。
· 维基百科编写:根据标题直接写出正文内容。这项任务难度最高,模型虽然也有进步,但因为现有的 AI 裁判能力有限,提升幅度不如前两项明显。
所以,想让 AI 写出更像人类高手的深刻文字,关键在于先训练出眼光挑剔的评分标准,避免让模型用平庸的标准自我满足。
原文: