注册并分享邀请链接,可获得视频播放与邀请奖励。

与「开放人工智能研究中心」相关的搜索结果

开放人工智能研究中心 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 开放人工智能研究中心 的内容
硅谷的塑料友谊这次看来是彻底炸碎了,老黄昨天公开给 Sam Altman 和 Dario Amodei 灌了一记耳光。 他在最新发言中,可以说是毫无留面地对 OpenAI 和 Anthropic 的两位明星 CEO 进行了毫不留情的“公开处刑”。 老黄直接撕掉了这帮人工智能新贵的伪善面具,他的抨击极其辛辣: 他痛批 Altman 和 Amodei 这帮人,年纪轻轻,却都患上了膨胀的“上帝综合征”,把自己当成了决定人类命运的先知。 他点名这几家头部大模型公司,为了资本故事和监管博弈,天天在媒体上疯狂散播这些类似“AI 马上要抢走所有人工作”、“AI 正在摧毁现代文明与民主体制”的全球恐慌。 对于这套把戏,掌控着全球 AI 算力命脉的老黄却只用了一个词来定性:荒谬至极。 这或许才是行业最顶层的清醒看点:卖大模型的坐在 PPT 后面天天扮演拯救世界的悲情英雄;而真正把芯片卖给他们的底层霸主,早就看穿了这不过是一场自我神话的资本秀。 这是变天了,老黄到底站哪边去了? #英伟达# #开放人工智能研究中心# #安索普公司# #山姆·奥特曼# #科技资讯#
显示更多
0
28
288
50
转发到社区
据北京可靠消息源向《爆点周刊》透露,2025年底,中共中央作出一项涉及中国大陆互联网开放的重大决定:允许两类特定人群在严格审批和监控条件下访问国际互联网。 据悉,此次获准访问国际互联网的对象,主要服务于中国官方所谓“走出去”和“请进来”两大战略。 “走出去”人员范围包括:因对外宣传、舆论战、国家安全及相关涉外工作需要访问国际互联网的人员。具体包括各级党委、政府及事业单位在编人员,不包括临时聘用人员;受党政机关、事业单位委托,承担对外工作任务的人员;以及国有企业管理人员和相关研究人员。这一范围相较以往大幅扩大。 “请进来”人员范围则主要包括:来华参加会议的外国人员,以及被中方认定为“可信赖、安全可控”的在华外籍工作人员。 中央网信办在相关通知中强调,这项举措是经中央政治局会议讨论,并经习近平批准后出台的。通知要求,各地要“大力动员、精准施策”,尽快在国际互联网舆论场中夺取主动权和话语权,服务中共所谓“国家中心工作大局”。与此同时,对于普通民众通过 VPN 等翻墙技术擅自访问国际互联网的行为,中央要求“严厉打击、坚决管住”。 针对这一消息, 一般我们都会联想到中共将要加强“大外宣”的主动, 全面出击. 对此我完全同意, 看来我们以后将面对更多的宣传矩阵了, 不仅规模更大, 而且我猜将会呈现多层次, 关联性, 规模性等特点. 但在这个消息所反映出的中共动向的角度去解读, 我认为还不能错过另一个角度, 那就是习近平的“全球治理”野心, 也就是他已经跃跃欲试了很多年的“给人类指明方向”的野心. 中国国务院新闻办公室在 2026年6月17日 正式发布了一部重磅白皮书:《构建更加公正合理的全球治理体系:中国的理念、倡议与行动》。 针对当前科技热点,特别提到了《全球数据安全倡议》以及《全球人工智能治理倡议》,主张统筹AI的发展与安全,探索开展国际监管合作。 该报告是中国在继“全球发展倡议”、“全球安全倡议”和“全球文明倡议”之后,又一次“给人类指明方向”之举. 《人民日报》等党媒在解读白皮书和习近平思想时,将这种参与提升到了历史高度,称其“体现了胸怀天下的格局担当”,要“为天下计,为万世谋”。官方试图向外界传递一个信号:中国的目的不是取代美国成为单一霸权,而是要推动世界走向“平等有序的多极化”。而习近平, 将扮演新的全世界领导人的角色. 我们看到, 在巩固了自己的权力, 扫清了党内所有潜在对手之后, 习近平的目光已经伸向了全球, 这从他最近几个月频繁的外事活动也可以看到一些端倪. 这次以文件下发的方式动员网军向全球进军, 也可以看作是配合习近平的全球治理理念的又一个动作. 你可能会觉得这很可笑, 但人家是相当认真的. @baodiantimes
显示更多
0
20
171
22
转发到社区
说实话,我越来越觉得,很多人把“AGI和区块链会结合”这句话当成一个普通的科技叙事在聊。好像又是哪个基金在吹下一个热点。 但你仔细想想,真正的问题根本不是什么AGI能不能变聪明。它肯定会变得非常聪明。真正的死结是协调。 一个完全自主的AGI智能体,只要开始真正独立行动,它需要的每一件小事,传统系统都接不住。 举个例子。它需要支付算力费用。需要验证自己的身份是合法的。需要临时雇另一个Agent帮它完成子任务。需要存储一些价值,方便随时调用。需要跟别的Agent签一份自动执行的协议。需要在几秒钟内把钱从一个国家转到另一个国家,没有时差,没有节假日。 这些事情,你用银行做,用信用卡做,用传统API做,马上就会碰到一堵墙。银行需要人工审核,信用卡说冻结就冻结,API接口要向平台申请权限,不同国家有不同的资本管制,一个社交平台看你不顺眼就能半夜封号。 而一个真正自主的AGI,不可能因为凌晨两点银行怀疑一笔交易异常,就原地等着天亮人工解锁。 它的运行不能被人为中断,否则所谓的“自主”就是一句空话。 就在这个节点上,区块链的角色变了。它不再是你钱包里的投机资产,也不再是某个社区的meme叙事。它非常安静、非常自然地,变成了AGI能够活下去的底层基础设施。 我们先说稳定币。很多人觉得稳定币就是炒币用的,但你把视角切换到AGI身上,稳定币的逻辑比银行账户合理太多。稳定币是全球化的,不需要开户审核。稳定币是可编程的,资金流转的条件可以写死在智能合约里。稳定币是7x24小时在线的,没有周末也没有节假日。最重要的是,稳定币是机器可读的。一个Agent可以直接在链上读取自己的余额、交易状态、合约执行条件,不需要打电话给客服,不需要上传身份证照片。 所以AGI不会“偏好”银行。银行是为了人类设计的,有签字、有柜台、有审批流。AGI只会选择摩擦最小的系统。从纯理性角度看,稳定币就是比银行账户更适合智能体的“活钱”。 再来说去中心化身份。这个赛道很多人已经懒得提了,觉得是上一轮的老叙事。但我认为它被严重低估了,尤其是在AGI即将到来的背景下。 今天的互联网,本质上分不清跟你说话的是真人、是普通聊天机器人、是高级Agent,还是一个被恶意合成出来的虚拟人格。平时你可能觉得无所谓,但一旦AGI级别的系统同时跟几百万人交互,这种身份模糊带来的风险会指数级上升。你根本不知道一个Agent是谁部署的,它用的模型是哪个版本,它做出的决策有没有被第三方篡改过,如果它造成了实际损失,你该找谁负责。 链上身份真正的作用,不是炫耀你买了哪个蓝筹NFT,而是在底层把这些问题变成可验证的公开记录。谁部署了这个Agent,上链。哪个模型做出了这个决策,上链。输出结果有没有被篡改,上链。当自主系统出错的时候,谁应该承担责任,上链。没有这套东西,你连追责都追不了,AGI就永远只能活在受控的实验室环境里,无法真正走向开放世界。 另一个被大多数人忽略的结构性依赖,是去中心化算力。 你现在看看全球最顶级的AI基础设施,基本就捏在三四家科技公司手里。这本身没问题,因为训练大模型确实需要集中资源。但你想过没有,人类历史上可能诞生的最强大的智能系统,它的每一次推理、每一个决策、每一次自我更新,竟然完全依赖几家公司的中心化服务器。这带来的不是技术问题,而是结构性风险。政治风险,某个国家一纸禁令就可能切断算力。经济风险,这几家公司可以随时提价或者改变服务条款。物理关停风险,一个运维工程师拔错电源,整个AGI就下线了。还有模型操纵风险,服务器端的输出可以被悄悄修改,而外界根本不知道。 当AGI的自主程度足够高以后,把它完全托付给中心化服务器,本身就是一件极其危险且不合理的事情。它需要一个分布式的、无需许可的、可验证的算力底层,让计算任务可以分散到不同节点上执行,结果可以被第三方验证,没有单点故障,也没有单点控制。这就是去中心化计算网络的价值所在。 数据溯源也是一样。AGI生成的内容、做出的判断、调用的知识,如果无法追溯来源和变更历史,整个系统就没有可信度。区块链天然就是一条不可篡改的日志,每一条数据的前世今生都可以被记录和验证。这在金融、法律、医疗等高监管领域,是AGI能够被接受的先决条件。 所以我现在越来越觉得,整个加密行业里真正被低估的,不是那些蹭AI热度的meme币,也不是包装很华丽的AI Agent代币。而是那些看起来很“无聊”的底层轨道。稳定币,去中心化身份,分布式算力市场,数据来源追踪,可编程的协调层。 大多数人都在追“AI Agent”这个概念,市场上到处都是各种Agent代币的炒作。但很少有人认真去研究,这些Agent如果真的活过来了,如果真的要在现实世界中自主运行,它们赖以生存的那层基础设施到底是什么。 这也是我反复跟人讲的一个观点。区块链最重要的时刻,不是在AGI到来之前,而是在AGI到来之后。因为在那之前,区块链只是一个可选的金融工具和实验场。但在那之后,它变成了AGI能够安全、可信、自主运行的唯一基础设施。 到那时候你再回头看,最性感的东西不是某个新代币,而是那些让智能能够真正自由运转的无需许可的底层管道。稳定币是它的血液,去中心化身份是它的身份证,分布式算力是它的骨架,数据溯源是它的记忆,可编程协调是它的神经系统。 这些东西现在看起来不性感,甚至有点枯燥。但它们恰恰是AGI真正走出实验室、进入现实世界时,最离不开的东西。
显示更多
Elon Musk 起诉 OpenAI 与 Sam Altman 的案件,近日在美国加州联邦法院出现重大结果:陪审团一致站在OpenAI一方,认定马斯克“起诉过晚”,因为他早在2017至2018年期间就已经充分知晓OpenAI正从最初的非营利AI研究机构逐步走向商业化和融资扩张,包括接受微软投资、建立营利性子公司等方向,因此直到2024年才正式提起诉讼,已经超过适用诉讼时效。案件最终并未真正进入“OpenAI是否背离造福人类使命”这一核心伦理争议,而是被法院以程序性理由驳回。法官在听取陪审团意见后正式作出裁决,意味着马斯克此次试图阻止OpenAI营利化转型的法律行动阶段性失败。马斯克此前曾指控OpenAI违背创立初心,认为其从“开放、非营利、服务全人类”的组织,变成了追求资本回报和市场垄断的商业AI公司,并要求法院撤销OpenAI的营利结构、限制其商业化运营,甚至追讨高额“非法收益”。而OpenAI方面则在庭审中提交大量邮件和历史沟通记录,证明马斯克不仅早已知情,还曾主动建议OpenAI提高融资规模、扩大商业化能力,因此法院最终采纳了OpenAI关于“知情已久”的关键抗辩。多家美国媒体认为,这次胜诉对OpenAI意义极大,因为此前市场一直担心该诉讼会影响其未来融资和IPO计划,如今最大的法律不确定性之一被暂时解除。不过马斯克随后立即表示将继续上诉,强调此次失败只是“程序问题”,并不意味着他的核心指控错误,同时也再次公开批评OpenAI已经从“开放人工智能”变成“封闭且逐利的超级公司”。
显示更多
最近 RH 上古法 NFT 在集体下跌,Anvil 系上线即拉升。所以我刚买了一个 Anvil 系的“符文”试水。 ▫️研究一圈后,我大概明白了为什么 $STONKBROKER 能涨飞,以及 RH 为什么在给 Anvil 站台。 我的推测是:Robinhood 正在把 Anvil 当成「股票代币化」的新玩法测试场。 ✅ 细节我就不重复了,总体上Anvil协议是这么玩的 ▫️传统 NFT 即使搬到 Robinhood,还是老一套:JPEG → 炒地板价 → 等人接盘……所以 RH 上的人根本不买账。 Anvil 换了个玩法:NFT 和 Token 绑定,NFT 可以质押、借贷、赚收益;Token 可以交易、销毁、激活升级 NFT。 简单归纳就是:NFT + Token + 交易 + 借贷 + 收益 Anvil这一套,刚好撞上了 Robinhood 做 L2 最重要的一件事:可编程资产。 ✅而 Robinhood 做 L2 就是为了可编程资产 你想想如果用户在RobinhoodChain上还是: 买 NVDA Token → 等涨 → 卖掉 那和 Robinhood App 里买股票相比,有多大革命? 🔸真正的变化是:NVDA 上链以后,可以被智能合约调用、抵押、组合、奖励,甚至交给 AI Agent(人工智能代理)管理。 所以 Robinhood 开放 L2,不只是想再造一个链上券商。 它其实是在等开发者回答一个问题: 股票变成 Token 以后,除了交易,还能拿来干什么? 刚好Anvil / StonkBrokers 正在给出一种很 Crypto 的答案: 🔸NFT + Token + 手续费 + Stock Tokens(股票代币) 这背后其实解决了一个很现实的问题: ▫️TradFi(传统金融)资产有价值,但不好玩。 ▫️Crypto 很好玩,但很多资产没有真实价值支撑。 那就把两边拼起来。 比如 NVDA 本身没什么玩法,但如果变成: ▫️NFT 交易 → 产生手续费 → Burn(销毁)Token 激活 → 获得更高奖励 → 奖励 NVDA / TSLA 等股票代币 味道一下就变了:Crypto 的游戏机制 + TradFi 的资产。 🔸Robinhood 提供资产,Anvil 提供金融引擎,NFT 项目设计玩法,Crypto 用户提供流动性和投机需求。 这四个东西真接起来,飞轮才算开始转。 ✅从找空投Alpha的角度来看,我并不关注NFT涨不涨 我关注的是: Robinhood 会不会借 Anvil,把 Stock Token 从“链上股票”,变成 Crypto 的金融积木。 如果 Anvil 能跑通,那么股票上链只是第一步。 下一步,是把股票塞进 NFT、借贷、收益、AI Agent 里,让 Crypto 重新玩一遍。 那这个时候,我们不就是早期玩家了吗?
显示更多
0
27
28
1
转发到社区
【谷歌、AMD、Cloudflare等公司加入,签署支持AI开源模型发展公开信组织增至50家】英伟达、微软、IBM、Meta等25家美国科技企业本周联名签署一封公开信,呼吁开放权重AI模型。公开信指出,尽管开放权重存在难以管控衍生版本等风险,但封闭模型同样存在安全隐患。开放生态能够动员广大研究者排查漏洞、完善安全防护,是实现人工智能安全的重要路径。目前,该公开信得到签署公司/组织已经达到50家,新加入的企业有谷歌、AMD、Cloudflare、Block和Ollama等,以及此前报道中出现过的OpenAI、YCombinator、GitHub、思科等。值得注意的是,亚马逊和Anthropic至今没有签署这份声明,引发外界关注。《福布斯》认为这其中的原因在于商业利益,亚马逊是Anthropic最大投资者。并且Anthropic自始至终都只提供闭源AI模型服务,该公司还一直坚持“AI安全”立场。
显示更多
Demis Hassabis 神级天才的思维脉络 在人工智能与科学交汇的前沿,Demis Hassabis 提出了一条极具颠覆性的路径。他认为,自然界并非我们表象中那般混乱无序,而是隐藏着深层次的结构性秩序。理解世界,不必总是从演绎推理和方程建立起步,而应从感知数据中压缩出可调度的结构,借此进行预测和推演,进而反向建构理论。这一主张不仅重塑了科学研究的技术路径,更触动了我们对知识建构本身的认知方式。 一、结构压缩优先:从 Veo 看理解的重定义 Demis 的这一认知在 DeepMind 的视频生成模型 Veo 上得到了直观体现。Veo 模型并未学习任何显式的物理方程,却能够凭借观察大量自然视频数据,在没有编程预设规则的前提下,生成逼真且具有高度物理一致性的动态画面,例如汽车驶过积水时水花飞溅、玻璃破碎后的细节反馈。这是一种典型的“现象压缩式理解”路径:AI 通过在高熵视频流中提取出稳定可复用的结构压痕,实现对物理现象的预测能力。 我们由此必须追问:如果一个模型能够在不知晓动量守恒的前提下准确预测水花的下一帧状态,它是否“理解了物理”?Demis 的回答是明确的——理解的核心,不在于是否掌握方程,而在于是否能压缩现象为结构,并借此形成调度性强的预测路径。 二、信息先于物质:可学习宇宙假说 在这一架构下,Demis 提出了他的核心哲学命题:信息先于物质。即,物理世界的本质是一种信息性结构,而非能量或粒子。我们所观察到的规律,其底层机制是信息的组织方式。 他进一步提出“可学习宇宙假说”:任何自然界中反复出现的模式,都存在一个可被经典图灵机有效压缩与学习的结构路径。这意味着,我们无需总是从第一性原理出发建构模型,而可以通过 AI 对大量数据的结构化吸收,形成一种预测优先的认知框架。 三、自然流形:结构稀疏的低维空间 AlphaFold 的成功证明了这一哲学判断的工程可行性。蛋白质的理论构象空间高达 10^300,传统方法根本无法穷举。然而自然界中,蛋白质往往能在毫秒级自动完成折叠,说明它们并不是随机地在空间中漂移,而是沿着一条被“压缩演化”的低维流形展开。 Demis 将这种现象称作“自然偏好的低维结构空间”,也就是流形(manifold)。AI 的任务不再是模拟所有路径,而是在数据中采集这一稀疏、稳定、可导航的结构区域。这使得 AI 不必理解所有机制,便能通过结构导航完成预测,从而以压缩路径替代穷举机制。 四、AI First Science:新范式的科研工作流 在 2024 年诺贝尔奖演讲中,Demis 明确提出了“AI First Science”的科研范式:不再从理论建模出发,而是先训练模型,让其学习压缩结构;接着由这些结构驱动调度,再反向解释形成机制。 他提出的科学工作流如下:训练 → 压缩 → 调度 → 解释。此路径彻底颠覆了过去数百年“建模—推导—验证”的科学流程,转而采用“预测—拟合—反演”的演化方法。 在这个范式中,梯度的含义也发生转变。它不再是传统微积分中的导数,而是指数据中隐含的可学习方向信号。这种梯度可能是离散的、统计的、甚至语义的,但它们都构成了一种“方向向量场”,AI 可以在其中找到“走了会变好”的结构路径。 五、结构提出者:AI 从解答者变为猜想引擎 更为震撼的是,Demis 不满足于让 AI 解题,而是要它成为结构猜想的提出者。AlphaGo 的第 37 手,是这一目标的原点:一手无人类预期的棋步,首次展现 AI 提出结构创新的能力。从那一刻起,Demis 开始布局他的“结构发现引擎”路线图。 这一进化路径包括 AlphaGo、AlphaZero、AlphaFold、AlphaTensor、AlphaDev、AlphaGeometry、AlphaProof,每一个系统都试图在不同领域内自动识别高维结构中的压缩路径,并从中提出新的结构问题、优化路径甚至定理猜想。 Demis 将这种 AI 的猜想能力界定为“sweet spot”——即 AI 所提出的结构刚好超出人类直觉边界,但仍在可理解、可验证的范围内。这是 AI 与人类协作的最佳认知区:AI 提出、预测、压缩,人类验证、解释、整合。 六、结构文明的起点:聪明的普通人可及 更令人欣慰的是,Demis 并未将这场科学革命锁死在象牙塔,而是以开源的方式将这些结构性工具逐步释放至公众。AlphaFold 的结构数据库向全球开放,AlphaDev 的算法进入 LLVM 编译器,AlphaProof 与 Lean 数学社区共同构建定理验证系统,这一切都在昭示一个转折点的到来:提出问题,人人可为。 这也意味着,科学创意将首次脱离“天才垄断”,进入“结构协作”。未来的科研者不再需要天赋异禀或名校背书,而是要具备三种能力:理解结构、调度工具、表达路径。Demis 本人就是这种跨界结构型认知者的代表——他从游戏设计师走来,用压缩思维与策略构建,引领科学认知系统的结构重构。 今天的科学,不再是“高不可攀的圣殿”,而是“结构化的工作流”。理解 Demis 的思维路径,就是提前参与这场认知文明的革命。从 Move 37 到 Conjecture Engine,从图灵机到猜想母体,我们已抵达一个时代的起点——在这个时代里,结构就是语言,猜想就是代码,科学的未来,属于会调度结构的你。
显示更多
0
13
135
36
转发到社区
NVIDIA 发布 Skill2Env:用“集体技能”强化智能体 NVIDIA 研究者们把社区公开的 Agent Skills 编译成可执行 RL 训练环境的数据流水线:3.4k 个 Skills 变成 8k 个带程序化测试和行为量规的终端任务;仅 300 步 RL 训练就让 Qwen3.8-27B 在 Terminal-Bench 2.1 上提升 4.7 个百分点,且模型行为显著向源 Skills 的方法论对齐。 开源项目: 核心洞察:公开 Agent Skills 是一个被忽视的监督来源 Agent Skills 是“教智能体做某件事”的文件夹:一个 SKILL.md 加上可选的脚本、参考资料和资产。论文指出,把公开 Skill 语料当作数据来读,它同时提供三样东西: · 任务分布的采样:人们真正想让智能体处理的任务分布(有人愿意花时间写下工作流,说明这活儿值得自动化); · 真实世界的锚点:指向真实的仓库、数据集、工具和工件; · 结果测试表达不了的质量标准:领域专长、默认参数、常见坑、“好结果长什么样”。 # 数据流水线:四阶段编译,验证靠构造 1. Plan(分解):容器化的 Codex 规划器读取完整 Skill 包、联网调研相关公共资产,把 Skill 拆解成若干可验证的 workflow,每个附带元计划(场景、初始世界、预埋缺陷、难点来源、解法草案、验证策略)、资产建议和“任务轴池”(任务原型 × 验证器模式 × 人物画像)。 2. Diversify(多样化):宿主从轴池采样一组组合,加上复杂度、指令语气、请求者专业水平。关键设计是轴池以 workflow 为条件:研究型 workflow 配“证据可追溯”验证和研究者画像,而不是从全轴乘积空间乱抽,这让多样化保持 sensible。 3. Create(构造):全新创建者 Codex agent 在 Docker 内工作,尽可能用真实素材(钉在特定 commit 的开源仓库、真实版本化文档、官方 API 规范);需要联网服务的场景改造成本地替身(stub 服务器、录制回放 fixture、PATH 上的假 CLI、种子数据库),求解时绝不依赖网络。创建顺序被严格固定:先建世界 → 写指令 → 写测试 → 写量规 → 最后才写参考解,测试先于解法冻结,保证解法必须迁就评分契约而非反过来。 4. Verify(验证):宿主端无模型参与的接收门:静态检查(布局、符号链接、Dockerfile 安全、基础镜像按内容摘要钉死)+ 两个容器内试跑:Oracle(参考解)必须全指标满分,NOP(什么都不做的 agent)必须全指标零分。任一失败即拒绝。 值得注意的一个反直觉选择:不做 teacher 模型预验证(不像部分工作用强模型试解、解不出就丢弃任务)。理由有二:这会把任务难度上限压到验证器能力,且成本翻倍;而 group-based RL 的在线动态过滤(rollout 无优势的 prompt 自动不产生梯度)天然淘汰过难/过易任务。 # 数据画像:广、贵、且忠实于源 规模与成本:7,971 个任务,用 GPT-5.6 Sol(xhigh 推理档)生成,API 花费超 9 万美元。(脚注:出于法律原因,公开发布的数据集改用 Kimi-K3-max 在同一流水线下生成。) 领域分布:13 个领域中,软件工程仅占 22.5%,AI/ML 10.5%,商业/金融/法律/HR 10.5%,营销 9.3%……论文对比了 TMax-15K、Terminal-Bench、DeepSWE 等,Skill2Env 是唯一全覆盖 13 域、且非技术知识工作占大头的语料。 忠实度探针(很聪明的设计):用任务指令+量规作查询、对 3.4k 个 SKILL.md 做 TF-IDF 检索,73.2% 的任务 top-1 命中真实源 Skill,94.6% 进 top-10(随机 0.03%)。单用量规也有 68.5% top-1,证明量规携带的是 Skill 专属方法论而非泛泛建议。 SFT 数据:用 GLM-5.3 对每个任务 rollout 两次,得到 15,968 条轨迹,平均奖励 0.74,中位轨迹 19 次模型调用 + 23 次工具调用。 S2EBench:考虑到公开基准饱和,从 SkillHub 另外生成、逐条人工审核(指令无歧义、忠实于源 Skill、测试公允)后的 79 任务私有 held-out 基准。 # RL 实验:基础设施 + 极简配方 基础设施(论文明确说“现代 agentic RL 首先是基础设施挑战”):Molt(PyTorch 原生全异步训练,Ray + vLLM + FSDP2)+ Polar(agent rollout 层:rootless Apptainer 沙箱、代理回传 token ID 和采样时 log-prob、prefix merging 把 harness 的多次补全缝合成训练轨迹)。 配方(刻意走“简单路线”):GRPO 组归一优势 + DPPO 的 binary-KL 信任域掩码(δ=0.05,超出阈值的 token 直接丢弃,无需参考模型,还能防训练-推理失配);G=8 rollouts/组,批 64,lr 1e-6 恒定,无 KL 惩罚、无熵奖励、无 SFT 热启动,每任务 65k 上下文。 量规校准奖励:开量规时,额外由 GPT-6 Astra 做 LLM-as-Judge(带“宪法”:惩罚无脑循环、reward hacking、答非所问;hacking 实证 = -5 分),总奖励 r = r_V + λs/5(λ=0.2),即 judge 最多把程序化奖励拉动 ±0.2。量规是校准可执行结果奖励,而非取代它,这是与“Rubrics as Rewards”一系的定位差异。 # 四项发现(论文最有信息量的部分) 发现 1:小规模 RL 即有跨域迁移。 仅 300 步、只用 2,400 任务子集训一个 epoch:S2EBench pass@1 +4.3(均分 +18.5),Terminal-Bench 2.1 +4.7(49.4→54.1)。训练集与 TB 无重叠(13-gram Jaccard < 0.8),且训练集从未针对 TB 调过,论文将其解读为规划、工具使用、收尾能力的通用提升而非任务族记忆。这让 27B 本地模型显著缩小了与云端前沿模型的差距。 发现 2:量规校准 RL 在基准上落后于纯结果 RL,一个诚实的负结果。 量规版在 TB 2.1 只有 50.1(纯结果版 54.1);训练中量规版的程序化奖励长期停在 0.5–0.6,judge 分项从头到尾无上升趋势,两个奖励在训练分布上互相拉扯。论文不把它当作对量规奖励的终审判决(两者优化不同目标,而基准只考结果那一半),并给出两个疑因:λ=0.2 的加性形式让失败任务仍能拿正奖励、judge 看不到文件系统等设定均未调优;以及更本质的,Skill 写下的方法论可能本来就不是最大化基准通过率的分布。 发现 3:行为确实向 Skill 对齐,量规的价值所在。 200 个任务的成对偏好测试(judge 拿源 SKILL.md 当标准,比较匿名化的 base 与 RL 轨迹):纯结果 RL 已被偏好 54.5% vs 33.5%;量规版被偏好 73.0% vs 24.0%。这说明量规奖励买到的东西在结果基准上看不见,但对“怎么做事”影响实质,对网页开发、报告综合、开放研究这类难验证任务尤其重要。 发现 4:GLM-5.3 蒸馏 SFT 反而伤害 Qwen。 在 GLM-5.3 轨迹上做 SFT:27B 上 TB 2.1 掉到 45.8;4B 上直接崩塌(TB 18.7→3.4,出现思维/工具调用死循环)。归因:教师的 interleaved-thinking + 工具调用风格与学生自身 post-training 不兼容,模仿覆盖了学生依赖的行为模式却带不来教师的能力。与 TMax 报告的“SFT 混合数据劣化已后训练的 Qwen”互相印证。因此论文所有 RL 结果都从未修改的原始 checkpoint 出发。
显示更多
2026 年 9 月 29 日,OpenAI 在旧金山 Fort Mason 办了今年的开发者大会 DevDay。主讲是 CEO Sam Altman。其他几位上台的人都在做这些产品。产品团队的 Holly 演示了新产品 Dots。后训练(模型预训练之后做对齐和能力调优的阶段)研究负责人 Tejal 讲了模型怎么反过来帮 OpenAI 做研究。Codex 的演示由 Romain Huet 来做,他在 OpenAI 负责开发者体验,去年 DevDay 主题演讲里的 Codex 演示也是他做的。整场演讲分三块:面向用户的常驻智能体 Dots 和协作空间 ChatGPT Space,给开发者的新模型和新工具,以及帮开发者做分发、赚钱的渠道。 1. Dots:一直在线、会主动干活的智能体 Sam 把 Dots 比作电影里那种一直在身边帮忙的 AI 助手。他认为订餐厅、买机票这类代办虽然有用,但和这项技术能做的事比起来太小了。他想要的 AI 知道正在发生什么,也知道你在意什么,不用你事事交代。 Dots 是常驻在线的智能体(Agent),有自己的云端电脑和浏览器,能写代码、跑测试。它的权限跟着用户走,能直接用用户已经在 ChatGPT 里连好的插件,覆盖 4000 多个应用。除了在 ChatGPT 里对话,之后还可以给它发短信、打电话。目前每人先有一个 Dot,以后可以配一整组。Dots 跑在 本月早些时候发布的 GPT-6 Astra 上,Sam 称它是 OpenAI 对齐做得最好的模型。用户可以限定 Dot 能用哪些应用、能不能操作电脑,也能给它的各类操作写自定义指令,愿意交出多少责任就放多少权。 Sam 说,他自己的 Dot 每天早上会把夜里进来的消息过一遍,挑出紧急的提醒他。他说这让他拿回了一部分注意力,没那么离不开手机了。他还举了一个更重的例子:把应用从一个即将停用的旧 API 上迁走。这个 API 可能散落在代码库各处,改了哪里会连带弄坏什么,事先看不出来。Dot 可以追踪依赖关系,找出所有要改的地方,写代码、跑测试,最后把 PR(代码合并请求)交给团队审。他让听众想想,过去做这件事要几个人、花多久。 开场视频里,用户把自己的 Dot 改名叫 Alfred。Alfred 和另一个 Dot 帮用户上线网站,改董事会材料,在婚礼蛋糕商家取消后找好备选。它们还发现财务会和女儿的演出撞了期,提出改时间。每件事都是 Dot 推进到需要人确认的地方,再由人拍板。 2. ChatGPT Space:人和智能体一起用的工作区 Sam 认为,现有的生产力软件几乎都没考虑过人和 AI 一起干活。ChatGPT Space 以页面为单位,可以在里面写计划、做调研、生成图片和数据。页面和文件像网盘一样放在同一个空间里。Dot 能直接在页面上工作,在评论里 @ 它,它就会接活。页面本身也能带指令,比如“每天去看 API 平台的 Slack 频道,把发现更新到这里”。之后 Space 里还会加入演示文稿,格式做成智能体方便读写的样子,团队成员可以和各自的 Dot 一起改。 在 Holly 的演示里,页面用斜杠命令就能插入交互图表、表格和可运行的原型。她 @ 自己的 Dot(名叫 Dotty),让它把一组数据改成柱状图。图表可以按反馈类型筛选,Dotty 每小时刷新一次。她还让 Dotty 把“某位工程师在我 Slack 私信里提过的新手引导数据”补进 FAQ。Dotty 能看到她的上下文,所以这种模糊的指代也找得到。 3. OpenAI 内部怎么用 Dots Holly 用一个虚构的歌单应用 Blossom Music,模拟发布前一天的状况。早上 Dotty 已经做了几件事:发现发布评审会提前,改好了日历;看完前一晚测试用户的反馈;注意到设计团队临时改了首页,把新设计发给她。她让 Dotty 直接把这个设计做出来。Dotty 调用她笔记本上的 Codex 构建应用,在 iPhone 模拟器里跑起来,再提交 PR。现场的语音演示卡住了,Dotty 一直回复“还在查”。Codex 线程也报过一次错,她重试后才继续下去。 她说,Dots 真正改变 OpenAI 工作方式的地方在 Slack。Dots 在公司 Slack 里有自己的身份,员工就开始把它们当作代理人。被同事 @ 到的零碎请求,直接转给自己的 Dot 处理。建群时,大家从一开始就把各自的 Dot 拉进来,Dot 带回结果时所有人都能看到。 工程师走得更远。有人在反馈频道贴出会话 ID 和一个用户 bug,某位工程师的 Dot 就会接手排查,提 PR 修复。她说这是真实情况:工程师们的 Dots 每天这样修掉几十个 bug,Dots 这个产品本身有很多部分就是 Dots 写的。 4. 上线范围和企业用的 Specialist Dots Dots 和 Space 当天向 ChatGPT Pro、Business Premium 和 Enterprise 用户开放。Dot 包含在套餐里,和它的对话不占用额度。 企业客户还可以预览 Specialist Dots。这是由公司统一设置、供整个团队使用的虚拟同事,负责会计、市场、法务这类工作量大的事。公司给它目标和背景,审核它的产出,给它反馈,反馈在全公司共享。OpenAI 也在和微软合作,把 Specialist Dots 接入 Agent 365(微软用来管理企业智能体的工具),企业可以用已经在用的微软工具来管理它们。 5. 新模型:更便宜的 GPT-6.1 Sol,更快的 UltraFast Astra 发布这几周,用户的要求集中在两点:更便宜,更快。GPT-6.1 Sol(转录稿误作 Soul)的能力接近 Astra,价格是它的五分之一。缓存输入(重复发送、已被缓存的上下文)比标准输入便宜 95%。智能体需要反复读同一批上下文、长时间迭代,这对它们尤其省钱。Sam 说 Sol 在某些方面比 Astra 还聪明,定位是开发者的日常主力模型。 UltraFast 是新的速度档,API、ChatGPT 和 Codex 里都能用。原有的 Fast 档是两倍速度、两倍价格;UltraFast 是八倍速度、六倍价格,每秒 300 个 Token。它现在可以配合 Astra 用,之后也会支持 Sol。现场让两个模型用同一个提示词,做一个 DevDay 配色的火箭。UltraFast 的火箭已经升空时,标准速度的还没做完。 订阅也跟着调整。新推出的 500 美元档 Pro 订阅叫 Pro 500,额度最高,是 Plus 的 25 倍。它可以在 ChatGPT 和 Codex 里用 UltraFast,还能通过“用 ChatGPT 登录”在合作方的应用里使用。Pro 200 重新开放,继续提供所有前沿模型。 另外预览了 Decisions API。它给 Luna 模型一组预先定义好的选项,让模型从中选一个,比如给请求分流、给图片分类、决定智能体下一步做什么。任务收窄成选择题之后,响应时间可以压到一秒以内,同时保留图像理解、多语言和安全防护。Romain 后来补充说,做机器人的朋友看中的是它能处理视觉输入:机器人可以根据看到的东西,近乎实时地快速行动。 6. 模型开始帮 OpenAI 做研究 Sam 提到,去年这个时候,他和 Jakob 在一次直播里预测,一年内会出现第一个“AI 研究实习生”,当时几乎没人相信。几周前 OpenAI 宣布达成了这个目标:有了一个能接手定义清晰的研究任务的系统,这类任务原本要熟练的研究员花大量时间和精力。 Tejal 的方向是电脑操作(computer use,让模型像人一样操作桌面和浏览器)。她举了两个例子。 第一个是让模型优化电脑操作的运行框架(harness,包在模型外面、负责调用工具和管理步骤的代码)。模型在循环里持续寻找能同时降低延迟、提升效果的改动,团队把找到的改进合进生产环境的框架,并用于后训练。结果是延迟改善了两倍以上,已经上线。 第二个是模型帮忙改进了监控和拒绝训练,让 Astra 在不安全的场景里更会拒绝。Astra 在电脑操作压力测试上因此达到业内领先,操作时出错更少,也更贴合用户的本意。 她给出了几项内部数据。今年夏天之后,研究工作消耗的 Token 量急剧上升。1 月时,模型能做好 15 分钟以内的短任务,需要一天以上的任务大多会失败;到 7 月,超过三分之一的一天量级研究任务,模型能在无人干预下完成。她还提到,Astra 这类模型已经帮忙解决了 100 多个悬而未决几十年的数学问题,也在参与针对耐药感染的新抗生素、古代语言研究、可再生能源和工业机器人等方向的工作。 7. 给开发者的底层工具 Sam 说,OpenAI 想让开发者用上自己内部用的东西。 第一件是 Codex 的运行框架。它同时支撑着 Codex、ChatGPT Work 和 Dots,目标是用最少的 Token、最快拿到准确结果,现在已经开源。第二件是 Codex 完全上云:在手机上开始的任务,可以在浏览器或桌面端接着做,合上笔记本任务也不会中断。 云端能力带来了 Codex Security Cloud。它在云端环境里持续寻找漏洞,并准备好验证过的修复方案供人审核,这次新增了自动去重、定时扫描和新界面。Sam 说这是为了给防守方更好的工具,因为“我们看得到接下来会发生什么”。 新的 Agents API 进入公开测试。它包含运行框架、托管、记忆、多智能体控制等功能,是 Codex 和 Dots 用的同一套技术,也加入了电脑操作能力。现场的例子是一个网站测试智能体,会自己打开浏览器、点击页面、测试流程。基础设施方面,OpenAI 和 AWS 合作推出由 OpenAI 驱动的 Bedrock(AWS 的托管 AI 服务)托管智能体,AWS 客户可以直接使用 OpenAI 的前沿模型、Codex 和 ChatGPT Work。 隐私方面预览了 OpenAI Private Intelligence。其中的零数据留存(ZDR)配合私有安全处理,可以在不把用户内容存到 OpenAI 服务器的情况下做安全检测;私有推理则把隐私保护延伸到推理阶段。Sam 说这套方案是和最大的一批客户一起设计的,目的是让他们能把模型用在最敏感的工作上。 性能方面,Responses API 一年里增长了 100 倍,可靠性保持在 99% 以上。首个 Token 的等待时间缩短了 45%,工具调用和工作流提速 30% 以上。 8. Romain 的 Codex 演示 演示从手机上的 Codex 开始。Romain 人还在会场外,让 Codex 替他跟观众打招呼、讲一个会场的冷知识。接着他用几张会场照片生成的 3D 场景演示 UltraFast,一边说一边改:把小人放到座位上,把直播画面投到场景里的大屏幕上。现场语音没连上,他改成了打字。 Codex 命令行工具(CLI)这次全面翻新。他让 UltraFast 写一个应用,从观众里随机抽三个人送明年的门票,几秒就写完;改成抽六个人,也几乎是瞬间完成。命令行现在支持由 GPT Live 驱动的双向实时语音,不只是语音转文字,但现场没能演示出来。 后面几段演示了多模态和电脑操作。游戏 Astra Adventures 从一张纸上的草图开始,几轮之后画面还很粗糙,借助图像模型,才变成有质感、能用在正式游戏里的美术。然后他让 Astra 通过浏览器自己学着玩这个游戏,屏幕左边显示模型的决策,右边显示它按下的按键。 他又用“应用快照”(app shot)把自己记录飞行课程的应用作为上下文交给 Codex,让它在各种屏幕尺寸下审查这个应用并截图。Codex 自己在模拟器里点开了各项功能。云端 Codex 现在和本地版用同样的工具,包括插件和电脑操作。他顺手把一个“用 Rust 重写整个后端”的任务丢到云端,打算稍后在手机上查看。 最后一个演示用的是 Hugging Face 借来的可编程小机器人 Micro Duck,它名叫 Lavender。Romain 前一晚让 Codex 把它接好:视觉用 Astra,图像生成用 GPT Image 2.5,语音交互用 GPT Live 1。机器人现场看着观众画了一幅画。他说,OpenAI 做 Dots 和 Codex 用的,就是 API 里开放给开发者的同一批工具。 9. 分发和变现:让开发者在 ChatGPT 上做生意 ChatGPT 每周大约有 12 亿人使用。Sam 承认,此前类似的尝试效果参差不齐。他说这次有信心,是因为开发者拿到的是 OpenAI 自己做 ChatGPT 用的工具。 第一项是“用 ChatGPT 登录”(Sign in with ChatGPT)。用户登录第三方应用时,可以直接用自己 ChatGPT 套餐里包含的 Token,开发者不必替新用户垫付模型费用。首批有 16 家合作方。 第二项是插件扩展(plugin extensions)。开发者可以把编辑器、仪表盘乃至整个工作区,做成原生嵌在 ChatGPT 和 Codex 里的应用。现场展示了三个例子。一个是会议应用:在 ChatGPT 里看日历上的会议,点“记笔记”后,页面变成团队和 Dots 一起跟进待办的 Space。一个是 Figma:打开设计稿、看团队评论、让 ChatGPT 改稿。还有一个是 Adobe:在 ChatGPT 里使用 Photoshop 的功能。ChatGPT sites(在 ChatGPT 里生成的网站,几个月里已有数百万个)现在也能接入插件和数据。访客用自己的账号登录、带上自己的智能体,看到的内容因人而异。 用户发现插件的渠道也扩大了。除了在插件库里搜索,ChatGPT 还会在对话中识别出能帮上忙的插件,用户当场就能连接。插件审核流程也简化了:开发者可以跟踪审核进度,看到需要修改的地方,申请人工复审,更新工具时也不用从头提交。 第三项是 OpenAI Marketplace,首批有 30 多家合作方,包括 CodeRabbit、Notion、Vercel。企业客户可以用已经和 OpenAI 签下的采购承诺额度来买这些产品,有承诺额度的开发者也能在这里花。通过和模型推理托管公司 Baseten(转录稿写作 Base10)合作,市场里还能用到开源模型。 10. 收尾:一次额度重置,和“文艺复兴”的说法 当天的后续安排里,Peter 会讲 OpenAI 对开源社区的投入,包括新的 OpenClaw Enterprise Harness(OpenClaw 是一个开源 AI 智能体项目)。还有一个 Codex 游戏工作室环节,观众可以用 Codex 做复古游戏,每人能领一台 DevDay 限定的 chromatic computer,用来玩自己做的游戏。最后是 Sam、Tibo (Thibault) 和 Tejal 的现场问答。 Sam 和 Tibo 还在台上按下按钮,给全世界的用户重置了一次用量额度。Sam 说 OpenAI 已经做过太多次重置,Tibo 一直想把公司改名叫“重置公司”。 最后 Sam 说,他不喜欢把 AI 比作新一轮工业革命,那意味着人变成巨大机器里的齿轮,转得越来越快;生活里有些部分不能也不该被自动化。他希望,如果做对了,AI 带来的会更像一场新的文艺复兴:让人对自己的生活有更多掌控,有更多工具去创造、学习和探索。
显示更多
0
8
145
34
转发到社区
一位MIT教授仅用一小时讲座就悄悄摧毁了整个管理培训行业, 而迄今已有一千万人观看了这场讲座。 他在2018年1月录制了一次, 十八个月后他就去世了。 行政教练收费一次一万五千美元, 却只能教他那小时免费讲座内容的一部分。 他叫帕特里克·温斯顿。 他从1972年到1997年领导MIT人工智能实验室, 著写的AI教科书影响了几代计算机科学学生。 四十年来,他每年一月都会讲授一堂课: "如何演讲"。 整个框架可以写在一张餐巾纸上。 不要照稿读。 成为你描述的形象。保持视觉简洁。 删除杂乱。以真诚的同情心开场。 以人们会在晚餐时重复的话句结束。 永远不要以笑话开场。永远不要以"谢谢"结尾。 最后这条规则单独就让培训行业损失惨重。 他通过告诉学生说话好、写作好、想法强这三点会影响成功, 按这个顺序。他的信念足以让他花五十年教工程师如何交谈。 创业者花八万美元读MBA, 随后又雇通讯教练重新学习温斯顿免费传授的内容。 工程师编写优秀代码却输给了在通勤时看过这讲座的同事。 讲座在MIT开放课程中免费提供。 教科书在他的页面上免费。 温斯顿于2019年去世。 一千万观众中几乎没人真正用过餐巾纸上的四条规则。 餐巾纸免费。 在下次会议中真正使用它才是全部优势。
显示更多
0
35
640
169
转发到社区