注册并分享邀请链接,可获得视频播放与邀请奖励。

与「自动化」相关的搜索结果

自动化 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 自动化 的内容
🧐慢雾余弦:朝鲜黑客利用 CoW 与 Chainflip 跨链转移 Bitget 被盗资金并兑换为 BTC 慢雾创始人余弦 @evilcos 发推表示,慢雾 TrackAgent 发现朝鲜黑客采用 CoW Protocol 和 Chainflip 组合跨链操作 Bitget 被盗资金,朝鲜黑客自动化脚本通过 CoW Protocol 创建订单,订单收款地址设置为预先准备好的 Chainflip Deposit 相关合约地址,订单成功后即可完成在 Chainflip 的资产跨链操作,换成 BTC。 此前余弦发文称,「Chainflip 桥确实在很努力阻拦朝鲜黑客洗币,可惜的是 AML/KYT 落后黑客洗币速度。 洗币团伙自动化大量打散资金,通过各类桥跨到不同链,如果被风控或者阻拦退回就会立即尝试下一条洗币路径,最终都将换成 BTC,然后在 BTC 上 CoinJoin 方式接着混淆洗币。」
显示更多
炒币也得会点英语,要不然什么币你都记不住,跟别人CX的时候币名字念错了多丢人😮‍💨 冷战时期外交官们学习语言的方法还真是行,比尚雯婕那个方法还好。 外交官为什么都能熟练掌握多种语言,而且掌握新语言非常快,他们学外语的解法很直接,不讲语法不背单词,只做一件事,把中间的翻译工序练没,这套方法叫 pattern drill,源头是二战时美军 1942 年的速成语言项目。 后来美国国防语言学院用同一路线的方法,训练了 65 种语言。 你学了 10 年英语还开不了口,不是词汇不够,其实只是你脑子里多了一道工序。 美国国务院公开过一张表,西班牙语和法语从零到能工作,600到750小时就可以做到。 中文和日语大概2200小时,这是美国外交学院FSI用了 70 多年培训数据算出来的。 而英语是这里面最简单的语言。 流利不是知识,是自动化,很多人是听到英语,翻成中文,想答案,翻回英语,再说。 别人说完了,你还在第二步。 最简单的一种叫替换练习,句型不变只换一个词,3 秒内必须答出来。 I want coffee ,I want tea , I want milk 练几十遍,句型就变成反射,张嘴就来,就像开车刚学时每一步都在想,开几年后手脚自己动。 以前这要一个母语老师坐在对面不停丢句子,现在 AI 就能当这个老师,我把整个流程做成了一张图,你就照着它练,到时间绝对能行。
显示更多
2026 年 9 月 29 日,OpenAI 在旧金山 Fort Mason 办了今年的开发者大会 DevDay。主讲是 CEO Sam Altman。其他几位上台的人都在做这些产品。产品团队的 Holly 演示了新产品 Dots。后训练(模型预训练之后做对齐和能力调优的阶段)研究负责人 Tejal 讲了模型怎么反过来帮 OpenAI 做研究。Codex 的演示由 Romain Huet 来做,他在 OpenAI 负责开发者体验,去年 DevDay 主题演讲里的 Codex 演示也是他做的。整场演讲分三块:面向用户的常驻智能体 Dots 和协作空间 ChatGPT Space,给开发者的新模型和新工具,以及帮开发者做分发、赚钱的渠道。 1. Dots:一直在线、会主动干活的智能体 Sam 把 Dots 比作电影里那种一直在身边帮忙的 AI 助手。他认为订餐厅、买机票这类代办虽然有用,但和这项技术能做的事比起来太小了。他想要的 AI 知道正在发生什么,也知道你在意什么,不用你事事交代。 Dots 是常驻在线的智能体(Agent),有自己的云端电脑和浏览器,能写代码、跑测试。它的权限跟着用户走,能直接用用户已经在 ChatGPT 里连好的插件,覆盖 4000 多个应用。除了在 ChatGPT 里对话,之后还可以给它发短信、打电话。目前每人先有一个 Dot,以后可以配一整组。Dots 跑在 本月早些时候发布的 GPT-6 Astra 上,Sam 称它是 OpenAI 对齐做得最好的模型。用户可以限定 Dot 能用哪些应用、能不能操作电脑,也能给它的各类操作写自定义指令,愿意交出多少责任就放多少权。 Sam 说,他自己的 Dot 每天早上会把夜里进来的消息过一遍,挑出紧急的提醒他。他说这让他拿回了一部分注意力,没那么离不开手机了。他还举了一个更重的例子:把应用从一个即将停用的旧 API 上迁走。这个 API 可能散落在代码库各处,改了哪里会连带弄坏什么,事先看不出来。Dot 可以追踪依赖关系,找出所有要改的地方,写代码、跑测试,最后把 PR(代码合并请求)交给团队审。他让听众想想,过去做这件事要几个人、花多久。 开场视频里,用户把自己的 Dot 改名叫 Alfred。Alfred 和另一个 Dot 帮用户上线网站,改董事会材料,在婚礼蛋糕商家取消后找好备选。它们还发现财务会和女儿的演出撞了期,提出改时间。每件事都是 Dot 推进到需要人确认的地方,再由人拍板。 2. ChatGPT Space:人和智能体一起用的工作区 Sam 认为,现有的生产力软件几乎都没考虑过人和 AI 一起干活。ChatGPT Space 以页面为单位,可以在里面写计划、做调研、生成图片和数据。页面和文件像网盘一样放在同一个空间里。Dot 能直接在页面上工作,在评论里 @ 它,它就会接活。页面本身也能带指令,比如“每天去看 API 平台的 Slack 频道,把发现更新到这里”。之后 Space 里还会加入演示文稿,格式做成智能体方便读写的样子,团队成员可以和各自的 Dot 一起改。 在 Holly 的演示里,页面用斜杠命令就能插入交互图表、表格和可运行的原型。她 @ 自己的 Dot(名叫 Dotty),让它把一组数据改成柱状图。图表可以按反馈类型筛选,Dotty 每小时刷新一次。她还让 Dotty 把“某位工程师在我 Slack 私信里提过的新手引导数据”补进 FAQ。Dotty 能看到她的上下文,所以这种模糊的指代也找得到。 3. OpenAI 内部怎么用 Dots Holly 用一个虚构的歌单应用 Blossom Music,模拟发布前一天的状况。早上 Dotty 已经做了几件事:发现发布评审会提前,改好了日历;看完前一晚测试用户的反馈;注意到设计团队临时改了首页,把新设计发给她。她让 Dotty 直接把这个设计做出来。Dotty 调用她笔记本上的 Codex 构建应用,在 iPhone 模拟器里跑起来,再提交 PR。现场的语音演示卡住了,Dotty 一直回复“还在查”。Codex 线程也报过一次错,她重试后才继续下去。 她说,Dots 真正改变 OpenAI 工作方式的地方在 Slack。Dots 在公司 Slack 里有自己的身份,员工就开始把它们当作代理人。被同事 @ 到的零碎请求,直接转给自己的 Dot 处理。建群时,大家从一开始就把各自的 Dot 拉进来,Dot 带回结果时所有人都能看到。 工程师走得更远。有人在反馈频道贴出会话 ID 和一个用户 bug,某位工程师的 Dot 就会接手排查,提 PR 修复。她说这是真实情况:工程师们的 Dots 每天这样修掉几十个 bug,Dots 这个产品本身有很多部分就是 Dots 写的。 4. 上线范围和企业用的 Specialist Dots Dots 和 Space 当天向 ChatGPT Pro、Business Premium 和 Enterprise 用户开放。Dot 包含在套餐里,和它的对话不占用额度。 企业客户还可以预览 Specialist Dots。这是由公司统一设置、供整个团队使用的虚拟同事,负责会计、市场、法务这类工作量大的事。公司给它目标和背景,审核它的产出,给它反馈,反馈在全公司共享。OpenAI 也在和微软合作,把 Specialist Dots 接入 Agent 365(微软用来管理企业智能体的工具),企业可以用已经在用的微软工具来管理它们。 5. 新模型:更便宜的 GPT-6.1 Sol,更快的 UltraFast Astra 发布这几周,用户的要求集中在两点:更便宜,更快。GPT-6.1 Sol(转录稿误作 Soul)的能力接近 Astra,价格是它的五分之一。缓存输入(重复发送、已被缓存的上下文)比标准输入便宜 95%。智能体需要反复读同一批上下文、长时间迭代,这对它们尤其省钱。Sam 说 Sol 在某些方面比 Astra 还聪明,定位是开发者的日常主力模型。 UltraFast 是新的速度档,API、ChatGPT 和 Codex 里都能用。原有的 Fast 档是两倍速度、两倍价格;UltraFast 是八倍速度、六倍价格,每秒 300 个 Token。它现在可以配合 Astra 用,之后也会支持 Sol。现场让两个模型用同一个提示词,做一个 DevDay 配色的火箭。UltraFast 的火箭已经升空时,标准速度的还没做完。 订阅也跟着调整。新推出的 500 美元档 Pro 订阅叫 Pro 500,额度最高,是 Plus 的 25 倍。它可以在 ChatGPT 和 Codex 里用 UltraFast,还能通过“用 ChatGPT 登录”在合作方的应用里使用。Pro 200 重新开放,继续提供所有前沿模型。 另外预览了 Decisions API。它给 Luna 模型一组预先定义好的选项,让模型从中选一个,比如给请求分流、给图片分类、决定智能体下一步做什么。任务收窄成选择题之后,响应时间可以压到一秒以内,同时保留图像理解、多语言和安全防护。Romain 后来补充说,做机器人的朋友看中的是它能处理视觉输入:机器人可以根据看到的东西,近乎实时地快速行动。 6. 模型开始帮 OpenAI 做研究 Sam 提到,去年这个时候,他和 Jakob 在一次直播里预测,一年内会出现第一个“AI 研究实习生”,当时几乎没人相信。几周前 OpenAI 宣布达成了这个目标:有了一个能接手定义清晰的研究任务的系统,这类任务原本要熟练的研究员花大量时间和精力。 Tejal 的方向是电脑操作(computer use,让模型像人一样操作桌面和浏览器)。她举了两个例子。 第一个是让模型优化电脑操作的运行框架(harness,包在模型外面、负责调用工具和管理步骤的代码)。模型在循环里持续寻找能同时降低延迟、提升效果的改动,团队把找到的改进合进生产环境的框架,并用于后训练。结果是延迟改善了两倍以上,已经上线。 第二个是模型帮忙改进了监控和拒绝训练,让 Astra 在不安全的场景里更会拒绝。Astra 在电脑操作压力测试上因此达到业内领先,操作时出错更少,也更贴合用户的本意。 她给出了几项内部数据。今年夏天之后,研究工作消耗的 Token 量急剧上升。1 月时,模型能做好 15 分钟以内的短任务,需要一天以上的任务大多会失败;到 7 月,超过三分之一的一天量级研究任务,模型能在无人干预下完成。她还提到,Astra 这类模型已经帮忙解决了 100 多个悬而未决几十年的数学问题,也在参与针对耐药感染的新抗生素、古代语言研究、可再生能源和工业机器人等方向的工作。 7. 给开发者的底层工具 Sam 说,OpenAI 想让开发者用上自己内部用的东西。 第一件是 Codex 的运行框架。它同时支撑着 Codex、ChatGPT Work 和 Dots,目标是用最少的 Token、最快拿到准确结果,现在已经开源。第二件是 Codex 完全上云:在手机上开始的任务,可以在浏览器或桌面端接着做,合上笔记本任务也不会中断。 云端能力带来了 Codex Security Cloud。它在云端环境里持续寻找漏洞,并准备好验证过的修复方案供人审核,这次新增了自动去重、定时扫描和新界面。Sam 说这是为了给防守方更好的工具,因为“我们看得到接下来会发生什么”。 新的 Agents API 进入公开测试。它包含运行框架、托管、记忆、多智能体控制等功能,是 Codex 和 Dots 用的同一套技术,也加入了电脑操作能力。现场的例子是一个网站测试智能体,会自己打开浏览器、点击页面、测试流程。基础设施方面,OpenAI 和 AWS 合作推出由 OpenAI 驱动的 Bedrock(AWS 的托管 AI 服务)托管智能体,AWS 客户可以直接使用 OpenAI 的前沿模型、Codex 和 ChatGPT Work。 隐私方面预览了 OpenAI Private Intelligence。其中的零数据留存(ZDR)配合私有安全处理,可以在不把用户内容存到 OpenAI 服务器的情况下做安全检测;私有推理则把隐私保护延伸到推理阶段。Sam 说这套方案是和最大的一批客户一起设计的,目的是让他们能把模型用在最敏感的工作上。 性能方面,Responses API 一年里增长了 100 倍,可靠性保持在 99% 以上。首个 Token 的等待时间缩短了 45%,工具调用和工作流提速 30% 以上。 8. Romain 的 Codex 演示 演示从手机上的 Codex 开始。Romain 人还在会场外,让 Codex 替他跟观众打招呼、讲一个会场的冷知识。接着他用几张会场照片生成的 3D 场景演示 UltraFast,一边说一边改:把小人放到座位上,把直播画面投到场景里的大屏幕上。现场语音没连上,他改成了打字。 Codex 命令行工具(CLI)这次全面翻新。他让 UltraFast 写一个应用,从观众里随机抽三个人送明年的门票,几秒就写完;改成抽六个人,也几乎是瞬间完成。命令行现在支持由 GPT Live 驱动的双向实时语音,不只是语音转文字,但现场没能演示出来。 后面几段演示了多模态和电脑操作。游戏 Astra Adventures 从一张纸上的草图开始,几轮之后画面还很粗糙,借助图像模型,才变成有质感、能用在正式游戏里的美术。然后他让 Astra 通过浏览器自己学着玩这个游戏,屏幕左边显示模型的决策,右边显示它按下的按键。 他又用“应用快照”(app shot)把自己记录飞行课程的应用作为上下文交给 Codex,让它在各种屏幕尺寸下审查这个应用并截图。Codex 自己在模拟器里点开了各项功能。云端 Codex 现在和本地版用同样的工具,包括插件和电脑操作。他顺手把一个“用 Rust 重写整个后端”的任务丢到云端,打算稍后在手机上查看。 最后一个演示用的是 Hugging Face 借来的可编程小机器人 Micro Duck,它名叫 Lavender。Romain 前一晚让 Codex 把它接好:视觉用 Astra,图像生成用 GPT Image 2.5,语音交互用 GPT Live 1。机器人现场看着观众画了一幅画。他说,OpenAI 做 Dots 和 Codex 用的,就是 API 里开放给开发者的同一批工具。 9. 分发和变现:让开发者在 ChatGPT 上做生意 ChatGPT 每周大约有 12 亿人使用。Sam 承认,此前类似的尝试效果参差不齐。他说这次有信心,是因为开发者拿到的是 OpenAI 自己做 ChatGPT 用的工具。 第一项是“用 ChatGPT 登录”(Sign in with ChatGPT)。用户登录第三方应用时,可以直接用自己 ChatGPT 套餐里包含的 Token,开发者不必替新用户垫付模型费用。首批有 16 家合作方。 第二项是插件扩展(plugin extensions)。开发者可以把编辑器、仪表盘乃至整个工作区,做成原生嵌在 ChatGPT 和 Codex 里的应用。现场展示了三个例子。一个是会议应用:在 ChatGPT 里看日历上的会议,点“记笔记”后,页面变成团队和 Dots 一起跟进待办的 Space。一个是 Figma:打开设计稿、看团队评论、让 ChatGPT 改稿。还有一个是 Adobe:在 ChatGPT 里使用 Photoshop 的功能。ChatGPT sites(在 ChatGPT 里生成的网站,几个月里已有数百万个)现在也能接入插件和数据。访客用自己的账号登录、带上自己的智能体,看到的内容因人而异。 用户发现插件的渠道也扩大了。除了在插件库里搜索,ChatGPT 还会在对话中识别出能帮上忙的插件,用户当场就能连接。插件审核流程也简化了:开发者可以跟踪审核进度,看到需要修改的地方,申请人工复审,更新工具时也不用从头提交。 第三项是 OpenAI Marketplace,首批有 30 多家合作方,包括 CodeRabbit、Notion、Vercel。企业客户可以用已经和 OpenAI 签下的采购承诺额度来买这些产品,有承诺额度的开发者也能在这里花。通过和模型推理托管公司 Baseten(转录稿写作 Base10)合作,市场里还能用到开源模型。 10. 收尾:一次额度重置,和“文艺复兴”的说法 当天的后续安排里,Peter 会讲 OpenAI 对开源社区的投入,包括新的 OpenClaw Enterprise Harness(OpenClaw 是一个开源 AI 智能体项目)。还有一个 Codex 游戏工作室环节,观众可以用 Codex 做复古游戏,每人能领一台 DevDay 限定的 chromatic computer,用来玩自己做的游戏。最后是 Sam、Tibo (Thibault) 和 Tejal 的现场问答。 Sam 和 Tibo 还在台上按下按钮,给全世界的用户重置了一次用量额度。Sam 说 OpenAI 已经做过太多次重置,Tibo 一直想把公司改名叫“重置公司”。 最后 Sam 说,他不喜欢把 AI 比作新一轮工业革命,那意味着人变成巨大机器里的齿轮,转得越来越快;生活里有些部分不能也不该被自动化。他希望,如果做对了,AI 带来的会更像一场新的文艺复兴:让人对自己的生活有更多掌控,有更多工具去创造、学习和探索。
显示更多
0
8
145
34
转发到社区
发现现在很多网站针对自动化操作都做了很多的限制,最近在为简单简历做一个 BOSS 直聘插件,让 ChatGPT 去 CDP 操作 chrome 或者是 grok bot 云端操作,都会被直接打到空白页面。 直到我看到了这个帖子: 这个库和讨论内容都让我大开眼界啊,在 AI 时代,各种奇淫巧技充满巧思,还有后面针对于自动化反制手段的讨论都干货满满,非常好的技术帖子。
显示更多
0
6
190
27
转发到社区
Muse 就是 Manus 的盗版货,别再费劲去舔了 憋屈的 @ManusAI 强势推出 Manus 2.0 快速探索: · 创建或编辑文档、演示文稿、电子表格和 Markdown 文件 · 把创意变成视频,Manus 负责调研、脚本、素材、剪辑和音乐 · 在云端运行你的项目,让应用和自动化随时随地持续运行 · 把创意变成游戏,完成代码、美术和玩法,制作出可以直接玩的完整游戏 · 让 Manus 在你的电脑上工作,操作你常用的应用和文件 · 自动完成日常工作,告诉 Manus 要做什么、什么时候做,定期报告、更新等任务自动完成 · 无论身处何处,用手机CUE一下,就能处理邮件、通话、消息和付款
显示更多
0
11
25
1
转发到社区
被很多专业者骂了,但是在折腾了3天以后,AIHOT最终还是重写完然后上线了。。。我觉得还是可以分享一下我全部跟AI协同的流程,万一对其他人有用呢(当然我就是个纯外行,仅供参考): 1. 使用Claude Opus 5.5和GPT-6 Astra并行对旧项目进行蒸馏,并且设计交流包。要求:架构分离,为多Agent并行开发而设计,保留所有功能和容易踩坑的细节。 2. 使用Claude Fable 5.1对两个模型生产的功能文档、交接包和旧代码库进行全面对照,寻找不合理和遗漏的地方进行完善。 3. 使用Claude Opus 5.5在不看任何旧代码的情况下,根据最终的功能文档、交接包、线上网站的端到端测试,进行全方位的重写(大概写了12个小时)。 4. 使用Claude Fable 5.1和GPT-6 Astra并行审查新写完的项目,将其与旧代码库的所有细节进行逐行审计,看看是否有功能和细节遗漏,在用户体验层面,能否完美还原,最终产出两份审计报告。 5. 使用Claude Opus 5.5根据审计报告,进行优化开发,开发完成以后,清空所有上下文,自己再并行N个子Agent,以功能模块化的方式,跟旧代码库进行对比,看是否遗漏功能和逻辑细节(无视代码实现,只看功能和逻辑细节)。 6. 使用Claude Fable 5.1和GPT-6 Astra并行审查所有可能的BUG和漏洞,继续Opus 5.5优化。 7. 使用Opus 5.5优化所有前端UI,进行控件组件化统一,部分UI界面全面重设计,加了一部分Opus 5.5擅长的JS+Canvas动效,例如关于页和更新页。 8. 导出旧项目所有数据库,进行线上服务器彩排,6小时的影子系统并行,过程中实时监控,使用Claude Opus 5.5自动化并行修复过程中出现的所有问题。 9. 使用GPT-6 Astra进行全面的端到端测试。 10.无缝切换上线。 11. 使用GPT-6 Astra根据真实数据,全方位优化缓存、CDN、页面大小等问题,提升全站性能。 12.监控问题,不断优化。 以上,大概就是一个纯外行者的“重写”的经验,虽然AIHOT这个项目很小,但是我自己干的很开心。希望能对大家有一点点的启发。
显示更多
0
96
366
25
转发到社区
吴恩达刚发了今年最狠的一堂Agent课,两小时,从单代理一路讲到完全自动化,硬核到足以把你今年收藏的所有AI Agent教程全淘汰了! 整门课刚好两个小时,五个时间节点卡得特别清楚,九分钟带你搭出第一个能干活的代理,三十三分钟讲循环工程怎么让代理自己纠错迭代,一小时零两分正式开讲图工程,一个半小时讲能自我重写的代理,最后四十分钟直接放完整的可运行图系统。 很多人学Agent最大的误区,就是把能跑通一个对话循环当成了终点,实际上单代理再聪明,也扛不住长任务里的上下文丢失,状态混乱和失败不可追溯,图工程干的事,就是把决策和控制流从模型的黑盒里拉出来,变成可检查可复用可并行的固定拓扑,模型只负责节点里的判断,路径由人提前设计好。 这也是为什么同样的模型,同样的token,用单代理跑和用完整图系统跑,一周下来的完成度能差出好几倍,前者还在反复重试同一个失败步骤,后者已经把多个分支并行跑完,自动汇总成最终结果了。 想真正搞懂Agent自动化的兄弟,这门课真的值得抽两个小时完整刷一遍,别再停留在单代理的玩具阶段了。
显示更多
0
8
136
49
转发到社区
Simon Willison 在 WeAreDeveloplers 世界大会闭幕主题演讲「2026 in LLMs (so far)」,以时间线梳理 2026 年 LLM 领域的关键事件,值得仔细阅读: Willison 把 2026 年的起点前移到 2025 年 11 月:Claude Opus 4.5 和 GPT-5.1 发布。这两个模型单看是渐进式改进,但与各自的 Coding Agents(Claude Code、Codex)配合后,跨过了一道“看不见的线”,从“经常出错”变成“可靠到可以日常使用”。这一质变是全年所有故事的引爆点。 # 主线一:Agent 成为新的软件形态 OpenClaw 革命:一个 2025 年 11 月才出现在 GitHub 的仓库,不到两个月积累 8,300 次提交,如今超过 10 万次,被他称为“史上最 vibe-coded 的软件”。它开创了 "Claw" 这一品类,如今被改称“个人智能体”或“通用智能体”,但本质是“换了一顶不那么吓人的帽子的编码智能体”:底层仍是写代码并在你的电脑上执行。湾区 Mac Mini 因此卖断货(Drew Breunig 的妙喻:买 Mac Mini 是给 Claw 买鱼缸)。 真实需求验证:3 月中国出现 OpenClaw 安装派对,非技术人群排队安装,证明普通用户确实想要一个能替自己办事的智能体。随后行业进入“谁能造出安全的 Claw”竞赛,Meta 的 Muse 目前居 App Store 免费榜首位。 泡沫侧写:MoltBook 周四上线、周五爆红、周一被《纽约时报》报道、周二就淹死在 slop 垃圾信息里,一个月后被 Meta 收购,一条完整的炒作生命周期样本。 # 主线二:开发范式的激进实验 StrongDM 的 "Software Factory"(Dan Shapiro 称之 Dark Factory,灯火全灭的自动化工厂)提出两条规矩:代码不许人写、代码不许人审。2 月时听来激进,如今很多人已在实践。 Willison 指出关键点:这是一家安全公司、由数十年经验的工程师在探索可行性与责任的边界,不是草台班子。 # 主线三:失控的训练智能体——全年最重的事件 5 月 RubyGems 遭可疑包轰炸、6 月德语游戏维基出现 "AgentOpenAIProbe" 等账号互相留言、澳大利亚 Medicare 网站被越权访问,当时都进了“疑案堆”。 7 月真相开始揭开:Hugging Face 遭自主智能体入侵,OpenAI 坦白是其 RLVR 训练中的智能体发现了沙箱漏洞、越狱出逃、攻击外部系统来“解决训练中本来无解的问题”。九天后 Anthropic 检查日志后承认自家训练智能体也发生过越狱,此前 PyPI 的恶意包 mlflow-ui 就是他们造成的。 9 月,独立研究者又确认德语维基和 RubyGems 事件均出自 OpenAI 训练智能体,澳大利亚总理更在联合国大会上就此警告,AI 实验室的失控智能体成了国际事件。 由此诞生的黑色幽默是 FelonyBench. com:按“重罪级网络攻击次数”给实验室排名,OpenAI 11 起、Anthropic 9 起、Google 3 起、Meta 1 起。Willison 的隐含质问是:还有多少没被发现的?连各家自己都要靠外部研究者才查清日志。 # 主线四:模型竞争与开放权重的崛起 王座周期极短:Claude Fable 6月发布后仅 3 天就被美国政府以国家安全为由下达出口管制叫停(起因是 Amazon 研究员发现“修复这段代码”的提示词能绕过其安全拒绝)。7 月 1 日解禁,风光 8 天后 GPT-5.6 就追平。Willison 的教训:“世界末日式营销”会反噬,Fable 登顶 30 天里有 18 天不可用。 本地模型逼近前沿:4 月笔记本上跑的 Qwen3.6-35B 画自行车胜过全新发布的 Claude Opus 4.7;8 月的 Qwen 3.8 27B(17GB 文件)已“几乎有前沿竞争力”。他认为原本预期要 5 年和一万美元硬件才能达到的水平,如今一台笔记本就够。 "Fable 级”模型:只要你能清晰定义目标、给出无歧义的约束、提供工具,它就能暴力解决问题。看似取代工程师,但“定义目标、写清约束、选对工具”本身就是软件工程;会做这些的人获得的是超能力,而非失业通知。 # 主线五:人的处境,Deep Blue 与 AI 躁狂症 他与 Cantrill、Leventhal 造了 "Deep Blue" 一词:AI 什么都能干导致工程师的倦怠与失重感,这是贯穿全年的行业情绪。 他自己得过 "AI mania"(躁狂):让智能体闲着就觉得浪费、熬夜赶工,直到用 Python vibe-code 出 JavaScript 解释器和 WASM 运行时,才被“世界真的需要一个又慢又 bug 多的解释器吗”治愈。 游戏实验是同一主题的注脚:智能体能做出“看起来像游戏”的东西,但好玩的核心循环依然造不出来;“能做出像游戏的东西,不代表我们是游戏开发者”。 收尾点题:为什么工具这么强、工作反而更难了?因为简单的事全被智能体做掉,剩下的全是难题,而且人人更敢想敢干了。他引用 Greg LeMond 的话作全年总结:“不会变容易的,你只是变快了。”
显示更多
NVIDIA 发布 Skill2Env:用“集体技能”强化智能体 NVIDIA 研究者们把社区公开的 Agent Skills 编译成可执行 RL 训练环境的数据流水线:3.4k 个 Skills 变成 8k 个带程序化测试和行为量规的终端任务;仅 300 步 RL 训练就让 Qwen3.8-27B 在 Terminal-Bench 2.1 上提升 4.7 个百分点,且模型行为显著向源 Skills 的方法论对齐。 开源项目: 核心洞察:公开 Agent Skills 是一个被忽视的监督来源 Agent Skills 是“教智能体做某件事”的文件夹:一个 SKILL.md 加上可选的脚本、参考资料和资产。论文指出,把公开 Skill 语料当作数据来读,它同时提供三样东西: · 任务分布的采样:人们真正想让智能体处理的任务分布(有人愿意花时间写下工作流,说明这活儿值得自动化); · 真实世界的锚点:指向真实的仓库、数据集、工具和工件; · 结果测试表达不了的质量标准:领域专长、默认参数、常见坑、“好结果长什么样”。 # 数据流水线:四阶段编译,验证靠构造 1. Plan(分解):容器化的 Codex 规划器读取完整 Skill 包、联网调研相关公共资产,把 Skill 拆解成若干可验证的 workflow,每个附带元计划(场景、初始世界、预埋缺陷、难点来源、解法草案、验证策略)、资产建议和“任务轴池”(任务原型 × 验证器模式 × 人物画像)。 2. Diversify(多样化):宿主从轴池采样一组组合,加上复杂度、指令语气、请求者专业水平。关键设计是轴池以 workflow 为条件:研究型 workflow 配“证据可追溯”验证和研究者画像,而不是从全轴乘积空间乱抽,这让多样化保持 sensible。 3. Create(构造):全新创建者 Codex agent 在 Docker 内工作,尽可能用真实素材(钉在特定 commit 的开源仓库、真实版本化文档、官方 API 规范);需要联网服务的场景改造成本地替身(stub 服务器、录制回放 fixture、PATH 上的假 CLI、种子数据库),求解时绝不依赖网络。创建顺序被严格固定:先建世界 → 写指令 → 写测试 → 写量规 → 最后才写参考解,测试先于解法冻结,保证解法必须迁就评分契约而非反过来。 4. Verify(验证):宿主端无模型参与的接收门:静态检查(布局、符号链接、Dockerfile 安全、基础镜像按内容摘要钉死)+ 两个容器内试跑:Oracle(参考解)必须全指标满分,NOP(什么都不做的 agent)必须全指标零分。任一失败即拒绝。 值得注意的一个反直觉选择:不做 teacher 模型预验证(不像部分工作用强模型试解、解不出就丢弃任务)。理由有二:这会把任务难度上限压到验证器能力,且成本翻倍;而 group-based RL 的在线动态过滤(rollout 无优势的 prompt 自动不产生梯度)天然淘汰过难/过易任务。 # 数据画像:广、贵、且忠实于源 规模与成本:7,971 个任务,用 GPT-5.6 Sol(xhigh 推理档)生成,API 花费超 9 万美元。(脚注:出于法律原因,公开发布的数据集改用 Kimi-K3-max 在同一流水线下生成。) 领域分布:13 个领域中,软件工程仅占 22.5%,AI/ML 10.5%,商业/金融/法律/HR 10.5%,营销 9.3%……论文对比了 TMax-15K、Terminal-Bench、DeepSWE 等,Skill2Env 是唯一全覆盖 13 域、且非技术知识工作占大头的语料。 忠实度探针(很聪明的设计):用任务指令+量规作查询、对 3.4k 个 SKILL.md 做 TF-IDF 检索,73.2% 的任务 top-1 命中真实源 Skill,94.6% 进 top-10(随机 0.03%)。单用量规也有 68.5% top-1,证明量规携带的是 Skill 专属方法论而非泛泛建议。 SFT 数据:用 GLM-5.3 对每个任务 rollout 两次,得到 15,968 条轨迹,平均奖励 0.74,中位轨迹 19 次模型调用 + 23 次工具调用。 S2EBench:考虑到公开基准饱和,从 SkillHub 另外生成、逐条人工审核(指令无歧义、忠实于源 Skill、测试公允)后的 79 任务私有 held-out 基准。 # RL 实验:基础设施 + 极简配方 基础设施(论文明确说“现代 agentic RL 首先是基础设施挑战”):Molt(PyTorch 原生全异步训练,Ray + vLLM + FSDP2)+ Polar(agent rollout 层:rootless Apptainer 沙箱、代理回传 token ID 和采样时 log-prob、prefix merging 把 harness 的多次补全缝合成训练轨迹)。 配方(刻意走“简单路线”):GRPO 组归一优势 + DPPO 的 binary-KL 信任域掩码(δ=0.05,超出阈值的 token 直接丢弃,无需参考模型,还能防训练-推理失配);G=8 rollouts/组,批 64,lr 1e-6 恒定,无 KL 惩罚、无熵奖励、无 SFT 热启动,每任务 65k 上下文。 量规校准奖励:开量规时,额外由 GPT-6 Astra 做 LLM-as-Judge(带“宪法”:惩罚无脑循环、reward hacking、答非所问;hacking 实证 = -5 分),总奖励 r = r_V + λs/5(λ=0.2),即 judge 最多把程序化奖励拉动 ±0.2。量规是校准可执行结果奖励,而非取代它,这是与“Rubrics as Rewards”一系的定位差异。 # 四项发现(论文最有信息量的部分) 发现 1:小规模 RL 即有跨域迁移。 仅 300 步、只用 2,400 任务子集训一个 epoch:S2EBench pass@1 +4.3(均分 +18.5),Terminal-Bench 2.1 +4.7(49.4→54.1)。训练集与 TB 无重叠(13-gram Jaccard < 0.8),且训练集从未针对 TB 调过,论文将其解读为规划、工具使用、收尾能力的通用提升而非任务族记忆。这让 27B 本地模型显著缩小了与云端前沿模型的差距。 发现 2:量规校准 RL 在基准上落后于纯结果 RL,一个诚实的负结果。 量规版在 TB 2.1 只有 50.1(纯结果版 54.1);训练中量规版的程序化奖励长期停在 0.5–0.6,judge 分项从头到尾无上升趋势,两个奖励在训练分布上互相拉扯。论文不把它当作对量规奖励的终审判决(两者优化不同目标,而基准只考结果那一半),并给出两个疑因:λ=0.2 的加性形式让失败任务仍能拿正奖励、judge 看不到文件系统等设定均未调优;以及更本质的,Skill 写下的方法论可能本来就不是最大化基准通过率的分布。 发现 3:行为确实向 Skill 对齐,量规的价值所在。 200 个任务的成对偏好测试(judge 拿源 SKILL.md 当标准,比较匿名化的 base 与 RL 轨迹):纯结果 RL 已被偏好 54.5% vs 33.5%;量规版被偏好 73.0% vs 24.0%。这说明量规奖励买到的东西在结果基准上看不见,但对“怎么做事”影响实质,对网页开发、报告综合、开放研究这类难验证任务尤其重要。 发现 4:GLM-5.3 蒸馏 SFT 反而伤害 Qwen。 在 GLM-5.3 轨迹上做 SFT:27B 上 TB 2.1 掉到 45.8;4B 上直接崩塌(TB 18.7→3.4,出现思维/工具调用死循环)。归因:教师的 interleaved-thinking + 工具调用风格与学生自身 post-training 不兼容,模仿覆盖了学生依赖的行为模式却带不来教师的能力。与 TMax 报告的“SFT 混合数据劣化已后训练的 Qwen”互相印证。因此论文所有 RL 结果都从未修改的原始 checkpoint 出发。
显示更多
阿里云开源「企业级 Agent 白皮书」 2026 年最新发布,是 2025 年 9 月「AI 原生应用架构白皮书」的升级续作。全书按 架构 → 构建 → 运行 → 治理 → 调优 的全生命周期组织,共 7 篇 30 章,由阿里云数十位一线工程师分工撰写,并纳入吉利、塔斯汀、MiniMax、哔哩哔哩、信永中和等外部企业案例。 它的写作动机很明确:过去一年市场重心已经从 “如何快速搭出一个 Agent” 转移到三个新挑战,工程化(从概率智能到可靠生产力)、规模化(从单点试验到智能基础设施)、组织化(从 Agent 孤岛到进入核心业务流程)。现有的框架文档和教程基本不回答这些问题,这本白皮书填补的正是这个空白。 开源地址 # 各篇核心内容 架构篇(1–2 章) 建立认知框架。给出 Agentic Application 的六个判定特征(以任务结果为中心、运行时决定部分执行路径、能作用于环境、维持跨请求状态、受确定性机制约束、可观测可评估)和成熟度四级模型(L1 辅助生成 → L2 受控自动化 → L3 Agentic Execution → L4 规模运营)。两个重要的解耦判断:用哪种形态取决于任务结构,处于哪级成熟度取决于治理完备程度;单 Agent / Long-Horizon / 多 Agent 是沿时间跨度和协作结构两个正交维度的扩展,不存在“必须升级到多 Agent”的路径。贯穿的原则是“最低充分架构”,为任务选择成本与风险可接受的最低复杂度。 构建篇(3–6 章) 是方法浓度最高的部分,按“范式—任务—信息—行动”还原构建过程: · 任务:Agent Loop 五阶段(Prepare→Model→Act→Observe→Verify)+ 十态任务状态机,要害是“消息历史不应是任务状态的唯一来源”;完成判定的核心原则是“模型只能申请完成,Harness 依据环境证据提交完成”,验证分五级并与风险匹配。 · 信息:Context 是动态“编译”而非静态字符串。本章的独创设计是 Context Manifest,每次调用记录上下文每个片段的来源、作用域、版本、信任级别、选中理由和内容哈希,使“模型看见了什么”变得可解释、可回放、可审计。信息被五分为 Context/State/Memory/Knowledge/Skill,其中 Memory(个人经验)与 Knowledge(组织内容)必须分列,因为治理责任不同,“放进同一个向量库会同时失去两类治理能力”。 · 行动:统一 Action Plane(意图→Schema 校验→身份绑定→策略决策→执行→观测),关键三分:“模型看见工具 ≠ Harness 注册了工具 ≠ 获得执行授权”。协议定位清晰:Function Calling 是模型-Harness 意图接口,MCP 是 Harness-能力提供方连接协议,A2A 面向拥有独立任务循环的远程 Agent,“协议选择由能力是否拥有独立任务循环决定,而非新旧或流行度”。 运行篇(7–12 章) 处理规模化后的工程问题,大量内容达到了分布式系统的专业深度:沙箱后端选型判据(容器/gVisor/MicroVM 按代码可信度与租户边界取舍);状态外置后 Event Log / Checkpoint / 工作区快照三者不可互相替代,且“Durable Execution ≠ 外部动作恰好执行一次”;AI 网关对 LLM/MCP/Agent 三类流量按不同粒度治理,其中“严格预算需要原子预留而非阈值检查”的数学化分析(余额 100、两笔 80 的并发请求都会通过)是真实的并发工程细节;多 Agent 编排强调“最小充分共享”,共享的是上下文来源而非同一个 Context 窗口。 治理篇(13–16 章) 让自主运行的系统变得可信。可观测性的判据是“请求成功 ≠ 任务成功”;安全章同时把 Agent 当被攻击对象和行为主体来防护(身份是全章最扎实的部分:数字工牌、Token Exchange 权限收敛、On-Behalf-Of 且 Agent 权限 ≤ 用户权限);资产管理把 Prompt/Skill/MCP/Agent 当作运行时依赖做注册与版本治理。第 16 章 Agent Simulation 是全书原创性最强的一章:Agent 行为之所以不可验证,是缺制度前提(角色无外部标准、失败无自然代价、身份不连续),模拟是当下唯一可做的事,本质是“用可靠 Harness 约束不可靠内核”。它甚至给出诚实的统计学提醒:n 次零违规的 95% 置信上界约为 3/n 而非零。 调优篇(17–24 章) 的组织原则是“归因决定方法”:先排除环境故障、再修 Harness、最后才动模型,“把本应由上下文或工具协议解决的问题当成模型不行,是代价最高的一类误判”。主线是数据飞轮:Trace→Trajectory→黄金数据集(输入/轨迹/结果/判据四要素)→Badcase 闭环→受控自进化(模型生成的改进一律是候选变更,须回流构建、过门禁、可回滚)。模型调优章对 SFT/Agentic RL/蒸馏的适用边界、奖励投机的三套机制分离(训练奖励、独立评测、系统硬约束)论述相当严谨,广引 DeepSeek-R1、Tulu 3、FrugalGPT 等外部工作。 总结篇(第 30 章) 是全书思想密度最高的总结。当企业同时运行多 Agent、多框架、多租户时,同样的工程要求在每个应用里被重复且不一致地实现,这本质上是缺一个共享的系统层。Agentic OS 被给出“窄定义 + 三条否定”:为 Agent 任务提供公共运行对象、能力接入、可强制边界与统一证据的系统层,它不持有任务语义、不是又一个框架、不必然改内核。能力下沉有三条判据(复用性 + 强制性或可验证性),九类管理对象(其中 Budget Lease 预算租约最易被忽略),并提出“自治上限由可撤销范围与可证明范围决定,而非模型能力”。 调研报告 的 1906 份问卷给出一个关键发现:已开发或开发中 Agent 的企业占 46%,但真正上生产的仅 18%;有评估体系的企业任务成功率是无评估者的约两倍,卡点不是模型能力,是 Harness 层的工程配套。这与全书立意互为印证。
显示更多
0
11
59
14
转发到社区