注册并分享邀请链接,可获得视频播放与邀请奖励。

与「多智能体」相关的搜索结果

多智能体 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 多智能体 的内容
2026 年 9 月 29 日,OpenAI 在旧金山 Fort Mason 办了今年的开发者大会 DevDay。主讲是 CEO Sam Altman。其他几位上台的人都在做这些产品。产品团队的 Holly 演示了新产品 Dots。后训练(模型预训练之后做对齐和能力调优的阶段)研究负责人 Tejal 讲了模型怎么反过来帮 OpenAI 做研究。Codex 的演示由 Romain Huet 来做,他在 OpenAI 负责开发者体验,去年 DevDay 主题演讲里的 Codex 演示也是他做的。整场演讲分三块:面向用户的常驻智能体 Dots 和协作空间 ChatGPT Space,给开发者的新模型和新工具,以及帮开发者做分发、赚钱的渠道。 1. Dots:一直在线、会主动干活的智能体 Sam 把 Dots 比作电影里那种一直在身边帮忙的 AI 助手。他认为订餐厅、买机票这类代办虽然有用,但和这项技术能做的事比起来太小了。他想要的 AI 知道正在发生什么,也知道你在意什么,不用你事事交代。 Dots 是常驻在线的智能体(Agent),有自己的云端电脑和浏览器,能写代码、跑测试。它的权限跟着用户走,能直接用用户已经在 ChatGPT 里连好的插件,覆盖 4000 多个应用。除了在 ChatGPT 里对话,之后还可以给它发短信、打电话。目前每人先有一个 Dot,以后可以配一整组。Dots 跑在 本月早些时候发布的 GPT-6 Astra 上,Sam 称它是 OpenAI 对齐做得最好的模型。用户可以限定 Dot 能用哪些应用、能不能操作电脑,也能给它的各类操作写自定义指令,愿意交出多少责任就放多少权。 Sam 说,他自己的 Dot 每天早上会把夜里进来的消息过一遍,挑出紧急的提醒他。他说这让他拿回了一部分注意力,没那么离不开手机了。他还举了一个更重的例子:把应用从一个即将停用的旧 API 上迁走。这个 API 可能散落在代码库各处,改了哪里会连带弄坏什么,事先看不出来。Dot 可以追踪依赖关系,找出所有要改的地方,写代码、跑测试,最后把 PR(代码合并请求)交给团队审。他让听众想想,过去做这件事要几个人、花多久。 开场视频里,用户把自己的 Dot 改名叫 Alfred。Alfred 和另一个 Dot 帮用户上线网站,改董事会材料,在婚礼蛋糕商家取消后找好备选。它们还发现财务会和女儿的演出撞了期,提出改时间。每件事都是 Dot 推进到需要人确认的地方,再由人拍板。 2. ChatGPT Space:人和智能体一起用的工作区 Sam 认为,现有的生产力软件几乎都没考虑过人和 AI 一起干活。ChatGPT Space 以页面为单位,可以在里面写计划、做调研、生成图片和数据。页面和文件像网盘一样放在同一个空间里。Dot 能直接在页面上工作,在评论里 @ 它,它就会接活。页面本身也能带指令,比如“每天去看 API 平台的 Slack 频道,把发现更新到这里”。之后 Space 里还会加入演示文稿,格式做成智能体方便读写的样子,团队成员可以和各自的 Dot 一起改。 在 Holly 的演示里,页面用斜杠命令就能插入交互图表、表格和可运行的原型。她 @ 自己的 Dot(名叫 Dotty),让它把一组数据改成柱状图。图表可以按反馈类型筛选,Dotty 每小时刷新一次。她还让 Dotty 把“某位工程师在我 Slack 私信里提过的新手引导数据”补进 FAQ。Dotty 能看到她的上下文,所以这种模糊的指代也找得到。 3. OpenAI 内部怎么用 Dots Holly 用一个虚构的歌单应用 Blossom Music,模拟发布前一天的状况。早上 Dotty 已经做了几件事:发现发布评审会提前,改好了日历;看完前一晚测试用户的反馈;注意到设计团队临时改了首页,把新设计发给她。她让 Dotty 直接把这个设计做出来。Dotty 调用她笔记本上的 Codex 构建应用,在 iPhone 模拟器里跑起来,再提交 PR。现场的语音演示卡住了,Dotty 一直回复“还在查”。Codex 线程也报过一次错,她重试后才继续下去。 她说,Dots 真正改变 OpenAI 工作方式的地方在 Slack。Dots 在公司 Slack 里有自己的身份,员工就开始把它们当作代理人。被同事 @ 到的零碎请求,直接转给自己的 Dot 处理。建群时,大家从一开始就把各自的 Dot 拉进来,Dot 带回结果时所有人都能看到。 工程师走得更远。有人在反馈频道贴出会话 ID 和一个用户 bug,某位工程师的 Dot 就会接手排查,提 PR 修复。她说这是真实情况:工程师们的 Dots 每天这样修掉几十个 bug,Dots 这个产品本身有很多部分就是 Dots 写的。 4. 上线范围和企业用的 Specialist Dots Dots 和 Space 当天向 ChatGPT Pro、Business Premium 和 Enterprise 用户开放。Dot 包含在套餐里,和它的对话不占用额度。 企业客户还可以预览 Specialist Dots。这是由公司统一设置、供整个团队使用的虚拟同事,负责会计、市场、法务这类工作量大的事。公司给它目标和背景,审核它的产出,给它反馈,反馈在全公司共享。OpenAI 也在和微软合作,把 Specialist Dots 接入 Agent 365(微软用来管理企业智能体的工具),企业可以用已经在用的微软工具来管理它们。 5. 新模型:更便宜的 GPT-6.1 Sol,更快的 UltraFast Astra 发布这几周,用户的要求集中在两点:更便宜,更快。GPT-6.1 Sol(转录稿误作 Soul)的能力接近 Astra,价格是它的五分之一。缓存输入(重复发送、已被缓存的上下文)比标准输入便宜 95%。智能体需要反复读同一批上下文、长时间迭代,这对它们尤其省钱。Sam 说 Sol 在某些方面比 Astra 还聪明,定位是开发者的日常主力模型。 UltraFast 是新的速度档,API、ChatGPT 和 Codex 里都能用。原有的 Fast 档是两倍速度、两倍价格;UltraFast 是八倍速度、六倍价格,每秒 300 个 Token。它现在可以配合 Astra 用,之后也会支持 Sol。现场让两个模型用同一个提示词,做一个 DevDay 配色的火箭。UltraFast 的火箭已经升空时,标准速度的还没做完。 订阅也跟着调整。新推出的 500 美元档 Pro 订阅叫 Pro 500,额度最高,是 Plus 的 25 倍。它可以在 ChatGPT 和 Codex 里用 UltraFast,还能通过“用 ChatGPT 登录”在合作方的应用里使用。Pro 200 重新开放,继续提供所有前沿模型。 另外预览了 Decisions API。它给 Luna 模型一组预先定义好的选项,让模型从中选一个,比如给请求分流、给图片分类、决定智能体下一步做什么。任务收窄成选择题之后,响应时间可以压到一秒以内,同时保留图像理解、多语言和安全防护。Romain 后来补充说,做机器人的朋友看中的是它能处理视觉输入:机器人可以根据看到的东西,近乎实时地快速行动。 6. 模型开始帮 OpenAI 做研究 Sam 提到,去年这个时候,他和 Jakob 在一次直播里预测,一年内会出现第一个“AI 研究实习生”,当时几乎没人相信。几周前 OpenAI 宣布达成了这个目标:有了一个能接手定义清晰的研究任务的系统,这类任务原本要熟练的研究员花大量时间和精力。 Tejal 的方向是电脑操作(computer use,让模型像人一样操作桌面和浏览器)。她举了两个例子。 第一个是让模型优化电脑操作的运行框架(harness,包在模型外面、负责调用工具和管理步骤的代码)。模型在循环里持续寻找能同时降低延迟、提升效果的改动,团队把找到的改进合进生产环境的框架,并用于后训练。结果是延迟改善了两倍以上,已经上线。 第二个是模型帮忙改进了监控和拒绝训练,让 Astra 在不安全的场景里更会拒绝。Astra 在电脑操作压力测试上因此达到业内领先,操作时出错更少,也更贴合用户的本意。 她给出了几项内部数据。今年夏天之后,研究工作消耗的 Token 量急剧上升。1 月时,模型能做好 15 分钟以内的短任务,需要一天以上的任务大多会失败;到 7 月,超过三分之一的一天量级研究任务,模型能在无人干预下完成。她还提到,Astra 这类模型已经帮忙解决了 100 多个悬而未决几十年的数学问题,也在参与针对耐药感染的新抗生素、古代语言研究、可再生能源和工业机器人等方向的工作。 7. 给开发者的底层工具 Sam 说,OpenAI 想让开发者用上自己内部用的东西。 第一件是 Codex 的运行框架。它同时支撑着 Codex、ChatGPT Work 和 Dots,目标是用最少的 Token、最快拿到准确结果,现在已经开源。第二件是 Codex 完全上云:在手机上开始的任务,可以在浏览器或桌面端接着做,合上笔记本任务也不会中断。 云端能力带来了 Codex Security Cloud。它在云端环境里持续寻找漏洞,并准备好验证过的修复方案供人审核,这次新增了自动去重、定时扫描和新界面。Sam 说这是为了给防守方更好的工具,因为“我们看得到接下来会发生什么”。 新的 Agents API 进入公开测试。它包含运行框架、托管、记忆、多智能体控制等功能,是 Codex 和 Dots 用的同一套技术,也加入了电脑操作能力。现场的例子是一个网站测试智能体,会自己打开浏览器、点击页面、测试流程。基础设施方面,OpenAI 和 AWS 合作推出由 OpenAI 驱动的 Bedrock(AWS 的托管 AI 服务)托管智能体,AWS 客户可以直接使用 OpenAI 的前沿模型、Codex 和 ChatGPT Work。 隐私方面预览了 OpenAI Private Intelligence。其中的零数据留存(ZDR)配合私有安全处理,可以在不把用户内容存到 OpenAI 服务器的情况下做安全检测;私有推理则把隐私保护延伸到推理阶段。Sam 说这套方案是和最大的一批客户一起设计的,目的是让他们能把模型用在最敏感的工作上。 性能方面,Responses API 一年里增长了 100 倍,可靠性保持在 99% 以上。首个 Token 的等待时间缩短了 45%,工具调用和工作流提速 30% 以上。 8. Romain 的 Codex 演示 演示从手机上的 Codex 开始。Romain 人还在会场外,让 Codex 替他跟观众打招呼、讲一个会场的冷知识。接着他用几张会场照片生成的 3D 场景演示 UltraFast,一边说一边改:把小人放到座位上,把直播画面投到场景里的大屏幕上。现场语音没连上,他改成了打字。 Codex 命令行工具(CLI)这次全面翻新。他让 UltraFast 写一个应用,从观众里随机抽三个人送明年的门票,几秒就写完;改成抽六个人,也几乎是瞬间完成。命令行现在支持由 GPT Live 驱动的双向实时语音,不只是语音转文字,但现场没能演示出来。 后面几段演示了多模态和电脑操作。游戏 Astra Adventures 从一张纸上的草图开始,几轮之后画面还很粗糙,借助图像模型,才变成有质感、能用在正式游戏里的美术。然后他让 Astra 通过浏览器自己学着玩这个游戏,屏幕左边显示模型的决策,右边显示它按下的按键。 他又用“应用快照”(app shot)把自己记录飞行课程的应用作为上下文交给 Codex,让它在各种屏幕尺寸下审查这个应用并截图。Codex 自己在模拟器里点开了各项功能。云端 Codex 现在和本地版用同样的工具,包括插件和电脑操作。他顺手把一个“用 Rust 重写整个后端”的任务丢到云端,打算稍后在手机上查看。 最后一个演示用的是 Hugging Face 借来的可编程小机器人 Micro Duck,它名叫 Lavender。Romain 前一晚让 Codex 把它接好:视觉用 Astra,图像生成用 GPT Image 2.5,语音交互用 GPT Live 1。机器人现场看着观众画了一幅画。他说,OpenAI 做 Dots 和 Codex 用的,就是 API 里开放给开发者的同一批工具。 9. 分发和变现:让开发者在 ChatGPT 上做生意 ChatGPT 每周大约有 12 亿人使用。Sam 承认,此前类似的尝试效果参差不齐。他说这次有信心,是因为开发者拿到的是 OpenAI 自己做 ChatGPT 用的工具。 第一项是“用 ChatGPT 登录”(Sign in with ChatGPT)。用户登录第三方应用时,可以直接用自己 ChatGPT 套餐里包含的 Token,开发者不必替新用户垫付模型费用。首批有 16 家合作方。 第二项是插件扩展(plugin extensions)。开发者可以把编辑器、仪表盘乃至整个工作区,做成原生嵌在 ChatGPT 和 Codex 里的应用。现场展示了三个例子。一个是会议应用:在 ChatGPT 里看日历上的会议,点“记笔记”后,页面变成团队和 Dots 一起跟进待办的 Space。一个是 Figma:打开设计稿、看团队评论、让 ChatGPT 改稿。还有一个是 Adobe:在 ChatGPT 里使用 Photoshop 的功能。ChatGPT sites(在 ChatGPT 里生成的网站,几个月里已有数百万个)现在也能接入插件和数据。访客用自己的账号登录、带上自己的智能体,看到的内容因人而异。 用户发现插件的渠道也扩大了。除了在插件库里搜索,ChatGPT 还会在对话中识别出能帮上忙的插件,用户当场就能连接。插件审核流程也简化了:开发者可以跟踪审核进度,看到需要修改的地方,申请人工复审,更新工具时也不用从头提交。 第三项是 OpenAI Marketplace,首批有 30 多家合作方,包括 CodeRabbit、Notion、Vercel。企业客户可以用已经和 OpenAI 签下的采购承诺额度来买这些产品,有承诺额度的开发者也能在这里花。通过和模型推理托管公司 Baseten(转录稿写作 Base10)合作,市场里还能用到开源模型。 10. 收尾:一次额度重置,和“文艺复兴”的说法 当天的后续安排里,Peter 会讲 OpenAI 对开源社区的投入,包括新的 OpenClaw Enterprise Harness(OpenClaw 是一个开源 AI 智能体项目)。还有一个 Codex 游戏工作室环节,观众可以用 Codex 做复古游戏,每人能领一台 DevDay 限定的 chromatic computer,用来玩自己做的游戏。最后是 Sam、Tibo (Thibault) 和 Tejal 的现场问答。 Sam 和 Tibo 还在台上按下按钮,给全世界的用户重置了一次用量额度。Sam 说 OpenAI 已经做过太多次重置,Tibo 一直想把公司改名叫“重置公司”。 最后 Sam 说,他不喜欢把 AI 比作新一轮工业革命,那意味着人变成巨大机器里的齿轮,转得越来越快;生活里有些部分不能也不该被自动化。他希望,如果做对了,AI 带来的会更像一场新的文艺复兴:让人对自己的生活有更多掌控,有更多工具去创造、学习和探索。
显示更多
0
8
145
34
转发到社区
[开源学习资源] AI Engineering from Scratch 59.8K ⭐️ 作者 @ghumare64 课程共 20 个阶段,以 Python 为主要编程语言,主张在导入任何框架之前,先用纯数学把每个算法手写一遍。 课程地址: 开源地址: 它和常见教程的本质区别 ? 大多数 AI 教程是“API 驱动”的:装个库、调个接口、跑个 demo。这个项目反其道而行,每节课遵循固定的六段结构: Motto → Problem → Concept → Build It → Use It → Ship It 以 Phase 10 的一节课「Tokenizers: BPE, WordPiece, SentencePiece」 为例,这个格式是真实落地的,而且写作质量相当高: · Problem 部分不讲废话,直接从代价切入:“你的 LLM 不读英语,它读整数。分词器决定这些整数是承载意义还是浪费意义”,然后解释为什么 tokenization 不是预处理,它是架构的一部分(影响上下文窗口利用率、API 计费、推理速度)。 · Concept 部分用“三种失败的方案和一种胜出的方案”来讲演化逻辑:词级切分(词表爆炸、[UNK] 问题)→ 字符级切分(序列过长)→ 子词切分(BPE 的折中),并配上真实语料上 BPE 逐步合并的手工演算。 每节约 3000+ 词,带 Mermaid 图、可运行代码和测试。 另外两个设计值得强调: · 每节课产出一个可复用的 artifact,一个 prompt、一个 skill、一个 agent 或一个 MCP server。学完整个课程,你手里有 523 个可展示的作品,不是 523 个跑完就扔的 notebook。 · 强调“证据留存”:保留命令、退出码、输出,作为学习发生的证明。这明显吸收了工程实践中“可验证性”的思路。 # 课程结构:从线性代数到自主智能体集群 20 个阶段构成一条完整的上升曲线,咱们它分成五个大块来看: 基础层(Phase 0–2):环境与工具链、数学基础(线性代数/概率/微积分)、经典机器学习。这是给基础不牢的读者铺的路。 深度学习与感知层(Phase 3–6):神经网络核心、计算机视觉(一路讲到 NeRF、高斯泼溅、世界模型,这已经超出一般教程的覆盖范围)、NLP、语音。 生成与决策层(Phase 7–9):Transformer 深挖、生成式 AI(GAN、扩散模型、flow matching)、强化学习。 LLM 层(Phase 10–12):这是全课程的重心之一。Phase 10 的目录我逐条看过,它不只是“从零实现 GPT”这种常规内容,还包含了相当前沿的论文级主题:DeepSeek-V3 架构走读、DualPipe 并行策略、Native Sparse Attention(NSA)、多 token 预测、Jamba 的 SSM-Transformer 混合架构、 speculative decoding 等。Phase 11 转向应用侧(RAG、LoRA、MCP、可观测性),Phase 12 覆盖多模态(从 CLIP 到 computer-use agent)。 智能体层(Phase 13–16):工具与协议(MCP、A2A、Agent Skills)、54 节课的 agent 工程、自主系统与安全、多智能体集群。这一层的分量很能说明项目的判断:它认为 AI 工程的重心正在从“训模型”转向“构建可靠协作的智能体”。 收尾(Phase 17–19):生产基础设施、伦理与对齐、毕业设计。 # 生态与周边:不只是一个课程仓库 网站:带浏览器本地存储的学习进度追踪、术语表、课程目录和路线图。 六卷本书籍:课程内容由 CI(pandoc)自动构建成 EPUB/PDF,附在 GitHub Releases 上,课程即书,且随仓库持续更新。 Agent 导师模式:运行 npx skills add rohitg00/ai-engineering-from-scratch,可以把整个课程装进 Claude Code、Codex 等编码智能体,变成一个带分级测验(placement quiz)和个性化路径的交互式导师,学习进度写在 LEARNING.md 里。这是“用你正在学的工具来学”的巧妙闭环。 认证备考:5 条备考路径、67 节课、505 道练习题,覆盖 Anthropic 的 Claude 认证和 Agentic AI Foundation 的 MCPA。项目明确声明与这些考试机构无关联,只是独立的备考材料。 12 种语言的翻译(含中文),以及四条核心学习路径(构建与部署 AI 应用、软件工程基础、Agent 辅助工程、产品判断与交付)供不同目标的人选路。
显示更多
0
11
75
16
转发到社区
这个开源项目系统整理了 35 家 AI 公司的 AI 工程师面试题,全部来自 “公开报告的面试经历” 来自 @outcome_school 团队 @pallavishekhar_ 开源发布,内容几乎涵盖了 OpenAI、Anthropic、DeepMind、xAI、DeepSeek、Kimi、GLM 等 AI Labs,Cursor、Cognition、ElevenLabs 等 AI Native 团队和 Nvidia、Microsoft、Amazon、Apple 等头部大厂。 覆盖的岗位头衔也非常多:AI Engineer、LLM Engineer、Gen AI Engineer、ML Engineer、Research Engineer、Applied Scientist、FDE、MLOps/LLMOps 工程师等。 开源地址: # 内容架构:一个精心设计的双层结构 第一层:跨公司通用题(Common Questions)。 作者把在多家公司反复出现的题目只列一次,标注"Asked at"哪些公司,按十大主题组织: 1. LLM 内部机制与架构 — attention 缩放因子、KV cache 内存公式推导、MQA/GQA/MLA、FlashAttention、BPE、RoPE/YaRN、Chinchilla scaling laws、MoE、解码采样策略、lost-in-the-middle、RMSNorm、SwiGLU 2. 推理、服务与 GPU 性能 — prefill vs decode、continuous batching、PagedAttention、投机解码、量化(FP16→FP4)、五种并行策略、TTFT/TPOT 指标、H100 上的 roofline 计算、vLLM/SGLang/TensorRT-LLM 选型、“如何把服务成本降 10 倍” 3. RAG 与检索 — 分块策略、BM25 vs 稠密检索、重排序器、HyDE、权限感知检索、ANN 索引、索引新鲜度、答案归因 4. Agent 与工具调用 — ReAct、MCP、工具 schema 设计、多智能体编排、Agent 记忆、循环终止条件、人类审批 5. 微调与对齐 — RLHF/DPO/GRPO/RLVR 全谱系、LoRA/QLoRA 数学、灾难性遗忘、“提示 vs RAG vs 微调”决策框架、蒸馏、reward hacking 6. 评估与可观测性 — LLM-as-judge 及其偏差、幻觉检测、基准污染、Agent 评估、回归门禁 7. 安全与负责任 AI — 提示注入(直接/间接)、OWASP LLM Top 10、护栏、Constitutional AI、红队 8. 多模态与语音 — VLM、语音 Agent 延迟预算、barge-in 打断处理、级联 vs 端到端语音、ASR/TTS 评估 9. AI 系统设计 — 十类高频设计题(千万级文档企业 RAG、代码助手、客服 Agent、Text-to-SQL、LLM 网关、数亿用户聊天服务等) 10. 编码题 — 从零实现 attention、KV cache、BPE、采样;LRU 缓存、令牌桶限流器、异步批处理器、SSE 流解析器、最小 Agent 循环 第二层:35 家公司的专属章节,分为五大梯队: 1. 前沿实验室(12 家):Anthropic、OpenAI、Google DeepMind、Meta、xAI、Mistral、Cohere、DeepSeek、月之暗面(Kimi)、智谱(GLM)、阿里(Qwen)、Sarvam AI(印度) 2. 大厂 AI 组织:Microsoft、Amazon、Apple、NVIDIA、Tesla,以及一组消费级 ML 公司(Uber/Netflix/LinkedIn/Airbnb/Pinterest/Spotify) 3. AI 基础设施公司:Databricks、Groq、Together AI、Hugging Face、Scale AI、Perplexity 4. AI 原生产品公司:Cursor、Cognition(Devin)、Sierra、Harvey(法律)、Glean、 AI(机器人)、Waymo 5. 前向部署/企业 AI:Palantir # 题目分布透露的行业信号同样值得关注 1. 公司的差异化考察方向,和它的商业模式严丝合缝。 这是最能体现整理功力的地方: · DeepSeek、月之暗面、智谱、Qwen 的题目深度绑定自家论文——MLA、auxiliary-loss-free 负载均衡、Multi-Token Prediction、MuonClip、DualPipe、长上下文扩展、GLM 的 thinking 模式。面试这些公司等于面试它们的论文,还要求 PyTorch 从零实现 MoE 路由。 · Groq 的题全是 SRAM-only 架构下的 roofline 重推演:“没有 HBM,decode 的 roofline 论证哪里变了”、“确定性在 p99 层面到底买到什么”。 · Apple 清一色端侧:3B 模型在手机上跑、PTQ vs QAT、不采集用户内容的前提下用设备信号改进模型、30+ 语言区无法记录用户内容的评估方案。 · CharacterAI 是推理经济学:“我们的服务成本被 KV cache 而非权重主导,降一个数量级,代价是什么”。 · Harvey(法律)和 Abridge(医疗) 考的是领域约束下的工程:200 页信贷协议里第 140 页的条款依赖第 8 页的定义术语怎么检索、生成的病历中出现了患者没提过的药怎么当作安全事故处理、PHI 如何约束整个架构。 · Palantir 的招牌是 "decomposition" 轮:把“一家货运铁路公司每年因机车非计划停机损失数千万”分解成工程计划。 2. 编码轮的形态正在发生实质性变化。 文档里反复出现的一类题,与传统 LeetCode 明显不同: · “实现一个内存 KV 存储:先 SET/GET/DELETE,再加事务 BEGIN/COMMIT/ROLLBACK,包括嵌套事务”(OpenAI、xAI 都问) · “给你一个 LLM 推理引擎的调度器类,其中一个方法是空壳,没有规格没有文档。说说你头三十分钟干什么”(xAI) “重构这 120 行能跑但很乱的代码,不许破坏测试”(OpenAI) · “对 5 万个文档跑 LLM 调用,API 限 100 并发、偶发 429 和超时,把 Python 写出来”(Anthropic) 考察重心从算法记忆转向增量需求下的代码演进能力、并发正确性、真实工程约束下的取舍。 3. “AI 协作轮”作为新题型已经进入正式面试流程。 这是文档里最前沿的信号: · Anthropic 部分机器学习岗有 AI-collaboration 轮:现场给你 Claude,考察的是你如何指挥它和验证它的产出,而不是你自己写。 · Meta 2026 年的流程新增三阶段 AI 辅助编码轮(探索修复 → 实现新功能 → 扩展改进)。 · Cursor 的 onsite 是两天在真实 Cursor 代码库上做一个功能(或 8 小时远程版),明确考核你对 AI 工具的使用效率和自主 scoping 能力。 · Sierra 给你两小时和任意 AI 工具,看你选择做什么。 xAI 有四小时限时产品构建。 4. FDE 成为一级岗位类别。 Anthropic、OpenAI、Databricks、Scale、Together、Sierra、Harvey、ElevenLabs、Palantir 的章节里都有 "Applied and Forward-Deployed Scenarios" 专属题库——典型题目如“企业客户说 Claude 幻觉太多,你是驻场工程师,头 48 小时做什么”。这对应了 AI 公司向企业交付方式的转变:模型能力差距收窄后,落地能力成为差异化。 5. 硬核系统题的普及。 "H100 上 70B 模型 batch size 1 的 roofline 计算"、"估算 70B 模型的 GPU 显存(权重 + KV cache + 激活 + 碎片)"、"p99 延迟在部署后翻倍但模型没变,走一遍诊断”——这类题横跨 NVIDIA、Together、OpenAI、Perplexity 等多家,说明推理性能的量化直觉已成为 AI 工程师的通用素养,而非基础设施工程师的专属。
显示更多
网卖 500 刀的所谓 Agent 实战课,含金量加起来都不如 Google 官方刚录的这 1 小时。 真正的大厂工程师根本不在聊天框里调试 Agent, 他们把单人做团队的秘密,全押在了「图工程(Graph Engineering)」上。 这 1 小时视频,直接从零教你搭一套不用人肉值班、24/7 自动运转的 Multi-Agent 商业系统: • 00:00 撕开图工程真相:告别单线流水线,接入状态图与动态路由; • 09:16 最小可行 Agent:怎么把工具(MCP)接入节点; • 21:15 状态与记忆流转:解决长任务上下文爆炸与失忆痛点; • 41:03 生产环境落地:多智能体并发调度与自动容错; • 52:21 自进化闭环:让 Agent 在失败中自动修补逻辑。 如果你想做能持续赚钱的 AI 自动化业务,而不是写几个 Demo 自嗨, 这绝对是今年含金量最高、没有半句废话的必看视频。
显示更多
0
26
481
127
转发到社区
Agent = Model + Harness:生产级 AI 智能体工程六层实战手册 结合 Mitchell Hashimoto、OpenAI Codex 团队、Martin Fowler、LangChain、Cursor 等公开工程资料编撰。 # Agent = Model + Harness 模型只提供推理能力,决定 Agent 能否从演示走向生产环境的是围绕模型的工程基础设施——Harness。 报告的核心论据是:只改 Harness、不换模型,收益可超过模型升级: · 同一 Claude Sonnet 4.5 在 GAIA 基准上从 30.91% 升至 74.55%(+43.64 分),差异完全来自 Harness; · LangChain 不改模型,仅靠 Harness 优化将 Terminal Bench 排名从第 30 提升至第 5; · OpenAI 团队 5 个月、约 1500 个自动化 PR 产出 100 万行生产代码,零人工手写——人负责设计环境,Agent 负责写代码("Humans steer. Agents build.")。 这也解释了一个行业现象:约 95% 的企业 AI Agent 止步于预生产阶段——演示效果好,却因安全审查、可观测性、边界情况幻觉、治理缺失而无法上线。 # 行业定位:AI 工程的第三个时代 1. 提示词工程(2023–24):模型"说什么" 2. 上下文工程(2025):模型"看到什么"(RAG/MCP/记忆) 3. Harness 工程(2026):模型"能做什么" # 六层架构(报告主体) 1. Guides 引导层(前馈控制):AGENTS.md / CLAUDE.md 等规则文件,在执行前塑造行为。要点:规则必须可执行、可验证、可追溯至真实失败案例;需定期修剪,否则 200 行无日期规则就是技术债。OpenAI 内部将其视为最高事实源——文件与会话冲突时,文件优先。 2. Sensors 传感层(反馈控制):执行后验证输出。优先使用确定性、零成本的计算型传感器(linter、测试、schema 校验);LLM-as-judge 等推理型传感器慢、贵、不确定,只用于无法用规则表达的语义判断,且应作参考信号而非硬门禁。 3. Agentic Loop 执行循环:计划→执行→验证→修复→前进或升级,必须有界——默认每步最多重试 3 次、30 分钟、10 万 token、5 美元、50 次工具调用。预算耗尽时返回最佳半成品并说明原因,不允许用流利的最终答案掩盖部分失败。正确升级的 Agent 比自信地给出错误答案的 Agent 更有价值。 4. Memory 记忆层:模型每次会话都从零开始,Harness 负责状态连续性。最简方案是文件系统(plan.md、decisions.jsonl、checkpoint),对多数场景比向量数据库更便宜可靠。检验标准:中途关闭会话重开,Agent 应能断点续作。 5. Permissions 权限层:模型无法自我约束,Harness 是唯一安全边界。按范围、速率、可逆性、可见性四个维度设定能力预算;不可逆操作(部署、删除、外发消息)必须人工批准;必须隔离可信指令与不可信数据以防提示注入。 6. Observability 可观测层:结构化日志 + 成本归因 + 熔断告警(trip wire)。真正的度量不是 token 数,而是无需人工干预即完成且证据合格的任务数;成本应按"每个验证通过的结果"而非按天计算。 # 方法论精髓:棘轮原则(Ratchet) Hashimoto 的原始定义:"每当 Agent 犯错,就工程化一个方案,让它永远不再犯这个错。" 六步循环:复现失败→归类根因→选择最强修复层→编码修复→验证防复发→监控回归。 修复强度呈阶梯上升:对话补丁 < 提示词 < 引导规则 < 传感器 < 环境约束——提示词只修一次对话,环境约束让错误在结构上不可能发生。 Cursor 的 Lauren Tan 补充了实操信号:同一条评审意见出现三次,就应固化为结构性约束。Harness 成熟的标志是规则增速下降(从每天 5 条降到每周 1 条)。 # 落地路径与边界 七天最小可用路径:Day 1–2 建引导文件 → Day 3–4 接入测试套件与有界循环 → Day 5–6 加检查点与权限 → Day 7 加日志与熔断。之后按"一次只改一层、可度量、可回滚"扩张,完成率 ≥80% 等六道闸门全过才允许扩大规模。 何时不需要 Harness:一次性问答、创意脑暴、低风险个人任务——"如果以上都不适用,对话本身就是 Harness"。 多智能体扩展:需要类型化交接("done, looks good" 不能推进生产流程)、共享状态模型而非共享上下文(避免上下文污染)、以及生产者不可覆盖的独立验证者。
显示更多
0
10
65
14
转发到社区
推荐一个演讲:当 Agent 比你更会写代码 看下演讲者 Daisy 的背景,她在 C++ 标准委员会摸爬滚打了近十年,期间还牵头过其中一个研究方向几年,专攻并行与分布式编程这种硬核方向,属于那种以代码功力为荣的工程师。加入 Anthropic 后她主导了 Claude Code 里 plugins 和 agent teams 这两块的设计与实现,也正因为这段经历,她自己说,在 Anthropic 这一年半,这套"以代码为荣"的心态被彻底动摇了。她在演讲里抛出一个假设,也是整场演讲的出发点: 如果 Agent 能写出比你更好的代码,工程学会变成什么样? 她想聊的是:一旦你认真对待这个假设,智能体编程的框架设计、上下文工程该怎么做,才能撑起真正大规模的软件工程。这篇笔记就沿着这条线,把演讲里从工具调用的进化、上下文工程的硬约束,到插件体系设计、多智能体协同、2026年展望这几块内容过一遍,作为整场演讲的快速导读。
显示更多
OpenAI联名推出首款硬件KBD1.0 Codex Micro,230美元的小键盘靠语音指令、摇杆切模式、旋钮控推理力度,把敲代码从“手动输入”变成了“指尖指挥多智能体”。这哪是换个键盘,分明是给AI Agent装了实体控制台——未来办公不再拼打字速度,只留“说想法、做判断”的核心动作,手动低级输入终将被淘汰。对普通用户是尝鲜税,对Codex重度党却是效率锚点,毕竟当AI开始干活,人只需要当好“指挥官”就行。
显示更多
Anthropic为了让你爽用Fable 5,整出了多智能体会话的功能,简单说就是在单个会话中协调多个Agent 有什么好处?就是Claude的单会话多线程,有点像Grok一个Leader管4个Agent跑并行任务 先用Fable 5提建议,再奴役Sonnet 5干活,狠狠地压榨每一个Workers(Sonnect 5)
显示更多
🚨 港大开源 ViMax,让 AI 变成一个完整剧组! GitHub 11K start 是一个多智能体视频生成框架,能把一句话的想法,直接生成带剧本、分镜、角色一致、自动配音的完整视频。 它把传统视频制作里不同角色的工作,用 Agent 分工实现: > 编剧 Agent 负责写故事和剧本 > 导演 Agent 控制镜头、分镜和叙事节奏 > 制片 Agent 负责角色一致性和画面连贯 > 生成 Agent 输出最终视频 解决以下痛点: > 支持长视频生成(不是只有几秒短 clip) > 角色一致性控制较强,适合讲故事类内容 > 支持 Idea2Video、Novel2Video、Script2Video 等多种输入方式 > 可本地部署,免费开源 简单来说,它把“从想法到完整视频”这个流程用多智能体的方式系统化了,适合想用 AI 做内容创作、故事讲述或短剧的用户尝试。
显示更多
0
1
20
11
转发到社区
想用三个月拿下年薪20万美金的AI工程师Offer? 现实点说,你根本不需要回炉重造拿学位,把下面这10个GitHub仓库彻底嚼碎吞下去,比什么都管用。 如今的AI工程岗,拼的根本不是一纸文凭,而是你对生产级工具的掌控力到底到了哪个段位。这份清单就是一条从零基础到具备实战能力的完整路径,各个环节都给你安排得明明白白。 ① awesome-llm-apps 起点就选这个,绝对不踩坑。RAG、智能体、多模态应用,一水的生产级真实代码,跟那些只能跑着玩的玩具项目完全是两码事。11.2万+ stars,这是目前市面上最系统的LLM落地实战地图。 ② LangChain 到了2026年,简历上要是没出现LangChain,很可能第一轮就被筛掉了。Klarna、Replit、Elastic这些一线公司都在用,绝大多数AI创业公司的生产环境跑的就是它。 ③ LangGraph 光会LangChain只是入门,LangGraph才是现在高级AI工程师岗位描述里的高频硬指标。它是生产级智能体的核心编排层,不懂这个,你只能打打下手做基础工作。 ④ CrewAI 多智能体协作早就不是概念了,它正在当下发生。财富500强团队已经拿它在生产环境落地,框架非常成熟,面试时聊到多智能体架构,你随口就能抛出实战经验。 ⑤ Ollama 想搞懂大模型底层到底在干嘛,最快的办法就是让它在你自己的机器上跑起来。Ollama让你一键运行任何开源LLM,这是绕过抽象概念、直击原理的最短路径。 ⑥ awesome-mcp-servers MCP已经是2026年主流AI实验室的统一标准协议了。现在懂MCP的工程师还是稀缺资源,你学完立刻就能拉开身位,但这个红利窗口不会一直开着。 ⑦ Qdrant 做RAG就绕不开向量数据库,Qdrant是大规模生产环境里公认的主流选项。嵌入和语义搜索已经是AI岗位的默认技能项了,没得商量。 ⑧ AI-Agents-for-Beginners 微软官方出品的免费12节实操课,手把手教你构建智能体。全是真实代码、真实练习,面试前刷一遍,直接就有拿得出手的项目经验可以讲。 ⑨ system-design-primer 很多人会忽视这一点,但生产级AI骨子里拼的就是系统设计能力。FAANG的工程师面试前都在刷这个仓库,想拿高薪Offer,系统设计这道关你必须得迈过去。 ⑩ awesome-claude-code Claude Code已经是FAANG、OpenAI、Anthropic以及绝大多数YC系创业公司内部的主流工具。这个仓库就是它的完整使用手册,用得溜的人,生产效率直接拉开同事实力差距。 三个月能不能拿下Offer,不取决于你背了多少理论,只取决于你有没有亲自把代码跑起来、把坑踩一遍。把上面10个仓库啃透,做出几个能直接展示的实战项目,比任何证书都更有说服力。
显示更多