注册并分享邀请链接,可获得视频播放与邀请奖励。

meng shao 的个人资料封面
meng shao 的头像

meng shao (@shao__meng)

@shao__meng
0 正在关注    0 粉丝
Manus 2.0 发布,能力更全面,Build 和 Create 两个主要 Agent 方向都覆盖到了 另外还发布了个人智能体「Cue」,可能这才是 Meta 个人智能体的 A 计划吧 Manus 团队给了我一些 Cue 内测邀请码,感兴趣的朋友可以评论和私信来领取,咱们一起看看 Manus 团队把个人智能体做到了什么程度,相信会有惊喜。 还没深入使用 Manus 2.0,不乱做分享,先发一个官方对 2.0 的介绍视频大家看看。
显示更多
Meta RAM 团队提出 RL-XAR:用专家对齐评分标准消灭 AI Slop RL-XAR (Reinforcement Learning from eXpert-Aligned Rubrics):用少量高质量人类文本作为“标准答案”,自动优化出一套能把专家写作和 AI 写作区分开的评分细则,再以此作为奖励信号做 RL。在 Qwen3.5-27B 写作模型上,该方法让 AI 写出的论文段落和故事续写在盲评中大幅击败原版人类专家文本(胜率 89%–95%),首次把“可验证任务上的超人 RL”推进到了写作这类不可验证任务。 问题:为什么写作是 RL 的洼地 ? RL(如 GRPO)之所以能在数学、代码上取得超人表现,核心前提是奖励可验证——答案对不对可以自动判定。但写作没有这种判据: · 最大似然预训练的天花板就是训练数据本身的质量。模型学的是“复现语境的平均水平”,而不是超越它。 · RLHF 的奖励模型继承标注者的品味上限。奖励模型从普通标注者的偏好排序中学出来,普通标注者自己写不出、也未必能稳定识别出专家级的文字质量。 结果是模型产出大量低质量写作,也就是 "AI slop"。 关键诊断:现成的 LLM 评判者本身就是“slop 同谋” 在一个“隐去论文某一段落(摘要/引言/相关工作/结论),让模型补写”的任务上: · 成对比较(pairwise judging):LLM 评判者在 63.5%–84.6% 的情况下把模型输出排在人类专家之上; · 普通 LLM 生成的评分标准:100% 偏向模型。 也就是说,如果直接拿主流 LLM 当裁判做 RLHF/RLAIF,你训练出来的只会是“更受 LLM 裁判青睐的 slop”。奖励信号本身就是坏的,而且坏得系统化。 方法:RL-XAR 的四步循环 既然普通评分标准分不清人类和模型,那就专门优化出一套分得清的。 1. 构造对照数据:取专家人类文本,切成“上下文 + 续写”对(如论文其余部分 + 被隐去的段落); 2. 生成竞品:让模型写同题续写,预期是 slop; 3. 元优化评分标准:用一个强 LLM 作为元优化器(如 Kimi-K2.6),反复修订一个“评分标准生成提示词”,目标是最大化人类得分与模型得分之差,且明确要求“为了真实的质量原因拉开差距,而不是抓住表层特征”。meta-prompt 有长度上限,迫使标准收敛、去冗余; 4. 用学到的评分标准跑 GRPO,训练写作者,然后回到第 3 步迭代,直到人类—模型分差消失(模型已经“好到分不出来”)。 作者认为,这与 GAN 同构:写作者像生成器,评分标准像判别器,二者交替对抗优化,直到判别器失效。妙处在于:判别器不需要人工标注偏好,只需要免费存在的专家文本作为锚点。 学到的评分标准到底在奖励什么? 这部分是方法真正“理解写作”的证据,而非玄学: · 普通评分标准退化成逐条内容清单,逐点检查该段是否提到某方法、某结果,实际上是在奖励每一段都写成“微型全文摘要”; · 元优化后的标准奖励的是:段落本位(sectional ownership,每段只做段内该做的事,不越界)、克制的取舍(disciplined selection)、经济性(economy)、精准的段内细节而非覆盖面; · 元优化器明确修正了早期标准的三类误判:因专家合理省略而扣分、把压缩摘要当流畅性加分、把表面润色当功力。 主实验结果 实验统一以 Qwen3.5-27B 为写作模型,训练时由 Qwen3.8-2.4T-A95B 担任裁判、Kimi-K2.6 担任元优化器,最终评估则换用 GPT-5.6,避免自评偏袒。 三个写作领域的表现一致向好。 · 论文段落补写(S2ORC 561 篇 CS 论文,2,243 个训练样本)效果最强:3 轮 RL-XAR 后,模型在最严评分标准下拿到 9.60/10(人类专家为 10),超过所有参测前沿模型;人类盲评中专家仅胜 2 局,模型 16:2(89% 胜率)胜出。 · 故事续写(古腾堡计划普利策/诺贝尔奖作者作品,2,290 个样本,经 13-gram 重复过滤排除记忆泄漏)得分从 2.8 升至 8.2,超过 Claude 5 Opus 的 6.8;盲评 19:1(95% 胜率)。 · 维基百科段落(特优/优级条目,1,187 个样本)增益最小:从 2.7 升至 4.0,仍落后于 GPT-5.6 的 7.9;作者归因于训练裁判在该任务上太弱,再次印证裁判上限决定写作上限。 消融实验:哪些成分在起作用? · 裁判质量是命门:换 Qwen3.5-27B 当裁判,人类—模型分差在故事任务为 −0.55、维基为 −0.39;弱裁判直接把奖励信号搞反。 · 元优化器要够强:Kimi-K2.6 和 Opus 5 能找到正向分差,更弱的 Muse Spark 1.1 找不到。 · 专家文本的成色决定上限:按论文质量分桶,分差分别为 +1.39(高)/ +0.95(中)/ +0.37(低),喂什么水平的专家,就学到什么水平。 · 评分标准跨裁判可迁移:在 GPT-5.6 和 Muse Spark 1.1 上同样有效,说明学到的是真实写作规律,不是对某个裁判的过拟合。 · 必须约束长度:不加长度约束时模型写出 2–3 倍长度的文本来“刷”评分标准(副作用是模型把大量思维链花在数字数上)。 · 多轮迭代评分标准防止对单轮标准过拟合;用 GRPO 在线共同训练评分标准(故事 2.8→6.0)是有前景的下一步。
显示更多
Unsloth 让开源决策模型 Laya 在本地部署,最低仅需 4GB 内存,全面支持 CPU、Mac、Windows、Linux 及 GPU 环境,Jev API 无缝替换 @UnslothAI 文档地址 部署与性能特征 1. Multilingual(默认)- 678 MB 体积、4 GB 内存,100+ 语言,1024 token 上下文 2. English - 846 MB 体积、5 GB 内存,更大的 encoder,512 token 上下文 3. Typed Decisions - 846 MB 体积、5 GB 内存,针对发票、安全事件、客服、agent 轨迹优化 性能表现很适合生产环境:首次请求加载模型需 10–20 秒,之后 CPU 上亚秒级响应;GPU 是可选加速,且显存不足时自动回落到 CPU 继续服务。安装走 Unsloth Desktop 或一键脚本,在 Settings → API → Decision API 里开启即可。 文档中最重要的工程建议 用 probabilities 做决策阈值,不要用 confidence。 例如规则应写成“当 technical 概率 > 0.8 时触发”,而不是“confidence > 某值”。这条建议出现两次,并且直接关联 Jev 迁移的头号坑:Laya 的 confidence 计算公式与 Jev 不同,在 Jev 上调好的 confidence 阈值不能直接搬过来。 其他硬性限制:单请求最多 64 个问题、每个 choice 最多 255 个选项、每个 score 最多 10 档;choice 的各选项共享固定 token 预算,带描述的选项超过约 20 个后标签会被截断,实际使用中选项数量要控制在这个范围内。 从 Jev 迁移 只需装 typesafe-sdk 并把 TYPESAFE_BASE_URL 指向 http://localhost:8888,SDK 默认的 jev-latest 会映射到你在设置里选的模型。除上述 confidence 公式差异外,唯一另一处行为差异就是 choice 选项的 token 预算截断。迁移成本设计得很低。
显示更多
Claude Code 怎么做「Eval Design」和「Hillclimbing」? 来自 A\ 这篇工程方法论,作者 @RLanceMartin 分享了如何把「评测设计」和「爬山优化」这两个 AI 工程中最关键也最容易自我欺骗的环节,产品化为 Claude Code 里的两个命令:/claude-api build-eval 和 /claude-api hillclimb,对应 Skills 也开源在 claude-api skill 中了。 博客地址: 开源地址: “设计评测、并在其上提升性能而不自我欺骗,是很难的。” 常见的自欺路径有三条: 1. 任务选取偏差:挑容易生成、容易打分的任务,而不是真正关心的任务; 2. 对抗性采样陷阱:专门挑模型失败的案例来构建评测,测到的不是任务的内在难度,是该模型的“失败指纹”。换一个模型,这套评测就失真了。正确做法是“因为人类专家判断它难才选它”; 3. 评分器配置错误:博客强调“评分失误是评测被错误配置的最常见方式之一”,而且往往要在人工抽查打分时才暴露。 好评测的四条标准 本质上是从心理测量学/实验设计借来的信度效度框架: 1. 任务镜像生产:任务分布必须代表你真正关心的东西,而非便于评分的东西 2. 性能随模型能力/努力程度单调变化:如果最强模型最高努力也做不好,多半是任务有歧义或评分器坏了,这是把“可区分性”当作评测健康度的诊断信号 3. 前沿模型留有头部空间:最强配置应明显低于 100%(基线已 ~95%+ 时,评测失去区分度,应转而优化成本) 4. 低运行间方差:四个来源:任务歧义、评分器对相同输出给出不同判定、配置不一致(如 effort 未统一施加)、环境状态泄漏(残留文件、git 历史直接暴露答案) build-eval:评测自动化的关键设计 工作流不应该是黑箱生成,是带人工审批关卡的引导式流程,输入采样按代表性排序:生产对话记录 → bug 报告/工单 → 5–10 个人工手写案例 → 从代码库合成的案例。 评分器选择遵循最便宜够用原则: · 输出受限时用程序化验证(精确匹配、固定标签、schema 校验、测试通过); · 开放式输出用 LLM-as-judge,但有三条纪律:rubric 写成“可核验的陈述”而非 1–5 分量表;有基线输出时用随机顺序的成对比较;裁判模型不能是被测模型本身(避免自我偏好)。 自动化诊断是亮点:评分器对同一输出跑两次检验稳定性;检查管道问题(超时、API 错误、答案被截断);基线过高时发出头部空间警告;每个案例输出 JSON 行 + 完整转录,并生成带置信区间的本地结果页。 hillclimb:爬山的核心是防过拟合 适用面判断是前提,可爬山的表面需满足三个条件:迭代便宜(prompt、skill 而非大改 harness 代码)、变化可归因(改什么就影响什么)、目标定义清晰。一个普适的稳健目标:性能持平前提下降成本,即使在饱和评测上也有效。 防过拟合机制构成了一个完整的实验协议: · 随机 train/test 划分,测试集永远不看; · 判定规则:训练集升 + 测试集平 = 疑似过拟合 → 回滚;两者同升才保留; · “绝不把失败案例内容粘贴进 prompt”,这是最直接的过拟合通道,补丁必须针对根因(重写问题段落),而非表面措辞; · 把答案保持在模型结构性接触不到的位置,防 reward hacking; · 开跑前先验证评测噪声小于你想采取行动的最小改进幅度,否则增加重复次数或案例数; · 连续 2–3 轮停滞时,对剩余失败按根因分类,这一步往往会暴露评测自身的 bug(歧义任务、harness 错误、评分器缺陷),剔除后只留真实失败继续迭代; · 最终以测试集上表现最好的版本收尾,若增益在噪声范围内则明确建议不要合并。 两个案例:数字表现 案例一:客服成本优化(44 张工单,30 训练 / 14 留出)。基线 Opus 4.8 高努力档:74.4% 决策准确率,4.6 美分/单。爬山过程展示了典型的“先减负再降配”路径:清理 prompt 中的工具调用仪式、草稿步骤和矛盾规则 → 换 Opus 5.5 低努力档(87.8%,1.9 美分)→ 降级到 Sonnet 5 低努力档(88.9%,约 1 美分)→ 针对性改进路由规则后训练集 98.9%。留出测试集:90.5% vs 原始 78.6%,成本约为原来的五分之一。 案例二:claude-api skill 自身提能(66% → ~88%)。这个过程更像一次诊断式复盘:补齐 8 个缺失功能覆盖 → 74%;修 C#/Java 类型表错误 → 77%;停滞后的根因分析发现模型在凭训练先验写过时的 API 形态(如已被新版 Opus 拒绝的固定预算 thinking),在 skill 顶部加迁移表 → 80%;随后甚至揪出评测自身的缺陷(一个任务只要求捕获一种错误但评分器要求至少三种错误的调用链;另一个评分器与文档矛盾,实测 API 证明文档是对的)→ ~88%。
显示更多
随着 Muse 的爆火、Manus Cue 的发布,豆包团队恍然大悟,原来让豆包工作之前,豆包得先是个人! 据说豆包团队中秋前就开始冲刺了,国庆期间会发布豆包个人?道听途说,坐等发布。 不过心里话,国内不适合做个人智能体,感觉真的没啥可做,也链接不了啥,稍微一发力,就又 tm 回到牛马的工作中了。
显示更多
斯坦福大学 CS329Z「Engineering AI Agents」 第二讲:LLMs for Builders 我把讲义主要内容解读做了一个快速预览的演示版本,可以先看这里,再看课件详细解读和课件内容。
显示更多
EverMind 开源了一个多智能体 Host Agent 框架「Raven」,定位是 "the harness of harnesses" @evermind Raven 站在 Claude Code、Codex 等 Coding Agent 之上:把任务拆解为 DAG,调度内置和第三方的专业 Agent 协同完成,并能迭代改进自己的 harness 本身,也就是递归自我改进(Recursive Self-Improvement, RSI)。 开源地址: 为什么是 "Harness of Harnesses"? 当前 Agent 生态的碎片化问题很明显:Claude Code、Codex 擅长编码、各类 Agent 各有所长,但没有一个统一层去编排它们。Raven 的切入点正是这个空档,它本身是一个“宿主 Agent”,接收复杂任务后: 1. 生成任务 DAG,明确依赖关系,可并行执行的并行执行; 2. 为每个节点分派最合适的 Agent(内置的四个之一,或通过 ACP / CLI / OpenAI 兼容 API 接入的第三方 Agent,官方内置了 Claude Code、Codex、Qwen Code、Kimi Code 等 13 个预设); 3. 沉淀为可复用的工作流,下次类似任务直接复用。 架构的核心模块 四个内置专业 Agent,各自有明确的职责边界和对应的 benchmark: · Raven-Research:自主深度研究、文献综述、带可溯源引用的结构化报告; · Raven-Code:Agentic 软件开发(SWE-bench Pro/Verified、DataAgentBench 等,README 称 DataAgentBench 以 0.8762 Pass@1 居首); · Raven-Design:视觉交付物,PPT、海报、图表、Web 界面(PresentBench、ArtifactsBench); · Raven-Oncall:无人值守的长时工作流自动化,跑数小时的实验、过夜监控、持续优化,官方称在 AI4AI 和 AI4S 基准上于质量、成功率、成本三项均优于 Claude Code。 这是理解 Raven 的关键:Oncall 这类“跑一整夜自己迭代实验”的场景,才是它区别于交互式编码工具的差异化所在。 Evolver 是 RSI 叙事的落地:它把 Agent 主循环拆为四个解耦的策略模块,Memory(本轮看到什么上下文)、Planning(用什么方法)、Capability(每轮可用哪些工具)、Action(下一步做什么及执行前判断)。一个实验性的 "Curator" 会重写这四块的实际代码(不只是 prompt,还包括工具、技能和判断逻辑),候选改动必须先在 benchmark 上打败基线、通过验证门禁才会被安装,且反馈中会剥离参考答案以防“作弊”。首次使用时 Curator 还会根据用户的任务描述组装一个定制化的 "Persona" 团队(一个主理角色 + 若干专家 Agent)。 EverOS Memory 提供跨会话的三层记忆:用户上下文、Agent 自身经验、世界知识。SkillForge 则统一检索本地技能库、记忆和 SkillHub 上约 11.4 万个 Skills。Proactivity 提供事件监听和定时调度(提醒、跟进)。 实证 Showcase · THRESHOLD:约 4 天、42 轮规划/开发/验证循环,全自主产出一款 Godot 4 FPS 游戏,外加海报、演示文稿和官网,这是“长时程多 Agent 协作”的展示; · RSI 实验:7 轮共 172 次 nanochat 训练全程无崩溃,在固定 20 分钟单 GPU 预算下将 val_bpb 降低 5.8%;另有 CFD(溃坝问题超调量降低三个数量级)和 FEA 极限载荷搜索的优化案例; · 发布物料(浏览器物理小游戏、16 页 deck、README 本身)均由 Raven 自己生成,这个“自证”传统与 Claude Code 一脉相承。
显示更多
Raven 0.2.0 — The Harness of Harnesses, built for RSI. 🐦‍⬛ One harness can't be best at everything. Raven combines its own specialist harnesses (Research, Code, Design, Oncall) with the agents you already use (Claude Code, Codex and more) into one team. And it's built for RSI, and not just at the skill level. The whole harness can be rewritten by AI: prompts, policies, strategy code, playbooks. Every sub-harness, including the orchestration layer itself, is its own instance that can be improved. With Raven you can: 1. Orchestrate many agents as one team. Raven's sub-harnesses and external agents work in one task graph with shared memory across sub-agents, powered by leading orchestration (0.963 Node F1 on the Multi-Agent Orchestration Benchmark). 2. Run long, complex tasks. Oncall and proactive execution keep work going for days, from scientific research loops to shipping a full Godot game. 3. Build vertical agents with RSI. Use Raven's RSI to develop and refine an agent for your domain, and we'll optimize it with you. Experimental for now; reach out to the Raven team(Discord: More in the video and slides below. Open source, Apache-2.0. (lots of work made with Raven lives there, and much of this launch's material was made with Raven too)
显示更多
斯坦福大学 2026 秋季新课 CME 295: Transformers & Large Language Models 已开课(第一讲公开) @stanfordnlp 这门课程由双胞胎兄弟 @afshinea @shervinea 主讲,9 讲走完 LLM 全部版图:从 Transformer 架构、注意力变体、RoPE,到 LoRA 微调、RLHF/GRPO 训练,再到 Flash Attention 推理优化、MCP 与 AI Agent、扩散语言模型。 第一讲 Transformers 课件和课程视频都已公开:
显示更多
斯坦福 @stanfordnlp 新课 CME 295,双胞胎兄弟 @afshinea @shervinea 主讲,9 讲走完 LLM 全部版图:从 Transformer 架构、注意力变体、RoPE,到 LoRA 微调、RLHF/GRPO 训练,再到 Flash Attention 推理优化、MCP 与 AI Agent、扩散语言模型。 课程和知名速查表全部公开。
显示更多
@achowdhery @Azaliamirh @stanfordnlp @StanfordOnline @Stanford 斯坦福大学 CS329Z「Engineering AI Agents」第二讲 LLMs for Builders:Agent 工程师必修的大模型底层原理
Claude Code 怎么做「Eval Design」和「Hillclimbing」? 来自 A\ 这篇工程方法论,作者 @RLanceMartin 分享了如何把「评测设计」和「爬山优化」这两个 AI 工程中最关键也最容易自我欺骗的环节,产品化为 Claude Code 里的两个命令:/claude-api build-eval 和 /claude-api hillclimb,对应 Skills 也开源在 claude-api skill 中了。 博客地址: 开源地址: “设计评测、并在其上提升性能而不自我欺骗,是很难的。” 常见的自欺路径有三条: 1. 任务选取偏差:挑容易生成、容易打分的任务,而不是真正关心的任务; 2. 对抗性采样陷阱:专门挑模型失败的案例来构建评测,测到的不是任务的内在难度,是该模型的“失败指纹”。换一个模型,这套评测就失真了。正确做法是“因为人类专家判断它难才选它”; 3. 评分器配置错误:博客强调“评分失误是评测被错误配置的最常见方式之一”,而且往往要在人工抽查打分时才暴露。 好评测的四条标准 本质上是从心理测量学/实验设计借来的信度效度框架: 1. 任务镜像生产:任务分布必须代表你真正关心的东西,而非便于评分的东西 2. 性能随模型能力/努力程度单调变化:如果最强模型最高努力也做不好,多半是任务有歧义或评分器坏了,这是把“可区分性”当作评测健康度的诊断信号 3. 前沿模型留有头部空间:最强配置应明显低于 100%(基线已 ~95%+ 时,评测失去区分度,应转而优化成本) 4. 低运行间方差:四个来源:任务歧义、评分器对相同输出给出不同判定、配置不一致(如 effort 未统一施加)、环境状态泄漏(残留文件、git 历史直接暴露答案) build-eval:评测自动化的关键设计 工作流不应该是黑箱生成,是带人工审批关卡的引导式流程,输入采样按代表性排序:生产对话记录 → bug 报告/工单 → 5–10 个人工手写案例 → 从代码库合成的案例。 评分器选择遵循最便宜够用原则: · 输出受限时用程序化验证(精确匹配、固定标签、schema 校验、测试通过); · 开放式输出用 LLM-as-judge,但有三条纪律:rubric 写成“可核验的陈述”而非 1–5 分量表;有基线输出时用随机顺序的成对比较;裁判模型不能是被测模型本身(避免自我偏好)。 自动化诊断是亮点:评分器对同一输出跑两次检验稳定性;检查管道问题(超时、API 错误、答案被截断);基线过高时发出头部空间警告;每个案例输出 JSON 行 + 完整转录,并生成带置信区间的本地结果页。 hillclimb:爬山的核心是防过拟合 适用面判断是前提,可爬山的表面需满足三个条件:迭代便宜(prompt、skill 而非大改 harness 代码)、变化可归因(改什么就影响什么)、目标定义清晰。一个普适的稳健目标:性能持平前提下降成本,即使在饱和评测上也有效。 防过拟合机制构成了一个完整的实验协议: · 随机 train/test 划分,测试集永远不看; · 判定规则:训练集升 + 测试集平 = 疑似过拟合 → 回滚;两者同升才保留; · “绝不把失败案例内容粘贴进 prompt”,这是最直接的过拟合通道,补丁必须针对根因(重写问题段落),而非表面措辞; · 把答案保持在模型结构性接触不到的位置,防 reward hacking; · 开跑前先验证评测噪声小于你想采取行动的最小改进幅度,否则增加重复次数或案例数; · 连续 2–3 轮停滞时,对剩余失败按根因分类,这一步往往会暴露评测自身的 bug(歧义任务、harness 错误、评分器缺陷),剔除后只留真实失败继续迭代; · 最终以测试集上表现最好的版本收尾,若增益在噪声范围内则明确建议不要合并。 两个案例:数字表现 案例一:客服成本优化(44 张工单,30 训练 / 14 留出)。基线 Opus 4.8 高努力档:74.4% 决策准确率,4.6 美分/单。爬山过程展示了典型的“先减负再降配”路径:清理 prompt 中的工具调用仪式、草稿步骤和矛盾规则 → 换 Opus 5.5 低努力档(87.8%,1.9 美分)→ 降级到 Sonnet 5 低努力档(88.9%,约 1 美分)→ 针对性改进路由规则后训练集 98.9%。留出测试集:90.5% vs 原始 78.6%,成本约为原来的五分之一。 案例二:claude-api skill 自身提能(66% → ~88%)。这个过程更像一次诊断式复盘:补齐 8 个缺失功能覆盖 → 74%;修 C#/Java 类型表错误 → 77%;停滞后的根因分析发现模型在凭训练先验写过时的 API 形态(如已被新版 Opus 拒绝的固定预算 thinking),在 skill 顶部加迁移表 → 80%;随后甚至揪出评测自身的缺陷(一个任务只要求捕获一种错误但评分器要求至少三种错误的调用链;另一个评分器与文档矛盾,实测 API 证明文档是对的)→ ~88%。
显示更多
Unsloth 让开源决策模型 Laya 在本地部署,最低仅需 4GB 内存,全面支持 CPU、Mac、Windows、Linux 及 GPU 环境,Jev API 无缝替换 @UnslothAI 文档地址 部署与性能特征 1. Multilingual(默认)- 678 MB 体积、4 GB 内存,100+ 语言,1024 token 上下文 2. English - 846 MB 体积、5 GB 内存,更大的 encoder,512 token 上下文 3. Typed Decisions - 846 MB 体积、5 GB 内存,针对发票、安全事件、客服、agent 轨迹优化 性能表现很适合生产环境:首次请求加载模型需 10–20 秒,之后 CPU 上亚秒级响应;GPU 是可选加速,且显存不足时自动回落到 CPU 继续服务。安装走 Unsloth Desktop 或一键脚本,在 Settings → API → Decision API 里开启即可。 文档中最重要的工程建议 用 probabilities 做决策阈值,不要用 confidence。 例如规则应写成“当 technical 概率 > 0.8 时触发”,而不是“confidence > 某值”。这条建议出现两次,并且直接关联 Jev 迁移的头号坑:Laya 的 confidence 计算公式与 Jev 不同,在 Jev 上调好的 confidence 阈值不能直接搬过来。 其他硬性限制:单请求最多 64 个问题、每个 choice 最多 255 个选项、每个 score 最多 10 档;choice 的各选项共享固定 token 预算,带描述的选项超过约 20 个后标签会被截断,实际使用中选项数量要控制在这个范围内。 从 Jev 迁移 只需装 typesafe-sdk 并把 TYPESAFE_BASE_URL 指向 http://localhost:8888,SDK 默认的 jev-latest 会映射到你在设置里选的模型。除上述 confidence 公式差异外,唯一另一处行为差异就是 choice 选项的 token 预算截断。迁移成本设计得很低。
显示更多
Meta RAM 团队提出 RL-XAR:用专家对齐评分标准消灭 AI Slop RL-XAR (Reinforcement Learning from eXpert-Aligned Rubrics):用少量高质量人类文本作为“标准答案”,自动优化出一套能把专家写作和 AI 写作区分开的评分细则,再以此作为奖励信号做 RL。在 Qwen3.5-27B 写作模型上,该方法让 AI 写出的论文段落和故事续写在盲评中大幅击败原版人类专家文本(胜率 89%–95%),首次把“可验证任务上的超人 RL”推进到了写作这类不可验证任务。 问题:为什么写作是 RL 的洼地 ? RL(如 GRPO)之所以能在数学、代码上取得超人表现,核心前提是奖励可验证——答案对不对可以自动判定。但写作没有这种判据: · 最大似然预训练的天花板就是训练数据本身的质量。模型学的是“复现语境的平均水平”,而不是超越它。 · RLHF 的奖励模型继承标注者的品味上限。奖励模型从普通标注者的偏好排序中学出来,普通标注者自己写不出、也未必能稳定识别出专家级的文字质量。 结果是模型产出大量低质量写作,也就是 "AI slop"。 关键诊断:现成的 LLM 评判者本身就是“slop 同谋” 在一个“隐去论文某一段落(摘要/引言/相关工作/结论),让模型补写”的任务上: · 成对比较(pairwise judging):LLM 评判者在 63.5%–84.6% 的情况下把模型输出排在人类专家之上; · 普通 LLM 生成的评分标准:100% 偏向模型。 也就是说,如果直接拿主流 LLM 当裁判做 RLHF/RLAIF,你训练出来的只会是“更受 LLM 裁判青睐的 slop”。奖励信号本身就是坏的,而且坏得系统化。 方法:RL-XAR 的四步循环 既然普通评分标准分不清人类和模型,那就专门优化出一套分得清的。 1. 构造对照数据:取专家人类文本,切成“上下文 + 续写”对(如论文其余部分 + 被隐去的段落); 2. 生成竞品:让模型写同题续写,预期是 slop; 3. 元优化评分标准:用一个强 LLM 作为元优化器(如 Kimi-K2.6),反复修订一个“评分标准生成提示词”,目标是最大化人类得分与模型得分之差,且明确要求“为了真实的质量原因拉开差距,而不是抓住表层特征”。meta-prompt 有长度上限,迫使标准收敛、去冗余; 4. 用学到的评分标准跑 GRPO,训练写作者,然后回到第 3 步迭代,直到人类—模型分差消失(模型已经“好到分不出来”)。 作者认为,这与 GAN 同构:写作者像生成器,评分标准像判别器,二者交替对抗优化,直到判别器失效。妙处在于:判别器不需要人工标注偏好,只需要免费存在的专家文本作为锚点。 学到的评分标准到底在奖励什么? 这部分是方法真正“理解写作”的证据,而非玄学: · 普通评分标准退化成逐条内容清单,逐点检查该段是否提到某方法、某结果,实际上是在奖励每一段都写成“微型全文摘要”; · 元优化后的标准奖励的是:段落本位(sectional ownership,每段只做段内该做的事,不越界)、克制的取舍(disciplined selection)、经济性(economy)、精准的段内细节而非覆盖面; · 元优化器明确修正了早期标准的三类误判:因专家合理省略而扣分、把压缩摘要当流畅性加分、把表面润色当功力。 主实验结果 实验统一以 Qwen3.5-27B 为写作模型,训练时由 Qwen3.8-2.4T-A95B 担任裁判、Kimi-K2.6 担任元优化器,最终评估则换用 GPT-5.6,避免自评偏袒。 三个写作领域的表现一致向好。 · 论文段落补写(S2ORC 561 篇 CS 论文,2,243 个训练样本)效果最强:3 轮 RL-XAR 后,模型在最严评分标准下拿到 9.60/10(人类专家为 10),超过所有参测前沿模型;人类盲评中专家仅胜 2 局,模型 16:2(89% 胜率)胜出。 · 故事续写(古腾堡计划普利策/诺贝尔奖作者作品,2,290 个样本,经 13-gram 重复过滤排除记忆泄漏)得分从 2.8 升至 8.2,超过 Claude 5 Opus 的 6.8;盲评 19:1(95% 胜率)。 · 维基百科段落(特优/优级条目,1,187 个样本)增益最小:从 2.7 升至 4.0,仍落后于 GPT-5.6 的 7.9;作者归因于训练裁判在该任务上太弱,再次印证裁判上限决定写作上限。 消融实验:哪些成分在起作用? · 裁判质量是命门:换 Qwen3.5-27B 当裁判,人类—模型分差在故事任务为 −0.55、维基为 −0.39;弱裁判直接把奖励信号搞反。 · 元优化器要够强:Kimi-K2.6 和 Opus 5 能找到正向分差,更弱的 Muse Spark 1.1 找不到。 · 专家文本的成色决定上限:按论文质量分桶,分差分别为 +1.39(高)/ +0.95(中)/ +0.37(低),喂什么水平的专家,就学到什么水平。 · 评分标准跨裁判可迁移:在 GPT-5.6 和 Muse Spark 1.1 上同样有效,说明学到的是真实写作规律,不是对某个裁判的过拟合。 · 必须约束长度:不加长度约束时模型写出 2–3 倍长度的文本来“刷”评分标准(副作用是模型把大量思维链花在数字数上)。 · 多轮迭代评分标准防止对单轮标准过拟合;用 GRPO 在线共同训练评分标准(故事 2.8→6.0)是有前景的下一步。
显示更多
Manus 2.0 发布,能力更全面,Build 和 Create 两个主要 Agent 方向都覆盖到了 另外还发布了个人智能体「Cue」,可能这才是 Meta 个人智能体的 A 计划吧 Manus 团队给了我一些 Cue 内测邀请码,感兴趣的朋友可以评论和私信来领取,咱们一起看看 Manus 团队把个人智能体做到了什么程度,相信会有惊喜。 还没深入使用 Manus 2.0,不乱做分享,先发一个官方对 2.0 的介绍视频大家看看。
显示更多
斯坦福大学课程 CS329A: Self-Improving AI Agents 斯坦福大学 @achowdhery @Azaliamirh 两位老师主讲,他们在 Google Brain / Deepmind 有过合作经历,现在合作连续两年讲授 AI Agents 课程。 分享这门课程后,类似获得了超过 5K+ 点赞和收藏,看到很多朋友喜欢,我也把 9 个视频做了一个预告视频,让大家对课程可以更快有更直观的感受。 虽然 AI Agent 已经强大到很多人觉得不需要再学习,什么问题都可以直接问,到顶级大学的基础课程,系统学习下来,还是会很有收获,全局认知的提升。 马上长假了,收藏学起来! 课程主页: 视频列表:
显示更多
0
17
526
76
转发到社区
[开源学习资源] AI Engineering from Scratch 59.8K ⭐️ 作者 @ghumare64 课程共 20 个阶段,以 Python 为主要编程语言,主张在导入任何框架之前,先用纯数学把每个算法手写一遍。 课程地址: 开源地址: 它和常见教程的本质区别 ? 大多数 AI 教程是“API 驱动”的:装个库、调个接口、跑个 demo。这个项目反其道而行,每节课遵循固定的六段结构: Motto → Problem → Concept → Build It → Use It → Ship It 以 Phase 10 的一节课「Tokenizers: BPE, WordPiece, SentencePiece」 为例,这个格式是真实落地的,而且写作质量相当高: · Problem 部分不讲废话,直接从代价切入:“你的 LLM 不读英语,它读整数。分词器决定这些整数是承载意义还是浪费意义”,然后解释为什么 tokenization 不是预处理,它是架构的一部分(影响上下文窗口利用率、API 计费、推理速度)。 · Concept 部分用“三种失败的方案和一种胜出的方案”来讲演化逻辑:词级切分(词表爆炸、[UNK] 问题)→ 字符级切分(序列过长)→ 子词切分(BPE 的折中),并配上真实语料上 BPE 逐步合并的手工演算。 每节约 3000+ 词,带 Mermaid 图、可运行代码和测试。 另外两个设计值得强调: · 每节课产出一个可复用的 artifact,一个 prompt、一个 skill、一个 agent 或一个 MCP server。学完整个课程,你手里有 523 个可展示的作品,不是 523 个跑完就扔的 notebook。 · 强调“证据留存”:保留命令、退出码、输出,作为学习发生的证明。这明显吸收了工程实践中“可验证性”的思路。 # 课程结构:从线性代数到自主智能体集群 20 个阶段构成一条完整的上升曲线,咱们它分成五个大块来看: 基础层(Phase 0–2):环境与工具链、数学基础(线性代数/概率/微积分)、经典机器学习。这是给基础不牢的读者铺的路。 深度学习与感知层(Phase 3–6):神经网络核心、计算机视觉(一路讲到 NeRF、高斯泼溅、世界模型,这已经超出一般教程的覆盖范围)、NLP、语音。 生成与决策层(Phase 7–9):Transformer 深挖、生成式 AI(GAN、扩散模型、flow matching)、强化学习。 LLM 层(Phase 10–12):这是全课程的重心之一。Phase 10 的目录我逐条看过,它不只是“从零实现 GPT”这种常规内容,还包含了相当前沿的论文级主题:DeepSeek-V3 架构走读、DualPipe 并行策略、Native Sparse Attention(NSA)、多 token 预测、Jamba 的 SSM-Transformer 混合架构、 speculative decoding 等。Phase 11 转向应用侧(RAG、LoRA、MCP、可观测性),Phase 12 覆盖多模态(从 CLIP 到 computer-use agent)。 智能体层(Phase 13–16):工具与协议(MCP、A2A、Agent Skills)、54 节课的 agent 工程、自主系统与安全、多智能体集群。这一层的分量很能说明项目的判断:它认为 AI 工程的重心正在从“训模型”转向“构建可靠协作的智能体”。 收尾(Phase 17–19):生产基础设施、伦理与对齐、毕业设计。 # 生态与周边:不只是一个课程仓库 网站:带浏览器本地存储的学习进度追踪、术语表、课程目录和路线图。 六卷本书籍:课程内容由 CI(pandoc)自动构建成 EPUB/PDF,附在 GitHub Releases 上,课程即书,且随仓库持续更新。 Agent 导师模式:运行 npx skills add rohitg00/ai-engineering-from-scratch,可以把整个课程装进 Claude Code、Codex 等编码智能体,变成一个带分级测验(placement quiz)和个性化路径的交互式导师,学习进度写在 LEARNING.md 里。这是“用你正在学的工具来学”的巧妙闭环。 认证备考:5 条备考路径、67 节课、505 道练习题,覆盖 Anthropic 的 Claude 认证和 Agentic AI Foundation 的 MCPA。项目明确声明与这些考试机构无关联,只是独立的备考材料。 12 种语言的翻译(含中文),以及四条核心学习路径(构建与部署 AI 应用、软件工程基础、Agent 辅助工程、产品判断与交付)供不同目标的人选路。
显示更多
0
11
75
16
转发到社区
Modal @modal 这份「GPU 术语手册」做的太友好了,它把整个 GPU 技术栈拆成四个相互勾连的层面:设备硬件、设备软件(执行模型)、主机软件(驱动与工具链)、性能分析,每个词条都密集交叉链接,既可以按需查阅单个术语,也可以从头到尾线性通读。 理解这份手册从「CUDA」开始,CUDA 有三重含义:一种设备架构、一个并行编程模型、一个软件平台。这份手册的四个章节恰好分别展开这三个含义加上性能分析。 GPU Glossary 四个章节: 1. 设备硬件:GPU 的物理解剖 - CPU 用复杂核心避免延迟,GPU 用海量简单线程隐藏延迟 2. 设备软件:CUDA 的执行模型 - 线程层级、内存层级、硬件三层严格同构,程序员亲手管理内存 3. 主机软件:驱动、工具链与库 - Runtime 包着 Driver,闭源库拿来即用,CUTLASS 一系负责构造自己的 kernel 4. 性能分析:完整诊断链 - 定瓶颈 → roofline 定性 → 利用率定位 → warp 机制 → 访存模式 → 资源约束 这三句总结很到位 GPU 的本质是“单周期切换海量简单线程来隐藏延迟”;编程的本质是“沿线程-内存-硬件的同构层级,把数据在正确的层级间搬运,把算术强度做到岭点以上”;性能工程的本质是“沿诊断链逐层定位,用 Little 定律算够并发,不为中间指标(如占用率)本身而优化。
显示更多
机器人领域正处在 LLM 的 “GPT-2 时刻”:预训练(VLA、世界-动作模型)已经规模化,赋予了模型广而不稳的能力;行业现在缺的是一套标准化、可复用的后训练方法,把“能做”变成“每次都可靠地做”。 语言模型走过的路径:监督指令微调 → RLHF → 可验证奖励的 RL(RLVR),最终收敛成一套社区共享的“即插即用”流水线:强预训练底座 + 明确的环境/奖励定义 + 锚定参考模型的 RL + 对 reward hacking 的监控。 @perryadong 和 @chelseabfinn 两位作者认为机器人需要等价方案,且可靠性要求更苛刻,因为“机器人的一次坏动作不会等人来审核,它直接就发生了”。 这套方案需要两样东西: · 算法:对十亿参数级模型稳定、且能从极少量真实经验中学习; · 协议:如何定义成功、如何复位场景、人如何介入反馈,这些目前在机器人学中都还是手工活。 为什么机器人 RL 与 LLM RL 是两回事? · 样本成本:围棋和 LLM 的动作生成廉价、可并行、易验证;机器人经验昂贵,而且“对真实物体的仿真可能比任务本身更难”。这迫使方法必须重用历史(off-policy)数据。 · 时间形状:LLM 一次 RL 回合对应一条完整回复;机器人是几百到上千步低层控制的链式决策(如 20ms 一拍、抓一个杯子约 500 次决策),奖励只在链条末端出现,信用分配极难。 · 随机性:物体滑落、传感器噪声、外部扰动让环境非确定,进一步污染信用分配。 三者共同把机器人推向基于价值(value-based)的 RL,而这恰恰是在十亿参数规模上最缺乏验证的方法族。这就是全文要解决的核心矛盾。 为什么现有方法都不行:一张“排除法地图”? 1. Q 梯度反传去噪过程 - Diffusion Q-Learning 系 信号要穿过长长的去噪链,贵且不稳;蒸馏到 1–2 步牺牲表达力 2. 采样后选择 - EMaQ、SfBC、IDQL 稳定,但策略本身从不学习,上限被底座模型的提议能力封死 3. 用动作梯度引导去噪步 - Psenka 2023、Fang 2024 需精细正则化,易不稳定 4. 在输入噪声空间上引导 - Wagenmaker et al. 2025 低风险,但只能重组冻结模型已知的行为,技能天花板由预训练决定 更深一层:经典 value-based RL(DDPG/TD3/SAC)假设高斯单峰策略,而前沿模型用扩散/流式生成来表现多模态行为(比如抓杯子可以抓柄也可以抓杯身);且价值方法“靠预测自己的未来预测来学习,再把这些预测当真值使用”,自举误差在十亿参数规模上被放大成不稳定。 EXPO-FT:作者给出的候选答案 机制设计相当精巧,核心是一个“大小模型分工 + 吸收回写”的三段式: 1. 编辑策略(edit policy):一个轻量级小模型,对底座模型输出的候选动作做有界的小幅修正,把动作从低价值区域推向所在模态的价值高峰。RL 的不稳定性被限制在这个小模型里,不会让大模型产生危险动作。 2. 执行时选择:机器人从底座模型采样若干候选动作,逐一编辑,再由价值函数挑出最优的那个执行。 3. 吸收(absorption):被选中且成功的动作回灌给预训练大模型继续训练,小编辑策略发现的改进被大模型的全部容量消化,从而真正学到新行为,而不是停留在噪声空间的重组。 人在环路中的角色是监督者:机器人出错时人工干预,干预数据进入训练(作者以 Waymo 远程安全员类比其可扩展性)。 实验结果:六个复杂操作任务(彩灯绕钩走线并插电、台球进球、花插瓶颈、翻鸡蛋、平衡球等),EXPO-FT 达到 30/30 全成功率,平均仅需 19 分钟在线交互,显著超过 SFT on π0.5、HG-DAgger、DSRL、HIL-SERL 等基线(后者的平均成功数大致在 5.5–20.5 区间)。 开放的协议问题 标题里 "Universal" 一词的真正所指。作者列出了配方化之前必须社区收敛的问题:奖励如何指定(机器人没有 RLVR 等价物,学习型成功分类器/奖励模型是有希望的方向)、复位由谁做(学习型复位策略、可逆任务设计)、人介入多少何时如何用、超参数默认值(学习率、UTD 比、停止准则、时域、控制频率)、初始化数据如何加权。他们已发布 EXPO-FT 的调参参考,作为朝这个方向迈出的一步。
显示更多
0
10
15
2
转发到社区