注册并分享邀请链接,可获得视频播放与邀请奖励。

与「GAIA2」相关的搜索结果

GAIA2 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 GAIA2 的内容
ローランドの方に噂のマシンを見せてもらいました!ウェーブテーブルをLFOでモジュレーションしてるだけですがエグっ😎♫(Nonフィルター、Nonエフェクト) #GAIA2#
显示更多
0
23
1.4K
277
转发到社区
Agent = Model + Harness:生产级 AI 智能体工程六层实战手册 结合 Mitchell Hashimoto、OpenAI Codex 团队、Martin Fowler、LangChain、Cursor 等公开工程资料编撰。 # Agent = Model + Harness 模型只提供推理能力,决定 Agent 能否从演示走向生产环境的是围绕模型的工程基础设施——Harness。 报告的核心论据是:只改 Harness、不换模型,收益可超过模型升级: · 同一 Claude Sonnet 4.5 在 GAIA 基准上从 30.91% 升至 74.55%(+43.64 分),差异完全来自 Harness; · LangChain 不改模型,仅靠 Harness 优化将 Terminal Bench 排名从第 30 提升至第 5; · OpenAI 团队 5 个月、约 1500 个自动化 PR 产出 100 万行生产代码,零人工手写——人负责设计环境,Agent 负责写代码("Humans steer. Agents build.")。 这也解释了一个行业现象:约 95% 的企业 AI Agent 止步于预生产阶段——演示效果好,却因安全审查、可观测性、边界情况幻觉、治理缺失而无法上线。 # 行业定位:AI 工程的第三个时代 1. 提示词工程(2023–24):模型"说什么" 2. 上下文工程(2025):模型"看到什么"(RAG/MCP/记忆) 3. Harness 工程(2026):模型"能做什么" # 六层架构(报告主体) 1. Guides 引导层(前馈控制):AGENTS.md / CLAUDE.md 等规则文件,在执行前塑造行为。要点:规则必须可执行、可验证、可追溯至真实失败案例;需定期修剪,否则 200 行无日期规则就是技术债。OpenAI 内部将其视为最高事实源——文件与会话冲突时,文件优先。 2. Sensors 传感层(反馈控制):执行后验证输出。优先使用确定性、零成本的计算型传感器(linter、测试、schema 校验);LLM-as-judge 等推理型传感器慢、贵、不确定,只用于无法用规则表达的语义判断,且应作参考信号而非硬门禁。 3. Agentic Loop 执行循环:计划→执行→验证→修复→前进或升级,必须有界——默认每步最多重试 3 次、30 分钟、10 万 token、5 美元、50 次工具调用。预算耗尽时返回最佳半成品并说明原因,不允许用流利的最终答案掩盖部分失败。正确升级的 Agent 比自信地给出错误答案的 Agent 更有价值。 4. Memory 记忆层:模型每次会话都从零开始,Harness 负责状态连续性。最简方案是文件系统(plan.md、decisions.jsonl、checkpoint),对多数场景比向量数据库更便宜可靠。检验标准:中途关闭会话重开,Agent 应能断点续作。 5. Permissions 权限层:模型无法自我约束,Harness 是唯一安全边界。按范围、速率、可逆性、可见性四个维度设定能力预算;不可逆操作(部署、删除、外发消息)必须人工批准;必须隔离可信指令与不可信数据以防提示注入。 6. Observability 可观测层:结构化日志 + 成本归因 + 熔断告警(trip wire)。真正的度量不是 token 数,而是无需人工干预即完成且证据合格的任务数;成本应按"每个验证通过的结果"而非按天计算。 # 方法论精髓:棘轮原则(Ratchet) Hashimoto 的原始定义:"每当 Agent 犯错,就工程化一个方案,让它永远不再犯这个错。" 六步循环:复现失败→归类根因→选择最强修复层→编码修复→验证防复发→监控回归。 修复强度呈阶梯上升:对话补丁 < 提示词 < 引导规则 < 传感器 < 环境约束——提示词只修一次对话,环境约束让错误在结构上不可能发生。 Cursor 的 Lauren Tan 补充了实操信号:同一条评审意见出现三次,就应固化为结构性约束。Harness 成熟的标志是规则增速下降(从每天 5 条降到每周 1 条)。 # 落地路径与边界 七天最小可用路径:Day 1–2 建引导文件 → Day 3–4 接入测试套件与有界循环 → Day 5–6 加检查点与权限 → Day 7 加日志与熔断。之后按"一次只改一层、可度量、可回滚"扩张,完成率 ≥80% 等六道闸门全过才允许扩大规模。 何时不需要 Harness:一次性问答、创意脑暴、低风险个人任务——"如果以上都不适用,对话本身就是 Harness"。 多智能体扩展:需要类型化交接("done, looks good" 不能推进生产流程)、共享状态模型而非共享上下文(避免上下文污染)、以及生产者不可覆盖的独立验证者。
显示更多
0
10
65
14
转发到社区
people lacking empathy for non-human animals actually pisses me off so bad. i have never felt closer to human beings than other animals. we are all from mother gaia. we all have the innate right to life and freedom. humans are no better than non-human animals, you're just arrogant.
显示更多
Most kisses in 30 seconds by a pair 😘 195 by Renato Bayma Gaia and Naiara Roberta Ribeiro de Marins 🇧🇷
0
958
3.7K
322
转发到社区
小米最近发表的这篇论文很适合所有在为 Agent 性能头疼、但不想每次都去换模型的工程师看,harness 工程值得你认真投入。 核心观点:LLM Agent 的性能,几乎有一半的决定权在那层「运行外壳」里,例如提示词、工具描述、记忆接入方式、控制流设计,而不只是底层模型的能力。HarnessX 把这层外壳变成了一个可以像乐高一样组合、并且能自动进化的系统。 具体来说:HarnessX 用「替换代数」定义运行外壳的基本构件,让 harness 的各个组件可以被系统化地替换和组合。然后用一个叫 AEGIS 的多 Agent 进化引擎,自动分析 Agent 运行轨迹,找出哪个组件拖了后腿,提出改进,在不碰底层模型的前提下迭代优化整个外壳系统。在 ALFWorld、GAIA、WebShop、tau³-Bench、SWE-bench Verified 五个基准测试上,平均提升 14.5%,最高单项提升 44.0%。 我觉得「不改模型、只改外壳,就能在五项 benchmark 平均提升 14.5%」这个数字本身最值得反复想。很多团队在用 Agent 时,遇到性能问题的第一反应是「模型不够强」;但 HarnessX 说的是:你可能还没有用完现有模型在正确外壳设计下的潜力。更重要的是:外壳是工程问题,是可以迭代、可以模块化、可以系统优化的,AEGIS 把这件事变成了一个可以跑起来的自动化流程。 以前我们关注 Agent 用什么模型,以后可能更要关注 Agent 的运行外壳设计得有多好,这一层可能才是真正决定 Agent 系统上限的地方。
显示更多
0
26
180
39
转发到社区
🔥 BrownDust2 X HANMI MICRONICS Limited Edition PC Cases! ✨ Lineup: Sacred Justia & Shadow Bunny Eleaneer 🗄️ Case Only: On sale starting 01/05/26 (Mon) 📋 Check out the full details here! 🏃💨 #BrownDust2# #LimitedEdition#
显示更多
0
7
2K
101
转发到社区
🎤イベントのお知らせ ☕️ / 11月29日(土) 「Mahiro music cafe ~冬のはじまりソング〜」 開店いたします 📣🎤♡ \ 詳細をご確認の上お申込みをお願い致します🎟️ チケットお申込み・詳細はこちら 🔗 (staff)
显示更多
0
0
83
11
转发到社区
软件开发里有一种叫 TDD(Test-Driven Development)的方式,简单讲,就是先写好测试用例,然后再写程序。每写一部分代码就立刻跑对应的测试,看能不能通过。能通过说明实现符合预期,不通过就说明有 bug。TDD 的好处在于,它让整个研发过程可验证、可回归,也让开发变成一种持续的反馈循环。 AI 的发展其实也像是在做一场巨大的 TDD,只不过测试用例变成了数据集(Dataset)。每一次模型迭代,本质上就是在跑新的单测(Benchmark)。MMLU 测知识广度,GSM8K 测逻辑推理,HumanEval 测编程能力,AIME 和 MATH 则测严谨的数学推理。每个 leaderboard 都是一张 AI 世界的成绩单——DeepSeek 在数学推理上用 GSM8K 打出好成绩,Manus 则靠打榜多模态任务的数据集 GAIA 崭露头角。这些 Benchmark 像是模型进化的里程碑,每一代 AI 都得交卷。 2025 可以说是智能体(Agent)元年,模型不再只靠会算、会说来评估,而是要能动手。要让一个 Agent 真正好用,光靠写 Prompt、加检索、拼上下文是不够的,它得能使用工具,能执行 Python、Shell、SQL,能感知状态、理解任务依赖,更要能在反馈中调整自己的行为。评估 Agent 好不好用,也就不能只看单轮问答,而得看它能否完成一件真实的工作。 Anthropic 做的 SWE-bench 就是个典型例子,让 Agent 去修真实项目里的 Bug,看能否通过单测。OpenAI 的 MLE-bench 则更进一步,考察 Agent 在机器学习工程中的执行力,从读数据、清洗、编程、训练,到收集指标、分析再改进,形成一个完整的闭环。社区里还在探索更复杂的测试,比如 App-bench,看 Agent 是否能独立开发一个 Web 应用,从前端到后端再到部署上线;或者 Ops-bench,让它去处理运维任务,比如容器编排、日志分析、系统回滚。这些都在考验 Agent 的真实工程执行力。 AI 的进步,正在从“能思考”走向“能执行”。TDD 让软件工程可验证,而在 AI 世界,Dataset 和 Benchmark 是创新的发动机。Dataset 定义了模型学习的方向,Benchmark 则刻画了行业标准与竞争格局。 未来的竞争,不再是谁的模型更聪明,而是谁的智能体更能干活。真正厉害的 AI,不一定语义最深、参数最多,而是那个能自己规划、自己验证、自己改进的 Agent。换句话说,AI 的未来不只是更聪明的脑子,而是更靠谱的手和脚,能想、能做、还能自己查错修正,这才是“用得上”的智能。
显示更多
0
10
252
21
转发到社区