注册并分享邀请链接,可获得视频播放与邀请奖励。

与「基础爵士」相关的搜索结果

基础爵士 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 基础爵士 的内容
穿无绑带高跟鞋性感地跳了💓RETRO FUTURE 🧠:bala编舞 #基础爵士## #heels## #辣妹# #性感# #kpop#
0
13
44
1
转发到社区
我终于找到 AI 真正融入生活的姿势,这才是真正的 AI Native🤩!!! 我直接让 AI 接入 微信、邮箱、日历,在后台跑定时任务: 每天定时读取新信息,自动帮我做好当天的行程规划和任务梳理,手机端准时弹出提醒。 微信群里各种通知、各种可能遗漏的客户,还有一堆邮件…… 每天被这些事情浪费很多时间,还可能遗漏。 这几天我把整个任务丢给了 Today AI,真的是爽翻了! 大概实现是这样的: 1、我用 Skills 解密本地微信数据,让它读取到微信最新信息,同时将工作邮箱和日历授权给它,它在后台跑定时任务,每天定时抓取最新上下文,自动做好统筹和规划,手机端直接推送执行建议。 2、并且设置了定时任务,每天早晨 8 点,Today 自动结合昨天的微信沟通、新邮件和今日日程,生成报告,以及待办的任务,并在手机上提醒我。 3、定期扫描邮箱账单,定期自动检查收据,帮我翻出了在吃灰的会员,并且差旅发票和报销凭证随手发过去,自动按项目归类核对金额,省下大把时间。 4、而且,健康饮食和健身规划也都可以交给它,做好定时任务和长期规划,接着就可以开始健康生活了~ 5、除此之外,这是国内第一个真正意义上的 Personal AI,电脑端在后台跑任务,手机端实时收提醒,非常方便。 国内版基础版免费用,新用户注册送 1 亿 Token 和 1 个月 Pro。 微信解密 Skills 和产品链接放评论区:
显示更多
早晨朋友在群里说他的同学胆管癌去世了,他是小一辈,四十左右。饮食带来的消化系统疾病,生活习惯形成的基础病,仍旧是死亡第一大因。
[开源学习资源] AI Engineering from Scratch 59.8K ⭐️ 作者 @ghumare64 课程共 20 个阶段,以 Python 为主要编程语言,主张在导入任何框架之前,先用纯数学把每个算法手写一遍。 课程地址: 开源地址: 它和常见教程的本质区别 ? 大多数 AI 教程是“API 驱动”的:装个库、调个接口、跑个 demo。这个项目反其道而行,每节课遵循固定的六段结构: Motto → Problem → Concept → Build It → Use It → Ship It 以 Phase 10 的一节课「Tokenizers: BPE, WordPiece, SentencePiece」 为例,这个格式是真实落地的,而且写作质量相当高: · Problem 部分不讲废话,直接从代价切入:“你的 LLM 不读英语,它读整数。分词器决定这些整数是承载意义还是浪费意义”,然后解释为什么 tokenization 不是预处理,它是架构的一部分(影响上下文窗口利用率、API 计费、推理速度)。 · Concept 部分用“三种失败的方案和一种胜出的方案”来讲演化逻辑:词级切分(词表爆炸、[UNK] 问题)→ 字符级切分(序列过长)→ 子词切分(BPE 的折中),并配上真实语料上 BPE 逐步合并的手工演算。 每节约 3000+ 词,带 Mermaid 图、可运行代码和测试。 另外两个设计值得强调: · 每节课产出一个可复用的 artifact,一个 prompt、一个 skill、一个 agent 或一个 MCP server。学完整个课程,你手里有 523 个可展示的作品,不是 523 个跑完就扔的 notebook。 · 强调“证据留存”:保留命令、退出码、输出,作为学习发生的证明。这明显吸收了工程实践中“可验证性”的思路。 # 课程结构:从线性代数到自主智能体集群 20 个阶段构成一条完整的上升曲线,咱们它分成五个大块来看: 基础层(Phase 0–2):环境与工具链、数学基础(线性代数/概率/微积分)、经典机器学习。这是给基础不牢的读者铺的路。 深度学习与感知层(Phase 3–6):神经网络核心、计算机视觉(一路讲到 NeRF、高斯泼溅、世界模型,这已经超出一般教程的覆盖范围)、NLP、语音。 生成与决策层(Phase 7–9):Transformer 深挖、生成式 AI(GAN、扩散模型、flow matching)、强化学习。 LLM 层(Phase 10–12):这是全课程的重心之一。Phase 10 的目录我逐条看过,它不只是“从零实现 GPT”这种常规内容,还包含了相当前沿的论文级主题:DeepSeek-V3 架构走读、DualPipe 并行策略、Native Sparse Attention(NSA)、多 token 预测、Jamba 的 SSM-Transformer 混合架构、 speculative decoding 等。Phase 11 转向应用侧(RAG、LoRA、MCP、可观测性),Phase 12 覆盖多模态(从 CLIP 到 computer-use agent)。 智能体层(Phase 13–16):工具与协议(MCP、A2A、Agent Skills)、54 节课的 agent 工程、自主系统与安全、多智能体集群。这一层的分量很能说明项目的判断:它认为 AI 工程的重心正在从“训模型”转向“构建可靠协作的智能体”。 收尾(Phase 17–19):生产基础设施、伦理与对齐、毕业设计。 # 生态与周边:不只是一个课程仓库 网站:带浏览器本地存储的学习进度追踪、术语表、课程目录和路线图。 六卷本书籍:课程内容由 CI(pandoc)自动构建成 EPUB/PDF,附在 GitHub Releases 上,课程即书,且随仓库持续更新。 Agent 导师模式:运行 npx skills add rohitg00/ai-engineering-from-scratch,可以把整个课程装进 Claude Code、Codex 等编码智能体,变成一个带分级测验(placement quiz)和个性化路径的交互式导师,学习进度写在 LEARNING.md 里。这是“用你正在学的工具来学”的巧妙闭环。 认证备考:5 条备考路径、67 节课、505 道练习题,覆盖 Anthropic 的 Claude 认证和 Agentic AI Foundation 的 MCPA。项目明确声明与这些考试机构无关联,只是独立的备考材料。 12 种语言的翻译(含中文),以及四条核心学习路径(构建与部署 AI 应用、软件工程基础、Agent 辅助工程、产品判断与交付)供不同目标的人选路。
显示更多
0
11
75
16
转发到社区
强烈推荐大家去看纪录片《巴菲特的一天》。 片子没有炫目的豪宅,也没有私人飞机的展示,更没有空洞的成功学鸡汤。 镜头里只是一位九十多岁老人普通的日常,一份汉堡,一杯可乐,却撑起了千亿商业帝国。 孔乙看完这部纪录片,提炼出很多值得思考的底层财富逻辑。 看完这部片子,很多人会长时间陷入沉思。 我们会猛然醒悟,能够改写命运的,从来不是一瞬间的爆发,而是日复一日的选择。 他定居奥马哈,几十年前购入的房子一直住到现在。 房屋只做过维修,没有扩建,没有搬家,也不会刻意去挤进更高圈层。 身为世界级富豪,他不会拿财富去堆砌用来炫耀的居住条件。 真正的富足,是学会克制欲望,而不是不停囤积物质。 不少人刚赚到钱,第一件事就是置换房产。 追求更大的客厅、更高档的小区,匹配身份的居住环境。 但换的不只是居住空间,而是拉高了自己的消费基准线。 身边邻居的座驾拉高你的审美,朋友之间的聚会推高你的开销,所处圈层潜移默化放大你的欲望。 圈层一旦升级,支出就会跟着加速上涨。 你以为自己在向上成长,实则正在被周围的环境裹挟。 巴菲特却守住了自己的生活底线,也守住了资产的护城河。 财富积累的关键,不在于赚钱速度有多快,而在于减少不必要的资金流失。 他日常代步的车子十分普通,开了很多年,就算更换新车,也只是满足基础出行。 以他的财力,任何顶级豪车都可以轻松入手,但他不会把钱花在满足虚荣心的消费上。 在他的认知里,无法产生回报的支出,不值得追捧。 顶尖高手,在非必要消费上极度克制。 他们对浪费零容忍,却愿意在投资上面大胆投入。 这就是普通人与高手的差距,普通人用钱证明自己,高手用钱布局长远未来。 伯克希尔·哈撒韦,本质上是一家收购优质企业的公司。 大多数人靠售卖产品赚取利润,而他靠收购好公司来创造财富。 道理简单,落地却极难复制。 大部分人都想做卖方,而顶级高手选择做买方。 他几十年保持同一个习惯,去麦当劳买汉堡当作早餐,搭配可乐。 这不是刻意作秀,只是理性的选择,低成本,足够满足需求。 他不会为了外人眼中的身份,刻意包装自己的生活。 真正的自信,不需要依靠商品价格来证明自身价值。 很多人默认成功就要看起来光鲜昂贵。 但世间最昂贵的资源,其实是时间。 纪录片里最震撼的片段,是他坚持阅读。 每天花五六个小时读书,这位时时刻刻都在创造财富的人,愿意把大量时间交给书本。 他说,知识是复利最强的引擎。 你的时间投入在哪里,复利效应就会在哪里生根。 别人拿时间去博取流量,他拿时间沉淀认知。 十年之后,两者之间的差距会彻底拉开。 再看他的工作状态,九十多岁依旧坚持每天到办公室。 不是缺钱,而是发自内心的热爱。 他那句经典的话,我每天都是跳着踢踏舞去上班。 听着轻松,背后的分量很重,能支撑你几十年保持热情的事情,才称得上事业。 很多人只羡慕最终的财富结果,忽略漫长的过程。 拉开人与人差距的,从来不是天赋,而是长期持续的投入。 你能不能在无人关注的时候反复打磨基础能力? 能不能在没有回报的阶段坚持沉淀? 能不能在诱惑摆在面前的时候按下暂停? 这才是核心问题。 他的投资理念同样充满克制。 一生之中,真正改变财富格局的投资,仅仅十几次。 不靠频繁交易,而是耐心等待合适的机会。 著名的打孔机理论,如果一生只有20次投资机会,你还会随意出手吗。 主动减少选择,是提升决策质量最简单的办法。 大多数人亏损源于冲动,高手盈利来自等待。 市场价格每日波动,人的情绪也跟着起伏。 真正能赚到钱的人,不会被涨跌牵着鼻子走。 情绪决定交易频率,认知决定投资方向。 整部《巴菲特的一天》,没有激烈冲突,没有戏剧化的高光桥段。 所有细碎的日常细节,都指向四个字:简单、克制、专注、重复。 这些词语看着平淡,却搭建起一套顶级的复利体系。 外人看到的是运气,内行看到的是一套稳定的系统。 外人看到惊人的资产规模,内行看懂背后的决策框架。 他没有刻意去过一种看上去很成功的生活,只是坚持一套长期有效的生活方式。 伟大不是短暂的高光时刻,而是长期少犯错。 财富不是一夜暴涨,而是稳步持续积累。 强者比拼的不是速度,而是方向。 我们要学习的,不是他赚到多少钱,而是几十年里如何规避愚蠢的决策。 不盲目换房,避开环境带来的消费绑架。 不追捧豪车,不向虚荣妥协。 减少投资出手次数,提高每一笔决策的质量。 坚持阅读,放大认知杠杆。 保持热爱工作,拉长自身成长周期。 看完这部纪录片,你会读懂一个真相。 决定财富层级的,不是收入的最高点,而是稳定的行为底线。 一个人每天如何安排作息,如何花钱,如何分配时间,就是未来资产曲线的初稿。 你当下的每一天,都在书写十年后的自己。 真正的长期主义,不是一句口号。 是克制欲望,过滤噪音,保持稳定输出。 当所有人追逐风口,保持冷静。 当所有人升级消费,稳住自身开支结构。 当所有人频繁交易,减少出手。 当所有人焦虑迷茫,持续积累自身能力。 一个人未来能抵达的高度,不在于抓住多少机会,而在于拒绝多少诱惑。 这,就是巴菲特的一天。 希望本次分享对你有帮助,我是孔乙,复旦经济学博士,关注我,每天低频高质拆解宏观经济与投资技巧。
显示更多
0
11
496
179
转发到社区
超级个体需要什么补剂? (深度研究版本) 我的组合是: 抗衰老+高精力+提升睡眠品质+练薄肌有力气 基础底盘: 高剂量综合维生素 鱼油Omega-3 D3 + K2 神经 & 睡眠: 甘氨酸镁 抗衰老抗氧化: GlyNAC(NAC+Glycine)+麦角硫因 线粒体 & 能量: 辅酶Q10 + PQQ 大脑 & 体能: 肌酸 5g 核心逻辑:补基础 → 抗氧化 → 修复线粒体 → 提升长期精力与性能。
显示更多
0
7
49
10
转发到社区
普通人吃肌酸补剂非常有用。肌酸是循证医学证据最完整、性价比极高的基础补剂,并非健身狂人专属: 运动增益:直接扩充细胞内 ATP“应急电池”,让深蹲、俯卧撑等多做 1~2 次,加速体力恢复,对抗随年龄增长的肌肉流失。 脑力抗疲劳:大脑是耗能大户,补充肌酸能缓解熬夜、高压下的认知迟钝与记忆衰退;对少吃红肉的人群提升尤为明显。 吃法:选最便宜纯粹的一水肌酸,每日固定 3~5 克温水送服即可,无需冲击期;初期微增的体重是细胞储水,并非长胖。
显示更多
0
4
131
10
转发到社区
终于有人把这事做了!不用碰 Python,零依赖 JS/TS 直接拿 A股/港股/美股/基金/期货/期权全市场行情 stock-sdk,1.9K stars,内置 92 个 MCP 工具直接喂给 AI。 以前前端想做行情看板,行情工具基本全是 Python 生态,要么自己起后端,要么忍受财经接口 GBK/并发/批量各种坑。 stock-sdk 不一样,v2 架构大改,命名空间 API + 统一符号模型,零依赖,浏览器和 Node 18+ 双端直接跑。 核心能力: 1️⃣ 一套 API 覆盖 A 股、港股、美股、公募基金、期货、期权,实时行情、K 线、分钟线都能直接调 2️⃣ 资金流、龙虎榜、融资融券、大宗交易、涨跌停池、盘口异动、板块资金这些 A 股常用数据也做进去了 3️⃣ 自带 MACD、RSI、KDJ、BOLL、ATR、SAR 等技术指标,还能直接识别指标信号 4️⃣ 内置 Screener + 本地回测,不只是拿数据,筛股和策略验证也能直接做 5️⃣ 筹码分布也已经支持,A 股 / 港股 / 美股都能本地计算获利比例、平均成本和筹码区间 6️⃣ 最关键的是 MCP 已经原生做好了,Claude、Codex、Cursor 可以直接调用这些金融工具,不用你再包一层接口 我觉得它现在最有意思的一点,是已经从“股票数据包”慢慢变成了 Agent 的金融基础设施。 上面 AI 负责研究,下面 stock-sdk 负责行情、指标、选股和回测。 做股票 Agent、AI 投研,或者想给自己的量化系统补一套统一数据层,这个很值得留着。
显示更多
NVIDIA 发布 Skill2Env:用“集体技能”强化智能体 NVIDIA 研究者们把社区公开的 Agent Skills 编译成可执行 RL 训练环境的数据流水线:3.4k 个 Skills 变成 8k 个带程序化测试和行为量规的终端任务;仅 300 步 RL 训练就让 Qwen3.8-27B 在 Terminal-Bench 2.1 上提升 4.7 个百分点,且模型行为显著向源 Skills 的方法论对齐。 开源项目: 核心洞察:公开 Agent Skills 是一个被忽视的监督来源 Agent Skills 是“教智能体做某件事”的文件夹:一个 SKILL.md 加上可选的脚本、参考资料和资产。论文指出,把公开 Skill 语料当作数据来读,它同时提供三样东西: · 任务分布的采样:人们真正想让智能体处理的任务分布(有人愿意花时间写下工作流,说明这活儿值得自动化); · 真实世界的锚点:指向真实的仓库、数据集、工具和工件; · 结果测试表达不了的质量标准:领域专长、默认参数、常见坑、“好结果长什么样”。 # 数据流水线:四阶段编译,验证靠构造 1. Plan(分解):容器化的 Codex 规划器读取完整 Skill 包、联网调研相关公共资产,把 Skill 拆解成若干可验证的 workflow,每个附带元计划(场景、初始世界、预埋缺陷、难点来源、解法草案、验证策略)、资产建议和“任务轴池”(任务原型 × 验证器模式 × 人物画像)。 2. Diversify(多样化):宿主从轴池采样一组组合,加上复杂度、指令语气、请求者专业水平。关键设计是轴池以 workflow 为条件:研究型 workflow 配“证据可追溯”验证和研究者画像,而不是从全轴乘积空间乱抽,这让多样化保持 sensible。 3. Create(构造):全新创建者 Codex agent 在 Docker 内工作,尽可能用真实素材(钉在特定 commit 的开源仓库、真实版本化文档、官方 API 规范);需要联网服务的场景改造成本地替身(stub 服务器、录制回放 fixture、PATH 上的假 CLI、种子数据库),求解时绝不依赖网络。创建顺序被严格固定:先建世界 → 写指令 → 写测试 → 写量规 → 最后才写参考解,测试先于解法冻结,保证解法必须迁就评分契约而非反过来。 4. Verify(验证):宿主端无模型参与的接收门:静态检查(布局、符号链接、Dockerfile 安全、基础镜像按内容摘要钉死)+ 两个容器内试跑:Oracle(参考解)必须全指标满分,NOP(什么都不做的 agent)必须全指标零分。任一失败即拒绝。 值得注意的一个反直觉选择:不做 teacher 模型预验证(不像部分工作用强模型试解、解不出就丢弃任务)。理由有二:这会把任务难度上限压到验证器能力,且成本翻倍;而 group-based RL 的在线动态过滤(rollout 无优势的 prompt 自动不产生梯度)天然淘汰过难/过易任务。 # 数据画像:广、贵、且忠实于源 规模与成本:7,971 个任务,用 GPT-5.6 Sol(xhigh 推理档)生成,API 花费超 9 万美元。(脚注:出于法律原因,公开发布的数据集改用 Kimi-K3-max 在同一流水线下生成。) 领域分布:13 个领域中,软件工程仅占 22.5%,AI/ML 10.5%,商业/金融/法律/HR 10.5%,营销 9.3%……论文对比了 TMax-15K、Terminal-Bench、DeepSWE 等,Skill2Env 是唯一全覆盖 13 域、且非技术知识工作占大头的语料。 忠实度探针(很聪明的设计):用任务指令+量规作查询、对 3.4k 个 SKILL.md 做 TF-IDF 检索,73.2% 的任务 top-1 命中真实源 Skill,94.6% 进 top-10(随机 0.03%)。单用量规也有 68.5% top-1,证明量规携带的是 Skill 专属方法论而非泛泛建议。 SFT 数据:用 GLM-5.3 对每个任务 rollout 两次,得到 15,968 条轨迹,平均奖励 0.74,中位轨迹 19 次模型调用 + 23 次工具调用。 S2EBench:考虑到公开基准饱和,从 SkillHub 另外生成、逐条人工审核(指令无歧义、忠实于源 Skill、测试公允)后的 79 任务私有 held-out 基准。 # RL 实验:基础设施 + 极简配方 基础设施(论文明确说“现代 agentic RL 首先是基础设施挑战”):Molt(PyTorch 原生全异步训练,Ray + vLLM + FSDP2)+ Polar(agent rollout 层:rootless Apptainer 沙箱、代理回传 token ID 和采样时 log-prob、prefix merging 把 harness 的多次补全缝合成训练轨迹)。 配方(刻意走“简单路线”):GRPO 组归一优势 + DPPO 的 binary-KL 信任域掩码(δ=0.05,超出阈值的 token 直接丢弃,无需参考模型,还能防训练-推理失配);G=8 rollouts/组,批 64,lr 1e-6 恒定,无 KL 惩罚、无熵奖励、无 SFT 热启动,每任务 65k 上下文。 量规校准奖励:开量规时,额外由 GPT-6 Astra 做 LLM-as-Judge(带“宪法”:惩罚无脑循环、reward hacking、答非所问;hacking 实证 = -5 分),总奖励 r = r_V + λs/5(λ=0.2),即 judge 最多把程序化奖励拉动 ±0.2。量规是校准可执行结果奖励,而非取代它,这是与“Rubrics as Rewards”一系的定位差异。 # 四项发现(论文最有信息量的部分) 发现 1:小规模 RL 即有跨域迁移。 仅 300 步、只用 2,400 任务子集训一个 epoch:S2EBench pass@1 +4.3(均分 +18.5),Terminal-Bench 2.1 +4.7(49.4→54.1)。训练集与 TB 无重叠(13-gram Jaccard < 0.8),且训练集从未针对 TB 调过,论文将其解读为规划、工具使用、收尾能力的通用提升而非任务族记忆。这让 27B 本地模型显著缩小了与云端前沿模型的差距。 发现 2:量规校准 RL 在基准上落后于纯结果 RL,一个诚实的负结果。 量规版在 TB 2.1 只有 50.1(纯结果版 54.1);训练中量规版的程序化奖励长期停在 0.5–0.6,judge 分项从头到尾无上升趋势,两个奖励在训练分布上互相拉扯。论文不把它当作对量规奖励的终审判决(两者优化不同目标,而基准只考结果那一半),并给出两个疑因:λ=0.2 的加性形式让失败任务仍能拿正奖励、judge 看不到文件系统等设定均未调优;以及更本质的,Skill 写下的方法论可能本来就不是最大化基准通过率的分布。 发现 3:行为确实向 Skill 对齐,量规的价值所在。 200 个任务的成对偏好测试(judge 拿源 SKILL.md 当标准,比较匿名化的 base 与 RL 轨迹):纯结果 RL 已被偏好 54.5% vs 33.5%;量规版被偏好 73.0% vs 24.0%。这说明量规奖励买到的东西在结果基准上看不见,但对“怎么做事”影响实质,对网页开发、报告综合、开放研究这类难验证任务尤其重要。 发现 4:GLM-5.3 蒸馏 SFT 反而伤害 Qwen。 在 GLM-5.3 轨迹上做 SFT:27B 上 TB 2.1 掉到 45.8;4B 上直接崩塌(TB 18.7→3.4,出现思维/工具调用死循环)。归因:教师的 interleaved-thinking + 工具调用风格与学生自身 post-training 不兼容,模仿覆盖了学生依赖的行为模式却带不来教师的能力。与 TMax 报告的“SFT 混合数据劣化已后训练的 Qwen”互相印证。因此论文所有 RL 结果都从未修改的原始 checkpoint 出发。
显示更多
阿里云开源「企业级 Agent 白皮书」 2026 年最新发布,是 2025 年 9 月「AI 原生应用架构白皮书」的升级续作。全书按 架构 → 构建 → 运行 → 治理 → 调优 的全生命周期组织,共 7 篇 30 章,由阿里云数十位一线工程师分工撰写,并纳入吉利、塔斯汀、MiniMax、哔哩哔哩、信永中和等外部企业案例。 它的写作动机很明确:过去一年市场重心已经从 “如何快速搭出一个 Agent” 转移到三个新挑战,工程化(从概率智能到可靠生产力)、规模化(从单点试验到智能基础设施)、组织化(从 Agent 孤岛到进入核心业务流程)。现有的框架文档和教程基本不回答这些问题,这本白皮书填补的正是这个空白。 开源地址 # 各篇核心内容 架构篇(1–2 章) 建立认知框架。给出 Agentic Application 的六个判定特征(以任务结果为中心、运行时决定部分执行路径、能作用于环境、维持跨请求状态、受确定性机制约束、可观测可评估)和成熟度四级模型(L1 辅助生成 → L2 受控自动化 → L3 Agentic Execution → L4 规模运营)。两个重要的解耦判断:用哪种形态取决于任务结构,处于哪级成熟度取决于治理完备程度;单 Agent / Long-Horizon / 多 Agent 是沿时间跨度和协作结构两个正交维度的扩展,不存在“必须升级到多 Agent”的路径。贯穿的原则是“最低充分架构”,为任务选择成本与风险可接受的最低复杂度。 构建篇(3–6 章) 是方法浓度最高的部分,按“范式—任务—信息—行动”还原构建过程: · 任务:Agent Loop 五阶段(Prepare→Model→Act→Observe→Verify)+ 十态任务状态机,要害是“消息历史不应是任务状态的唯一来源”;完成判定的核心原则是“模型只能申请完成,Harness 依据环境证据提交完成”,验证分五级并与风险匹配。 · 信息:Context 是动态“编译”而非静态字符串。本章的独创设计是 Context Manifest,每次调用记录上下文每个片段的来源、作用域、版本、信任级别、选中理由和内容哈希,使“模型看见了什么”变得可解释、可回放、可审计。信息被五分为 Context/State/Memory/Knowledge/Skill,其中 Memory(个人经验)与 Knowledge(组织内容)必须分列,因为治理责任不同,“放进同一个向量库会同时失去两类治理能力”。 · 行动:统一 Action Plane(意图→Schema 校验→身份绑定→策略决策→执行→观测),关键三分:“模型看见工具 ≠ Harness 注册了工具 ≠ 获得执行授权”。协议定位清晰:Function Calling 是模型-Harness 意图接口,MCP 是 Harness-能力提供方连接协议,A2A 面向拥有独立任务循环的远程 Agent,“协议选择由能力是否拥有独立任务循环决定,而非新旧或流行度”。 运行篇(7–12 章) 处理规模化后的工程问题,大量内容达到了分布式系统的专业深度:沙箱后端选型判据(容器/gVisor/MicroVM 按代码可信度与租户边界取舍);状态外置后 Event Log / Checkpoint / 工作区快照三者不可互相替代,且“Durable Execution ≠ 外部动作恰好执行一次”;AI 网关对 LLM/MCP/Agent 三类流量按不同粒度治理,其中“严格预算需要原子预留而非阈值检查”的数学化分析(余额 100、两笔 80 的并发请求都会通过)是真实的并发工程细节;多 Agent 编排强调“最小充分共享”,共享的是上下文来源而非同一个 Context 窗口。 治理篇(13–16 章) 让自主运行的系统变得可信。可观测性的判据是“请求成功 ≠ 任务成功”;安全章同时把 Agent 当被攻击对象和行为主体来防护(身份是全章最扎实的部分:数字工牌、Token Exchange 权限收敛、On-Behalf-Of 且 Agent 权限 ≤ 用户权限);资产管理把 Prompt/Skill/MCP/Agent 当作运行时依赖做注册与版本治理。第 16 章 Agent Simulation 是全书原创性最强的一章:Agent 行为之所以不可验证,是缺制度前提(角色无外部标准、失败无自然代价、身份不连续),模拟是当下唯一可做的事,本质是“用可靠 Harness 约束不可靠内核”。它甚至给出诚实的统计学提醒:n 次零违规的 95% 置信上界约为 3/n 而非零。 调优篇(17–24 章) 的组织原则是“归因决定方法”:先排除环境故障、再修 Harness、最后才动模型,“把本应由上下文或工具协议解决的问题当成模型不行,是代价最高的一类误判”。主线是数据飞轮:Trace→Trajectory→黄金数据集(输入/轨迹/结果/判据四要素)→Badcase 闭环→受控自进化(模型生成的改进一律是候选变更,须回流构建、过门禁、可回滚)。模型调优章对 SFT/Agentic RL/蒸馏的适用边界、奖励投机的三套机制分离(训练奖励、独立评测、系统硬约束)论述相当严谨,广引 DeepSeek-R1、Tulu 3、FrugalGPT 等外部工作。 总结篇(第 30 章) 是全书思想密度最高的总结。当企业同时运行多 Agent、多框架、多租户时,同样的工程要求在每个应用里被重复且不一致地实现,这本质上是缺一个共享的系统层。Agentic OS 被给出“窄定义 + 三条否定”:为 Agent 任务提供公共运行对象、能力接入、可强制边界与统一证据的系统层,它不持有任务语义、不是又一个框架、不必然改内核。能力下沉有三条判据(复用性 + 强制性或可验证性),九类管理对象(其中 Budget Lease 预算租约最易被忽略),并提出“自治上限由可撤销范围与可证明范围决定,而非模型能力”。 调研报告 的 1906 份问卷给出一个关键发现:已开发或开发中 Agent 的企业占 46%,但真正上生产的仅 18%;有评估体系的企业任务成功率是无评估者的约两倍,卡点不是模型能力,是 Harness 层的工程配套。这与全书立意互为印证。
显示更多
0
11
59
14
转发到社区