注册并分享邀请链接,可获得视频播放与邀请奖励。

与「数据飞轮」相关的搜索结果

数据飞轮 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 数据飞轮 的内容
阿里云开源「企业级 Agent 白皮书」 2026 年最新发布,是 2025 年 9 月「AI 原生应用架构白皮书」的升级续作。全书按 架构 → 构建 → 运行 → 治理 → 调优 的全生命周期组织,共 7 篇 30 章,由阿里云数十位一线工程师分工撰写,并纳入吉利、塔斯汀、MiniMax、哔哩哔哩、信永中和等外部企业案例。 它的写作动机很明确:过去一年市场重心已经从 “如何快速搭出一个 Agent” 转移到三个新挑战,工程化(从概率智能到可靠生产力)、规模化(从单点试验到智能基础设施)、组织化(从 Agent 孤岛到进入核心业务流程)。现有的框架文档和教程基本不回答这些问题,这本白皮书填补的正是这个空白。 开源地址 # 各篇核心内容 架构篇(1–2 章) 建立认知框架。给出 Agentic Application 的六个判定特征(以任务结果为中心、运行时决定部分执行路径、能作用于环境、维持跨请求状态、受确定性机制约束、可观测可评估)和成熟度四级模型(L1 辅助生成 → L2 受控自动化 → L3 Agentic Execution → L4 规模运营)。两个重要的解耦判断:用哪种形态取决于任务结构,处于哪级成熟度取决于治理完备程度;单 Agent / Long-Horizon / 多 Agent 是沿时间跨度和协作结构两个正交维度的扩展,不存在“必须升级到多 Agent”的路径。贯穿的原则是“最低充分架构”,为任务选择成本与风险可接受的最低复杂度。 构建篇(3–6 章) 是方法浓度最高的部分,按“范式—任务—信息—行动”还原构建过程: · 任务:Agent Loop 五阶段(Prepare→Model→Act→Observe→Verify)+ 十态任务状态机,要害是“消息历史不应是任务状态的唯一来源”;完成判定的核心原则是“模型只能申请完成,Harness 依据环境证据提交完成”,验证分五级并与风险匹配。 · 信息:Context 是动态“编译”而非静态字符串。本章的独创设计是 Context Manifest,每次调用记录上下文每个片段的来源、作用域、版本、信任级别、选中理由和内容哈希,使“模型看见了什么”变得可解释、可回放、可审计。信息被五分为 Context/State/Memory/Knowledge/Skill,其中 Memory(个人经验)与 Knowledge(组织内容)必须分列,因为治理责任不同,“放进同一个向量库会同时失去两类治理能力”。 · 行动:统一 Action Plane(意图→Schema 校验→身份绑定→策略决策→执行→观测),关键三分:“模型看见工具 ≠ Harness 注册了工具 ≠ 获得执行授权”。协议定位清晰:Function Calling 是模型-Harness 意图接口,MCP 是 Harness-能力提供方连接协议,A2A 面向拥有独立任务循环的远程 Agent,“协议选择由能力是否拥有独立任务循环决定,而非新旧或流行度”。 运行篇(7–12 章) 处理规模化后的工程问题,大量内容达到了分布式系统的专业深度:沙箱后端选型判据(容器/gVisor/MicroVM 按代码可信度与租户边界取舍);状态外置后 Event Log / Checkpoint / 工作区快照三者不可互相替代,且“Durable Execution ≠ 外部动作恰好执行一次”;AI 网关对 LLM/MCP/Agent 三类流量按不同粒度治理,其中“严格预算需要原子预留而非阈值检查”的数学化分析(余额 100、两笔 80 的并发请求都会通过)是真实的并发工程细节;多 Agent 编排强调“最小充分共享”,共享的是上下文来源而非同一个 Context 窗口。 治理篇(13–16 章) 让自主运行的系统变得可信。可观测性的判据是“请求成功 ≠ 任务成功”;安全章同时把 Agent 当被攻击对象和行为主体来防护(身份是全章最扎实的部分:数字工牌、Token Exchange 权限收敛、On-Behalf-Of 且 Agent 权限 ≤ 用户权限);资产管理把 Prompt/Skill/MCP/Agent 当作运行时依赖做注册与版本治理。第 16 章 Agent Simulation 是全书原创性最强的一章:Agent 行为之所以不可验证,是缺制度前提(角色无外部标准、失败无自然代价、身份不连续),模拟是当下唯一可做的事,本质是“用可靠 Harness 约束不可靠内核”。它甚至给出诚实的统计学提醒:n 次零违规的 95% 置信上界约为 3/n 而非零。 调优篇(17–24 章) 的组织原则是“归因决定方法”:先排除环境故障、再修 Harness、最后才动模型,“把本应由上下文或工具协议解决的问题当成模型不行,是代价最高的一类误判”。主线是数据飞轮:Trace→Trajectory→黄金数据集(输入/轨迹/结果/判据四要素)→Badcase 闭环→受控自进化(模型生成的改进一律是候选变更,须回流构建、过门禁、可回滚)。模型调优章对 SFT/Agentic RL/蒸馏的适用边界、奖励投机的三套机制分离(训练奖励、独立评测、系统硬约束)论述相当严谨,广引 DeepSeek-R1、Tulu 3、FrugalGPT 等外部工作。 总结篇(第 30 章) 是全书思想密度最高的总结。当企业同时运行多 Agent、多框架、多租户时,同样的工程要求在每个应用里被重复且不一致地实现,这本质上是缺一个共享的系统层。Agentic OS 被给出“窄定义 + 三条否定”:为 Agent 任务提供公共运行对象、能力接入、可强制边界与统一证据的系统层,它不持有任务语义、不是又一个框架、不必然改内核。能力下沉有三条判据(复用性 + 强制性或可验证性),九类管理对象(其中 Budget Lease 预算租约最易被忽略),并提出“自治上限由可撤销范围与可证明范围决定,而非模型能力”。 调研报告 的 1906 份问卷给出一个关键发现:已开发或开发中 Agent 的企业占 46%,但真正上生产的仅 18%;有评估体系的企业任务成功率是无评估者的约两倍,卡点不是模型能力,是 Harness 层的工程配套。这与全书立意互为印证。
显示更多
0
11
59
14
转发到社区
CS 329Z: Engineering AI Agents Stanford / Fall 2026 @stanfordnlp 课程定位:从"模型"到"系统"的工程学 覆盖:简单 LLM 流水线 → 复合 AI 系统 → 自主 Agent。三位讲师的背景也高度互补: @Diyi_Yang(斯坦福 NLP 教授,人机交互与社会计算方向) @michaelryan207(DSPy 核心贡献者,自动评估 AutoMetrics 作者) @jyangballin(SWE-agent / SWE-bench / SWE-smith 作者,软件工程 Agent 领域最重要的研究者之一) # 课程主线:三大工程挑战 贯穿全课的三个核心问题——分解(decomposition)、数据(data)、评估(evaluation)。11 周的内容基本围绕这三条线展开,可以分为五个模块: 模块 1:构建基元(Week 2–3) · LLM 作为构建材料:API/SDK(litellm)、结构化输出、约束生成、解码策略、test-time compute、上下文工程、模型选型与成本/延迟权衡 · RAG:embedding、向量库、分块策略、混合检索、cross-encoder 与 ColBERT 后期交互 · 工具调用:函数调用 API、MCP(Model Context Protocol)、工具设计、代码沙箱、错误处理与重试 模块 2:框架与设计模式(Week 3–5) · 框架层:DSPy(signature / module / optimizer)、LangChain/LangGraph、LlamaIndex,重点是"框架抽象了什么 vs. 你手写了什么" · 设计模式:workflow vs. agent 的分类学,五种可组合 workflow 模式,ReAct / plan-and-execute / reflection,"scaffold(脚手架)本身就是设计决策" · 记忆架构:短期/长期记忆、记忆作为工具动作、文件系统作为外化记忆、跨 Agent 记忆(MemGPT、Mem0、Generative Agents) · 多 Agent 系统:编排模式、handoff 与状态传递,以及一个很有态度的对照阅读——既读 AutoGen,也读《Why Do Multi-Agent LLM Systems Fail?》和 Neubig 的《Don't Sleep on Single-agent Systems》 模块 3:优化(Week 5) · 从提示词到微调的全景:GEPA、MIPROv2、OPRO、TextGrad(提示优化);LoRA/QLoRA、蒸馏、RLHF/DPO(权重优化);test-time scaling(推理算力) · 核心问题是决策框架:什么时候优化 prompt、什么时候优化 weights、什么时候堆推理算力 模块 4:数据与评估(Week 6–8)——最有分量的部分 · 数据:trace、demonstration、feedback 三类数据;训练数据 vs. 评估数据;数据飞轮;合成数据;从 Agent 轨迹构建数据集(SWE-smith) · 评估基础:为什么 eval 难;4 元组框架(request / environment / stopping criteria / scorer);好 benchmark 的性质;tinyBenchmarks · 评估基础设施:三类 grader、LLM-as-judge 的 prompt 设计与已知偏差、pairwise vs. pointwise、非确定性指标 pass@k vs. pass^k、harness 设计 模块 5:安全与前沿(Week 8–11) · 安全:工具访问的隐私风险、prompt injection(含间接注入)、红队、沙箱与权限模型、输出护栏、human-in-the-loop · Coding Agent:SWE-agent、Claude Code、OpenHands 的端到端架构对比 · 主动式 Agent:从 reactive 到 proactive,General User Models(GUM)、Next Action Prediction,以及"Agent 何时应主动、何时应等待"的 mixed-initiative 问题 · 开放问题:多模态/web/计算机使用 Agent、科学 Agent、长时运行架构、生产可观测性(tracing、monitoring、成本管理) # 作业设计:一手建、一手评 HW1:从零构建 Agent 系统(10%) 给定论文库,构建能检索并推理回答科学问题的 Agent。 · Part A:只用 litellm 手写 RAG + 工具调用 + ReAct 式 Agent 循环 · Part B:用 DSPy 重建关键组件,并反思框架抽象了什么 HW2:评估一个 Agent(10%) 给定一个预构建 Agent,设计完整评估套件:代码型 grader、至少一个 LLM-as-judge、用 4 元组框架构建 benchmark 任务、错误分析。
显示更多
0
23
148
30
转发到社区
高盛的这篇智谱 GLM-5.3 的报告值得一看。 大模型竞争逻辑正在发生变化👉Scaling 正从一味堆参数,转向 Post-training。 GLM-5.3 参数规模基本没变,仍约 744B,但通过更长任务环境、更长训练时间、强化学习和工具协同,代码、长任务执行和安全能力继续提升。 模型进步开始越来越依赖“真实任务里的训练”,而不是单纯做更大的模型。 这背后还有一层更重要的商业逻辑。像 ZCode 这样的 Coding 产品,不只是变现工具,也可能成为数据入口:用户完成真实的软件工程任务,产生长周期执行轨迹,再反哺下一轮 Post-training,形成“产品使用 → 数据 → 模型升级 → 更多使用”的飞轮。 所以资本市场接下来真正要看的,已经不是 GLM-5.3 比 DeepSeek、Claude 高几个 Benchmark 点,而是三个转化率: 1️⃣ 模型能力 → 用户使用量 2️⃣ 用户使用量 → 付费收入 3️⃣ 真实任务数据 → 下一代模型能力 这也是为什么模型升级和股价逻辑要分开看。技术突破只能解释为什么产品更强,估值最终还是要靠收入增速、付费率和利润率兑现。 模型能力是起点,数据飞轮是护城河,商业化效率才是估值终点。
显示更多
2月份的有聊过一个思考:从中长期而言,技术提升效率是趋势,我们需要思考最终胜出的到底会是哪些玩家?纯AI就能颠覆所有行业,还是说积极拥抱AI而且能彻底变革的行业/产业巨头更有机会?最近跟朋友也有讨论过:AI确实会“吃掉”大量通用型SaaS,但越垂直、越深入产业内部的SaaS,反而价值越大,甚至可能变得更难被取代, 1、为什么通用型SaaS很危险? 它们做的往往是水平任务(写代码、写文案、做 PPT、简单客服),这一类任务纯靠模型原始能力提升就能变好, 而AI大模型厂商拿顶级模型 + 现成连接器(G Drive、Slack、Salesforce 等)+ 简单 agentic 编排层。就能把这一类工作给替代掉, 2、为什么垂直 SaaS 的护城河更强? 行业专业数据和“部落知识”几乎拿不到,通用大模型的训练数据是公开互联网 + 部分企业许可数据,但大量真正的行业know-how是未书面化、口口相传、公司内部特有的: 1)制造业的供应链隐形约束、设备测试维护等; 2)化工行业专有的生产模式,特殊工艺流程等; 3)保险公司特有的承保哲学、理赔例外处理规 4)医院的科室间审批流程、医保政策灰色地带 这些东西不在任何公开数据集里,通用 AI 再强也学不到。除非你把真实生产流程跑起来、不断收集人类修正信号,否则模型永远只能“差不多”。 越垂直 = 越需要“系统级”而非“工具级” 通用 SaaS 往往是“叠加在现有系统上的小工具”(写邮件、生成报表、简单 agent),而垂直SaaS做的是端到端的业务执行系统(end-to-end workflow),它要跨越遗留系统、真人审批、合规审计、P&L 直接影响。还需要熟悉所处的行业,所处的企业特有的生产流程、工艺流程等。 这部分工作里,确定性软件工程 + 治理 + 数据飞轮 占比远超模型本身,AI大模型很难全部包圆。每服务一个客户、跑一次真实流程,就多积累一次“运营记忆”(哪次 redline 被客户改了、哪种例外人类会介入)。积累 100 个客户 × 1000 次交易后,你的系统在那个垂直领域的准确率和智能化程度,会把通用模型在这个垂直领域的能力大幅度甩开。 从这个角度,垂直SaaS反而是 AI 最好的“放大器”和“交付层”——AI 提供智能,垂直SaaS提供行业上下文、行业专有数据、特定经验和规范,合规、集成和最终责任。那些把 AI 当作“引擎”,把垂直行业流程、数据和责任当“车身”的公司也将会是未来的赢家这一。
显示更多
0
46
82
10
转发到社区
杰富瑞:中国开源AI模型与美国领先闭源模型差距约为3至6个月。AI价值链中的价值将流向那些拥有专有数据、深度工作流整合能力以及范式突破能力的企业。 在其投资者日活动期间,两位AI专家认为,美国仍在前沿模型能力方面保持领先,中国的优势则在于工程化落地能力、丰富的应用场景与数据、开源生态体系,以及充足且低成本的电力供应。专家估计,中国开源模型与美国领先闭源模型之间的差距仅约为3至6个月。 字节跳动、腾讯和阿里巴巴等大型互联网平台在消费者流量入口方面具有优势,而独立AI公司则在海外市场和企业垂直领域更具竞争力。 一位专家则更看好独立AI公司的创新能力,认为大型互联网企业受到内部竞争以及传统互联网运营模式的制约。 总体而言,两位专家目前均未看到明显的“赢家通吃”格局。最终的领先者将是那些能够结合顶级技术人才、强大工程执行能力、专有数据飞轮以及深度场景整合能力的公司。
显示更多
0
24
80
8
转发到社区
宝可梦GO玩家抓了十年皮卡丘,顺便给送餐机器人画了张地图 Pokémon Go 背后的公司 Niantic 本周宣布,将与送餐机器人公司 Coco Robotics 合作,用一项名为 VPS(视觉定位系统)的导航技术帮机器人送外卖。这项技术的训练数据,来自 Pokémon Go 玩家十年间用手机摄像头拍下的超过 300 亿张图像。 VPS 的原理和 GPS 不同。GPS 靠卫星信号定位,在高楼密集的城市里经常飘移不准;VPS 则是"看一眼周围的建筑和地标,就知道自己在哪",精度据称可以达到厘米级。而 Pokémon Go 恰好是理想的数据来源——玩家为了抓宝可梦,必须亲自走到指定地点,举着手机从各种角度扫描周围环境。2020 年游戏还专门加了个"实地调查"功能,鼓励玩家扫描现实中的雕像和地标来换游戏奖励。玩家不知道的是,这些扫描数据正在构建真实世界的 3D 模型。 Niantic CEO John Hanke 的说法:让皮卡丘在现实场景里逼真地跑来跑去,和让机器人在街上准确导航,本质上是同一个问题。 这件事更值得关注的是它揭示的模式:用户为了一个目的贡献的数据,多年后被悄悄用于完全不同的用途。 类似的事并不新鲜,Google 的 CAPTCHA 验证码让用户点选交通灯和自行车,长期被怀疑用来训练 AI 视觉模型;地图工具 Waze 的用户数据也被曝出曾被执法部门获取。而一个能通过照片中的地标精确定位拍摄位置的系统,对执法机构的吸引力不难想象。 Niantic 把这次合作定位为构建一张"活地图"的长期计划的一部分。送餐机器人上路后,还会持续采集新数据反哺模型,和自动驾驶公司 Waymo、特斯拉的数据飞轮逻辑如出一辙。Pokémon Go 巅峰期月活 2.3 亿,现在仍有约 5000 万活跃玩家,数据量不是问题。 相关新闻:
显示更多
19/22 原则二:构建专有的“数据飞轮” 从用户的使用中积累专有数据,这是前沿大模型无法访问的资产。 数据飞轮:用户交互 -> 修正与反馈 -> 边缘案例积累 -> 优化产品/微调模型 -> 吸引更多用户。 这是最坚实的护城河。
显示更多
Marc最近收入过300万,大家都在吹他,我想分享一下我的看法: 我其实一直不太看好 Marc的创业打法,它有它的独特性,以及成功的巧合性,因为不少朋友是独立开发创业去做出海、做产品。 在推上看到它,很可能会心动,跟着它的方向去做。 但是我想跟大家泼一个冷水,就是不建议大家去模仿他。 比如说,我置顶的这个项目,就是为了证明outbid和Marc 又开始做的拍卖这种网红项目,而特意做的一个社会实验。 我就是想自己亲自实验一下: 即使在同样的时间跟他推出同样的项目,也不会成功。 他的打法是粉丝经济。说的不好听一点,就是向独立开发的创业者抛售一个独立开发能轻易成功,发一个产品就能迅速赚钱的梦: TrustMRR 公开数据里,Marc 累计约 $300 万。真正贡献大头的是: • ShipFast($130 万):卖给独立开发者的 Next.js boilerplate • CodeFast($83 万):教人「几天学会写代码、把 idea 做成生意」 • TrustMRR($33 万):独立开发者的收入公示 + 收购市场 • DataFast($27 万):给 startup founder 的收入分析 • Ship or Die($11 万):30 天必须上线的独立开发挑战 • IndiePage($5 万):独立开发者主页 这几项加起来大约 $290 万 / $305 万,接近 95%。他 2025 年 11 月自己也说过:CodeFast + ShipFast 曾经占月收入 90%。 不知道大家发现规律没有?他这个独立开发者的所有产品都是帮 独立开发者去进行独立开发的. Marc他确实做过姿势矫正、习惯打卡、语言练习册这类非产品, 这些产品才是大多数独立开发者想突然创业去做的心血来潮的项目。 他最开始也是这样的独立开发者. 但是你猜怎么着? 即使像他那样, 做的这些产品几乎不赚钱。赚钱的,基本都围着同一群人转:想靠独立开发发财的人。 他也自己承认过:AI 已经打掉了 coding course 和 boilerplate。 现在能撑住的,是 TrustMRR / DataFast 这类「卖给 maker 的基础设施」,以及持续发收入截图带来的流量。 我对 Marc本人没有什么恶意,发这个帖子不是为了批判Marc。恰恰相反,我也其实很欣赏和钦佩Marc这样能够在独立开发这个赛道里面杀出来的人。 但是作为一个中推年纪稍微大点的人,我觉得有义务说下:最近看到太多的营销号吹捧,可能会误导刚刚后来一拍脑袋选择创业独立开发的年轻人。 所以还是想写点东西: 同时,我也想鼓励一下:如果你是在独立开发这条道路上挣扎着、迷茫着、徘徊着的人,不要被这些网红程序员天天截图的 MRR 误导了。他们本来就是靠这个截图获取流量、涨粉和飞轮增长的。 独立开发就是他的客户。没错,你就是他的客户,他就是发给你看的,让你崇拜的。 让你羡慕的,让你更加义无反顾地要加大投资去做独立开发的 。 而你的产品受众,如果不是独立开发,你就没有必要跟着他一起 building public。你吸引的都是同行。 你截图 MRR,只会让同行嫉妒,同时会有别人抄你站,你App的风险。 但是独立开发这条路还是可以走的,特别是在AI的时代,机会还是很多的。但需要埋下头来深耕你的niche,到你真正客户的地方去做宣传,而不要跟风网红程序员。他们不可复制。
显示更多
0
20
52
1
转发到社区
我是个爱交朋友的人,想要回关的蓝V评论区留言,私信有时候真的没提示,但是评论了就是朋友了别搞事! 昨天没发推因为有点emo,前几天那个互保排名前1000给空投那玩意本来也是打算陪跑的,结果还尼玛有人恶意给我写差评,点进去一看还是25年和我要回关的,真的恶心死了!今天听说总市值还没个有点角度的MEME高心情又好了亿点点 想想还是当年的 @KaitoAI 更靠谱一点,就是这次的排行榜为啥不公开呢?这样真的很容易被怀疑有黑幕 本来想认认真真的做 @axisrobotics 机械手任务的,结果一晚上一个都没完成,这AI我是训练不了了,估计我训练完要成人工智障了,有没有啥方式可以快速通关啊啊啊啊啊啊! 带大家了解一下 @axisrobotics 吧~Axis Robotics 2025年成立,总部在美国加州伯克利附近,目标是解决物理AI最大的痛点训练数据太少、太贵、太难搞,大模型能靠网上海量文字长大,可机器人得学真实动作轨迹,数据稀缺得要命,Axis就做了个复合数据引擎,靠仿真、手机第一视角拍摄,再加上人实时纠正,把全球普通人变成数据贡献者 创始人兼CEO叫Chris Feng @chris_anm01 ,他以前在贝恩咨询干过,还当过风险投资人,后来做Chainbase的COO,也参与过AI模型项目,Chris从做数据基础设施创业时就明白数据往往决定一家公司能飞多高,2024年初他觉得AI要从拼模型转向拼数据,2025年夏天就和南洋理工、伯克利的朋友们聊技术路线,正式把Axis拉起来了 联合创始人兼CMO是Christine,负责社区和增长,团队里还有伯克利、卡内基梅隆、佐治亚理工、南洋理工和上海交大的AI机器人高手,再加上把产品做到几千万用户的增长老手,最近还请了佐治亚理工的Jiachen Li教授当研究顾问,整个团队也就十来人,精干得很 2026年7月27日,公司宣布拿下1200万美元种子轮。Hack VC领投,Nomad Capital、Pi Network相关基金、10K Ventures和一堆天使跟投,钱主要用来扩数据产能、拉更多全球贡献者把引擎做得更稳,他们已经和Booster Robotics、吉利、路特斯等合作,帮对方定制训练数据,平台上收集了超200万条轨迹,数据还记在Base链上,方便追溯和激励,接下来9月出Sim Dataset V2,11月推DAgger后训练集,目标半年到一年做到50万到100万美元年经常性收入,这轮融资在机器人赛道里算挺亮眼的,说明资本开始认真看数据层了,Axis用浏览器和手机让普通人轻松参与,再靠链上机制保证公平,慢慢转起数据→模型→反馈的飞轮,以后机器人真正走进生活,说不定就靠这种大家一起攒经验的方式,Axis现在就像卖铲人,不造机器人本身,却在给整个行业铺路
显示更多
0
74
67
0
转发到社区
JST价格创四年新高 “小TRX”的飞轮转起来了 今天看到JST的价格突破四年新高 领跑整个赛道和生态 同时也是Top100代币一年中涨幅前五 而且看数据JustLend DAO的手续费暴涨 证明用户量和使用频次都暴涨了 无论是sTRX、能量租赁、GasFree最终都会赋能到JST @justinsuntron @DeFi_JUST #TRONEcoStar#
显示更多