注册并分享邀请链接,可获得视频播放与邀请奖励。

与「世界模型」相关的搜索结果

世界模型 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 世界模型 的内容
AMD 宣布用约 82 亿美元收购李飞飞创办的 World Labs,这期是彭博科技节目主持人 Ed Ludlow 对两位当事人的联合采访。一位是 AMD CEO 苏姿丰,AMD 做 CPU 和 GPU,OpenAI、Anthropic、Meta 都是它的大客户。另一位是 World Labs 创始人兼 CEO 李飞飞,她主持建立的 ImageNet 图像数据集是这一轮深度学习浪潮的起点之一。两人聊了为什么要做这笔交易、李飞飞在 AMD 的新角色、开放生态,以及 AI 安全该由谁负责。 交易本身 这是一笔全股票交易,也就是 AMD 用自己的股票而不是现金来付款,对 World Labs 的估值约 82 亿美元,预计年底前完成,还需要监管审批。交易完成后,李飞飞出任 AMD 执行副总裁兼首席科学家,直接向苏姿丰汇报,World Labs 团队将成为 AMD AI 模型团队的核心。 两家公司的关系早就开始了。AMD 是 World Labs 的早期投资方,也给它供芯片。苏姿丰说她从 World Labs 只有几个研究员的时候就在看着这个团队成长。两人也都提到彼此认识多年,私下是朋友。 芯片公司为什么要买模型公司 苏姿丰的理由是,AI 现在还在很早期的阶段,而且越来越明显的是,硬件、软件、系统和模型这几层互相影响,对整条链路理解得越透,造出来的系统就越好。收购 World Labs,一方面是拿到李飞飞聚起来的一批顶尖研究人员,另一方面是让 AMD 对模型未来的发展方向有第一手的判断,反过来指导下一代硬件怎么设计。 李飞飞从模型公司的角度讲了同一件事。World Labs 越做越大,对算力的需求也越来越大;和 AMD 合在一起,模型可以用最前沿的硬件加速训练和推理,硬件团队也能提前看到模型未来的工作方式和需求。她把这叫作 AI 软件和 AI 硬件的“共同进化”。 主持人追问 AMD 是不是要开始卖模型、卖软件。苏姿丰说不会改变商业模式,AMD 仍然是一家平台和解决方案公司,软件是用来支撑硬件的。收购的最终目的是让 AMD 更好地服务那些最大的算力客户,也就是各家模型公司。 World Labs 做到了哪一步 World Labs 成立于 2024 年,到现在两年多,专攻空间智能和物理智能,也就是让 AI 理解和生成三维世界、懂得物理规律,这类模型通常叫“世界模型”。李飞飞说,他们想做的是语言模型之外的方向,因为创作者、设计师、教育、医疗都有这方面的需求,机器人技术也快要迎来爆发。 公司目前已经发布了两代模型,先是 Marble,然后是最新的 Atlas。李飞飞介绍 Atlas 是一个多模态的“全能模型”,能生成高质量的画面,同时保持三维和四维(三维空间加上时间)上的一致性,摄像机和智能体可以在它生成的世界里移动和交互。 团队也在扩张。World Labs 最近收购了 SceniX,这家公司做出了一套机器人仿真工作流程,以及训练机器人控制策略的模型,由此给 World Labs 补上了机器人方向的人才。 李飞飞为什么选择加入 AMD 苏姿丰说她给李飞飞的说法是“加入全世界最令人兴奋的 AI 公司”。李飞飞的作用也不只限于 World Labs 团队。苏姿丰说 AI 没有一种方案能通吃,除了大家熟悉的云端 CPU、GPU,物理 AI、机器人、从云端到边缘设备再到个人电脑的端到端 AI,都是 AMD 未来三到十年要重点增长的方向,而这些正好是 World Labs 擅长的领域。 World Labs 今年早些时候刚融过一大笔钱,发展势头也不错,主持人问李飞飞是否考虑过别的出路。她说公司从一开始就以使命为导向,这件事的关键在于双方的愿景是否一致,和有哪些选择关系不大。在她看来,这次合并会是“一加一大于二”,接着她笑着补了一句,AMD 显然比 World Labs 大得多。 至于加入后会不会只做空间智能,李飞飞说两人还没来得及细谈所有计划,World Labs 正在做的工作会继续,但她预计研究方向会扩大、节奏会加快。 开放生态与可选择性 苏姿丰说,AI 未来会同时有开源模型和闭源模型、大模型和小模型,它们跑在不同的硬件上,这一直是 AMD 规划高性能计算和 AI 产品线的前提。她和企业的 CEO、CIO 聊下来,没有人愿意被锁死在某一家的硬件或软件生态里,大家都想在不同时候挑最合适的。所以 AMD 会继续押注开放生态,她和李飞飞也讨论过怎样用 World Labs 已有的成果推动开源生态。 李飞飞补充说,现代 AI 的发展离不开开放。从科学界公开分享神经网络算法,到她自己做的 ImageNet,这个首批开放的大规模数据集就是现代 AI 革命的推动力之一。开放生态能让不同的发现、创新和创业机会互相促进。 AI 安全该由谁负责 主持人提到当前的一个争论:模型能力的进步速度超过了安全和对齐研究的进步速度。苏姿丰说这件事上“没有可选项”,技术必须好,也必须安全。她拿芯片行业做例子:最高性能的处理器在设计时就要把安全和数据保密作为优先事项来考虑,AI 行业也需要把安全放到同样的位置。她说自己是 AI 乐观派,相信行业能建立起合适的流程和防护措施,而且各家应该像硬件行业现在分享安全方面的经验那样,互相分享做法。 主持人进一步问,提供算力的公司对训练是否安全、推理时模型是否按预期行事,要负什么责任。苏姿丰说生态里每一方都要为自己的行为负责。对 AMD 来说,要保证硬件本身安全、按设计运行,模型在上面跑时数据是安全的,还要和模型公司一起处理好软硬件之间的交互。她认为这件事应该由行业主导,但因为 AI 是新东西,各方学习的速度不一样,所以她欢迎更多的行业协作,也欢迎一定程度的第三方评估。 李飞飞说,主持人上周问她监管、第三方评估、前沿实验室自我负责这几种方式该选哪个,她的回答是全都要。她认为 AI 是一项“文明级”的技术,和历史上所有这类技术一样,初衷是让人的生活和工作变得更好,但每项技术都是双刃剑,必须负责任地开发和部署。无论在斯坦福、World Labs 还是现在的 AMD,她都想推动个人、公司、行业和社会四个层面共同承担这份责任。 AMD 的下一步 主持人提到 AMD 市值已经到了 1 万亿美元,苏姿丰近来也多次和美国总统一同公开露面。苏姿丰说 AMD 过去做过好几笔对公司影响很大的收购,World Labs 是下一笔,而且是战略意义很重要的一笔。在她看来,技术如今和经济、国家安全都紧密相关,AMD 有机会真正影响计算的未来走向。 最后主持人请李飞飞预测 AI 下一个重大突破。她没有给具体的技术判断,只说接下来 AMD 和 World Labs 会一起打造未来,而这个未来必须对人类社会和人们的生活有益。苏姿丰在一旁说:“我会让她忙起来的。”
显示更多
[开源学习资源] AI Engineering from Scratch 59.8K ⭐️ 作者 @ghumare64 课程共 20 个阶段,以 Python 为主要编程语言,主张在导入任何框架之前,先用纯数学把每个算法手写一遍。 课程地址: 开源地址: 它和常见教程的本质区别 ? 大多数 AI 教程是“API 驱动”的:装个库、调个接口、跑个 demo。这个项目反其道而行,每节课遵循固定的六段结构: Motto → Problem → Concept → Build It → Use It → Ship It 以 Phase 10 的一节课「Tokenizers: BPE, WordPiece, SentencePiece」 为例,这个格式是真实落地的,而且写作质量相当高: · Problem 部分不讲废话,直接从代价切入:“你的 LLM 不读英语,它读整数。分词器决定这些整数是承载意义还是浪费意义”,然后解释为什么 tokenization 不是预处理,它是架构的一部分(影响上下文窗口利用率、API 计费、推理速度)。 · Concept 部分用“三种失败的方案和一种胜出的方案”来讲演化逻辑:词级切分(词表爆炸、[UNK] 问题)→ 字符级切分(序列过长)→ 子词切分(BPE 的折中),并配上真实语料上 BPE 逐步合并的手工演算。 每节约 3000+ 词,带 Mermaid 图、可运行代码和测试。 另外两个设计值得强调: · 每节课产出一个可复用的 artifact,一个 prompt、一个 skill、一个 agent 或一个 MCP server。学完整个课程,你手里有 523 个可展示的作品,不是 523 个跑完就扔的 notebook。 · 强调“证据留存”:保留命令、退出码、输出,作为学习发生的证明。这明显吸收了工程实践中“可验证性”的思路。 # 课程结构:从线性代数到自主智能体集群 20 个阶段构成一条完整的上升曲线,咱们它分成五个大块来看: 基础层(Phase 0–2):环境与工具链、数学基础(线性代数/概率/微积分)、经典机器学习。这是给基础不牢的读者铺的路。 深度学习与感知层(Phase 3–6):神经网络核心、计算机视觉(一路讲到 NeRF、高斯泼溅、世界模型,这已经超出一般教程的覆盖范围)、NLP、语音。 生成与决策层(Phase 7–9):Transformer 深挖、生成式 AI(GAN、扩散模型、flow matching)、强化学习。 LLM 层(Phase 10–12):这是全课程的重心之一。Phase 10 的目录我逐条看过,它不只是“从零实现 GPT”这种常规内容,还包含了相当前沿的论文级主题:DeepSeek-V3 架构走读、DualPipe 并行策略、Native Sparse Attention(NSA)、多 token 预测、Jamba 的 SSM-Transformer 混合架构、 speculative decoding 等。Phase 11 转向应用侧(RAG、LoRA、MCP、可观测性),Phase 12 覆盖多模态(从 CLIP 到 computer-use agent)。 智能体层(Phase 13–16):工具与协议(MCP、A2A、Agent Skills)、54 节课的 agent 工程、自主系统与安全、多智能体集群。这一层的分量很能说明项目的判断:它认为 AI 工程的重心正在从“训模型”转向“构建可靠协作的智能体”。 收尾(Phase 17–19):生产基础设施、伦理与对齐、毕业设计。 # 生态与周边:不只是一个课程仓库 网站:带浏览器本地存储的学习进度追踪、术语表、课程目录和路线图。 六卷本书籍:课程内容由 CI(pandoc)自动构建成 EPUB/PDF,附在 GitHub Releases 上,课程即书,且随仓库持续更新。 Agent 导师模式:运行 npx skills add rohitg00/ai-engineering-from-scratch,可以把整个课程装进 Claude Code、Codex 等编码智能体,变成一个带分级测验(placement quiz)和个性化路径的交互式导师,学习进度写在 LEARNING.md 里。这是“用你正在学的工具来学”的巧妙闭环。 认证备考:5 条备考路径、67 节课、505 道练习题,覆盖 Anthropic 的 Claude 认证和 Agentic AI Foundation 的 MCPA。项目明确声明与这些考试机构无关联,只是独立的备考材料。 12 种语言的翻译(含中文),以及四条核心学习路径(构建与部署 AI 应用、软件工程基础、Agent 辅助工程、产品判断与交付)供不同目标的人选路。
显示更多
0
11
75
16
转发到社区
我终于明白为什么LeCun顶着全网群嘲也要死磕世界模型了, 现在很多人误以为大模型快要通向AGI了,纯粹是因为被那种博导般的答题体感给骗了, @ylecun 说单靠把大语言模型做大,哪怕到了地狱也搞不出人类水平智能, 甚至直接开喷数据中心养出天才军团纯属扯淡,很多人觉得他迂腐、天天唱衰, 但我仔细翻完他在ECCV上的最新拆解才彻底明白,他反对的从来不是语言模型有用,他自己做了一辈子模型太清楚了,大模型说白了就是把全人类写过的几千亿字当成了超级开卷题库, 你问什么它都能对号入座吐出来,这种博导体感是工程的巨大成功,但也让很多人误以为它真的学会了独立思考 
有意思的是LeCun搬出了皮亚杰那句老话,智能从来不看你知道什么、看的是你不知道的时候该怎么做,拿学开车来说, 人类小孩四岁光靠眼睛看世界就吸进几十万亿字节,二十小时练习就能上路,而我们的大模型相当于读了人类四十万年的书, 在物理世界里连个洗碗叠衣服的家务机器人都撑不起来,换个没见过的环境分分钟崩溃, 说白了自回归只是在一个词一个词往下猜,现在的所谓推理其实大量是在词语空间里做多轮抽样搜索,遇到代码和数学这种有编译器自动给奖励的封闭沙盒还能刷分,一旦扔进没有自动打分器的真实世界,错误就会指数级放大 
说实话这就是为什么他宁可离开Meta、跑到巴黎去给AMI Labs融三十五亿美元估值,也要死磕JEPA和世界模型,他要的是让机器学会预测我做这件事世界会发生什么, 在抽象空间里做动作规划,不用在文字表面拼漂亮句子,连现在的缩放派其实都在偷偷向他妥协,单独拉视觉编码器、在隐空间里做搜索、用物理引擎搞模拟, 外壳虽然还叫LLM,内核其实都在往世界模型的方向打补丁,大家争论到最后已经不是要不要算力,而是我们要把算力花在背诵更多文字上,还是花在让机器看懂物理因果上 
我自己平时也天天靠AI写代码查资料,缩放派确实把已知世界的说明书背到了极致,但真正的智能是要去写说明书从来没写过的那一页, 以后别再看各家发布会画什么天才之国的饼,就盯紧三件事,新任务要多少样本能学会,换个环境会不会整段崩溃, 以及汽车和机器人能不能像人一样在物理世界里安全跑起来,谁对谁错不用在网上打嘴仗,现实世界自会交卷。
显示更多
关于世界模型的一点思考,目前主要有三大派: 1. 李飞飞派,主打从最少输入实时生成持久可交互空间世界的全生成路线 2. PixVerse R2派,用预生成高质片段叠加Omni Causal AR实时因果生成,属于实用过渡 3. 我的世界派,用离散方块限制换来共享一致性与自由探索
显示更多
399美元,开源,还会滑轮滑。 Hugging Face发布小型机器人Microduck:能走路、拿东西、摔倒后自己站起来,还能通过强化学习学新动作。 动手探索实体AI和世界模型,门槛又低了一点。
显示更多
2026必须要知道的推特博主 @simonw = LLM 实战之王 @swyx = AI Engineering 之王 @t3dotgg = Cursor / 开发者工具之王 @tdinh_me = 独立 AI 产品之王 @dannypostma = AI SaaS 变现之王 @emollick = AI 工作应用之王 @chipro = 生产级 AI 系统之王 @hwchase17 = Agent 框架之王 @bcherny = Claude Code 之王 @alexalbert__ = Claude / API 之王 @rauchg = AI 原生 Web 之王 @fchollet = 智能评测之王 @ylecun = 世界模型之王 @DrJimFan = 具身智能之王 @shl = 一人公司之王 还有哪些遗漏的博主,可以在评论区补充一下~
显示更多
0
58
355
56
转发到社区
🔶YZi Labs 第四季 EASY Residency 入选项目速览 YZi Labs @yzilabs 表示,第四季阵容体现了其对全球支付、链上市场与「代理式金融」(agentic finance)方向的判断:更可编程、更本地化、更注重合规,并真正嵌入日常金融流程。 以下是 24 家入选公司及简要介绍: 🔸Aile :面向区域稳定币的无许可链上外汇层 🔸 @alloco_fi :从市场观点到链上投资产品 🔸D0:链上金融的本地支付轨道 🔸De¹:基于实时执行的金融世界模型 🔸ElfomoFi:EVM 市场的 Prop-AMM 基础设施 🔸Facto:让链上余额直接用于日常支付的中间件 🔸FinTax:数字资产金融的会计、税务与 AI 基础设施 🔸Kravata:拉丁美洲受监管的稳定币「最后一公里」基础设施 🔸Liquorice:意图与 RFQ 做市商的库存信贷层 🔸Meddcom AI:AI 驱动的个性化预防健康与长寿平台 🔸Nara:跨境支付的可编程信贷层 🔸 @TradeNeutral :通过金库基础设施代币化对冲基金策略 🔸Nxos:面向跨境贸易的稳定币新银行 🔸 @primus_labs :机构链上金融的机密基础设施 🔸Roostoo :AI 交易代理的资格认证层 🔸 @SmartXTerminal :链上市场的个性化社交交易 🔸Spectrum :Web2 向 Web3 过渡的加密到法币清算 🔸 @surgepayxyz :面向全球印度侨民的账单支付 🔸 @ViFi_Labs :新兴市场货币的去中心化交易所 🔸xAPI:AI 代理的 API 市场 🔸 @xhunt_ai :AI 原生创作者智能与机会基础设施 🔸XStable:链上黄金与外汇交易的 AI 原生基础设施 🔸@ZeroDriftSec :企业软件的代理式安全基础设施
显示更多
0
78
37
12
转发到社区
有人说如果 Decart 这家以色列世界模型创业公司以 70 亿美元被收购,Sequoia 和 Benchmark 的回报会非常夸张。 按他的估算,Sequoia 跨多轮投资综合下来,大概能拿到 11–14 倍回报。 投入可能约 7000 万美元,回报约 9 亿美元。 这绝对是 Shaun Maguire 的一次大胜。
显示更多
《历史不可评价,只可理解》 人们很喜欢评价历史。 某个人做了一个决定,十年后造成严重后果,于是得出结论:这个人愚蠢、短视。另一个决定几十年后产生巨大收益,又被称为高瞻远瞩。 这里有一个巨大的问题: 我们知道后来发生了什么,他不知道。 假设一个人在某个历史节点上可以选择 A、B、C。今天的我们已经知道 A 失败了、B 可能成功,于是很容易问: 他为什么不选 B? 这和看着一只已经涨了十倍的股票问“你当年为什么不买”,没有本质区别。 真正处在那个时间点的人,看不到未来走势图。他拥有的只有残缺的信息、有限的资源、既有制度、自己的认知,以及充满不确定性的未来。 所以真正值得研究的问题应该是: 在当时的约束条件下,他还能怎么做? 历史人物也是棋盘上的棋子 一个皇帝看起来拥有至高无上的权力,但仍然受到财政、官僚体系、地方利益、军事能力、交通条件、社会观念的约束。 一个企业家也一样。 后来的人可以轻易问:为什么没有早点转型?为什么没抓住某项技术? 可真正的问题是:当时有没有足够的信息?有没有钱和人才?组织能不能执行?市场是否成熟?失败一次以后,还有没有第二次机会? 当这些约束全部被删除以后,历史就会变得异常简单。 简单到每个坐在沙发上的人,都比历史人物聪明。 历史没有收盘日 更麻烦的是,结果本身也无法稳定地评价一个决策。 一项政策实施三年,造成经济下降,人们说它失败。 十年后,它促成产业转型,又被重新评价为远见。 二十年后,新的产业结构产生严重问题,评价再次反转。 五十年后,这些问题又逼迫系统完成下一次升级。 那么究竟应该在哪一年结算? 历史没有真正的收盘日。 任何所谓“最终评价”,都只是在某个时间截面上强行结算。因果链不会在人类写完历史教科书以后自动停止。 所以必须区分三个东西: 决策质量、实际结果、历史影响。 决策质量讨论当时的选择是否合理;实际结果是世界后来走向了哪里;历史影响则是结果进入更大的系统以后,又产生了怎样的连锁反应。 一个好决策完全可能得到坏结果,一个愚蠢的赌博也可能因为运气获得巨大成功。 如果只根据结果评价决策,我们最终学习到的往往只是幸存者故事。 重建约束空间 真正理解历史,需要做一件困难得多的事情: 回到那个时间点,删除未来,重建约束空间。 只保留当时能够获得的信息,再摆上财政、技术、制度、组织能力、利益集团、社会观念、外部竞争,以及决策者本人的认知结构。 然后问: 这个节点究竟有哪些可行解? 如果存在更好的解,还要继续追问: 他能不能看到?看到了能不能推动?推动了有没有人执行?执行以后系统能不能承受? 问到这里,很多历史讨论都会突然安静下来。 因为很多后来看来理所当然的选择,在当时根本不存在于可行解空间里。 从评价走向理解 评价只需要一个结果。 理解需要恢复整个结构。 “英明”“昏庸”“伟大”“邪恶”,几个词就可以完成评价,却几乎没有增加我们对世界的理解。 真正值得研究的是: 在什么约束下,一个拥有怎样世界模型的人,为什么会产生这样的行为? 历史由此不再是一群伟人与蠢货轮流登台的故事,而成为一个巨大系统在无数约束中寻找可行路径的过程。所谓历史人物,只是其中作用半径更大的节点。 当然,法律可以追责,道德可以表达立场,社会也必须建立自己的价值边界。 但如果目标是认识世界,那么知道某个人“好”或“坏”,并不能帮助我们面对下一次历史。 理解制造行为的约束结构,才能让我们在相似结构再次出现时,看见它将走向哪里。 历史不可评价,只可理解。 评价是在知道答案以后给过去打分。 理解,则是回到那个没有答案的时刻,重新看见当时的人所面对的世界。
显示更多
FLUX 3 发布了! Black Forest Labs 对它的定位,不再是又一个「文生视频模型」或「文生图模型」,是「真实世界模型」! 团队把 图像 / 视频 / 音频 放进同一套 multimodal flow 架构里,试图学「世界如何运作」,再把同一底座同时接到 内容生成 和 具身/动作预测。 为什么要「多模态一起学」? · 图像:提供某一时刻的空间结构与关系 · 视频:提供时间、动力学、物理规律 · 音频:提供机械现象与声学之间的因果线索 · 语言:提供目标、抽象、指令 各模态都是同一现实的「投影」,单独训只能拟合投影;一起训时,模态之间的互约束(声音必须对得上撞击、运动必须符合质量、未来必须接续过去)才更接近「世界表征」。 能力拆解:同一模型,三条产品线 1. Video(已 Early Access):最长约 20 秒、原生音频;文/图/视频参考、续写、关键帧、多语言对白;可链式拼更长片。 2. Image(随后数周):合成 + 编辑;复杂 prompt、多语文字、风格与分辨率更强(仍在 midtraining 迭代)。 3. Action(伙伴通道):原生动作预测,或把视频骨干当动力学底座微调;已有 FLUX-mimic(mimic robotics / Audi 场景)。
显示更多