注册并分享邀请链接,可获得视频播放与邀请奖励。

与「世界模型」相关的搜索结果

世界模型 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 世界模型 的内容
FLUX 3 发布了! Black Forest Labs 对它的定位,不再是又一个「文生视频模型」或「文生图模型」,是「真实世界模型」! 团队把 图像 / 视频 / 音频 放进同一套 multimodal flow 架构里,试图学「世界如何运作」,再把同一底座同时接到 内容生成 和 具身/动作预测。 为什么要「多模态一起学」? · 图像:提供某一时刻的空间结构与关系 · 视频:提供时间、动力学、物理规律 · 音频:提供机械现象与声学之间的因果线索 · 语言:提供目标、抽象、指令 各模态都是同一现实的「投影」,单独训只能拟合投影;一起训时,模态之间的互约束(声音必须对得上撞击、运动必须符合质量、未来必须接续过去)才更接近「世界表征」。 能力拆解:同一模型,三条产品线 1. Video(已 Early Access):最长约 20 秒、原生音频;文/图/视频参考、续写、关键帧、多语言对白;可链式拼更长片。 2. Image(随后数周):合成 + 编辑;复杂 prompt、多语文字、风格与分辨率更强(仍在 midtraining 迭代)。 3. Action(伙伴通道):原生动作预测,或把视频骨干当动力学底座微调;已有 FLUX-mimic(mimic robotics / Audi 场景)。
显示更多
DeepSeek 老板梁文峰面向投资者内部的讲话实录文章,已经在网上疯传了一整天了, 下午在国内公众平台网络陆续被下架。 我看到是群友的文档,不过还是津津有味! 42页文字稿里,谈了AGI、开源、商业化、算力、国产芯片,也谈了组织管理和人才。 信息很多,不过我觉得他反复讲的其实只有一件事:怎么提高最终把AGI做成的概率。 比如让我印象比较深的就是 DeepSeek 选择的不是四处进攻,而是不断做减法。 不急着抢用户,不做下一个超级App; 不为了收入,把C端和B端什么都吃下来; 视频生成、3D、世界模型再热,也不跟; 模型可以闭源多赚钱,仍然选择开源; 价格明明可以定得更高,也只赚自己认为合理的利润。 这不是因为他不想赚钱。 恰恰相反,是因为他知道,哪些钱可以赚,哪些钱现在赚了,反而会拖慢自己。 1️⃣克制是一种战略! 有句话我印象很深:克制是一种战略。 很多人理解的商业竞争,是抢用户、抢入口、抢收入,凡是能拿到的,都先拿到手里。 但梁文锋的理解完全相反。 AI这件事足够大,大到没有任何一家公司可以真正独占。既然后面的西瓜足够大,就没必要为了眼前的芝麻停下来。 C端用户可以做,B端收入也可以赚,但这些都只是通往AGI路上的副产品,不应该反过来成为公司的目标。 这其实也是整场交流里最有哲思的地方: 你想要得越多,最后可能越难得到;你愿意主动少拿一点,反而更容易走到最后。 开源也是这个逻辑。 很多人认为开源就是放弃护城河,梁文锋却认为,只要DeepSeek在成本和效率上始终有优势,开源不但不会伤害商业,反而能吸引人才、建立生态、减少敌人。 他甚至判断,如果一家公司想拿走AI时代过多的利益,最终一定会被另一个愿意少拿一点的人打败。 拿得太少,公司活不下去; 拿得太多,又会被新的竞争者挑战。 最后能长期存在的,一定是那个“合理的利润”。 所以他的克制并不是佛系,更不是无欲无求。 而是一种极强的目标感: 利润可以少拿,热门业务可以不做,短期用户可以不抢,但真正不能失去的东西只有两个:AGI这条主线,以及核心团队的稳定。 这才是克制真正锋利的地方。 他不是没有欲望,而是把全部欲望压在了一件事上。 2️⃣技术路线 技术上,梁文锋给出的路线也很清晰: 语言模型之后是思维链,思维链之后是Agent,Agent之后真正需要解决的是“持续学习”。 现在的AI能力已经很强,但它仍然需要人类提供完整的上下文。它不能像一个新员工一样,进入公司学习两个月,理解这里的人、关系、规则和工作习惯,然后持续成长。 一旦AI拥有持续学习的能力,就可以开始帮助人类研究下一代AI,形成“AI加速AI”的循环。再往后,才是自我迭代和具身智能。 当然,他也非常诚实地承认: 持续学习现在还没有被真正解决,全世界都还在摸索。 这种坦诚也很难得。 一边相信AGI一定会发生,一边承认具体路径仍然充满未知。不是为了融资,硬给投资者画一个确定的时间表。 3️⃣中美差距 对于中美AI的差距,他的判断也很直接: 最大的差距不是人才,而是算力和资源。 在算力仍然存在数量级差距的情况下,中国不可能全面超越,只能靠更高的效率、更低的成本和更明确的取舍,在部分方向上追赶甚至领先。 他判断未来大模型真正的差距,也不会是什么永远无法复制的神秘技术,而是三件事: 成本、时间和用户体验。 谁能更早做出来,谁能以更低成本提供,谁的产品让人用得更舒服,谁就能留下来。 4️⃣长期主义 这场交流对我最大的启发,也不是应该去买哪一家AI公司,而是重新理解了“长期主义”这四个字。 真正的长期主义,不是嘴上说自己看得远。 而是当短期利益真的摆在面前时,你有没有能力拒绝。 投资也是一样。 每一个热点都想参与,每一段行情都想赚到,每一次上涨都害怕错过,最后资金、注意力和判断力全部被分散。 一个人真正的能力圈,可能不只是知道自己擅长什么,还要知道: 哪些钱,本来就不属于自己。 但是梁文锋的这套模式,也不能被简单浪漫化。 DeepSeek敢于克制,是因为它有技术效率、有团队、有资金,也相信后面的市场足够大。开源、不设KPI、让员工自由探索,并不是任何公司照抄都能成功。 梁文锋自己也承认,随着公司规模扩大,部分部门仍然需要更明确的组织结构;DeepSeek也必须依靠API和商业收入活下去。 所以真正值得学习的,不是表面上的“不赚钱”“不加班”和“不设KPI”。 而是先想清楚: 什么是自己绝对不能失去的,什么又是可以主动放弃的。 对DeepSeek来说,不能失去的是AGI和核心团队。 对普通人来说,可能是健康、家庭、现金流、判断力,以及那个自己真正愿意长期投入的方向。 今天所有人都在讨论怎么拥有更多,梁文锋却用了接近四个小时,讲自己为什么可以不要那么多。 我觉得这可能才是整场交流最有力量的地方: 不是抓住每一次机会才叫厉害,而是面对无数机会,仍然知道自己真正要去哪里。 很多人以为长期主义最难的是坚持。 其实更难的,可能一直都是放弃。
显示更多
梁文锋又挡人财路,说AI路径还要贬损一下世界模型,言下之意现在投美女AI、老前辈AI的那些世界模型,大概率是打水漂。这真是把人得罪光了,一大批美女和老前辈都指着世界模型吃饭的。
显示更多
0
24
92
3
转发到社区
梁文峰胆子真大 四小时投资人会议实录流出,我发现他的预判真大胆: 1)英伟达那套生态一年内就废了,华为的卡一年后完全能平替英伟达,贵一倍两倍都无所谓。 2)谁想着靠AI暴利谁就死,拿得少的人一定打败拿得多的人,OpenAI就是因为想独占才被围攻。 3)奇点不是什么爆炸,是个漫长的温水煮青蛙过程,而且顺序不能乱——先解决持续学习,再到自我迭代,最后才做机器人。 4)Ai技术路线是这样:语言模型 → 思维链(CoT) → Agent → 持续学习 → 智能奇点(自我迭代) → 具身智能 现在处于Agent走一半,持续学习是下一个必须跨过去的坎,跨过去才能进入AI自己迭代自己的奇点阶段。 5)克制是核心战略,主动放弃C端流量争夺战,不做超级App,短期商业化只是保底,全部资源主线聚焦AGI。 6)中美AI差距就一年,但国内只用了人家二十分之一的算力,人才根本不缺,差的就是卡。 7)公司一半的核心研究员都在标数据,这就是现阶段最重要的事,高端数据瓶颈不是钱,是时间。 8)最坏情况技术冻结了,光卖API也够撑起一家上市公司,商业化根本不用愁。 9)不加班、没KPI、没组织架构,全靠愿景驱动,因为做研究就得松弛,逼太紧反而没用。 10)国产芯片产能问题今年明年后年都卡,但五年后肯定解决了。 11)国内几十家做基模的公司太多了,最后就剩三四家,而且谁也别想有暴利。 12)视频生成、3D、世界模型这些东西跟智能上限没关系,纯粹是商业噱头,坚决不做。 13)员工期权拿够、团队稳住,AGI(通用人工智能)就一定能成,其他全是小事,最多晚个一年半载。 14)中国AI最终拼的是“系统性便宜”,就跟制造业一样,成本优势是结构性的。 15)持续学习要是先做出来了,通用智能就很简单,让AI自己帮自己研究就行。 最后,梁文峰最大胆的判断: 「拿得少的人,一定打败拿得多的人。」 他说哪怕你还没赚到钱,只要脑子里想的是“我要垄断、我要暴利”,你就已经输了。OpenAI今天的困境就源于此,当初想独占AI,所以一定会被无数人围攻。反过来,DeepSeek主动放弃暴利、最强模型开源、不抢用户、不搞垄断,反而赢面最大。这套逻辑把整个商业世界的常识都翻过来了
显示更多
0
321
948
199
转发到社区
梁文峰四小时交流会内容: 1,英伟达那套生态一年内就废了,华为的卡一年后完全能平替英伟达,贵一倍两倍都无所谓。 2,谁想着靠AI暴利谁就死,拿得少的人一定打败拿得多的人,OpenAI就是因为想独占才被围攻。 3,奇点不是什么爆炸,是个漫长的温水煮青蛙过程,而且顺序不能乱——先解决持续学习,再到自我迭代,最后才做机器人。 4,Ai技术路线是这样:语言模型 → 思维链(CoT) → Agent → 持续学习 → 智能奇点(自我迭代) → 具身智能,现在处于Agent走一半,持续学习是下一个必须跨过去的坎,跨过去才能进入AI自己迭代自己的奇点阶段。 5,克制是核心战略,主动放弃C端流量争夺战,不做超级App,短期商业化只是保底,全部资源主线聚焦AGI。 6,中美AI差距就一年,但国内只用了人家二十分之一的算力,人才根本不缺,差的就是卡。 7,公司一半的核心研究员都在标数据,这就是现阶段最重要的事,高端数据瓶颈不是钱,是时间。 8,最坏情况技术冻结了,光卖API也够撑起一家上市公司,商业化根本不用愁。 9,不加班、没KPI、没组织架构,全靠愿景驱动,因为做研究就得松弛,逼太紧反而没用。 10,国产芯片产能问题今年明年后年都卡,但五年后肯定解决了。 11,国内几十家做基模的公司太多了,最后就剩三四家,而且谁也别想有暴利。 12,视频生成、3D、世界模型这些东西跟智能上限没关系,纯粹是商业噱头,坚决不做。 13,员工期权拿够、团队稳住,AGI(通用人工智能)就一定能成,其他全是小事,最多晚个一年半载。 14,中国AI最终拼的是“系统性便宜”,就跟制造业一样,成本优势是结构性的。 15,持续学习要是先做出来了,通用智能就很简单,让AI自己帮自己研究就行。
显示更多
0
8
80
18
转发到社区
看完了梁文锋在最近一轮投资人会议上的语录 不愧为全世界最有格局的创始人... 记录下来一些非常触动我的,全文背诵学习... 1. 在通过 AGI 的路上,要经过产品这个台阶,但不用花太多心思,产品只是在 AGI 路上的副产物。 2. 3D、视频生成、世界模型,跟智能上限没有太大的关系。 3. 多模态很重要,但不是智能本身。 4. 大模型的幻觉是一个产品问题,可以解决,但不是重点。 5. 现阶段最重要的是 Coding Agent,通用 Agent,金融医疗等 Agent 优先级较低。 6. AI 现在不缺品味和直觉,缺的是持续学习的能力。 7. 人类能够持续学习,但 AI 还没有,下一代模型必须要具有持续学习能力。 8. 我们希望下一代模型帮助我们开发,这是实现 AGI 最快的方法,但「学习」有很多东西组成,目前全世界还没找到好方法。 9. 如果把 AGI 比作爬楼梯,去年的阶梯是 CoT,今年的阶梯是 Agent,之后的阶梯是持续学习。 10. 实现持续学习之后,可能会来到渐进的奇点,AI 可以开发更前沿的模型,加速 AI 研究,这部走完,才是具身智能。 11. 智能的重点可能是具身,因为对一个正常人来讲,他的需求并不是电脑,而是人力。 12. 我们只赚合理利润,非常考虑成本效率,所以价格能做到最低,卖 API 这件事,我们没有销售,也没有客服,用户自己就会来。 13. 我不怀疑 AGI 会有巨大的商业价值,我考虑的是如何增加做成的概率。 14. AI 在商业上做成,开源是有好处的,一个软件公司,市场一年就几十亿美金,一开源就没有了,但是 AI 这个事情足够大,最终可能得占掉人类社会 GDP 的 10%,如果想独占这个利益就一定会被历史抛弃,这是一个客观规律,这是一个历史观。 15. 开源对我们的商业模式没有任何影响,前提是「只赚一定的利润」,如果要赚百倍利润,开源确实会影响你。 16. 中国 AI 的差距主要在资源,我们相信 scaling,规模越大,效果越好,但资源就这么多,人才没有差距,都是同一批人。 17. Anthropic 超过 OpenAI,不是长期的,是阶段性的。OpenAI 和 Google 未来大概率会交替上升。 18. 国内模型公司太多了,资源分散,最终一定会收敛,如果每家只拿合理的利润,不需要那么多人做大模型,可能两家大公司,两家小公司就够了。 19. 我绝对不认为大模型公司可以拿走AI行业的大部分利润。 20. 大模型的竞争差距会体现在三个方面:成本、时间、用户体验。成本排第一位,时间早几个月就不一样,用户体验有些黏性和壁垒,但不本质。 21. 无意成为下一个超级app,看不上这个东西,不要为了芝麻丢了西瓜。 22. 去年大家都抢 Chatbot,抢 C 端流量,今年是抢 B 端收入,我们真正关心的是 AGI 路线图,下一步技术怎么突破。最想得到的东西得不到,没那么在意的反而容易得到。 23. 团队的稳定性是没法退让的,这是我们面临的一个非常大的风险,随着这次融资,也得到了解除(这是低利润模式必须的支撑) 24. 不想和任何人成为竞争对手,希望给他们赋能,帮助他们,这样我们的环境也会更好。 25. 我们一般不太加班,第一个原因是研究需要一个比较松弛的环境,第二个原因是我们非常聚焦,不去补产品的所有问题,也算一种克制的文化。 26. 公司是动态的,随着公司变大,可能会有一些必要的结构,但不会完成变成传统的层级制度。 27. 我们做这个公司,初衷没想要赚多少钱,要去上市。我们怀着一个对这个世界非常大的善意来做这个事情,觉得这对人类有用。 28. 我们是一个靠愿景驱动的组织,KPI 不是我们的组织方式,有好处也有坏处,但这个是我们的特色。 29. 愿景不是成文的,而是在做事的方法中,对待世界的态度里,可能我们每个人的理解也不一样,但大方向是一致的。 30. 一个公司最重要的是愿景,愿景不是挂在墙上的标语,不是怎么说,而是怎么做。 31. 克制是我们愿景里的一部分。AGI 之外的事情,我们没有精力就不做。AI 这个事情太大了,利益也太大了,随便分一点利益就非常大,你越克制,就越有可能做成这件事。除了愿景,我们并没有非常多的其他优势。 32. 开源也属于克制的一部分,从长期来说,价格低可能是优势,克制是一种战略。 33. 如果你的愿景是拿得多,你就先输了,你可能会面临更大的问题,这个世界就是这样。
显示更多
0
13
310
72
转发到社区
我靠,乐高这个广告视频真的杀疯了,屌爆了 他太懂男人的快,和这个时代的快了 真的完美诠释了到底在 AI 时代,什么东西才是壁垒 这个视频完全可以用 AI 生成—— 一辆乐高车、完美光影、飙到一百多公里的速度,技术上毫无难度 但乐高没有这么做。他们硬生生用真实积木拼出一辆车,然后让它在物理世界里真的跑到了 111 km/h 因为当所有人都在讨论「AI 如何创造出一个真实世界、世界模型」的时候, 但是乐高,开始反过来制造「不可生成的真实」 AI可以帮你做内容、做画面、做创意, 但它做不了三件事: 第一,真实的代价 第二,长期的坚持 第三,被时间验证的信任 乐高的世界和乐趣,无法被AI代替 这他妈的才叫品牌和品牌形象广告啊
显示更多
真正言出法随的AI视频工具,终于被我找到了!! 而且还是个100%开源的视频世界模型项目! 这个用来做视频真的很高级! 先说一个长期的“痒点”,做AI视频为了保证空间场景的一致性, 不得不生成一大堆各种角度的场景的图片作参考约束, 要确保正反打都不会穿帮,要确保镜头转过去再转回来场景不走形, 但其实,这个方法很原始! 但如果,直接可以生成一个高度一致性的空间, 让人物站在该有的位置,并且还能够自由控制镜头在空间里的运动, 所有一致性的困扰,就全部解决了!! AlayaWorld @alayastd 就完全是这个思路, 根据任何图片和视频,实时渲染一个自由空间, 先固化一个场景,然后人物和道具进场,先搭景再拍摄, 这样做视频的体验,就无限接近于真实片场! 你就像一个导演,站在片场里,并且拥有“言出法随”的能力! 改天气、换演员、换服装、甚至直接换场景,可玩性和可控性全部拉满, 突发奇想的指令或者是已经设置好“技能”,就可以实时渲染出来! 而且这个时长不受限制,一个空间里,“拍摄”多久都可以。 想想就很爽,这种创作体验,是前所未有的!! 不光是视频,这也完全是彻底改变游戏行业的存在。 尤其是那种沉浸感很强的第一人称游戏! 越说越激动,这个项目现在是完全开源的, 有兴趣的朋友,真的可以关注一下这方面的趋势, 我觉得在这个探索世界模型的阶段, 这个,就是最好的落地应用!!
显示更多
0
134
127
11
转发到社区
1 一个人走进 AI 生成的巷子,说了句召唤——天上真飞下来一只鹰。🦅 这不就是《盗梦空间》么? Alaya World 干的就是这种事:一句话、一张图丢进去,实时长出一个能逛的世界。你挪视角,街巷往前展开;走到一半打一句提示词,里面真会跟着变。不是后期特效,是当场生成的。 说个暴论:未来游戏开发可能要变天了——先生成一个可玩的 demo,然后就直接上线了。🎮 我们现在用的 AI,多半还是打字进、文字出,最多再给你一张图、一段视频。看完就结束,你始终站在屏幕外面。 可以这么理解: • 💬 聊天模型陪你说话 • 🎬 视频模型给你放片 • 🌍 世界模型开始给你一个能走进去晃两下的地方 它还不完美,偏研究向,家用电脑也跑不动——别当成明天就能下载开玩的游戏。但代码开源了,主页上 Demo 很多,光看就能明白:AI 下一步可能不只是更会聊天,而是开始撑起一个空间。 想直观感受,直接刷 @alayastd 的 Demo,比看任何介绍都快。 1.🐦‍ 召唤火鸟 冷却好了,点火鸟技能。烟尘里冲出一只燃烧的凤凰,双翼一展,脚下黑烟烈焰
显示更多
0
83
53
0
转发到社区
被字节开除并起诉的老哥,创业估值 2 亿了。 此前因在字节上班,不满团队资源分配,通过篡改代码等,恶意攻击内部项目,而被字节开除的实习生田柯宇。 最新消息已在世界模型领域创业,并拿到多位天使投资人投资,估值 2 亿,他目前也是北大博士,NeurIPS 24 最佳论文奖获得者。
显示更多
0
106
151
5
转发到社区