注册并分享邀请链接,可获得视频播放与邀请奖励。

Eric Xu (e/Mettā) 的个人资料封面
Eric Xu (e/Mettā) 的头像

Eric Xu (e/Mettā) (@xleaps)

@xleaps
0 正在关注    0 粉丝
科普一下“多模态”的具体含义。 首先,我们虽然不认为盲人有“智力”上的缺陷,但不会因此让盲人靠听收音机去驾驶汽车。因为有些模态比如视觉,不是其他模态(文字或者语音)能够简单取代的。这里面有一个人择原理:即使最终在 AI 内大家都是 token, 但人类选择了用红灯而非多普勒雷达构建了整个交通系统,也选择了用 2D 屏幕而非字节流表达计算机操作,因此 AI 为了在现实世界和数字世界中完成任务,必须接受人类已经接受的模态和输入。 多模态是个被滥用了的词。模型多模态输入有利于内部更好的表示这个人择的世界,特别是视觉信号,可以帮助模型 grounding ,比如“红灯”它到底是一个什么样的信号, 在语义上毫无问题,但在开车场景里要接近人择的感知和推理,才能更加准确的表征人择世界的模型——这个世界上不存在客观的世界模型,都是人择的。 即是是纯粹追求虚幻的 AGI 目标,就以长程任务为标尺, DeepSeek 要做的长程任务,持续学习,最终也都绕不过多模态,特别是人择世界的视觉信号。一个很明显的例子就是盲人不能够仅靠语言,不依赖计算机屏幕,来操作针对视觉无碍者设计的计算机,很好完成长程计算机操作任务。 AI 也会在这种选择压力下,迫使 tokenize 人择的数字视觉信号。 DeepSeek 不愿意在 AGI 的路上做多模态的输出,和 Anthropic 的方向是一样的。因为多模态输出更多是一个工程问题,牵涉到如何构建扩散或者 flow match 模型,如何让输出的分布不塌陷到平均期望上,如何保障多步输出的一致性——在通往 AGI 路上这些都是垂直的任务,可以被通用的 AI 模型一句话调用,因此可以从通用智能里外化掉。 DeepSeek 放出一个只支持 text 输入的模型不代表 DeepSeek 就死死抱住 text-only 不放。实际上 DeepSeek 的非 API , 非开放权重版本是可以处理视觉信号的,而且许多我知道的企业应用里,都有人在试图给 DeepSeek 嫁接一个 ViT.
显示更多
怎么还是有这么多人没懂 多模态对实现AGI真的不重要 这已经是业内两三年前的共识了 你见到盲人影响他们智力了吗 多模态是一种能力,不是一种智力 就像有的人反应快,有的人手很巧,有的人空间感很强 这些都是能力,但我们不会说有这些能力就很聪明 本质上来说,图像带来的大部分语义信息已经被压缩成语言了,剩下的像素信息对于实现机器人来说是重要的,但是一个会洗衣服,会做菜的机器人不代表他很聪明,实现了AGI,这些是能力不是智力 这就是为什么所有serious的AGI公司都在做coding和math,因为解决这些问题代表智力,解决好这些问题就离AGI更近了一步
显示更多
Just like I predicted: Kimi K3's license requires inference providers to enter a separate commercial agreement (ARR > $20M). Kimi might be the first company doing a "fabless" business model. -- 验证了我几周前的预言: Kimi 的开放权重模型 K3 ,有单独的商业授权协议,在这样的协议下,模型训练和推理可以在商业上分开,就和半导体设计与制造一样。 围绕着开放权重模型会有一整套的生态和公司,比如专门从事为企业应用微调的,专门做 prefill-only 适配的等等。这种生态系统层面的力量,是封闭厂商完全没法匹配的。
显示更多
大模型是一个专利期十个月的制药生意
0
6
93
29
转发到社区
大家或许不知道的是,那些 OpenAI 和 Anthropic 的账单,包括 API 和月订阅 都是 Stripe 处理的 不是说要卖铲子么 Stripe 就是卖铲子的其中一家 从产业链上每 Watt AI 拿走大约 $0.05 但支付本身消耗瓦特极低,所以是一个近似于 Meta 的极好的生意 可惜是未上市标的,否则上涨应该是超过内存股票的
显示更多
我觉得 Stripe 这是业务发展太牛逼了,它打算以 100 亿美元的估值收购 OpenRouter。 想想两三年前很多人只觉得 OpenRouter 是个规模大点的中转站,甚至对中转生意轻视,这波交易要是成了,那就是中转生意的天花板了
显示更多
这个模式我在 LinkedIn 上前几天写过 其实是一个真正追求产品质量的团队最终必然要实现的一种模式 (我原创的名词:叫做 shadow steering ) 它是这样的: 平时一个普通的模型工作。另一个更聪明的模型在后台并不需要做什么 甚至无需输出 只要输入 (输入成本极其便宜)来维护一个 prefill kv. 到了某个时刻 harness 侦测到小模型质量下降干不下去的时候,大模型介入 输出一百个 token 的指导 小模型被点悟 一点即通 继续干活 这个 “影子点拨”可以藏在小模型的思考轨迹里 反正用户看不见 这种直接在轨迹上的点拨比 off policy 不知道高到哪去了,因为可以在长程任务中期给一个 on-policy 的指点 后面拿来蒸馏非常舒服 这个模式可以用来节省大量中等模型成本,也可以用来蒸馏,用来测试,用来收集长程任务质量等等 回到这则新闻本身。我看到的是它只能说明一件事情,DeepSeek 下一代模型已经训练完毕,在影子测试而已 智能程度让用户感知到了 Fable 5 而已。
显示更多
你是说 我充的20块人民币的DeepSeek里 掺了茅台?? 这可真的太良心了
0
12
76
12
转发到社区
出来说句公道话,这是不可能的 Caffe 问世的时候 是深度学习刚开始的西部拓荒时代 大家都还手写算子手工搭建计算图呢 Caffe 让搭建卷积网络变成搭建一个描述。 这在当时是纯新的范式,哪里有什么“闭源产品”可以借鉴? 如果真的有,不妨说出名字。
显示更多
@46ge5 成名作caffe也是借鉴的他看过的一个闭源产品做的
我不是 Elon Musk 的粉丝什么的,但是我常常审视自身的“外插局限”。 每当我预测什么事情的上下限的时候,我就先阅读一遍当年那个号称卫星专家写的“为什么 Starlink 不可能实现” 的帖子 ----- 每颗 Tintin 卫星(Starlink 星座的演示卫星)重 400kg。假设每颗卫星加燃料(并且重量不会因为其他原因增加)是 1kg,那么单次 F9 在每个倾角轨道上可以发射 22 颗(整流罩里大概率根本塞不下这么多,但我们先忽略)。所需的一次性 F9 发射总数是 546 次;假设第一颗在 2020 年上线,而整个星座到 2025 年完成(官方说法是“2020 年代中期”),那就需要每年 110 次 F9 发射。整个研发和部署的总成本据说是 100 亿美元。 SpaceX 目前只有一个能进行极轨发射的设施,SLC-4E(也许 Brownsville 可以,但从那里发射极轨会擦着墨西哥海岸线飞过去——我感觉他们不会太高兴……)。所以每个发射场一年要发射 54–55 次 F9。 我们来极其乐观一点。每颗卫星都用一次性的 Falcon Heavy 发射;每颗卫星都刚好是 400kg(不太可能,因为你需要载荷质量余量,而且更低的卫星轨道大概率还需要更多燃料);我们忽略每颗卫星是否真的塞得进整流罩;我们完全忽略发射倾角(以错误倾角发射,对一颗想变轨的卫星来说简直是地狱);也就是说每次发射 160 颗卫星(几乎肯定不可能,因为整流罩体积不够)。这样最少需要 75 次 FH 发射(几乎肯定不现实)。我们还假设它第一次发射是在 2019 年 1 月 1 日,并且最终完成日期定在 2027 年 12 月 30 日。这意味着每年要发射 8–9 次 FH。听起来很简单,对吧?但这已经比 SpaceX 目前每年从 SLC-4E 发射的次数高出大约 23%。它实际上必须把自己的极轨发射次数翻倍,而且这是绝对最低要求。这个“最低要求”几乎肯定在物理上就是不可能的。 我觉得造卫星不会是问题,Elon…… SpaceX 里居然没有人做过这种信封背面的粗算,然后问问 Elon——这是不是稍微有点太有野心了?
显示更多
其实Space X的市值上限也很低的。 SpaceX 的一个核心业务是Starlink。 2025的starlink 营收113亿美元。 ATT+Verizon+Tmobile+Comcast一起的市值是加起来6000亿美元左右。 但是 这四家的revenue加起来是 1380+1250+ 1210+883= 4723亿美元。 starlink的营收和这些大哥比起来,一个零头都不到。 那么现在的卫星业务能不能替代ATT+Verizon+TMobile+Comcast吗? 星链业务加起来能占整个connection 市场业务10%就了不起了。 本来这种卫星业务就是一个现有通信系统的补充。 太空数据中心,不就是PPT么。 这不叫市盈率,这叫市梦率。 老马不是神仙,XAI搞了那么大阵仗,结果呢? 沦落到出租数据中心给别人用。 高估值还需要靠跟google的关联交易。
显示更多