注册并分享邀请链接,可获得视频播放与邀请奖励。

熊师傅 weight decay 了吗 (@bigeagle_xd) “我确实是早知道模型会越来越大呀,但不妨碍我买的存储都亏完了…… 😭😭” — TopicDigg

熊师傅 weight decay 了吗 的个人资料封面
熊师傅 weight decay 了吗 的头像
熊师傅 weight decay 了吗
@bigeagle_xd
a person living with @mianmoe, opinions are my own
加入 February 2010
1.2K 正在关注    8.7K 粉丝
我确实是早知道模型会越来越大呀,但不妨碍我买的存储都亏完了…… 😭😭
开源模型的参数规模迅速膨胀,性能也在逼近甚至追平闭源frontier model。K2(1T)到DeepSeek V4 Pro(1.6T)再到K3(2.8T),间隔不到12个月。K3在独立评测中已经能对标Claude Fable 5,企业拿开源模型做私有化部署,不再是性能上的妥协,而是成本和隐私上的优选。 当这类万亿级MoE模型真正落地部署,硬件侧的瓶颈就不在算力了,而在内存容量、数据格式(FP4)、以及scale-up域内的低延时高带宽互联。 K3总参2.8T,FP4量化后权重约1.4TB,每个token只激活896个专家中的16个,计算量不大,但专家路由要求全部权重可访问,GPU大部分时间在等内存读取,不是在算。FP4不再是可选的精度降级,而是架构级的刚需,推理芯片如果不在硬件层原生支持FP4,基本没法跑这个体量的模型。 MoE模型的推理通常采用专家并行(EP),每个token的expert routing都需要跨卡通信完成分发和结果聚合。scale-up域内的低延时高带宽互联质量,直接影响用户端的token rate和系统的总吞吐。参数规模越大,需要装进同一个低延时域的权重越多,scale-up域也必须跟着扩大。 关于scale-up域内的具体方案,我在之前”把一万块芯片变成一台计算机”的三篇推文里详细讨论过,这里不再展开。 另一个被拉动的环节是CXL。MoE模型98%以上的专家权重在任意时刻是冷的,纯靠HBM装太贵。把冷专家放CXL-attached DDR5,热专家留HBM,做分层调度,理论上成本可以大幅下降。再往下一层,把更冷的权重卸载到高速SSD也在成为可行的路径,学术界和工业界都已经有MoE专家分层加载的方案在验证。未来大概率是HBM放热专家,CXL DRAM放温专家,SSD放冷专家,形成多级内存层次。Astera Labs和澜起在CXL控制器芯片上的卡位已经很清楚了,一个吃全球hyperscaler,一个吃中国本土供应链。 开源模型的参数规模没有放缓的迹象,scale-up域必须跟着扩大。更大的scale-up域意味着更多的HBM容量、更大的先进封装面积、更多的高速光互联和铜互联、更多的CXL内存扩展、以及更多的retimer。这条需求链条会随着每一代开源模型的参数膨胀持续拉长。 除了上边聊到的,还哪些受益环节?大家可以一起聊聊。
显示更多
0
13
65
0
转发到社区