注册并分享邀请链接,可获得视频播放与邀请奖励。

熊师傅 weight decay 了吗 的个人资料封面
熊师傅 weight decay 了吗 的头像

熊师傅 weight decay 了吗 (@bigeagle_xd)

@bigeagle_xd
a person living with @mianmoe, opinions are my own
1.2K 正在关注    8.7K 粉丝
我确实是早知道模型会越来越大呀,但不妨碍我买的存储都亏完了…… 😭😭
开源模型的参数规模迅速膨胀,性能也在逼近甚至追平闭源frontier model。K2(1T)到DeepSeek V4 Pro(1.6T)再到K3(2.8T),间隔不到12个月。K3在独立评测中已经能对标Claude Fable 5,企业拿开源模型做私有化部署,不再是性能上的妥协,而是成本和隐私上的优选。 当这类万亿级MoE模型真正落地部署,硬件侧的瓶颈就不在算力了,而在内存容量、数据格式(FP4)、以及scale-up域内的低延时高带宽互联。 K3总参2.8T,FP4量化后权重约1.4TB,每个token只激活896个专家中的16个,计算量不大,但专家路由要求全部权重可访问,GPU大部分时间在等内存读取,不是在算。FP4不再是可选的精度降级,而是架构级的刚需,推理芯片如果不在硬件层原生支持FP4,基本没法跑这个体量的模型。 MoE模型的推理通常采用专家并行(EP),每个token的expert routing都需要跨卡通信完成分发和结果聚合。scale-up域内的低延时高带宽互联质量,直接影响用户端的token rate和系统的总吞吐。参数规模越大,需要装进同一个低延时域的权重越多,scale-up域也必须跟着扩大。 关于scale-up域内的具体方案,我在之前”把一万块芯片变成一台计算机”的三篇推文里详细讨论过,这里不再展开。 另一个被拉动的环节是CXL。MoE模型98%以上的专家权重在任意时刻是冷的,纯靠HBM装太贵。把冷专家放CXL-attached DDR5,热专家留HBM,做分层调度,理论上成本可以大幅下降。再往下一层,把更冷的权重卸载到高速SSD也在成为可行的路径,学术界和工业界都已经有MoE专家分层加载的方案在验证。未来大概率是HBM放热专家,CXL DRAM放温专家,SSD放冷专家,形成多级内存层次。Astera Labs和澜起在CXL控制器芯片上的卡位已经很清楚了,一个吃全球hyperscaler,一个吃中国本土供应链。 开源模型的参数规模没有放缓的迹象,scale-up域必须跟着扩大。更大的scale-up域意味着更多的HBM容量、更大的先进封装面积、更多的高速光互联和铜互联、更多的CXL内存扩展、以及更多的retimer。这条需求链条会随着每一代开源模型的参数膨胀持续拉长。 除了上边聊到的,还哪些受益环节?大家可以一起聊聊。
显示更多
0
13
65
0
转发到社区
K3 发布前两天内部 vibe 出来的 win xp 模拟器,功能相当完整,有“千千静听”可以听歌,有“QQ2005”可以聊天,朋友们会在你的QQ空间里聊超女,新浪首页在报道神州6号…… 在内部传开的那个下午,站起身来,发现一半的同事都在用 XP,瞬间有一些恍惚,此情此景,仿佛回到了学校的微机课,又像是当年的网吧。我回想起 20 年前中考后的夏天,每天在家听着《宁夏》和《突然很安静》,在不舍得开空调的炎热的下午,在家里的老电脑上刷冒险岛…… 20 年弹指一挥间,感谢 K3,能在这个剧变的时代,让我怀念一下年轻的自己。
显示更多
0
19
126
11
转发到社区