注册并分享邀请链接,可获得视频播放与邀请奖励。

思维怪怪 (@0xLogicrw) “AI 云服务商 Zyphra 发布了首份基于 AMD 旗舰芯片 MI355X 的端到端大模型推理实测。测” — TopicDigg

思维怪怪 的个人资料封面
思维怪怪 的头像
思维怪怪
@0xLogicrw
写关于 AI 的一切 Shit Post AI 信息流:
加入 May 2018
2.4K 正在关注    6.1K 粉丝
AI 云服务商 Zyphra 发布了首份基于 AMD 旗舰芯片 MI355X 的端到端大模型推理实测。测试在真实单节点环境下运行了 DeepSeek V3.2、Kimi K2.6 与 GLM-5.1,并直接对标 NVIDIA B200。 实测揭示了两款芯片最核心的物理差异。AMD 的杀手锏是 288GB 的海量显存,远超 B200 的 180GB。这让它在处理超长文本时,单卡就能塞下更多缓存,直接省下了拆卡并行的硬件成本。但在芯片间互联上 AMD 处于劣势。B200 靠 NVLink 交换机能让任意双卡跑满 900GB/s 带宽;而 MI355X 采用点对点直连,卡与卡之间的通信效率大打折扣。 为了填补硬件互联上的短板,Zyphra 开发了张量序列并行 (TSP) 与树状注意力 (Tree Attention) 算法。团队用树状通信取代了传统的环形网络,把解码阶段的计算和数据传输完全折叠在一起,强行用算法弥补了 AMD 硬件在点对点互联上的缺陷。 最终的成绩单明确了现阶段的排位:在单请求绝对速度上,NVIDIA B200 依然全面领跑。但在长文本场景下,随着上下文拉长,Zyphra 推理栈的吞吐量快速逼近 B200。这证明只要底层软件栈优化得当,AMD 完全能依靠大显存红利,在长文本生产环境中与 NVIDIA 旗舰正面抗衡。 下一步,Zyphra 计划利用这套架构支持 1.6 万亿参数的 DeepSeek V4 Pro,并将上下文拉升至 100 万 token。团队后续还将针对 MI355X 开发专属的低精度量化方案,并引入全新的扩散投机采样模型,进一步挖掘这块芯片的算力潜能。
显示更多
We're publishing our first end-to-end benchmarks for Zyphra Inference on @AMD Instinct MI355X. Our inference optimizations strongly outperform the AMD baseline and narrows the gap between MI355X and B200 for serving Kimi K2.6, GLM 5.1, and DeepSeek V3.2 🧵
显示更多