注册并分享邀请链接,可获得视频播放与邀请奖励。

Gorden Sun (@Gorden_Sun) “谷歌开源TPU Raiden 大模型推理常把prefill(预填充)和decode(解码)拆成两组独立实” — TopicDigg

Gorden Sun 的个人资料封面
Gorden Sun 的头像
Gorden Sun
@Gorden_Sun
加入 August 2013
0 正在关注    0 粉丝
谷歌开源TPU Raiden 大模型推理常把prefill(预填充)和decode(解码)拆成两组独立实例部署,但拆开后KVCache怎么从prefill搬到decode,在GPU阵营有NVIDIA开源的NIXL把这层传输标准化,TPU阵营此前一直没有对应方案。 现在谷歌开源了Raiden,你在TPU上部署分离式推理架构时,不用再自己写KVCache搬运的底层代码,可以直接调用现有方法。 方向很好,但是项目现在非常早期,仓库里也明确写了存在不稳定的情况。 Github:
显示更多