9 月 24 日Kimi K3 在 TPUv7 上经 megakernel 优化跑到 700 tok/s/用户,比 GB200 NVL72 高 56%
Kimi K3 在 TPUv7 上经 megakernel 优化跑到 700 tok/s/用户,比 GB200 NVL72 高 56%
该 megakernel 由 inferact 团队开源,K3 全部 92 个 MoE 层合进单个 Pallas kernel 里跑
疑似或传闻 当事方还没回应迹象指向 依据接口、代码提交等公开痕迹作出的推断转述 二手说法,不是原话
供给
| 看什么 | 现在的情况 | 依据 |
|---|---|---|
| 事实 | K3 全部 92 个 MoE 层合进单个 Pallas kernel 里跑 | |
| 后果 | 低并发场景多了一个 GB200 之外的已开源可自测选项 | |
| 官方 | 尚未表态 |
vLLM转述inferact 团队开源的内核在低并发解码下做到 709 tokens/s,对照的 GB200 基线为 450 tokens/s𝕏
SemiAnalysis转述SemiAnalysis 称这一结果来自 vLLM 维护者刚刚展示的演示𝕏
产业解读
这不是投资建议。
关注后可跟此人更新与他说过的话,需用手机号登录