9 月 24 日Kimi K3 在 TPUv7 上经 megakernel 优化跑到 700 tok/s/用户,比 GB200 NVL72 高 56%

话题 · 硬件/算力

先看结论

Kimi K3 在 TPUv7 上经 megakernel 优化跑到 700 tok/s/用户,比 GB200 NVL72 高 56%

该 megakernel 由 inferact 团队开源,K3 全部 92 个 MoE 层合进单个 Pallas kernel 里跑

这些标记是什么意思

疑似或传闻 当事方还没回应迹象指向 依据接口、代码提交等公开痕迹作出的推断转述 二手说法,不是原话

最新进展SemiAnalysis 称 vLLM 维护者展示 TPUv7 经 megakernel 优化在 Kimi K3 上达 700 tok/s/user,比 NVIDIA GB200 NVL72 高 56%
当前状态未定稿 · 转述

供给

inferact 开源 Kimi K3 的 TPU megakernel,低并发解码 709 tokens/s,GB200 基线 450 tokens/s

看什么现在的情况依据
事实K3 全部 92 个 MoE 层合进单个 Pallas kernel 里跑
后果低并发场景多了一个 GB200 之外的已开源可自测选项
官方尚未表态

各方2 人

vLLM转述inferact 团队开源的内核在低并发解码下做到 709 tokens/s,对照的 GB200 基线为 450 tokens/s𝕏

SemiAnalysis转述SemiAnalysis 称这一结果来自 vLLM 维护者刚刚展示的演示𝕏

产业解读

关键数字700 tok/s/用户对 GB200 NVL72 高 56%;底层数字 709 对 450 tokens/s
时间点演示与开源均在约 6-7 小时前发生
谁会受影响GB200 NVL72 的推理性能叙事被 TPUv7 单点挑战;能用 TPU 的推理部署方多一条路径

这不是投资建议。

每早一封:昨夜到今晨新增的几件事,每件一行,点开回站点看完整。
HOURAHEAD关于 · 往期 · 2026-09-24 11:16