9 月 24 日CPU

环节

CPU

数据中心主机 CPU,AI 机柜里跟 GPU 配套的那颗

带到 ChatGPT带走
更多

比上次:多了 1 件,有变化 2

在跟的事 · 3 件最新说法
有变化推理机柜该加主机CPU还是旁路CPU内存
证据范围不同(定量 / 定性)· 无法比较
有变化智能体机柜卡点在主机CPU还是网络调度
证据范围不同(定量 / 定性)· 无法比较
Ben Bajarin9/4
推理时CPU会卡住GPU;配比或仅4:1且晶圆不足𝕏
新增智能体沙箱主机CPU利用率卡在哪一档

另有 2 件未展开

有变化推理机柜该加主机CPU还是旁路CPU内存

何时见分晓:本季机柜配比观测
AMDAstera Labs 说法不一
AMD · 8月22日
GPU生成token越多越需CPU资源,CPU与GPU配比随能力演变
Astera Labs · 9月17日
KV cache溢入CPU RAM则GPU空转;Leo称首token快62%

AMD · 8月22日 AMD 称 GPU 生成 token 越多越需 CPU 资源,CPU 与 GPU 配比随 GPU 能力增长而演变𝕏

Astera Labs · 9月17日 Astera Labs 称 Leo X-Series + Scorpio 为 KV cache 提供独立通道,首 token 时间快 62%、每秒 token 数多 22%𝕏

Astera Labs · 9月15日 Astera Labs 的 Leo 智能内存控制器已向多家超大规模客户送样,并与 CPU、GPU、内存厂商合作𝕏

Ben Bajarin · 9月4日 Ben Bajarin:推理场景 CPU 瓶颈被低估,需更多 CPU𝕏

Ben Bajarin · 9月16日 Ben Bajarin:Leo X-series 让 GPU 绕过 CPU 内存子系统直连更多内存,PCIe 可选性成设计变量𝕏

AMD · 9月22日 AMD 称第 6 代 EPYC「Venice」支持 agentic AI 从延迟敏感任务到高吞吐的多样性能需求𝕏

Ben Bajarin · 9月23日 Ben Bajarin:CXL 放量在缓解内存墙的同时会带来更多 CPU 需求,因为二者都是规模化推理的服务方案𝕏

有变化智能体机柜卡点在主机CPU还是网络调度

何时见分晓:超大规模调度披露
Gavin BakerBen Bajarin 说法不一
Gavin Baker · 8月24日
AFFN解聚是圣杯但网络难,需调度Agent CPU与GPU Prefill
Ben Bajarin · 9月4日
推理时CPU会卡住GPU;配比或仅4:1且晶圆不足

Gavin Baker · 8月24日 Gavin Baker:AFFN 解聚是圣杯,但网络是难题;Pareto 最优需调度优化 Agent CPU 控制、工具调用、GPU Prefill 与 ASIC FFN 解码,AWS 已准备好,其他超大规模厂商落后𝕏

Ben Bajarin · 9月4日 Ben Bajarin:推理场景 CPU 瓶颈被低估,需更多 CPU𝕏

Ben Bajarin · 9月20日 Ben Bajarin:agentic CPU 与 GPU 比例不会到 40:1,按 agentic 负载建模或为 4:1,且晶圆产能长期不足𝕏

Ben Bajarin · 9月23日 Ben Bajarin 在 CS Atlas 发布新笔记,详述 CPU+GPU+内存+互连(scale up 域)服务大规模推理所需的工作流示例及各自对执行负载的限制𝕏

新增智能体沙箱主机CPU利用率卡在哪一档

何时见分晓:沙箱CPU利用率观测
只有 Teortaxes 一方说法
Teortaxes · 9月23日
典型沙箱约5%CPU;DSec每核12.6并发仅达上限25–30%

我们只标出对不上的地方,不下结论。出处是中文摘要。由模型梳理后经引用校验,未逐条人工复核。

这页的完整内容订阅后可见。去订阅

每早一封:昨夜到今晨新增的几件事,每件一行,点开回站点看完整。
HOURAHEAD关于 · 往期 · 2026-09-24 12:04