9 月 24 日推理成本

环节

推理成本

推理 $/百万 token 的成本曲线,agent 放量的前提

带到 ChatGPT带走
更多
关键数字
推理成本GLM-5.3-Flash;AA 公示官方 API 输入 0.15 / 输出 0.50 美元每百万 token,7:2:1 混合 0.10。河级口径取独立评测站混合价,不替代 zhipu_flagship_aa。上一行 note 被 shell 把美元符展开,以本行为准。0.1$/百万 token2026-09-10

比上次:多了 2 件,有变化 1,2 件没人再提

在跟的事 · 3 件最新说法
有变化账上0.1时百万token混合价是否还在降
新增token降价是否已让agent进得了生产
Machine Learning Street Talk9/18 token成本过高,agentic软件尚未进入生产𝕏
新增DeepSeek级缓存命中是否仍压着别人报价
Teortaxes9/20 仅DeepSeek能做到99%缓存命中,别人宣称即套壳𝕏

有变化账上0.1时百万token混合价是否还在降

何时见分晓:本月混合价与指数
智谱 Z.aiTestingCatalog 说法不一
智谱 Z.ai · 8月26日
GLM-5.3-Flash输入$0.15、输出$0.50/百万
TestingCatalog · 9月5日
转述:GPT-6 Astra输入$10/百万、输出$50/百万

新增token降价是否已让agent进得了生产

何时见分晓:本月生产部署观测
token成本过高,agentic软件尚未进入生产
Fireworks · 9月15日
帮juicebox年推理成本从$4M降至$800K

Machine Learning Street Talk · 9月18日 Machine Learning Street Talk:agentic software 因 token 成本过高尚未进入生产环境𝕏

Fireworks · 9月15日 Fireworks 称帮 juicebox_work 将推理延迟降 80%、年成本从 $4M 降至 $800K𝕏

Nathan Labenz · 9月11日 Nathan Labenz 访谈 Baseten CTO Amir Haghighat,讨论 GPT-6 Astra 后大规模 agent 推理成本与利润归属𝕏

新增DeepSeek级缓存命中是否仍压着别人报价

何时见分晓:本月缓存命中披露
只有 Teortaxes 一方说法
Teortaxes · 9月20日
仅DeepSeek能做到99%缓存命中,别人宣称即套壳

Teortaxes · 9月20日 Teortaxes:DeepSeek 推理成本优势来自已开源的缓存机制,其他厂商宣称 99% 缓存命中率实为套壳 DeepSeek𝕏

我们只标出对不上的地方,不下结论。出处是中文摘要。由模型梳理后经引用校验,未逐条人工复核。

这页的完整内容订阅后可见。去订阅

每早一封:昨夜到今晨新增的几件事,每件一行,点开回站点看完整。
HOURAHEAD关于 · 往期 · 2026-09-24 13:22