9 月 24 日智谱 GLM-5.3-Flash

已见于 9 月 3 日午间

先看结论

GLM-5.3-Flash 3-bit 量化权重约 156GB,128GB Mac Studio 跑不动

官方 100M 免费 token 已到账,实测用户反映模型可用但速度很慢

这些标记是什么意思

疑似或传闻 当事方还没回应迹象指向 依据接口、代码提交等公开痕迹作出的推断转述 二手说法,不是原话

当前状态进行中 · 转述

模型

智谱 GLM-5.3-Flash

本地部署按 166GB 级内存门槛备机,走 API 且在意服务成本的团队可把它列入默认档候选

GLM-5.3-Flash 发布:MIT 许可,320B 总参 / 18B 激活 MoE,原生多模态、1M 上下文,输入 15c、输出 50c 每百万 token

官方 100M 免费 token 已到账,实测用户反映模型可用但速度很慢

看什么现在的情况依据
独立榜Artificial Analysis 智能指数 57
性价比Agent Arena 每任务 $0.12,站上 Pareto 前沿
便宜档输入 15c、输出 50c 每百万 token,Agent Arena 每任务 $0.12
任务成本Together 级联实测 $1.70/任务、80.9% 准确率,比 GLM-5.3 便宜 17 倍
可靠性无法比较DeepSWE 初报 80 终值 63,噪声偏大;多名用户反映速度慢
中文智谱 GLM 系列,中文社区大规模实测与讨论
写仓库用户实测连续运行 9 至 64 小时改进应用,并自主 12 小时搭出 Blender 演示
办公活GDPval-AA v2 得分 1770,与 GLM-5.3 (max) 的 1766 持平
攻防

各方3 人

studymarketsai分析「128GB 上跑 3-bit」宣称背后的两笔账:加 8k 上下文和运行开销总需求约 166GB,卸载到内存外后约 1 tok/s𝕏

teortaxes分析拆出 12,096 个专家单元(42 层 × 288 专家),带每层 1,259 万 token 算出的 REAP 重要度,可按 14 个领域切片分析𝕏

Dtouer1解读认为它在同规模模型中领先,适合在意服务成本的团队,并给出与 Qwen、DeepSeek 的对比𝕏

每早一封:昨夜到今晨新增的几件事,每件一行,点开回站点看完整。
HOURAHEAD关于 · 往期 · 2026-09-24 11:13