9 月 24 日GPT-6 Astra

已见于 9 月 6 日晚间

先看结论

GPT-6 Astra 登顶 WebDev Arena,领先 Claude Fable 5.1 35 分

同篇转述称其以 $40/百万 token 的输出价重塑 Pareto 前沿

这些标记是什么意思

疑似或传闻 当事方还没回应迹象指向 依据接口、代码提交等公开痕迹作出的推断转述 二手说法,不是原话

当前状态进行中 · 转述
还没解决的「框架」会不会被模型原生能力吸收掉?谁在真正跑生产级多步 agent,谁还在 demo?可靠性的硬瓶颈(上下文 / 工具调用)在哪一层?自研推理硅有没有形成可核对的第三套账?哪几家已经从样品走到可部署机柜?外卡采购被定制硅替掉了多少?$/百万 token 还能往下走几个数量级?降价是不是被「转嫁给长上下文」抵消?推理降本对应用层(agent)的放量拐点在哪?

模型

GPT-6 Astra

账单按任务算与 GPT-5.6 Sol 接近,换不换默认档看单任务总成本,别看 token 单价

API 输入 $10/百万、输出 $50/百万 token,已向全部 Plus 和 Business 用户开放

同篇转述称其以 $40/百万 token 的输出价重塑 Pareto 前沿

看什么现在的情况依据
独立榜WebDev Arena 登顶,领先 Claude Fable 5.1 35 分(AA Intelligence Index 综合分未到)
性价比Artificial Analysis:每任务成本接近 GPT-5.6 Sol,token 效率高约 70%
便宜档官方称强API 定价输入 $10/百万、输出 $50/百万 token,多名用户指其昂贵
任务成本无法比较Artificial Analysis:每任务成本接近 GPT-5.6 Sol,token 效率高约 70%
可靠性系统卡称越狱、提示注入和工具操作较 GPT-5.6 Sol 大幅改善
中文Jerry Liu 的 ParseBench 基准:中文档解析 90.6%
写仓库OSWorld 成绩高于 GPT-5.6 Sol,同时任务时间缩短约 47%
办公活ParseBench 短文档解析 97.2% 达 SOTA
攻防首个达到 OpenAI 网络安全框架 Critical 阈值的模型,配套 10 亿美元 Daybreak 项目补贴

各方2 人

Elvis Saravia实测他让 Astra 在 Three.js 里做出一个 3D 相机模型,含 122 个组件组和 1877 个建模部件𝕏

Teortaxes分析他推断 Anthropic 最新风险报告未披露全部内部模型:Model 1、Model 2 和 Mythos 5.1 都太弱,达不到报告里出现的结果𝕏

同一型号下还有几件不同的事,分开看更清楚1 个相关页

Teortaxes 称 GPT-6 Astra 在 MuJoCo 相扑…7 条

每早一封:昨夜到今晨新增的几件事,每件一行,点开回站点看完整。
HOURAHEAD关于 · 往期 · 2026-09-24 12:07