9 月 24 日GPT-6 Astra
GPT-6 Astra 登顶 WebDev Arena,领先 Claude Fable 5.1 35 分
同篇转述称其以 $40/百万 token 的输出价重塑 Pareto 前沿
疑似或传闻 当事方还没回应迹象指向 依据接口、代码提交等公开痕迹作出的推断转述 二手说法,不是原话
模型
账单按任务算与 GPT-5.6 Sol 接近,换不换默认档看单任务总成本,别看 token 单价
API 输入 $10/百万、输出 $50/百万 token,已向全部 Plus 和 Business 用户开放
同篇转述称其以 $40/百万 token 的输出价重塑 Pareto 前沿
| 看什么 | 现在的情况 | 依据 |
|---|---|---|
| 独立榜 | WebDev Arena 登顶,领先 Claude Fable 5.1 35 分(AA Intelligence Index 综合分未到) | |
| 性价比 | Artificial Analysis:每任务成本接近 GPT-5.6 Sol,token 效率高约 70% | |
| 便宜档 | 官方称强 | API 定价输入 $10/百万、输出 $50/百万 token,多名用户指其昂贵 |
| 任务成本 | 无法比较 | Artificial Analysis:每任务成本接近 GPT-5.6 Sol,token 效率高约 70% |
| 可靠性 | 强 | 系统卡称越狱、提示注入和工具操作较 GPT-5.6 Sol 大幅改善 |
| 中文 | 强 | Jerry Liu 的 ParseBench 基准:中文档解析 90.6% |
| 写仓库 | 强 | OSWorld 成绩高于 GPT-5.6 Sol,同时任务时间缩短约 47% |
| 办公活 | 强 | ParseBench 短文档解析 97.2% 达 SOTA |
| 攻防 | 强 | 首个达到 OpenAI 网络安全框架 Critical 阈值的模型,配套 10 亿美元 Daybreak 项目补贴 |
Elvis Saravia实测他让 Astra 在 Three.js 里做出一个 3D 相机模型,含 122 个组件组和 1877 个建模部件𝕏
Teortaxes分析他推断 Anthropic 最新风险报告未披露全部内部模型:Model 1、Model 2 和 Mythos 5.1 都太弱,达不到报告里出现的结果𝕏
关注后可跟此人更新与他说过的话,需用手机号登录