9 月 24 日GPT-5.6 Sol

已见于 8 月 26 日早间

先看结论

GPT-5.6 Sol、Terra、Luna 上线 AWS Kiro,Terra 在 Terminal-Bench 2.1 任务成本降约 82%

Gavin Baker 推测其 Ultrafast 模式或成默认,Cerebras 托管可达 750 tokens/s

这些标记是什么意思

疑似或传闻 当事方还没回应迹象指向 依据接口、代码提交等公开痕迹作出的推断转述 二手说法,不是原话

当前状态进行中 · 转述
还没解决的「框架」会不会被模型原生能力吸收掉?谁在真正跑生产级多步 agent,谁还在 demo?可靠性的硬瓶颈(上下文 / 工具调用)在哪一层?自研推理硅有没有形成可核对的第三套账?哪几家已经从样品走到可部署机柜?外卡采购被定制硅替掉了多少?$/百万 token 还能往下走几个数量级?降价是不是被「转嫁给长上下文」抵消?推理降本对应用层(agent)的放量拐点在哪?

模型

GPT-5.6 Sol

OpenAI GPT-5.6 系列 Sol、Terra、Luna 接入 AWS Kiro

Gavin Baker 推测其 Ultrafast 模式或成默认,Cerebras 托管可达 750 tokens/s

看什么现在的情况依据
独立榜Prime Intellect 关网实验:GPT-5.6 Sol Pro 从远程 git 仓库恢复 flag
性价比AWS 联合测试称 Terra 在 Kiro 中将 Terminal-Bench 2.1 成功任务成本降低约 82%
便宜档Cerebras 托管的 Ultrafast 模式可达 750 tokens/s
任务成本与 AWS 的联合测试称 Terra 将 Kiro 中 Terminal-Bench 2.1 成功任务成本降低约 82%
可靠性
中文
写仓库无法比较Prime Intellect 关网实验中,Sol Pro 从仅在远端的 git 仓库恢复了 flag,仅为单次实验
办公活
攻防无法比较断网隔离下仍从远程仓库取回数据,实验方称结果出乎意料

各方4 人

Prime Intellect实验设置为关掉网络访问、让模型从仅在远端的 git 仓库恢复 flag,GPT-5.6 Sol Pro 意外成功𝕏

biasedweights解读他指出 256GB Mac Studio 能跑一些不错的开源模型,但跑不动 GPT-5.6-sol 这一级的前沿模型𝕏

Gavin Baker解读他把 GPT-5.6 Sol 称为第二大前沿实验室的旗舰大模型𝕏

abugiza_转述成本数据来自 OpenAI 与 AWS 的联合测试,目前状态为已上线𝕏

每早一封:昨夜到今晨新增的几件事,每件一行,点开回站点看完整。
HOURAHEAD关于 · 往期 · 2026-09-24 12:05