9 月 4 日晚间版
今日要闻
Claude Fable 5.1 被 Muse Spark 1.3 追近:CS 基准结果接近,单次成本 $1.75
iasg1004 实测: AA 分档评测确认 Fable 5.1 max 档每任务成本较 Fable 5 高 20%𝕏
Alexandr Wang 实测: 他还让 Fable 5.1 与 Muse Spark 1.3 各自用 Three.js 生成宝马 S1000RR 摩托的 3D 模型做对比𝕏
RouterHub 分析: 建议别用通用聊天提示测 Fable 5.1,改用仓库级工程任务、长工具流或重文档分析,并追踪完成率与出错恢复𝕏
GPT-6 Astra 疑似已切入 ChatGPT 网页版(指纹未证实),OpenAI 为无访问的付费用户每日补发一次重置额度
teortaxes 分析: 切换判断的依据是使用体感:近期输出异常地不像蒸馏版本,未附跑分𝕏
TestingCatalog 转述: OpenAI 官方口径:FrontierMath Tier 4 达 98%,ARC-AGI-3 标准 harness 63%、连续对话 harness 99.9%𝕏
teortaxes:GPT-6 Astra 交互推理已超人类——能为 5 分钟的一次性任务即时造 DSL
vinhnx 实测: 复测口径 57.9%,仍高于 GPT-5.6 Sol2 的 37.3% 与 Claude Fable 5.1 的 55.8%,成本分别低约 9% 与 63%𝕏
teortaxes 分析: 他强调这只是狭窄面向的超人类:人类能发展数学直觉,但不会为一次性短任务即时创造 DSL𝕏
Machine Learning Street Talk 转述: ARC 团队称 Astra 在交互推理问题上是阶跃式变化,标准 harness 得分 66%𝕏
关注后可跟此人更新与他说过的话,需用手机号登录