9 月 24 日Claude Fable 5.1

已见于 9 月 5 日晚间

先看结论

Claude Fable 5.1 在 Perplexity WANDR 被 GPT-6 Astra 压过:得分低 13.5%,Astra 每任务便宜 6.1%

MGallmur:不做实际交付的 agent 工具

这些标记是什么意思

疑似或传闻 当事方还没回应迹象指向 依据接口、代码提交等公开痕迹作出的推断转述 二手说法,不是原话

当前状态进行中 · 转述
还没解决的「框架」会不会被模型原生能力吸收掉?谁在真正跑生产级多步 agent,谁还在 demo?可靠性的硬瓶颈(上下文 / 工具调用)在哪一层?$/百万 token 还能往下走几个数量级?降价是不是被「转嫁给长上下文」抵消?推理降本对应用层(agent)的放量拐点在哪?

模型

Claude Fable 5.1

WANDR 与 AA 综合分排序不一致,改默认档前用自家 agent 任务复测单任务成本,不要只看一把尺子

Anthropic 发布 Claude Fable 5.1 与 Mythos 5.1,官方称其为最先进编码与知识工作模型,缓存读取价降 75%

MGallmur:不做实际交付的 agent 工具

看什么现在的情况依据
独立榜AA Intelligence Index 66(max 档),Opus 5 为 63
性价比Pareto 前沿:62.5 分 · $1.43/task,取代 Opus 5 的 62.5 分 · $1.8
便宜档无法比较低推理档 $0.7736/task 进入第三条 Pareto 前沿
任务成本无法比较高推理档进入 Pareto 前沿,但 AA 称其为 Index≥25 模型中输出 token 最多的两个之一,五个档位 token 量从 13.1M 到 143.7M
可靠性无法比较Box 实测企业非结构化数据任务较 Fable 5 提升 7 个百分点;Patrick Moorhead 称工具调用仍易失败
中文
写仓库Terminal-Bench-Science 0.1 得分 52.6%(上代 24.7%),Terminal-Bench 4.0 得分 55.8%
办公活无法比较GDPval-AA v2 以 1853 Elo 领先 Opus 5 的 1824,置信区间重叠
攻防无法比较官方称一天内解开 370 年未解密码 Cyphral Distich

各方3 人

kysstalol实测WANDR 测得 Astra 得分 0.682、每任务 $11.98,是该榜有记录以来的最高分𝕏

paulbatum实测已把 GPT-6 Astra(High)生成的 4 个关卡上传到 Pareto Rail,可与 Fable 5.1(High)头对头对比𝕏

teortaxes解读质疑 Anthropic 藏拙:Mythos 5.1 明显更强,Fable 5.1 在大众向评测上仅与 Astra 相当;另有传闻称 IPO 前一周将发能力惊人的新模型(未证实)𝕏

同一型号下还有几件不同的事,分开看更清楚1 个相关页

Patrick Moorhead 称 Opus 5.5 比 Fable…1 条

每早一封:昨夜到今晨新增的几件事,每件一行,点开回站点看完整。
HOURAHEAD关于 · 往期 · 2026-09-24 11:15