9 月 24 日Claude Fable 5.1
Claude Fable 5.1 在 Perplexity WANDR 被 GPT-6 Astra 压过:得分低 13.5%,Astra 每任务便宜 6.1%
MGallmur:不做实际交付的 agent 工具
疑似或传闻 当事方还没回应迹象指向 依据接口、代码提交等公开痕迹作出的推断转述 二手说法,不是原话
模型
WANDR 与 AA 综合分排序不一致,改默认档前用自家 agent 任务复测单任务成本,不要只看一把尺子
Anthropic 发布 Claude Fable 5.1 与 Mythos 5.1,官方称其为最先进编码与知识工作模型,缓存读取价降 75%
MGallmur:不做实际交付的 agent 工具
| 看什么 | 现在的情况 | 依据 |
|---|---|---|
| 独立榜 | AA Intelligence Index 66(max 档),Opus 5 为 63 | |
| 性价比 | Pareto 前沿:62.5 分 · $1.43/task,取代 Opus 5 的 62.5 分 · $1.8 | |
| 便宜档 | 无法比较 | 低推理档 $0.7736/task 进入第三条 Pareto 前沿 |
| 任务成本 | 无法比较 | 高推理档进入 Pareto 前沿,但 AA 称其为 Index≥25 模型中输出 token 最多的两个之一,五个档位 token 量从 13.1M 到 143.7M |
| 可靠性 | 无法比较 | Box 实测企业非结构化数据任务较 Fable 5 提升 7 个百分点;Patrick Moorhead 称工具调用仍易失败 |
| 中文 | ||
| 写仓库 | 强 | Terminal-Bench-Science 0.1 得分 52.6%(上代 24.7%),Terminal-Bench 4.0 得分 55.8% |
| 办公活 | 无法比较 | GDPval-AA v2 以 1853 Elo 领先 Opus 5 的 1824,置信区间重叠 |
| 攻防 | 无法比较 | 官方称一天内解开 370 年未解密码 Cyphral Distich |
关注后可跟此人更新与他说过的话,需用手机号登录