Patrick Moorhead 用 Fable 5.1 评估 Dario 放缓前沿文章,指出承诺不可测量:只承诺接待评估者,没有"更慢"的指标𝕏
Patrick Moorhead9 月 24 日Artificial Analysis:Devin Fusion CLI 搭配 Claude Fable 5.1(xhigh)加 SWE-2(medium)在 Coding Agent Index 得 61.7
Artificial Analysis:Devin Fusion CLI 搭配 Claude Fable 5.1(xhigh)加 SWE-2(medium)在 Coding Agent Index 得 61.7
疑似或传闻 当事方还没回应迹象指向 依据接口、代码提交等公开痕迹作出的推断转述 二手说法,不是原话
事件
| 看什么 | 现在的情况 | 依据 |
|---|---|---|
| 官方 | 尚未表态 |
Artificial Analysis实测两套配置都落在 Coding Agent Index 分数对单任务成本的 Pareto 前沿上𝕏
Teortaxes实测V4.1 在 JS 上达 81.8%;TypeScript 上与 Fable 5.1、Muse Spark 1.3 并列 60%,他判断 TS 分数已经饱和𝕏
Jerry Liu解读他判断 Astra 与 Fable 5.1 的输出要么太冗长、要么堆砌信息密度,瓶颈在读者自己消化信息的能力𝕏
产业解读
这不是投资建议。
Taelin 称 Fable 5.1 与 Astra 6 因网络安全拒答无法审计 Bend,质疑攻击者可轻易绕过𝕏
更早
Patrick Moorhead 用 Fable 5.1 评估 Dario 放缓前沿文章,指出承诺不可测量:只承诺接待评估者,没有"更慢"的指标𝕏
Patrick MoorheadTeortaxes 指出 V4.1 在 LiveBench 排第 5,Agentic Coding 第 1,领先 Fable 5.1 与 Astra𝕏
TeortaxesMax For AI 判断 K3-flash 命名不成立,因该模型疑似并非基于 K3𝕏
Max For AITeortaxes 判断 DeepSeek V4.1 论文显示其研究目标是无缝持续的能力累积,所有历史算力都作为教师𝕏
TeortaxesTeortaxes 判断 DeepSeek V4.1 论文可进 DeepSeek 前五,像教科书般克制自信𝕏
TeortaxesTeortaxes 判断 DeepSeek V4.1 全面抛弃 V4 的拼凑设计,弃用 HCA、泛化 CSA、取消稀疏注意力 warmup、改用更简单的单遍 mHC𝕏
Teortaxes关注后可跟此人更新与他说过的话,需用手机号登录