新当事方Cursor 上线 Claude Opus 5.5,CursorBench 达 57.8%(Max),每任务成本比 Opus 5 低 40%𝕏
Cursor9 月 24 日Claude Opus 5.5、GPT-6 Sol/Luna 与 MiMo-V2.6-Pro 同周把智能-成本 Pareto 前沿整体外推
Claude Opus 5.5、GPT-6 Sol/Luna 与 MiMo-V2.6-Pro 同周把智能-成本 Pareto 前沿整体外推
写作榜实测给 Opus 5.5 打出 2631 Elo 登顶,被引用的评测者称分数高到一度怀疑是 bug
疑似或传闻 当事方还没回应迹象指向 依据接口、代码提交等公开痕迹作出的推断转述 二手说法,不是原话
事件
| 看什么 | 现在的情况 | 依据 |
|---|---|---|
| 事实 | 写作榜实测给 Opus 5.5 打出 2631 Elo 登顶,被引用的评测者称分数高到一度怀疑是 bug | |
| 后果 | Cursor 已上线 Opus 5.5:每任务成本比 Opus 5 低 40%,代码任务可直接换档试 | |
| 官方 | 尚未表态 |
Artificial Analysis实测榜单方把四个新模型放进同一张 Intelligence Index 对每任务成本的图里比较,前沿由它们共同建立𝕏
Taelin分析他在找 Opus 5.5 的长上下文推理基准,想确定模型开始掉 IQ 之前能撑住的实际上下文长度𝕏
Teortaxes解读他认为 Anthropic 一直有能力修复旧问题却没做,只是这次没人在意到拦下 5.5𝕏
Nathan Labenz转述Prakash 称 GPT-6 Sol、Luna 与 Opus 5.5 同日发布,就是所谓压着前沿节奏走𝕏
产业解读
这不是投资建议。
昨天
新当事方Cursor 上线 Claude Opus 5.5,CursorBench 达 57.8%(Max),每任务成本比 Opus 5 低 40%𝕏
Cursor今天
Ian Cutress 转述 Arm Izanagi XPU 1 规格:TSMC N2 on N3、5.5x reticle、120mm x 125mm 封装、HBM4𝕏
Ian Cutress昨天
Max For AI 称该文本由 Opus 5.5 写成,偶尔出现 GPT 口癖𝕏
Max For AITaelin 猜测 Anthropic 内部用更强模型,导致没意识到 Opus 5.5 其实很好𝕏
TaelinMLST 称 Astra 低推理档 3 小时耗尽周订阅额度,Opus 5.5 因此更实用𝕏
Machine Learning Street Talketc. [引用] Claude Opus 5.5 drew every frame of this animation in JavaScript. Everyone in town sends Claude their requests𝕏
Miles BrundageElvis Saravia 判断 Opus 5.5 更像 Opus 4.5,写作明显变好且 Claudese 味基本消失𝕏
Elvis SaraviaSimon Willison 撰文对比 Claude Opus 5.5、GPT-6 Sol 与 GPT-6 Luna,并附各模型家族不同推理级别的 pelican 对比图𝕏
Simon WillisonArtificial Analysis:Claude Opus 5.5 (max) 每 Intelligence Index task 成本 $5.98,与 Opus 5 (max) 的 $5.86 相近,但 token 用量增加约 80%𝕏
Artificial AnalysisJerry Liu:Opus 5.5 在 ParseBench 表格解析得 93.9%,比 Opus 5 高 7%+,仍弱于图表𝕏
Jerry LiuTestingCatalog 转述 AI/ML API 团队对 Claude Opus 5.5 与 GPT-6 Sol 的一次性 3D 场景生成对比测试𝕏
TestingCatalogElvis Saravia 分享 Anthropic 提示词,用于 Opus 5.5 在 Claude Code 长任务中避免提前停下汇报𝕏
Elvis SaraviaTeortaxes 称 Opus 5.5 是首个由 RSI 训练、并从 Anthropic 内部教师模型蒸馏的模型(Model-2)𝕏
TeortaxesTestingCatalog:Claude 网页版与桌面版上线 Banked usage limit reset 按钮,供用户探索 Opus 5.5𝕏
TestingCatalogJerry Liu 用 Opus 5.5 制作 DocJev 宣传视频𝕏
Jerry LiuJerry Liu 称用 Claude Code Opus 5.5 直接跑出该视频𝕏
Jerry LiuAaron Levie:Opus 5.5 降价叠加 GPT-6 Sol 与 Luna token 价格降 50%,AI 每任务成本下降速度前所未见𝕏
Aaron LevieTeortaxes 判断 GPT-6 Sol 与 Luna 更便宜更好,疑似原生训练为 Astra 的从属模型,可能抵消 Opus 5.5 在成本与多智能体上的优势𝕏
TeortaxesTaelin 称在网站上也遇到 Opus 5.5 无法输出,疑似提示词触发截断或 ToS 拦截𝕏
TaelinTaelin 报告 Opus 5.5 API 疑似无法输出,报错指向 max_tokens 截断与 ToS 反逆向限制𝕏
TaelinTeortaxes 讽刺 Opus 新模型 token 消耗过高,称其是 token-gobbling monster(Intelligence Index)𝕏
TeortaxesNathan Lambert:Claude Opus 5.5 将首次在 kernel development 等前沿 LLM 开发能力上回退到较弱模型𝕏
Nathan LambertAaron Levie:Box 测试 Claude Opus 5.5,token 用量比 Opus 5 少 63%、成本低 42%𝕏
Aaron LevieCursor 上线 Claude Opus 5.5,CursorBench 达 57.8%(Max),每任务成本比 Opus 5 低 40%𝕏
CursorNathan Lambert 质疑 Opus 5.5 默认档位宣称的 frontier 结果与成本优势𝕏
Nathan LambertArtificial Analysis 发布 Claude Opus 5.5 在 Intelligence Index 各推理档位的分项评测𝕏
Artificial AnalysisArtificial Analysis:Claude Opus 5.5 五个 effort level 中四个(max、xhigh、high、medium)位于 Intelligence vs Cost per Task 的 Pareto𝕏
Artificial AnalysisClaude Opus 5.5 登顶 Artificial Analysis Intelligence Index,并降价 20% 且加大缓存命中折扣(GPT-6)𝕏
Artificial Analysis关注后可跟此人更新与他说过的话,需用手机号登录