9 月 24 日Claude Opus 5

已见于 8 月 26 日晚间

先看结论

Claude Opus 5 指纹被指大量出现在其他中国模型中(未证实)

同一研究者此前评价 ProgramBench Vetted 榜单:0813 为最强开源模型,Opus 5 仍然领先

这些标记是什么意思

疑似或传闻 当事方还没回应迹象指向 依据接口、代码提交等公开痕迹作出的推断转述 二手说法,不是原话

当前状态进行中 · 转述
还没解决的「框架」会不会被模型原生能力吸收掉?谁在真正跑生产级多步 agent,谁还在 demo?可靠性的硬瓶颈(上下文 / 工具调用)在哪一层?$/百万 token 还能往下走几个数量级?降价是不是被「转嫁给长上下文」抵消?推理降本对应用层(agent)的放量拐点在哪?

模型

Claude Opus 5

Anthropic 承诺改进 Opus 5

同一研究者此前评价 ProgramBench Vetted 榜单:0813 为最强开源模型,Opus 5 仍然领先

看什么现在的情况依据
独立榜ProgramBench Vetted:Opus 5 仍领先最强开源模型 0813
性价比Glean 表上 67 分对应 $2.96/task,55 分的 GPT-5.6 Luna 只要 $0.08/task
便宜档官方称强Glean 工作流评测单任务 $2.96,同表 GPT-5.6 Luna 为 $0.08
任务成本官方称强智能体工作流单任务 $2.96,为 Glean 同表最贵的一档
可靠性
中文
写仓库无法比较在 ProgramBench Vetted 编程榜单上领先最强开源模型 0813
办公活Glean 工作流评分 67 分,为同表最高
攻防

各方2 人

teortaxes解读他解读该榜单的「almost」档:含义是任务至少通过 95% 的测试𝕏

MLBear2转述其早间汇总提到 Anthropic 承诺改进 Opus 5𝕏

同一型号下还有几件不同的事,分开看更清楚1 个相关页

Teortaxes 称 GPT-6 Astra 在 MuJoCo 相扑…7 条

每早一封:昨夜到今晨新增的几件事,每件一行,点开回站点看完整。
HOURAHEAD关于 · 往期 · 2026-09-24 11:15