9 月 3 日晚间版
今日要闻
Muse Spark 1.3 每任务成本 $0.55,居同智能档最低
Alexandr Wang: 在 Muse Code 内推广试用,宣称前沿模型成本降低 100 倍𝕏
认为该模型并未刷榜:智能且具自我意识,成本低于涨价前的 DeepSeek𝕏
称前沿阵营从两家扩为 Claude、ChatGPT、Grok、Muse 四家,Gemini 落在后面𝕏
Claude Fable 5.1 三天内二度调价,统一费率后每任务成本增 20%
teortaxes 实测: Fable 5.1 (high) 在 WeridML 得 92.3%,基准接近饱和,对较弱模型仍有区分度𝕏
Miles Brundage 实测: 评测里省 token 不等于默认省:默认工作流似乎会多产出数百万 token𝕏
Machine Learning Street Talk 分析: 重度使用下每小时成本可达数百美元𝕏
K2 Horizon 375B A23B 智能指数 47,较前代提升 30 分
Artificial Analysis 实测: 出品方为阿联酋 MBZUAI,代理任务表现相对其智能水平偏强𝕏
宁可拒答不硬猜:只作答 40% 的 AA-Omniscience 问题,幻觉率 26% 处低位,准确率 18% 与前代持平𝕏
代理任务强于同档:GDPval-AA Elo 1430,领先 MiniMax-M3 等相近智能水平模型𝕏
关注后可跟此人更新与他说过的话,需用手机号登录