9 月 24 日Grok 4.7 在独立安全场景子集上好过 4.6,但仍落后最先进水平

已见于 9 月 22 日午间

话题 · 模型产品

先看结论

Grok 4.7 在独立安全场景子集上好过 4.6,但仍落后最先进水平

Elon Musk 转引「90 天内从勉强前十到重回前沿前三」的说法并回复 True,xAI 自认此前 RL 过度惩罚响应长度,致模型对本可做对的难题过早放弃

这些标记是什么意思

疑似或传闻 当事方还没回应迹象指向 依据接口、代码提交等公开痕迹作出的推断转述 二手说法,不是原话

最新进展Musk 称 Grok 4.7 搭配 Build harness 是强力日常主力
当前状态未定稿 · 转述

事件

xAI 发布 Grok 4.7,称在困难任务上工作更久、更仔细自查并配备迄今最强安全防护

看什么现在的情况依据
事实Elon Musk 转引「90 天内从勉强前十到重回前沿前三」的说法并回复 True,xAI 自认此前 RL 过度惩罚响应长度,致模型对本可做对的难题过早放弃
后果对安全敏感的场景先不换默认档:独立子集测试显示它仍落后于最先进水平
官方Elon Musk

各方3 人

Elon Musk他转引一条回顾 Grok 近 90 天从「勉强前十」到「大幅回归」再到「进入前沿前三」的帖子并回复 True𝕏

Miles Brundage实测结论基于他跨模型复用的一组 Petri 安全场景子集,只覆盖部分安全场景,并非完整安全评测𝕏

Teortaxes分析他转述 xAI 自认 RL 可能过度惩罚响应长度、导致模型过早放弃难题,官方解法是 xhigh 档配 Grok Build,并补一句「到现在还是没写出代码」𝕏

产业解读

关键数字本版无新增跑分数字,新增事实是安全子集结论:好于 4.6、落后最先进水平
时间点模型发布与独立安全测试均发生在 24 小时内
谁会受影响对安全合规有要求、正考虑把 Grok 当默认档的团队

这不是投资建议。

Musk 称 Grok 4.7 搭配 Build harness 是强力日常主力𝕏

这件事更早 11

更早

Teortaxes 对 Grok 4.7 在 Vals Index 降至 54.2%、排名第 24 表示担忧𝕏

Teortaxes

Teortaxes:Grok 4.7 表现糟糕,印证算力至上论——xAI 有钱、硬件、电力、数据和 CEO 意志仍不够𝕏

Teortaxes

Elon Musk 称 Grok 4.7 是智能、速度与低成本的良好组合𝕏

Elon Musk
每早一封:昨夜到今晨新增的几件事,每件一行,点开回站点看完整。
HOURAHEAD关于 · 往期 · 2026-09-24 12:01