Miles Brundage 称 Grok 4.7 在某些安全方面略有改善𝕏
Miles Brundage9 月 24 日Grok 4.7 在独立安全场景子集上好过 4.6,但仍落后最先进水平
Grok 4.7 在独立安全场景子集上好过 4.6,但仍落后最先进水平
Elon Musk 转引「90 天内从勉强前十到重回前沿前三」的说法并回复 True,xAI 自认此前 RL 过度惩罚响应长度,致模型对本可做对的难题过早放弃
疑似或传闻 当事方还没回应迹象指向 依据接口、代码提交等公开痕迹作出的推断转述 二手说法,不是原话
事件
| 看什么 | 现在的情况 | 依据 |
|---|---|---|
| 事实 | Elon Musk 转引「90 天内从勉强前十到重回前沿前三」的说法并回复 True,xAI 自认此前 RL 过度惩罚响应长度,致模型对本可做对的难题过早放弃 | |
| 后果 | 对安全敏感的场景先不换默认档:独立子集测试显示它仍落后于最先进水平 | |
| 官方 | Elon Musk |
Elon Musk他转引一条回顾 Grok 近 90 天从「勉强前十」到「大幅回归」再到「进入前沿前三」的帖子并回复 True𝕏
Miles Brundage实测结论基于他跨模型复用的一组 Petri 安全场景子集,只覆盖部分安全场景,并非完整安全评测𝕏
Teortaxes分析他转述 xAI 自认 RL 可能过度惩罚响应长度、导致模型过早放弃难题,官方解法是 xhigh 档配 Grok Build,并补一句「到现在还是没写出代码」𝕏
产业解读
这不是投资建议。
Musk 称 Grok 4.7 搭配 Build harness 是强力日常主力𝕏
更早
Miles Brundage 称 Grok 4.7 在某些安全方面略有改善𝕏
Miles BrundageTeortaxes 称 Elon 对 RL 惩罚响应长度导致 Grok 4.7 过早放弃难题的解法是 Grok 4.7 xhigh 与 Grok Build𝕏
TeortaxesElon Musk 称用 Build harness 搭配 Grok 4.7 效果最佳𝕏
Elon MuskTeortaxes 称 Grok 4.7 表现糟糕,单次运行仅花 $1.59 而 Kimi 约 $6𝕏
TeortaxesTeortaxes 对 Grok 4.7 在 Vals Index 降至 54.2%、排名第 24 表示担忧𝕏
TeortaxesGuillermo Rauch 称 Grok 4.7 快速解决运行中二进制逆向工程难题𝕏
Guillermo RauchElon Musk 称 Grok 4.7 在自家 Build harness 中表现极佳𝕏
Elon MuskElon Musk 称 Grok 4.7 在 agentic coding 上排第三,仅次于 Anthropic 与 OpenAI(GPT-5.6)(Intelligence Index)𝕏
Elon MuskNVIDIA 称 Grok 4.7 是其支持 SpaceXAI 训练的最强编码与知识工作模型𝕏
NVIDIATeortaxes:Grok 4.7 表现糟糕,印证算力至上论——xAI 有钱、硬件、电力、数据和 CEO 意志仍不够𝕏
TeortaxesElon Musk 称 Grok 4.7 是智能、速度与低成本的良好组合𝕏
Elon Musk关注后可跟此人更新与他说过的话,需用手机号登录