9 月 22 日午间版

今日要闻

Grok 4.7 在独立安全场景子集上好过 4.6,但仍落后最先进水平

Grok 4.7 在独立安全场景子集上好过 4.6,但仍落后最先进水平

Elon Musk: 他转引一条回顾 Grok 近 90 天从「勉强前十」到「大幅回归」再到「进入前沿前三」的帖子并回复 True𝕏

Miles Brundage 实测: 结论基于他跨模型复用的一组 Petri 安全场景子集,只覆盖部分安全场景,并非完整安全评测𝕏

Teortaxes 分析: 他转述 xAI 自认 RL 可能过度惩罚响应长度、导致模型过早放弃难题,官方解法是 xhigh 档配 Grok Build,并补一句「到现在还是没写出代码」𝕏

Alexandr Wang:Muse 是首个做给 AI 怀疑者的 AI,有用户靠它清掉 163,490 封推广邮件

Alexandr Wang:Muse 是首个做给 AI 怀疑者的 AI,有用户靠它清掉 163,490 封推广邮件

Alexandr Wang: 他展示的新用例是全程代办保修索赔,不需要用户在旁边盯着流程𝕏

他给出的依据案例是:一位用户的妻子第一次允许把 AI 装进自己手机,头号目标就是清推广邮件𝕏

白毛 Serenity 解读: 他称 $META Muse 正在全力推进,背景里 AMD、Intel、ARM 的 CPU 与 NIC、SSD、DRAM 等组件都在跟着运转𝕏

Grok 4.7 在 AA 估值链示例中独立跑完流程并标出问题,Grok 4.6 直接落在交易合伙人速算值上

Grok 4.7 在 AA 估值链示例中独立跑完流程并标出问题,Grok 4.6 直接落在交易合伙人速算值上

Artificial Analysis 实测: 另一个 PE deck 示例中 4.6 只用最新一年数据、无营收趋势与汇率讨论,4.7 则评估完整三年历史并得出增长被抹平的结论𝕏

AA 同时放出 Grok 4.7 (xhigh) 的 Intelligence Index 完整评测分解,与 Grok 4.6 (high) 等领先模型并列对比𝕏

Teortaxes 实测: 他在 Grok Build 里对比 4.7 high 与 4.6 high 的 3D 生成(空客 H145 直升机模型),称疑似降级且极耗 token𝕏

台积电 1.4nm(A14)最早 2027 年一季度启动试产

台积电 1.4nm(A14)最早 2027 年一季度启动试产

TrendForce 转述: 其引 IC 设计来源称台积电 14A 路线图正在逼近 Intel𝕏

Dan Nystedt 转述: 他转述媒体报道称设备已开始搬入新竹 Fab 20(P3)𝕏

위클리포스트 转述: 韩媒称台积电已启动 1.4nm 之后工艺的准备,目标 2030 年下一代晶圆厂投产

StepFun Step 5 Preview 拿下 AA Intelligence Index 44 分,追平 Kimi K3 (max) 且每任务成本低约 2.8 倍

StepFun Step 5 Preview 拿下 AA Intelligence Index 44 分,追平 Kimi K3 (max) 且每任务成本低约 2.8 倍

Artificial Analysis 实测: 结论出自 Artificial Analysis 公开评测𝕏

HOURAHEAD关于 · 往期 · 2026-09-22 04:31