9 月 24 日研究与方法
研究与方法
今天
Teortaxes 称 GPT-6 Astra 在 MuJoCo 相扑模拟中 31 秒击败 Claude Opus 5.5
Teortaxes 判断小米 MiMo-V3 的 HySparse2 相比 V2.6 Hybrid SWA 在 1M tokens 下 prefill FLOP
Elvis Saravia 称 Google 论文指出自动优化 agent harness 会让评测分上升但真实任务变差,并给出防止方法
Machine Learning Street Talk 转述 Frank Hutter:TabPFN 用纯合成数据训练,单次前向传播完成表格预测
Ethan Mollick 称多模态 AI 进步显著,引用 FAB 基准显示最高分 10 个月内从 28% 升至 80%
Claude Opus 5.5 登顶 Artificial Analysis Intelligence Index,并降价 20% 且加大缓存命中折扣(GPT-
Chelsea Finn 提出 Real-Time EXPO-FT:基础 VLA 跑旧图像、小编辑策略实时运行,全面显著优于 RTC
Teortaxes 判断 DSec 与 DSH 项目将合并,VM 实例化成为 Whale 原生训练的 agentic action 类别
昨天
Ollama 承认 deepseek-v4.1-flash 部分请求计费费率错误,导致用户用量消耗高于预期
Perplexity 用 hint-guided self-distillation 后训练 Computer agent,A/B 测试中工具调用失败率相对下降
Fireworks 推出 Specialized Intelligence Index(SII),按行业汇集真实工作基准
Teortaxes 指出 DeepSeek 新论文 DSec:单生产单元约 160 节点,日服务约 300 万沙箱、并发超 38 万
AK 提出 RRSI(Regularized Recursive Self-Improvement of Agent Harnesses)论文
更早
Elvis Saravia 推荐 Google 论文 DualSQL:用多智能体 RL 训练 Text-to-SQL,拆成选表列与写 SQL 两个 agent
今天
腾讯混元将经典临界批量理论扩展到在线 LLM RL,研究训练效率𝕏
腾讯混元Teortaxes:RSI 与 cyber/bio 等最关键领域不需要蒸馏,kernel eng、CVE search 天然可自动化𝕏
TeortaxesTeortaxes 称 METR 认为 Anthropic 的 AI 驱动研发加速为 1.5x𝕏
TeortaxesEthan Mollick:达到25%或75%数学科学基准分数的成本正在崩塌,当前针对特定方案优化成本可能短视𝕏
Ethan MollickEthan Mollick:硬数学与科学基准达到 25%/75% 分数的成本正在崩塌,当前按成本优化特定方案可能短视𝕏
Ethan MollickAllen Institute for AI 与 Global Fishing Watch、Skylight Marine 合作开发新检测模型𝕏
Allen Institute for AIAnthropic 称 Claude 在噬菌体 DNA 中发现未知酶系统,其基因旁有类似 CRISPR 的重复序列阵列𝕏
AnthropicShawn Wang 称新模型评估主要靠人工 vibe check,自动检查为辅𝕏
Shawn WangIan Cutress 称 AI 辅助 RF 设计迁移将 N2 PLL 周期从 90+ 周压缩至 32 周(HBM)𝕏
Ian CutressSkild AI 称其模型在物理模拟中自我对弈 140 年𝕏
Skild AIChelsea Finn:机器人要真正可用,可靠性是当前 AI 最大开放挑战之一𝕏
Chelsea FinnIan Cutress:TSMC 数据中心伙伴用 EDA 伙伴数据训练 AI 优化流程,已见实质收益并更快流片𝕏
Ian CutressNathan Labenz 称 Astra 与 Fable 返回的论文草稿高度相似,猜测各家在买同一批 RL 环境𝕏
Nathan Labenz昨天
Ben Bajarin 称 agentic AI 企业部署最大瓶颈之一是存储,将发布 V2 新研究𝕏
Ben BajarinElvis Saravia 推荐 Microsoft Research 论文:无预设角色、通过共享进度通信的多智能体协作𝕏
Elvis SaraviaTeortaxes:C-HD 算法仅在罕见区间窄幅优于 Dijkstra,RSI 的戏剧性可能被高估𝕏
TeortaxesElvis Saravia 推荐 Stanford 与 Together AI 论文:自组织 agent 团队在五个数学物理基准上平均 66.7%(DeepSeek-V3)(o3-mini)𝕏
Elvis SaraviaTeortaxes 建议在 computer-10 式无助手数据基座清单中加入 Kimi K2 base、Dots2.llm 与 Inkling𝕏
TeortaxesTeortaxes 认为 LLM 除被重度 RL 的领域外并不持有观点,预训练只继承可拼装的 Vibes 混合体𝕏
TeortaxesTeortaxes 判断通用压缩理论疑似学术空头支票,但若成立可连接 PEFT/adapter/prompt tuning 与持续学习𝕏
Teortaxes更早的时间线(10 件事)订阅后可见。去订阅
关注后可跟此人更新与他说过的话,需用手机号登录