9 月 24 日模型产品
模型产品
今天
Alexandr Wang 发布 Muse Realtime Avatar,与 Muse Realtime Voice 同步实现亚秒级音视频对话
Teortaxes 称 GPT-6 Astra 在 MuJoCo 相扑模拟中 31 秒击败 Claude Opus 5.5
Ming-Image-0.1-Design 在 Text to Image 分类的 Layout 能力上位列 67 个模型中第 19,为开源权重最高
Together AI 发布 tev1-4B-experimental 分类器,基于 Qwen3.5 4B 微调,serverless 定价 $0.042/M
Fireworks 发布基于 Kimi K3 的 Ember-1,推理 token 用量减少约 40% 且保持顶级质量
TestingCatalog 转述 Meta 计划在 Meta Connect 发布 Meta Business Agent Platform
Patrick Moorhead 称 Opus 5.5 比 Fable 5.1 每正确任务便宜 2 倍以上,幻觉率 2.8% 但为 4 倍
OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna,基于 GPT-6 Astra 技术,更快更便宜并优化缓存与推理效率
Claude Opus 5.5 登顶 Artificial Analysis Intelligence Index,并降价 20% 且加大缓存命中折扣(GPT-
Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型
昨天
Teortaxes 判断小米 MiMo-V3 的 HySparse2 相比 V2.6 Hybrid SWA 在 1M tokens 下 prefill FLOP
NVIDIA Nemotron 3 Diarization 在 voicearena_ai Diarization-Bench 12 个系统中排名第一,错误率
Qwen 推出 Qwen Intelligence,含 Mobile Planner Agent 与 Mobile-Use Agent 两个 SOTA agen
Qwen 发布 Qwen-Audio-3.1,含 TTS-Next 与 ASR-Next 两个新模型并下调 API 价格
TestingCatalog 指出 Grok iOS 端 Remote Control 指向 Grok Desktop 应用而非 Grok Build CLI,
vLLM 在 nightly 镜像中提供 Jev-compatible endpoint,需启动 vLLM 与示例 server 后调用
Cerebras 称 GPT-5.6 Sol 加速安全分析工作流
腾讯混元 Hy Image3.5 preview 上线 ComfyUI,人类评测胜率较 Hy Image3.0 高 30%(image3.5)
Elon Musk 转发称 Grok 4.7 在音乐错误检测测试中得分 100%,与 GPT-6 Astra 持平
科技新报转述 RoboHarm 实体 AI 安全测试:GPT-6 Astra、Claude Fable 5.1 接双臂机器人执行五项高风险指令,缺乏稳定防御机制
Ollama 承认 deepseek-v4.1-flash 部分请求计费费率错误,导致用户用量消耗高于预期
Qwen-Image-2.1 获 Intel OpenVINO Day-0 支持,单一开源权重 checkpoint 兼顾生成与编辑
StepFun 发布 StepAudio 3 ASR,在 AA-WER Index 非流式语音转文字榜以 1.7% WER 排名第一,优于 StepAudio
Aravind Srinivas:GPT-6 Sol 在 WANDR 评测上以 Opus 5 五分之一价格超越 Opus 5,并成为 Computer 的 Li
今天
Miles Brundage 质疑 ChatGPT 网页版 Chat mode 完全没有 Astra,且默认从 Astra 切回 Sol𝕏
Miles BrundageMiles Brundage 质疑 ChatGPT 网页版默认切回 Sol 而非保留 Astra 选择𝕏
Miles BrundageJerry Liu 发布 LlamaExtract Agentic Plus,支持长表格、巨型表单、校准置信度与 grounded extraction𝕏
Jerry LiuArtificial Analysis 指出 Ming-Image-0.1-Design 在 UI/UX Design 用例最接近前沿𝕏
Artificial AnalysisMing-Image-0.1-Design 的 UI/UX Design Elo 比整体 Elo 高 88 分,为 10 个 Text to Image 用例中最大差距𝕏
Artificial AnalysisAllen Institute for AI 称 Global Fishing Watch 将使用 OlmoEarth 平台标注数据并训练模型𝕏
Allen Institute for AI昨天
Logan Kilpatrick 称 Google AI Studio 新体验成本低于上一代 3.1 Flash TTS 模型𝕏
Logan KilpatrickGoogle DeepMind 为 Gemini API 音频生成加入逐行节奏情感控制与 SynthID 水印𝕏
Google DeepMindMax For AI 回复称 Gemini 3.0 在 10 月前发布𝕏
Max For AIQwen 发布 Mobile Creative Agent 性能基准套件𝕏
QwenQwen 发布 Mobile-Use Agent 性能数据𝕏
QwenMax For AI 称 Opus5.5 周额度消耗极慢,有人蹬一天只掉 10%𝕏
Max For AIMax For AI 判断 Opus5.5 不如 Opus4.6𝕏
Max For AITestingCatalog 判断 Grok 相关界面为 onboarding flow 但疑似订阅方案𝕏
TestingCatalogShawn Wang 称 5.5 Opus 成为 AINews 新默认模型,比 5 Opus 更简洁、slopese 更少𝕏
Shawn WangMachine Learning Street Talk 称 Astra 在 computer use 上很强,但自己工作里 Opus 已够用𝕏
Machine Learning Street TalkTeortaxes 转述 Eddie Wu:Qwen 团队 RSI 取得进展,计划 5-10T 参数模型,Qwen-4.5 采用新训练架构𝕏
TeortaxesMiles Brundage 询问 Claude app 的 Fast mode 发生了什么𝕏
Miles Brundage高通执行长阿蒙指出AI将成为全新介面,手机能理解使用者意图并代表执行任务𝕏
科技新报Guillermo Rauch 发布 Next.js evals:Opus 5.5、GPT-6 Sol、Fable 5.1 均达 97%,Grok 4.7 为 94% 且便宜 2x-7x𝕏
Guillermo Rauch关注后可跟此人更新与他说过的话,需用手机号登录