9 月 24 日Teortaxes:V4.1 Flash 是过度思考者,50 秒内修完并验证错误后仍纠结视觉测试

已见于 9 月 12 日午间

话题 · 模型产品

先看结论

Teortaxes:V4.1 Flash 是过度思考者,50 秒内修完并验证错误后仍纠结视觉测试

转述报告称经果蝇连接组优化的 V4.1 Flash 在 2 台 NVIDIA GB300 DGX Station 上达 56k tok/s prefill、201.7 tok/s 单并发 decode

这些标记是什么意思

疑似或传闻 当事方还没回应迹象指向 依据接口、代码提交等公开痕迹作出的推断转述 二手说法,不是原话

最新进展SemiAnalysis 指出 AMD 在 DeepSeek V4.1 Flash 发布 23 小时后仍未公开 vllm-openai-rocm:deepseekv41-flash-0909 镜像
当前状态已结束 · 转述

供给

Teortaxes 称 DeepSeek V4.1 Flash 与 Kimi K3、GLM-5.3 Flash 建模风格差异巨大,疑似训练数据路径完全不同

看什么现在的情况依据
事实转述报告称经果蝇连接组优化的 V4.1 Flash 在 2 台 NVIDIA GB300 DGX Station 上达 56k tok/s prefill、201.7 tok/s 单并发 decode
官方尚未表态

产业解读

关键数字换 DSH 新版后总 Token 多 2.4%、费用少 36.6%;GB300 双机上 56k tok/s prefill
时间点模型发布次日内的实测与转述
谁会受影响用 V4.1 Flash 跑多轮 agent 的团队账单,cache 是否失效直接决定费用

这不是投资建议。

转折更早 2

更早

这件事更早 35

更早

DeepSeek V4.1 Flash 发布一天后,NVIDIA-NeMo 出现巨型 PR 加入完整训练与微调支持,含 Causal Encoder/Decoder、CSA2、mHC、Engram、MoE、视觉输入与 Checkpoint𝕏

Max For AI

Teortaxes 反驳 DeepSeek 人才被挖空说法,称 V4.1 数小时内将碾压竞争对手𝕏

Teortaxes

Teortaxes 称 V4.1 在 HLE 上接近 Fable,并自主下载 180 MB PDF 研究珍珠层材质𝕏

Teortaxes

Teortaxes 判断 Kimi K3 经严肃后训练后在多数评测上优于 V4.1,且 token 效率更高𝕏

Teortaxes

Teortaxes:DeepSeek 论文给出 Agent Swarm RL 初步配方,V4.1 团队在 ProgramBench 达 30%,官方 20.3% 非上限,约为 Kimi K3 两倍𝕏

Teortaxes

SemiAnalysis 转述 DeepSeek-V4.1-Flash 发布:552B 骨干、prefill 激活 8B、decode 激活 16B、196B Engram 稀疏查表、持久 KV 比 V4-Flash 少约 8 倍𝕏

SemiAnalysis

Teortaxes 称 DeepSeek V4.1 是首个游戏型模型,对做出真正好玩的东西有异常兴趣𝕏

Teortaxes

Teortaxes 推测 DeepSeek V4.1 Pro 为 3.1T 总参数 30/60B 激活 MoE 加 1.1T Engram,磁盘占用 2.6TB𝕏

Teortaxes

Teortaxes 判断 DeepSeek V4.1 是首个以 .1 版本号标注的全新基座模型,与 V4 差异大于 LLaMA 1 到 LLaMA 3,但未到 V5 程度𝕏

Teortaxes
每早一封:昨夜到今晨新增的几件事,每件一行,点开回站点看完整。
HOURAHEAD关于 · 往期 · 2026-09-24 12:01