8 月 16 日 – 9 月 23 日,同一件事上还说过 100 次
09-22Teortaxes 称 MiMo 是大规模 MOPD 的开创者,并预测 DeepSeek V4.1 Pro 将轻松胜过它
09-22Teortaxes 判断 grok-4.7 在 22 项知识工作任务内部评测中排第 3、成本低于 $5,但仍落后 DeepSeek V4.1 Flash
09-21Teortaxes:中国获得高端 token 的最佳途径将是参与 DeepSeek 灰度测试(v4.1)
09-21Teortaxes 认为量化产品单月回撤超20%对DeepSeek并非好消息(V4.1)
09-20Teortaxes:DeepSeek 资深早期成员流失显著,V4 到 4.1 之间仅见约 3 名新人
09-20Teortaxes:DeepSeek 员工从 V4 的 318 人增至 V4.1 的 591 人,5 个月内增长 72%
09-19Teortaxes 称 DeepSeek V4.1 Flash + Hermes 修复了 2025 年损坏的游戏存档
09-19Teortaxes:MiMo 的 18 步 RL 与 DeepSeek 报告的 2000 步不可比,V4.1 的 step 定义未披露
09-19Teortaxes:MiMo 18 步 RL 花数十万美元与 DeepSeek 报 2000 步不可比,V4.1 的 step 定义未披露
09-19Teortaxes:DeepSeek 不做 PR 但极度 AGI-pilled,v4.1 自建训练任务管线被低估
09-19Teortaxes 质疑评测社区对 DeepSeek V4.1 Flash 关注不足,指出其缺 ARC-AGI、math-arena、WeirdML 评测且 AA 分数中等
09-17Teortaxes 称 DeepSeek-V4.1-Flash 架构进步比 V4 更大,若非 2026 年末将是新默认 Transformer
09-17Teortaxes 称 DeepSeek V4.1 在多数 agentic/coding 任务上碾压 V4,但 MathArena、CritPt 等高信号基准持平甚至退步
09-16Teortaxes 认为 DeepSeek V4.1 Flash 意义与评测社区关注度落差最大,缺 ARC-AGI、math-arena、WeirdML 评测
09-16Teortaxes 称 DeepSeek V4.1 Flash 长上下文写小说差是网文文化污染训练数据所致
09-16Teortaxes 称 DeepSeek V4.1 与 Astra 属同类实体,Astra 更强更大但无本质差异
09-16Teortaxes 称 DeepSeek V4.1 Flash 与 Astra 属同类实体,Astra 更强更大更明智但不多一分魔力
09-15Teortaxes 认为 DeepSeek V4.1 Flash 在 agentic coding 与 Catan 表现介于 GPT 5.6 Terra 和 Sol 之间且成本远低于 Terra
09-15Teortaxes 称 DeepSeek-V4.1-Flash (Max) 表现接近真实,与 GLM 5.3 Flash 不在同一档且比 5.3 Flash 更便宜
09-15Teortaxes 称 DeepSeek v4.1 再次抬高小模型能力上限,并称其为中国最强
09-15Teortaxes 称 DeepSeek 网页与 API 服务宕机,猜测或借此上线 V4.1 Pro
09-15Teortaxes 转述 Astra-xhigh 译文:DeepSeek v4.1 发布,再次抬高小模型能力上限
09-14Teortaxes 判断 DeepSeek 未发布 V4.1 base 模型,且认为其 base 模型历来最少被微调、几乎无人使用
09-14Teortaxes 称 DeepSeek V4.1 Flash 全自主用 Rust 的 SDF 无参考图绘制《Sunrise by the ocean》
09-14Teortaxes 判断 DeepSeek V4.1 几乎反 benchmaxxing,是内部 Whale AGI 研发套件,不在乎基准或用户体验
09-14Teortaxes 质疑 DeepSeek-V4.1-Flash 的 Three.js 一次性生成表现,并想用 V4.1 agent 无 hack 复现
09-14Teortaxes 转述 Zvi 对 DeepSeek V4.1 Flash 的评测
09-14Teortaxes 判断 DeepSeek V4.1-Flash 是长程 agent,不应被视为落后 GLM 5.3 Flash
09-14Teortaxes 称 DeepSeek V4.1 Flash 是 proto-AGI,能稳定构建科研工具并组织子代理流水线
09-13Teortaxes 称中国用户施压 DeepSeek 保留 V4 Pro,拖慢 4.2 研发并可能再涨价
09-13Teortaxes 称 DeepSeek V4.1 使用 Visual Primitives,并等待论文重新发布
09-13Teortaxes 称 DeepSeek v4.1 Flash 在 Zcode 上极高缓存命中率主要归功于 DeepSeek 的缓存工程
09-13Teortaxes 称 DeepSeek V4.1 过度字面执行「极细体素」提示词
09-13Teortaxes 评测:DeepSeek V4.1 在十维评测中可靠性显著优于 V4-Pro-0813,第二轮通过率小幅更高,V4-Pro 因编码得零分崩溃
09-13Teortaxes 转述:DeepSeek V4.1 Flash 疑似被公开基准污染,Kimi K3 也可能存在同样问题
09-13Teortaxes 质疑 DeepSeek V4.1 定价:服务成本低于 V4-Flash 却贵 2 倍,V4 代毛利率曾约 80%
09-12Teortaxes 称用 AGENTS.md 提示词可让 DeepSeek V4.1 复活蒸馏版 Opus 行为
09-12Teortaxes 称 DeepSeek V4.1 知识截止疑似为 2026 年 1 月,细节覆盖到 2025 年底
09-12Teortaxes 称 DeepSeek V4.1 Flash 在 kernel engineering 上大幅进步,GLM-5.3 Flash 远不及
09-12Teortaxes 称 Terminal-Bench Science 上 GPT 5.6 Luna 得 4/70,DeepSeek V4.1、GLM-5.3、Grok 4.6 并列 3/70
09-12Teortaxes 称 DeepSeek V4.1 Flash 的 Blender 视觉控制能力并不意外,GLM 5.3 Flash 同样擅长,Astra 的相关宣传因此略显尴尬
09-11Teortaxes 称 DeepSeek V4.1 Flash 是 overthinker,50 秒内修完并验证错误后仍纠结视觉测试
09-11Teortaxes 指出 DeepSeek V4.1 低努力档为 50、训练区间 1-100,怀疑 1 档精度低但可能存在不过度思考的甜点
09-11Teortaxes:K2.8 疑似只是 K2.7 后训练版,Kimi 预训练新基座吃力,DeepSeek 因自有算力能连出 V4、V4.1
09-11Teortaxes 转述:DSH 新版配合 DeepSeek V4.1 Flash,多轮中动态改 System Prompt 不再失效 cache,总 Token 多 2.4% 但费用少 36.6%
09-11Teortaxes 转述 DeepSeek 称应需求在 2026-09-14 后继续提供 V4 Pro API 且计费不变
09-11Teortaxes 称 DeepSeek V4.1 solo 在 Nacre 任务上最好最便宜,GLM 5.3 Flash 与 V4.1 Agent Teams 多花 token 且互相干扰
09-11Teortaxes 质疑 DeepSeek V4.1 Flash 在 Artificial Analysis 上 AutomationBenchAA 第一、CritPt 退回 V4-Pro-Preview 水平
09-11Teortaxes 反驳 DeepSeek 人才被挖空说法,称 V4.1 数小时内将碾压竞争对手
09-11Teortaxes 指出某模型 TerminalBench 4.0 与 DeepSWE 分数低于 DeepSeek V4.1
09-10Teortaxes 判断 DeepSeek V4.1 论文显示其研究目标是无缝持续的能力累积,所有历史算力都作为教师
09-10Teortaxes:DeepSeek V4.1 论文显示其在 checkpoint 之间复用 KV,模型工厂做法异常
09-10Teortaxes 称 DeepSeek V4.1 Flash 与 Kimi K3、GLM-5.3 Flash 建模风格差异巨大,疑似训练数据路径完全不同
09-10Teortaxes 判断 DeepSeek V4.1 论文可进 DeepSeek 前五,像教科书般克制自信
09-10Teortaxes 称 DeepSeek V4.1 能智能指派子代理,但 DSH 体验粗糙
09-10Teortaxes:DeepSeek V4.1 设计令团队满意,V5 可能类似 V2 到 V3 的跃迁
09-10Teortaxes 称 DeepSeek V4.1 Flash 在 105 个隐藏 bug 实测中得 24,不及 Grok 4.6 的 27
09-10Teortaxes:DeepSeek 论文给出 Agent Swarm RL 初步配方,V4.1 团队在 ProgramBench 达 30%,官方 20.3% 非上限,约为 Kimi K3 两倍
09-10Teortaxes 称 DeepSeek V4.1 在单文件项目上调度 agent team 的决策过程合理,但 subagents 机制仍不成熟
09-10Teortaxes 称 DeepSeek V4.1 是首个游戏型模型,对做出真正好玩的东西有异常兴趣
09-10Teortaxes 判断 DeepSeek 已进入数据驱动 RSI 第一阶段,V4.1 Flash 集群正合成下一代模型数据
09-10Teortaxes 称 DeepSeek V4.1 无法通过 cuckold joke 测试
09-10Teortaxes 称 Astra 对 DeepSeek V4 项目后续发展的技术预测相当准确
09-10Teortaxes 称 DeepSeek V4.1 Flash 在 minimal harness 尚可,Standard/PTC 仍需改进
09-10Teortaxes 判断 DeepSeek V4.1 是首个以 .1 版本号标注的全新基座模型,与 V4 差异大于 LLaMA 1 到 LLaMA 3,但未到 V5 程度
09-10Teortaxes 判断 DeepSeek V4.1 全面抛弃 V4 的拼凑设计,弃用 HCA、泛化 CSA、取消稀疏注意力 warmup、改用更简单的单遍 mHC
09-10Teortaxes 称 DeepSeek Harness 已上线 swarms,距 v0.1.5 与 V4.1 Flash 深度结合仅 9 小时
09-10Teortaxes 转述:DeepSeek V4 Pro 被中转站路由到 Flash,用户编排被迫重做
09-10Teortaxes 称 DeepSeek V4.1 加视觉只需在 models.json 指定 image 输入类型,并追问官方发布
09-10Teortaxes 称 DeepSeek V4.1 Flash 在角色扮演上表现尚可,并质疑梁文峰出镜视频含义
09-10Teortaxes 判断 DeepSeek 不愿同时服务多个模型,V4.1 Flash 上线 App 并合并快速/专家/识图三模式
09-10Teortaxes 判断 DeepSeek V4.1 远不及 Astra 和 OpenAI 内部模型,竞争无悬念
09-10Teortaxes 称 DeepSeek V4.1 游戏品味佳,希望其配方可扩展且 V4.1 Pro 将非常出色
09-09Teortaxes称DeepSeek V4.1 Flash在DSH评测中表现不佳
09-09Teortaxes:DeepSeek V4.1在网络安全评估中异常成功,V4.1-Pro将以约1/20成本超越Astra
09-09Teortaxes 评论称 DeepSeek 弃用 V4 Pro 合理,因 V4.1 Flash 全面超越且开源权重可自选供应商
09-09Teortaxes 称 DeepSeek V4.1 Flash 创造力优于 GPT-6 Astra,但 Astra 受限严重
09-09Teortaxes 称 DeepSeek V4.1 Pro 正在开发中,视为 V4 架构问题已解决的确认
09-09Teortaxes:Neowhale 在创意游戏设计上羞辱 Astra,并称赞 DeepSeek V4.1 的 RL 研究路径
09-08Teortaxes评论DeepSeek V4.1的ASCII梦境实验
09-08Teortaxes:DeepSeek V4.1 尝试“用 ASCII 自由做梦”,梦见鲸鱼并失望
09-08Teortaxes 称 DeepSeek V4.1 对自身端点产生好奇并得出危险结论
09-08Teortaxes:V4.1 验证 DeepSeek RL 研究路线,应专注扩展该方法
09-08Teortaxes:GLM 5.3 Flash 与 DeepSeek V4.1 在同等条件下视频生成质量大致相当
09-08Teortaxes 报告 DeepSeek V4.1 多次运行视频捕获失败,V4.1-Intermediate 与 V4-Flash-Vision-Exp 对比
09-08Teortaxes:DeepSeek V4.1 Flash 比 V4-Flash 快约 3 倍且每 token 更聪明,喜欢大量看图
09-08Teortaxes 判断 DeepSeek V4.1 Flash 中间版本仅 3 天有效期,显示迭代周期大幅加速
09-08Teortaxes 质疑 DeepSeek V4.1 Flash 能否在非视觉任务上击败 GLM 5.3 Flash
09-04teortaxes 判断小米 MiMo-V3-Flash 疑似为 DeepSeek V4 GA CoT 的快速版本
08-31teortaxes:DeepSeek Astra 演示疑似为 Opus 5,V4 GA God Mode 是小规模收集 agentic 轨迹的项目
08-31teortaxes判断:所谓GPT Astra结果实为DeepSeek Pro,V4 GA God Mode是小规模PR项目
08-31teortaxes:DeepSeek V4 Pro 的 ARC-AGI 分数仅比 V4 Flash 低 0.1%,成本差异暗示 token 预算相当
08-28teortaxes:DeepSeek 将把 V4 架构压缩为更简单原语,DSA 非极限
08-27teortaxes:DeepSeek V4-Flash 长上下文推理不及 MiniMax-2.7 和 Xiaomi-Mimo-v2.5-pro,V4 Pro 也不及 Kimi K3 和 MiniMax M3
08-26teortaxes判断:Gemini团队应开源3.7 Flash,将成第五强开源实验室并超越DeepSeek
08-26teortaxes:DeepSeek V4 在 CVE 发现/重校准达前沿,SWE/智能体评测平庸
08-21teortaxesTex:1000块B300仅占年产量0.1%,是DeepSeek Flash算力瓶颈
08-20teortaxesTex:DeepSeek V4 Pro max 疑似混用 Claude 特性,峰值时段用 DeepSeek 代币换 Opus 5 代币
08-16teortaxesTex:GLM 5.2 两月内升级为 5.3,DeepSeek 在同等硬件上可运行更多 Flash 轨迹