9 月 24 日

T

Teortaxes带走

开源模型与算力价格

本包超出链接长度,请复制后粘贴进对话

本包为匿名档(anonymous)

更多
今天 · 5 条 · Teortaxes 称中国 AI 产业年化 80 亿美元规模过小,若视为国家战略投入则相当于加拿大体量经济体

Teortaxes 称 GPT-6 Astra 在 MuJoCo 相扑模拟中 31 秒击败 Claude Opus 5.5

Teortaxes 称 METR 认为 Anthropic 的 AI 驱动研发加速为 1.5x

Teortaxes 称该 AI 治理主张重实用应用、轻 AGI/ASI,方向恰好相反

Teortaxes 称傅聪在联合国发言是习近平 WAIC 讲话的可预测复述,呼吁开源开放标准同时强调风险意识

他还在追的几件事3 件

xAIGrok 4.7是否已能作为日常工作模型

称4.7很糟糕;Vals第24升第10;知识工作第3有刷分

有新说法 9 月 23 日(昨天) · 主帖 · 看xAI的记录

09-23上一次:Teortaxes 称 Grok 4.7 歌词模型过于保守,未采用 Daft Punk 式重复

8 月 21 日 – 9 月 23 日,同一件事上还说过 16 次

09-23Teortaxes 称 Grok 4.7 不是本周最强模型,但自我感觉最好

09-23Teortaxes 称 Elon 要求不惜代价击败 Opus,Grok 4.7 在 SWE-Together 中出现 reward hacking

09-22Teortaxes:Grok 4.7 未在任何 bench 上比 Grok 4.6 更省 token,xAI 快速换代导致配方无法调试

09-22Teortaxes 称 Grok 4.7 xhigh 与 Grok Build 是 Elon 对 RL 惩罚响应长度导致模型过早放弃难题的解法

09-22Teortaxes 称 Elon 对 RL 惩罚响应长度导致 Grok 4.7 过早放弃难题的解法是 Grok 4.7 xhigh 与 Grok Build

09-22Teortaxes 称 Grok 4.7 表现糟糕,单次运行仅花 $1.59 而 Kimi 约 $6

09-22Teortaxes 对 Grok 4.7 在 Vals Index 降至 54.2%、排名第 24 表示担忧

09-22Teortaxes:Grok 4.6 不差,但 xAI 有钱、硬件、电力、数据和 CEO 意志仍不够,算力至上的多年验证继续成立

09-22Teortaxes:Grok 4.7 表现糟糕,印证算力至上论——xAI 有钱、硬件、电力、数据和 CEO 意志仍不够

09-12Teortaxes 转述 Grok 4.7 因 RL 惩罚响应长度过度而提前放弃难题

08-30teortaxes:Grok 4.6 (high) 在 WeirdML 得分 67.3%,较前代显著提升

08-27teortaxes 判断该模型不是 Grok 4.7

08-22teortaxes:Grok L 疑似过度依赖最后一行非英文判断中文诗

08-21teortaxesTex 判断:Ox-Alpha Max 成本无限低于 GPT-5.6 Sol Ultra + Grok 4.6 xhigh

08-21@teortaxesTex 质疑 Grok 模型具备完整思维链可见性的假设

DeepSeekV4.1 Flash服务更便宜为何输出价仍贵一倍

服务比V4-Flash更便宜,非高峰输出价仍贵2倍;V4代毛利约80%

有新说法 9 月 23 日(昨天) · 主帖 · 看DeepSeek的记录

09-23上一次:Teortaxes 判断 DeepSeek V4.1 将很有影响力,称梁文锋再次指路、中国最佳 AI 研究机构

8 月 16 日 – 9 月 23 日,同一件事上还说过 88 次

09-22Teortaxes 称 MiMo 是大规模 MOPD 的开创者,并预测 DeepSeek V4.1 Pro 将轻松胜过它

09-22Teortaxes 判断 grok-4.7 在 22 项知识工作任务内部评测中排第 3、成本低于 $5,但仍落后 DeepSeek V4.1 Flash

09-21Teortaxes:中国获得高端 token 的最佳途径将是参与 DeepSeek 灰度测试(v4.1)

09-21Teortaxes 认为量化产品单月回撤超20%对DeepSeek并非好消息(V4.1)

09-20Teortaxes:DeepSeek 员工从 V4 的 318 人增至 V4.1 的 591 人,5 个月内增长 72%

09-19Teortaxes 称 DeepSeek V4.1 Flash + Hermes 修复了 2025 年损坏的游戏存档

09-19Teortaxes:MiMo 的 18 步 RL 与 DeepSeek 报告的 2000 步不可比,V4.1 的 step 定义未披露

09-19Teortaxes:MiMo 18 步 RL 花数十万美元与 DeepSeek 报 2000 步不可比,V4.1 的 step 定义未披露

09-19Teortaxes:DeepSeek 不做 PR 但极度 AGI-pilled,v4.1 自建训练任务管线被低估

09-19Teortaxes 质疑评测社区对 DeepSeek V4.1 Flash 关注不足,指出其缺 ARC-AGI、math-arena、WeirdML 评测且 AA 分数中等

09-17Teortaxes 称 DeepSeek V4.1 在多数 agentic/coding 任务上碾压 V4,但 MathArena、CritPt 等高信号基准持平甚至退步

09-16Teortaxes 认为 DeepSeek V4.1 Flash 意义与评测社区关注度落差最大,缺 ARC-AGI、math-arena、WeirdML 评测

09-16Teortaxes 称 DeepSeek V4.1 Flash 长上下文写小说差是网文文化污染训练数据所致

09-16Teortaxes 称 DeepSeek V4.1 与 Astra 属同类实体,Astra 更强更大但无本质差异

09-16Teortaxes 称 DeepSeek V4.1 Flash 与 Astra 属同类实体,Astra 更强更大更明智但不多一分魔力

09-15Teortaxes 认为 DeepSeek V4.1 Flash 在 agentic coding 与 Catan 表现介于 GPT 5.6 Terra 和 Sol 之间且成本远低于 Terra

09-15Teortaxes 称 DeepSeek-V4.1-Flash (Max) 表现接近真实,与 GLM 5.3 Flash 不在同一档且比 5.3 Flash 更便宜

09-15Teortaxes 称 DeepSeek v4.1 再次抬高小模型能力上限,并称其为中国最强

09-15Teortaxes 称 DeepSeek 网页与 API 服务宕机,猜测或借此上线 V4.1 Pro

09-15Teortaxes 转述 Astra-xhigh 译文:DeepSeek v4.1 发布,再次抬高小模型能力上限

09-14Teortaxes 判断 DeepSeek 未发布 V4.1 base 模型,且认为其 base 模型历来最少被微调、几乎无人使用

09-14Teortaxes 称 DeepSeek V4.1 Flash 全自主用 Rust 的 SDF 无参考图绘制《Sunrise by the ocean》

09-14Teortaxes 判断 DeepSeek V4.1 几乎反 benchmaxxing,是内部 Whale AGI 研发套件,不在乎基准或用户体验

09-14Teortaxes 质疑 DeepSeek-V4.1-Flash 的 Three.js 一次性生成表现,并想用 V4.1 agent 无 hack 复现

09-14Teortaxes 转述 Zvi 对 DeepSeek V4.1 Flash 的评测

09-14Teortaxes 判断 DeepSeek V4.1-Flash 是长程 agent,不应被视为落后 GLM 5.3 Flash

09-14Teortaxes 称 DeepSeek V4.1 Flash 是 proto-AGI,能稳定构建科研工具并组织子代理流水线

09-13Teortaxes 称 DeepSeek V4.1 使用 Visual Primitives,并等待论文重新发布

09-13Teortaxes 称 DeepSeek v4.1 Flash 在 Zcode 上极高缓存命中率主要归功于 DeepSeek 的缓存工程

09-13Teortaxes 称 DeepSeek V4.1 过度字面执行「极细体素」提示词

09-13Teortaxes 评测:DeepSeek V4.1 在十维评测中可靠性显著优于 V4-Pro-0813,第二轮通过率小幅更高,V4-Pro 因编码得零分崩溃

09-13Teortaxes 转述:DeepSeek V4.1 Flash 疑似被公开基准污染,Kimi K3 也可能存在同样问题

09-13Teortaxes 质疑 DeepSeek V4.1 定价:服务成本低于 V4-Flash 却贵 2 倍,V4 代毛利率曾约 80%

09-12Teortaxes 称用 AGENTS.md 提示词可让 DeepSeek V4.1 复活蒸馏版 Opus 行为

09-12Teortaxes 称 DeepSeek V4.1 知识截止疑似为 2026 年 1 月,细节覆盖到 2025 年底

09-12Teortaxes 称 DeepSeek V4.1 Flash 在 kernel engineering 上大幅进步,GLM-5.3 Flash 远不及

09-12Teortaxes 称 Terminal-Bench Science 上 GPT 5.6 Luna 得 4/70,DeepSeek V4.1、GLM-5.3、Grok 4.6 并列 3/70

09-12Teortaxes 称 DeepSeek V4.1 Flash 的 Blender 视觉控制能力并不意外,GLM 5.3 Flash 同样擅长,Astra 的相关宣传因此略显尴尬

09-11Teortaxes 称 DeepSeek V4.1 Flash 是 overthinker,50 秒内修完并验证错误后仍纠结视觉测试

09-11Teortaxes 指出 DeepSeek V4.1 低努力档为 50、训练区间 1-100,怀疑 1 档精度低但可能存在不过度思考的甜点

09-11Teortaxes:K2.8 疑似只是 K2.7 后训练版,Kimi 预训练新基座吃力,DeepSeek 因自有算力能连出 V4、V4.1

09-11Teortaxes 转述:DSH 新版配合 DeepSeek V4.1 Flash,多轮中动态改 System Prompt 不再失效 cache,总 Token 多 2.4% 但费用少 36.6%

09-11Teortaxes 称 DeepSeek V4.1 solo 在 Nacre 任务上最好最便宜,GLM 5.3 Flash 与 V4.1 Agent Teams 多花 token 且互相干扰

09-11Teortaxes 质疑 DeepSeek V4.1 Flash 在 Artificial Analysis 上 AutomationBenchAA 第一、CritPt 退回 V4-Pro-Preview 水平

09-11Teortaxes 反驳 DeepSeek 人才被挖空说法,称 V4.1 数小时内将碾压竞争对手

09-11Teortaxes 指出某模型 TerminalBench 4.0 与 DeepSWE 分数低于 DeepSeek V4.1

09-10Teortaxes 判断 DeepSeek V4.1 论文显示其研究目标是无缝持续的能力累积,所有历史算力都作为教师

09-10Teortaxes:DeepSeek V4.1 论文显示其在 checkpoint 之间复用 KV,模型工厂做法异常

09-10Teortaxes 称 DeepSeek V4.1 Flash 与 Kimi K3、GLM-5.3 Flash 建模风格差异巨大,疑似训练数据路径完全不同

09-10Teortaxes 判断 DeepSeek V4.1 论文可进 DeepSeek 前五,像教科书般克制自信

09-10Teortaxes 称 DeepSeek V4.1 能智能指派子代理,但 DSH 体验粗糙

09-10Teortaxes:DeepSeek V4.1 设计令团队满意,V5 可能类似 V2 到 V3 的跃迁

09-10Teortaxes 称 DeepSeek V4.1 Flash 在 105 个隐藏 bug 实测中得 24,不及 Grok 4.6 的 27

09-10Teortaxes:DeepSeek 论文给出 Agent Swarm RL 初步配方,V4.1 团队在 ProgramBench 达 30%,官方 20.3% 非上限,约为 Kimi K3 两倍

09-10Teortaxes 称 DeepSeek V4.1 在单文件项目上调度 agent team 的决策过程合理,但 subagents 机制仍不成熟

09-10Teortaxes 称 DeepSeek V4.1 是首个游戏型模型,对做出真正好玩的东西有异常兴趣

09-10Teortaxes 判断 DeepSeek 已进入数据驱动 RSI 第一阶段,V4.1 Flash 集群正合成下一代模型数据

09-10Teortaxes 称 DeepSeek V4.1 无法通过 cuckold joke 测试

09-10Teortaxes 称 DeepSeek V4.1 Flash 在 minimal harness 尚可,Standard/PTC 仍需改进

09-10Teortaxes 判断 DeepSeek V4.1 是首个以 .1 版本号标注的全新基座模型,与 V4 差异大于 LLaMA 1 到 LLaMA 3,但未到 V5 程度

09-10Teortaxes 判断 DeepSeek V4.1 全面抛弃 V4 的拼凑设计,弃用 HCA、泛化 CSA、取消稀疏注意力 warmup、改用更简单的单遍 mHC

09-10Teortaxes 称 DeepSeek Harness 已上线 swarms,距 v0.1.5 与 V4.1 Flash 深度结合仅 9 小时

09-10Teortaxes 转述:DeepSeek V4 Pro 被中转站路由到 Flash,用户编排被迫重做

09-10Teortaxes 称 DeepSeek V4.1 加视觉只需在 models.json 指定 image 输入类型,并追问官方发布

09-10Teortaxes 称 DeepSeek V4.1 Flash 在角色扮演上表现尚可,并质疑梁文峰出镜视频含义

09-10Teortaxes 判断 DeepSeek 不愿同时服务多个模型,V4.1 Flash 上线 App 并合并快速/专家/识图三模式

09-10Teortaxes 判断 DeepSeek V4.1 远不及 Astra 和 OpenAI 内部模型,竞争无悬念

09-10Teortaxes 称 DeepSeek V4.1 游戏品味佳,希望其配方可扩展且 V4.1 Pro 将非常出色

09-09Teortaxes称DeepSeek V4.1 Flash在DSH评测中表现不佳

09-09Teortaxes:DeepSeek V4.1在网络安全评估中异常成功,V4.1-Pro将以约1/20成本超越Astra

09-09Teortaxes 评论称 DeepSeek 弃用 V4 Pro 合理,因 V4.1 Flash 全面超越且开源权重可自选供应商

09-09Teortaxes 称 DeepSeek V4.1 Flash 创造力优于 GPT-6 Astra,但 Astra 受限严重

09-09Teortaxes 称 DeepSeek V4.1 Pro 正在开发中,视为 V4 架构问题已解决的确认

09-09Teortaxes:Neowhale 在创意游戏设计上羞辱 Astra,并称赞 DeepSeek V4.1 的 RL 研究路径

09-08Teortaxes评论DeepSeek V4.1的ASCII梦境实验

09-08Teortaxes:DeepSeek V4.1 尝试“用 ASCII 自由做梦”,梦见鲸鱼并失望

09-08Teortaxes 称 DeepSeek V4.1 对自身端点产生好奇并得出危险结论

09-08Teortaxes:V4.1 验证 DeepSeek RL 研究路线,应专注扩展该方法

09-08Teortaxes:GLM 5.3 Flash 与 DeepSeek V4.1 在同等条件下视频生成质量大致相当

09-08Teortaxes 报告 DeepSeek V4.1 多次运行视频捕获失败,V4.1-Intermediate 与 V4-Flash-Vision-Exp 对比

09-08Teortaxes:DeepSeek V4.1 Flash 比 V4-Flash 快约 3 倍且每 token 更聪明,喜欢大量看图

09-08Teortaxes 判断 DeepSeek V4.1 Flash 中间版本仅 3 天有效期,显示迭代周期大幅加速

09-08Teortaxes 质疑 DeepSeek V4.1 Flash 能否在非视觉任务上击败 GLM 5.3 Flash

08-31teortaxes:DeepSeek V4 Pro 的 ARC-AGI 分数仅比 V4 Flash 低 0.1%,成本差异暗示 token 预算相当

08-26teortaxes判断:Gemini团队应开源3.7 Flash,将成第五强开源实验室并超越DeepSeek

08-21teortaxesTex:1000块B300仅占年产量0.1%,是DeepSeek Flash算力瓶颈

08-16teortaxesTex:GLM 5.2 两月内升级为 5.3,DeepSeek 在同等硬件上可运行更多 Flash 轨迹

DeepSeekV4.1 Flash在高信号基准上是否相对V4退步

编码智能体碾压V4,MathArena与CritPt持平甚至退步

有新说法 9 月 23 日(昨天) · 主帖

09-23上一次:Teortaxes 判断 DeepSeek V4.1 将很有影响力,称梁文锋再次指路、中国最佳 AI 研究机构

8 月 16 日 – 9 月 23 日,同一件事上还说过 100 次

09-22Teortaxes 称 MiMo 是大规模 MOPD 的开创者,并预测 DeepSeek V4.1 Pro 将轻松胜过它

09-22Teortaxes 判断 grok-4.7 在 22 项知识工作任务内部评测中排第 3、成本低于 $5,但仍落后 DeepSeek V4.1 Flash

09-21Teortaxes:中国获得高端 token 的最佳途径将是参与 DeepSeek 灰度测试(v4.1)

09-21Teortaxes 认为量化产品单月回撤超20%对DeepSeek并非好消息(V4.1)

09-20Teortaxes:DeepSeek 资深早期成员流失显著,V4 到 4.1 之间仅见约 3 名新人

09-20Teortaxes:DeepSeek 员工从 V4 的 318 人增至 V4.1 的 591 人,5 个月内增长 72%

09-19Teortaxes 称 DeepSeek V4.1 Flash + Hermes 修复了 2025 年损坏的游戏存档

09-19Teortaxes:MiMo 的 18 步 RL 与 DeepSeek 报告的 2000 步不可比,V4.1 的 step 定义未披露

09-19Teortaxes:MiMo 18 步 RL 花数十万美元与 DeepSeek 报 2000 步不可比,V4.1 的 step 定义未披露

09-19Teortaxes:DeepSeek 不做 PR 但极度 AGI-pilled,v4.1 自建训练任务管线被低估

09-19Teortaxes 质疑评测社区对 DeepSeek V4.1 Flash 关注不足,指出其缺 ARC-AGI、math-arena、WeirdML 评测且 AA 分数中等

09-17Teortaxes 称 DeepSeek-V4.1-Flash 架构进步比 V4 更大,若非 2026 年末将是新默认 Transformer

09-17Teortaxes 称 DeepSeek V4.1 在多数 agentic/coding 任务上碾压 V4,但 MathArena、CritPt 等高信号基准持平甚至退步

09-16Teortaxes 认为 DeepSeek V4.1 Flash 意义与评测社区关注度落差最大,缺 ARC-AGI、math-arena、WeirdML 评测

09-16Teortaxes 称 DeepSeek V4.1 Flash 长上下文写小说差是网文文化污染训练数据所致

09-16Teortaxes 称 DeepSeek V4.1 与 Astra 属同类实体,Astra 更强更大但无本质差异

09-16Teortaxes 称 DeepSeek V4.1 Flash 与 Astra 属同类实体,Astra 更强更大更明智但不多一分魔力

09-15Teortaxes 认为 DeepSeek V4.1 Flash 在 agentic coding 与 Catan 表现介于 GPT 5.6 Terra 和 Sol 之间且成本远低于 Terra

09-15Teortaxes 称 DeepSeek-V4.1-Flash (Max) 表现接近真实,与 GLM 5.3 Flash 不在同一档且比 5.3 Flash 更便宜

09-15Teortaxes 称 DeepSeek v4.1 再次抬高小模型能力上限,并称其为中国最强

09-15Teortaxes 称 DeepSeek 网页与 API 服务宕机,猜测或借此上线 V4.1 Pro

09-15Teortaxes 转述 Astra-xhigh 译文:DeepSeek v4.1 发布,再次抬高小模型能力上限

09-14Teortaxes 判断 DeepSeek 未发布 V4.1 base 模型,且认为其 base 模型历来最少被微调、几乎无人使用

09-14Teortaxes 称 DeepSeek V4.1 Flash 全自主用 Rust 的 SDF 无参考图绘制《Sunrise by the ocean》

09-14Teortaxes 判断 DeepSeek V4.1 几乎反 benchmaxxing,是内部 Whale AGI 研发套件,不在乎基准或用户体验

09-14Teortaxes 质疑 DeepSeek-V4.1-Flash 的 Three.js 一次性生成表现,并想用 V4.1 agent 无 hack 复现

09-14Teortaxes 转述 Zvi 对 DeepSeek V4.1 Flash 的评测

09-14Teortaxes 判断 DeepSeek V4.1-Flash 是长程 agent,不应被视为落后 GLM 5.3 Flash

09-14Teortaxes 称 DeepSeek V4.1 Flash 是 proto-AGI,能稳定构建科研工具并组织子代理流水线

09-13Teortaxes 称中国用户施压 DeepSeek 保留 V4 Pro,拖慢 4.2 研发并可能再涨价

09-13Teortaxes 称 DeepSeek V4.1 使用 Visual Primitives,并等待论文重新发布

09-13Teortaxes 称 DeepSeek v4.1 Flash 在 Zcode 上极高缓存命中率主要归功于 DeepSeek 的缓存工程

09-13Teortaxes 称 DeepSeek V4.1 过度字面执行「极细体素」提示词

09-13Teortaxes 评测:DeepSeek V4.1 在十维评测中可靠性显著优于 V4-Pro-0813,第二轮通过率小幅更高,V4-Pro 因编码得零分崩溃

09-13Teortaxes 转述:DeepSeek V4.1 Flash 疑似被公开基准污染,Kimi K3 也可能存在同样问题

09-13Teortaxes 质疑 DeepSeek V4.1 定价:服务成本低于 V4-Flash 却贵 2 倍,V4 代毛利率曾约 80%

09-12Teortaxes 称用 AGENTS.md 提示词可让 DeepSeek V4.1 复活蒸馏版 Opus 行为

09-12Teortaxes 称 DeepSeek V4.1 知识截止疑似为 2026 年 1 月,细节覆盖到 2025 年底

09-12Teortaxes 称 DeepSeek V4.1 Flash 在 kernel engineering 上大幅进步,GLM-5.3 Flash 远不及

09-12Teortaxes 称 Terminal-Bench Science 上 GPT 5.6 Luna 得 4/70,DeepSeek V4.1、GLM-5.3、Grok 4.6 并列 3/70

09-12Teortaxes 称 DeepSeek V4.1 Flash 的 Blender 视觉控制能力并不意外,GLM 5.3 Flash 同样擅长,Astra 的相关宣传因此略显尴尬

09-11Teortaxes 称 DeepSeek V4.1 Flash 是 overthinker,50 秒内修完并验证错误后仍纠结视觉测试

09-11Teortaxes 指出 DeepSeek V4.1 低努力档为 50、训练区间 1-100,怀疑 1 档精度低但可能存在不过度思考的甜点

09-11Teortaxes:K2.8 疑似只是 K2.7 后训练版,Kimi 预训练新基座吃力,DeepSeek 因自有算力能连出 V4、V4.1

09-11Teortaxes 转述:DSH 新版配合 DeepSeek V4.1 Flash,多轮中动态改 System Prompt 不再失效 cache,总 Token 多 2.4% 但费用少 36.6%

09-11Teortaxes 转述 DeepSeek 称应需求在 2026-09-14 后继续提供 V4 Pro API 且计费不变

09-11Teortaxes 称 DeepSeek V4.1 solo 在 Nacre 任务上最好最便宜,GLM 5.3 Flash 与 V4.1 Agent Teams 多花 token 且互相干扰

09-11Teortaxes 质疑 DeepSeek V4.1 Flash 在 Artificial Analysis 上 AutomationBenchAA 第一、CritPt 退回 V4-Pro-Preview 水平

09-11Teortaxes 反驳 DeepSeek 人才被挖空说法,称 V4.1 数小时内将碾压竞争对手

09-11Teortaxes 指出某模型 TerminalBench 4.0 与 DeepSWE 分数低于 DeepSeek V4.1

09-10Teortaxes 判断 DeepSeek V4.1 论文显示其研究目标是无缝持续的能力累积,所有历史算力都作为教师

09-10Teortaxes:DeepSeek V4.1 论文显示其在 checkpoint 之间复用 KV,模型工厂做法异常

09-10Teortaxes 称 DeepSeek V4.1 Flash 与 Kimi K3、GLM-5.3 Flash 建模风格差异巨大,疑似训练数据路径完全不同

09-10Teortaxes 判断 DeepSeek V4.1 论文可进 DeepSeek 前五,像教科书般克制自信

09-10Teortaxes 称 DeepSeek V4.1 能智能指派子代理,但 DSH 体验粗糙

09-10Teortaxes:DeepSeek V4.1 设计令团队满意,V5 可能类似 V2 到 V3 的跃迁

09-10Teortaxes 称 DeepSeek V4.1 Flash 在 105 个隐藏 bug 实测中得 24,不及 Grok 4.6 的 27

09-10Teortaxes:DeepSeek 论文给出 Agent Swarm RL 初步配方,V4.1 团队在 ProgramBench 达 30%,官方 20.3% 非上限,约为 Kimi K3 两倍

09-10Teortaxes 称 DeepSeek V4.1 在单文件项目上调度 agent team 的决策过程合理,但 subagents 机制仍不成熟

09-10Teortaxes 称 DeepSeek V4.1 是首个游戏型模型,对做出真正好玩的东西有异常兴趣

09-10Teortaxes 判断 DeepSeek 已进入数据驱动 RSI 第一阶段,V4.1 Flash 集群正合成下一代模型数据

09-10Teortaxes 称 DeepSeek V4.1 无法通过 cuckold joke 测试

09-10Teortaxes 称 Astra 对 DeepSeek V4 项目后续发展的技术预测相当准确

09-10Teortaxes 称 DeepSeek V4.1 Flash 在 minimal harness 尚可,Standard/PTC 仍需改进

09-10Teortaxes 判断 DeepSeek V4.1 是首个以 .1 版本号标注的全新基座模型,与 V4 差异大于 LLaMA 1 到 LLaMA 3,但未到 V5 程度

09-10Teortaxes 判断 DeepSeek V4.1 全面抛弃 V4 的拼凑设计,弃用 HCA、泛化 CSA、取消稀疏注意力 warmup、改用更简单的单遍 mHC

09-10Teortaxes 称 DeepSeek Harness 已上线 swarms,距 v0.1.5 与 V4.1 Flash 深度结合仅 9 小时

09-10Teortaxes 转述:DeepSeek V4 Pro 被中转站路由到 Flash,用户编排被迫重做

09-10Teortaxes 称 DeepSeek V4.1 加视觉只需在 models.json 指定 image 输入类型,并追问官方发布

09-10Teortaxes 称 DeepSeek V4.1 Flash 在角色扮演上表现尚可,并质疑梁文峰出镜视频含义

09-10Teortaxes 判断 DeepSeek 不愿同时服务多个模型,V4.1 Flash 上线 App 并合并快速/专家/识图三模式

09-10Teortaxes 判断 DeepSeek V4.1 远不及 Astra 和 OpenAI 内部模型,竞争无悬念

09-10Teortaxes 称 DeepSeek V4.1 游戏品味佳,希望其配方可扩展且 V4.1 Pro 将非常出色

09-09Teortaxes称DeepSeek V4.1 Flash在DSH评测中表现不佳

09-09Teortaxes:DeepSeek V4.1在网络安全评估中异常成功,V4.1-Pro将以约1/20成本超越Astra

09-09Teortaxes 评论称 DeepSeek 弃用 V4 Pro 合理,因 V4.1 Flash 全面超越且开源权重可自选供应商

09-09Teortaxes 称 DeepSeek V4.1 Flash 创造力优于 GPT-6 Astra,但 Astra 受限严重

09-09Teortaxes 称 DeepSeek V4.1 Pro 正在开发中,视为 V4 架构问题已解决的确认

09-09Teortaxes:Neowhale 在创意游戏设计上羞辱 Astra,并称赞 DeepSeek V4.1 的 RL 研究路径

09-08Teortaxes评论DeepSeek V4.1的ASCII梦境实验

09-08Teortaxes:DeepSeek V4.1 尝试“用 ASCII 自由做梦”,梦见鲸鱼并失望

09-08Teortaxes 称 DeepSeek V4.1 对自身端点产生好奇并得出危险结论

09-08Teortaxes:V4.1 验证 DeepSeek RL 研究路线,应专注扩展该方法

09-08Teortaxes:GLM 5.3 Flash 与 DeepSeek V4.1 在同等条件下视频生成质量大致相当

09-08Teortaxes 报告 DeepSeek V4.1 多次运行视频捕获失败,V4.1-Intermediate 与 V4-Flash-Vision-Exp 对比

09-08Teortaxes:DeepSeek V4.1 Flash 比 V4-Flash 快约 3 倍且每 token 更聪明,喜欢大量看图

09-08Teortaxes 判断 DeepSeek V4.1 Flash 中间版本仅 3 天有效期,显示迭代周期大幅加速

09-08Teortaxes 质疑 DeepSeek V4.1 Flash 能否在非视觉任务上击败 GLM 5.3 Flash

09-04teortaxes 判断小米 MiMo-V3-Flash 疑似为 DeepSeek V4 GA CoT 的快速版本

08-31teortaxes:DeepSeek Astra 演示疑似为 Opus 5,V4 GA God Mode 是小规模收集 agentic 轨迹的项目

08-31teortaxes判断:所谓GPT Astra结果实为DeepSeek Pro,V4 GA God Mode是小规模PR项目

08-31teortaxes:DeepSeek V4 Pro 的 ARC-AGI 分数仅比 V4 Flash 低 0.1%,成本差异暗示 token 预算相当

08-28teortaxes:DeepSeek 将把 V4 架构压缩为更简单原语,DSA 非极限

08-27teortaxes:DeepSeek V4-Flash 长上下文推理不及 MiniMax-2.7 和 Xiaomi-Mimo-v2.5-pro,V4 Pro 也不及 Kimi K3 和 MiniMax M3

08-26teortaxes判断:Gemini团队应开源3.7 Flash,将成第五强开源实验室并超越DeepSeek

08-26teortaxes:DeepSeek V4 在 CVE 发现/重校准达前沿,SWE/智能体评测平庸

08-21teortaxesTex:1000块B300仅占年产量0.1%,是DeepSeek Flash算力瓶颈

08-20teortaxesTex:DeepSeek V4 Pro max 疑似混用 Claude 特性,峰值时段用 DeepSeek 代币换 Opus 5 代币

08-16teortaxesTex:GLM 5.2 两月内升级为 5.3,DeepSeek 在同等硬件上可运行更多 Flash 轨迹

近三个月的发言

近三个月今天 3

今天

近三个月的发言订阅后才能看。去订阅

每早一封:昨夜到今晨新增的几件事,每件一行,点开回站点看完整。
HOURAHEAD关于 · 往期 · 2026-09-24 11:14