9 月 24 日

厂商

Qwen

投资者视角 · 只摆公开事实与变化,不是投资建议。

刚才看的:DeepSeek Harness 发布

关键数字
Qwen 旗舰智能指数Qwen3.8 Max (0902);AA v4.3 榜单显示 45,精确 45.4445.02026-09-18

比上次:有变化 1

在跟的事 · 3 件最新说法
无变化Qwen3.8登顶编码榜能否换掉闭源办公旗舰
Teortaxes9/12 科研工作流榜Max与37B仅1/70,不信27B高于GPT 5.6 Sol Max𝕏
无变化成本榜第三能否覆盖智能体办公差距
无变化开源推理栈已日零Ollama是否仍未跟上

另有 3 件未展开

无变化Qwen3.8登顶编码榜能否换掉闭源办公旗舰

何时见分晓:本月工作流榜复测
QwenTeortaxes 说法不一
Qwen · 9月2日
Max-0902以1691分登顶WebDev编码榜,27B开源第一整体第七
Teortaxes · 9月12日
科研工作流榜Max与37B仅1/70,不信27B高于GPT 5.6 Sol Max

Qwen · 9月2日 Qwen3.8-Max-0902 登顶 CodeArena WebDev 排行榜,得分 1691𝕏

Qwen · 8月26日 Qwen:Qwen3.8-27B在Image-to-WebDev Arena开源模型中排名第一,整体第七,27B参数性能媲美百倍规模模型𝕏

Teortaxes · 9月12日 Teortaxes 称 Terminal-Bench Science 上 GPT 5.6 Luna 得 4/70,DeepSeek V4.1、GLM-5.3、Grok 4.6 并列 3/70𝕏

Teortaxes · 8月22日 teortaxes:不信 ox alpha 低于 Qwen 3.8 27B,也不信 Qwen 27B 高于 GPT 5.6 Sol Max𝕏

无变化成本榜第三能否覆盖智能体办公差距

何时见分晓:本月GDPval-AA对账
Patrick Moorhead · 9月5日
Flash-Next每正确任务17美分排第三,开源权重首次高于托管层
新实验室GDPval-AA领先DeepSeek和Qwen,智能体基准才是差异化

Patrick Moorhead · 9月5日 Patrick Moorhead:Qwen3.8-Flash-Next 在 Signal_65 PINNACLE 以 17 美分/正确任务位列第三,首个开源权重模型在成本上超越托管层𝕏

Artificial Analysis · 9月1日 Artificial Analysis:新实验室进入中端并在GDPval-AA上领先DeepSeek和Qwen,称智能体基准成为真正差异化因素𝕏

无变化开源推理栈已日零Ollama是否仍未跟上

何时见分晓:Ollama后续版本说明
OllamavLLM 说法不一
Ollama · 8月28日
正在认真考虑支持Qwen 3.8
vLLM · 8月26日
Flash-Next已日零支持,并在NVIDIA与AMD GPU上验证

我们只标出对不上的地方,不下结论。出处是中文摘要。由模型梳理后经引用校验,未逐条人工复核。

近期要闻

相关

谁在跟踪

这不是投资建议。

每早一封:昨夜到今晨新增的几件事,每件一行,点开回站点看完整。
HOURAHEAD关于 · 往期 · 2026-09-24 12:55