9 月 24 日Agent 框架

环节

Agent 框架

多步 agent 编排框架,能否被模型原生能力吸收

带到 ChatGPT带走
更多

比上次:有变化 4

在跟的事 · 3 件最新说法
有变化公开演示集满分到底算模型还是整栈框架
François Chollet9/1
公开集只演示环境格式,质疑把100%写成通用编码agent得分𝕏
有变化智能体改进究竟主要靠框架还是更强模型
证据范围不同(定量 / 定性)· 无法比较
Harrison Chase9/10
agent改进是harness改进不是模型改进,干预常在工具边界𝕏
有变化更强模型会否继续上移测试改动的权限闸

另有 3 件未展开

有变化公开演示集满分到底算模型还是整栈框架

何时见分晓:半私有集核验尚未公布
NVIDIAFrançois Chollet 说法不一
NVIDIA · 8月21日
AVO在公开演示集100%清183关,称满分需全栈调优与安全
François Chollet · 9月1日
公开集只演示环境格式,质疑把100%写成通用编码agent得分

NVIDIA · 8月21日 NVIDIA 称 ARC-AGI-3 满分证明需全 agent 栈调优与安全𝕏

NVIDIA · 8月22日 NVIDIA AVO coding agent scored 100% on ARC-AGI-3, clearing 183 levels across 25 environments without instructions or sta𝕏

François Chollet · 9月1日 François Chollet 质疑 Intel 在 ARC-AGI-3 上 100% 得分的声明,指出公开集仅用于演示环境格式𝕏

有变化智能体改进究竟主要靠框架还是更强模型

何时见分晓:下一次后训练对照观测
Harrison ChaseTogether AI 说法不一
Harrison Chase · 9月10日
agent改进是harness改进不是模型改进,干预常在工具边界
Together AI · 8月31日
GLM-5.3不换基座,加长程环境后训练即在agentic基准超过Fable 5

Harrison Chase · 9月10日 Harrison Chase 认同智能体改进是 harness 改进而非模型改进,干预常在工具边界𝕏

Together AI · 8月31日 Together AI:GLM-5.3 在智能体基准上超越 GPT-5.6 Sol 和 Claude Fable 5,5.3 Flash 紧随其后𝕏

Harrison Chase · 9月22日 Harrison Chase 称 jev 代表 decision models 方向,SemIf 基于 qwen3.5 已在 LangSmith Gateway 免费托管一周𝕏

Elvis Saravia · 9月23日 Elvis Saravia:同一 GPT-5.5 在 Claude Code 与 Codex 两个 harness 下跑 1000 任务,结果差异显著𝕏

有变化更强模型会否继续上移测试改动的权限闸

何时见分晓:下一代模型权限闸观测
Nathan LabenzElvis Saravia 说法不一
Nathan Labenz · 9月18日
转述:Fable前改测试须先申请,Fable后可先改后告知
Elvis Saravia · 9月20日
用Jev给harness的/goal做自定义verifier,查目标是否真完成

我们只标出对不上的地方,不下结论。出处是中文摘要。由模型梳理后经引用校验,未逐条人工复核。

这页的完整内容订阅后可见。去订阅

每早一封:昨夜到今晨新增的几件事,每件一行,点开回站点看完整。
HOURAHEAD关于 · 往期 · 2026-09-24 12:03