9 月 24 日

E

Elvis Saravia带走

研究者

今天 · 2 条 · Elvis Saravia 转述 Almanac 面向医生推出医疗 agent,任务在独立 sandbox 运行并需授权

Elvis Saravia 称 Google 论文指出自动优化 agent harness 会让评测分上升但真实任务变差,并给出防止方法

他还在追的几件事3 件

Agent 框架更强模型会否继续上移测试改动的权限闸

用Jev给harness的/goal做自定义verifier,查目标是否真完成

有新说法 9 月 24 日(今天) · 主帖 · 看Agent 框架的记录

09-24上一次:Elvis Saravia 称 Google 论文指出自动优化 agent harness 会让评测分上升但真实任务变差,并给出防止方法

8 月 22 日 – 9 月 24 日,同一件事上还说过 18 次

09-22Elvis Saravia 推荐 AML 的 Agent Memory Challenge,用 150 个软件任务测试检索陈旧上下文问题

09-21Elvis Saravia 预告将发布用 Jev 构建 System 1 + System 2 agent harness 的指南

09-21Elvis Saravia 建议把 Jev 合集喂给 agent 以生成新用例

09-20Elvis Saravia 认为 Jev 类 System One 模型在持续评测、长时程 agent 验证器与递归自改进 harness 三方向值得关注

09-16Elvis Saravia 转述 Salesforce 基于 Nemotron-3-Super-120B 训练企业 agent 模型 Koa

09-15Elvis Saravia 称多 agent harness 同步是难点,并转述 Plasma AI 发布 Radio 方案

09-15Elvis Saravia 建议用 TypeScript 或 Python 从零构建 agent harness 以真正理解其机制

09-15Elvis Saravia 建议用 TypeScript 或 Python 从零构建 agent harness 以真正理解其原理

09-14Elvis Saravia 判断:AI 工程师应学习构建 agent harness,以获取 agent 的独特价值

09-12Elvis Saravia 主张自建并优化 agent harness 能更快拿到更好代码、输出与成本

09-04Elvis Saravia:评测单元应是完整求解器(模型+工具+记忆+执行环境+控制回路),仅评基座模型会漏掉智能体实际失败点

09-02Elvis Saravia:openJiuwen 开源 harness 展示静态 agent harness 可被推进多远

08-29Elvis Saravia 赞同 Sam 观点:拥有自己的智能体、工具链和智能,基于开源和模型无关构建

08-26Elvis Saravia 推荐关于 agent harness 评估的论文:12 个开源模型在 26 种配置下回答 3,679 道题

08-25Elvis Saravia 推荐阅读:Prime Agent 开源自我改进 harness 出现

08-24Elvis Saravia:探讨 agent harness 如何支持递归自我改进(RSI)

08-22Elvis Saravia:开源 harness 是未来,正基于 Pi 和 Hermes Agent 构建

Agent 框架现成智能体套件是否过臃肿因而必须自建

开箱harness过臃肿,自建可再压成本,停用后token大降

有新说法 9 月 24 日(今天) · 主帖

09-24上一次:Elvis Saravia 称 Google 论文指出自动优化 agent harness 会让评测分上升但真实任务变差,并给出防止方法

8 月 22 日 – 9 月 24 日,同一件事上还说过 23 次

09-23Elvis Saravia 推荐 Microsoft Research 论文:无预设角色、通过共享进度通信的多智能体协作

09-21Elvis Saravia 预告将发布用 Jev 构建 System 1 + System 2 agent harness 的指南

09-20Elvis Saravia 推荐 MIT 与 Sakana AI 的 SIFT 论文:自改进编码智能体在 Polyglot 上以 o3-mini 达 35.1%,CPU 小时仅为 DGM 的十分之一

09-20Elvis Saravia 认为 Jev 类 System One 模型在持续评测、长时程 agent 验证器与递归自改进 harness 三方向值得关注

09-15Elvis Saravia 称多 agent harness 同步是难点,并转述 Plasma AI 发布 Radio 方案

09-15Elvis Saravia 建议用 TypeScript 或 Python 从零构建 agent harness 以真正理解其机制

09-15Elvis Saravia 建议用 TypeScript 或 Python 从零构建 agent harness 以真正理解其原理

09-14Elvis Saravia 判断:AI 工程师应学习构建 agent harness,以获取 agent 的独特价值

09-12Elvis Saravia 主张自建并优化 agent harness 能更快拿到更好代码、输出与成本

09-09Elvis Saravia 认为智能体产生的代码超出评审流程设计处理能力,且缺乏资深工程师的上下文

09-04Elvis Saravia:评测单元应是完整求解器(模型+工具+记忆+执行环境+控制回路),仅评基座模型会漏掉智能体实际失败点

09-02Elvis Saravia:openJiuwen 开源 harness 展示静态 agent harness 可被推进多远

08-30Elvis Saravia 推荐 Apple 论文 Agent Seer:从 MCP 规范生成评测套件

08-29Elvis Saravia 赞同 Sam 观点:拥有自己的智能体、工具链和智能,基于开源和模型无关构建

08-28Elvis Saravia 推荐 Google 论文:通过持久知识库维护智能体技能

08-26Elvis Saravia:学习AI智能体应从理解基础开始,再通过构建实践

08-26Elvis Saravia 推荐关于 agent harness 评估的论文:12 个开源模型在 26 种配置下回答 3,679 道题

08-26Elvis Saravia 质疑 KeenableAI 同时构建索引与查询语言,好奇 WQL 相比标准搜索 API 能改变智能体回答的问题类型

08-25Elvis Saravia 推荐阅读:Prime Agent 开源自我改进 harness 出现

08-24Elvis Saravia:探讨 agent harness 如何支持递归自我改进(RSI)

08-24Elvis Saravia 判断游戏引擎将成为智能体评估新环境

08-22Elvis Saravia:开源 harness 是未来,正基于 Pi 和 Hermes Agent 构建

开源权重前沿开源权重实践上是否仍远落后闭源前沿

称闭源与开源差距已成过去,Bolt上GLM 5.3 Flash占54%

重申 9 月 18 日(6 天前) · 主帖 · 看开源权重前沿的记录

09-18上一次:Elvis Saravia 称闭源与开源模型差距已成过去,引用 Bolt 数据 GLM 5.3 Flash 占 54%

8 月 24 日 – 9 月 18 日,同一件事上还说过 9 次

09-07Elvis Saravia 判断开源模型将在递归自我改进中扮演重要角色,并已从开源权重模型 token 使用量快速增长中看到苗头

09-04Elvis Saravia:看好开源模型,AGI 应一次性开放而非分阶段

09-03Elvis Saravia 评论称开源模型可解 Parad0x80 之困

09-03Elvis Saravia:前沿开源模型在编码与长程任务上提速明显,Muse Spark 1.2 到 1.3 仅隔 4 周

08-30Elvis Saravia:开源廉价模型入门指南,回应 Joonahn 关于开源模型使用门槛的讨论

08-30Elvis Saravia 赞同:拥有 harness 获得模型独立性,拥有模型层获得数据主权,微调开源权重模型是抵御 API 撤出的唯一方式

08-28Elvis Saravia:自托管开源模型在成本与速率限制上优于前沿闭源模型

08-24Elvis Saravia:开源模型token份额将持续上升,多智能体模式是关键

近三个月的发言

近三个月今天 3

今天

主帖Google 论文指出自动优化 agent harness 会让评测分上升但真实任务变差,并给出防止方法𝕏

近三个月的发言订阅后才能看。去订阅

每早一封:昨夜到今晨新增的几件事,每件一行,点开回站点看完整。
HOURAHEAD关于 · 往期 · 2026-09-24 12:07