跳到正文
汉松札记
返回

Agent 构建 Agent

AI Highlight

来源

文本来源是 AI Engineer 频道视频《Agent 构建 Agent》的修复版中文稿。下面按汉松兴趣画像优先保留机制解释、反常识判断和可复用工作流,而不是做普通摘要。

开头可以先抓住一句:本演讲来自 AI Engineer 频道,主题为”Agent 构建 Agent”——介绍如何借助编程辅助工具与规格驱动开发,通过 AutoAgent 循环和实时数据分析流水线,迭代构建可靠、安全的 AI Agent。

一、第 1 段

背景

介绍演讲者背景、行业现状,以及使用 AI 构建 AI Agent 的动机与挑战。

但从第一性原理出发,我们可以说:Agent 就是一个运行在 Agent 式循环中的 LLM,它连接着工具,能够检索上下文。就这些。今天我们要分析两类问题。第一类是在评测上表现差,我们稍后会介绍评测是什么。第二类是在实时数据上表现差,有时和评测中的问题类似,但来自真实用户、带着真实期望的实时数据,往往范围更广,有时也更混乱。

兴趣匹配度很高。它对应的是 Agent 工程化的核心问题:如何把不稳定的模型行为放进清晰的状态、动作、工具和反馈闭环里。

二、第 2 段

背景

介绍黄金数据集、评测体系,以及 AutoAgent 循环的基本原理与实验结果。

这是最基础的形态。我们也构建了一个简单的评测器。还记得黄金数据集只有输入和输出吗?这个简单评测器做的事情,就是检查 LLM 的输出是否包含我们期望的标准答案。当然,运行评测套件后,结果非常糟糕,通过率只有 18%。这是因为有些问题足够简单,比如加法、乘法,LLM 的训练数据里就有这些知识,不需要访问任何外部上下文或特定工具就能回答。所以 18% 的问题可以靠 LLM 的权重来回答,其余的不行。我们需要一种方法来提升这个通过率。

兴趣匹配度很高。它对应的是 Agent 工程化的核心问题:如何把不稳定的模型行为放进清晰的状态、动作、工具和反馈闭环里。

三、第 3 段

背景

详细讲解 AutoAgent 的工作流:创建优化任务、生成基线报告、逐轮迭代假设与回滚机制。

此外,Claude Code 还可以读取执行轨迹,包括思考轨迹或目标 Agent 的完整运行轨迹,判断哪里出了问题、哪里没有按预期工作,从而实现自我改进。当然,人类也在循环中。人类通常负责构建初始 Agent,并尽可能多地向编程 Agent 提供上下文,告诉它可以做什么、不能做什么。比如,修改黄金数据集或评分器来让评测通过,就不是个好主意,所以我们要明确告诉 AI Agent 不要这样做。作为人类,我们可以适当引导编程 Agent,让它去优化目标 Agent。

详细讲解 AutoAgent 的工作流:创建优化任务、生成基线报告、逐轮迭代假设与回滚机制。

兴趣匹配度很高。它对应的是 Agent 工程化的核心问题:如何把不稳定的模型行为放进清晰的状态、动作、工具和反馈闭环里。

四、第 4 段

背景

展示真实生产 Agent 的优化案例,并引入第二类问题——基于实时用户数据的性能改进流程。

现在,我们今天要解决的第二类问题不是评测数据,而是实时数据中的糟糕表现。所谓实时数据,是指我们从真实用户、Beta 测试者、领域专家那里收集的数据,也就是来自所有正在积极测试和使用系统、并给我们反馈的人。举个例子,右侧可以看到”这个回答有帮助吗?“,用户可以选择”是”或”否”,然后留下备注。我们利用这些数据来进一步优化 Agent。

兴趣匹配度很高。它对应的是 Agent 工程化的核心问题:如何把不稳定的模型行为放进清晰的状态、动作、工具和反馈闭环里。

五、第 5 段

背景

详述实时数据分析流水线:收集执行轨迹、聚类失败模式、生成 Markdown 报告、与领域专家协作分诊。

第二步之后,我们期望用户给我们反馈。正如我提到的,用户可以点赞或点踩,然后留下评论,说明什么做得好、什么没做好,以及系统的预期行为是什么。另一个选项是让领域专家对执行轨迹进行标注。如果没有真实用户的反馈,我可以请领域专家查看执行轨迹,投入时间,像用户一样给我们反馈。第三步是收集所有带反馈的执行轨迹,并以 JSON 或你使用的任何格式下载到本地。如你所见,这里我们有 114 条执行轨迹,我们用这些轨迹来做聚类分析。我们如何运行分析?这实际上是我们构建的一个技能。

详述实时数据分析流水线:收集执行轨迹、聚类失败模式、生成 Markdown 报告、与领域专家协作分诊。

兴趣匹配度很高。它对应的是 Agent 工程化的核心问题:如何把不稳定的模型行为放进清晰的状态、动作、工具和反馈闭环里。

整体判断

这篇最值得保留的不是某个单点技巧,而是它把「Agent 构建 Agent」放进了更完整的工程框架里:第 1 段、第 2 段、第 3 段。这些内容可以作为汉松后续写 AI 工程、Agent 系统和团队工作流时的素材。

更重要的是,它提供了一种判断 AI 系统的方式:先看问题如何被拆成状态、动作、工具、评估和人的边界,再看模型能力如何嵌进去。只有这样,视频里的做法才会从一次演示变成可迁移的方法。

AI Highlight RSS
分享这篇文章:


上一篇
100 工具 Agent 是个陷阱
下一篇
Agent 化 AI 工程师