来源
- 原始链接:https://www.youtube.com/watch?v=Jx4ZFEAq6bY
- 来源类型:视频逐字稿
- 来源标题:用户信号死在检索边界
文本来源是 AI Engineer 频道视频《用户信号死在检索边界》的修复版中文稿。下面按汉松兴趣画像优先保留机制解释、反常识判断和可复用工作流,而不是做普通摘要。
开头可以先抓住一句:这场 AI Engineer 演讲讨论 Agent 为什么会在检索阶段反复失败:传统记忆系统多数只按语义相似度保存偏好和历史,缺少来自执行结果的反馈。演讲者提出 Agent RX 和效用分数,把任务结果、评测信号和历史有用性纳入检索重排,让 Agent 的记忆从静态事实库变成能随运行经验更新的推理层,并通过 SQL 产品搜索演示展示反馈如何改变后续工具调用轨迹。
一、问题:Agent 缺少从结果中学习的检索层
背景
演讲者先定义 Agent:一个具备自主性的 LLM,可以推理、调用工具、与现实世界交互并检索记忆来完成任务。她指出当前 Agent 架构中常缺少学习闭环,评测和可观测性系统捕获了成败信号,但这些信号通常停留在仪表盘里,没有进入 Agent 的上下文、技能或后续行动。
因此,Agent 会在同一个任务上反复失败。Gartner 报告说,85% 的 AI 没能获得有效采用。这个说法也出现在 McKinsey 的 2025 年报告里。问题大多数时候在于检索是静态的。我们 73% 的流水线失败是因为检索,而不是生成或上下文堆砌。Pinecone 前 CTO Ram Sriram 最近有一篇帖子说:我们一直在优化错误的东西。你为 Agent 的记忆付了很多钱,而这套东西很可能是坏的。我们一直在优化错误的东西。我们让错误答案变得更快、更便宜,却忘了让检索学会学习。那么,这为什么重要?
演讲者先定义 Agent:一个具备自主性的 LLM,可以推理、调用工具、与现实世界交互并检索记忆来完成任务。她指出当前 Agent 架构中常缺少学习闭环,评测和可观测性系统捕获了成败信号,但这些信号通常停留在仪表盘里,没有进入 Agent 的上下文、技能或后续行动。
兴趣匹配度很高。它对应的是 Agent 工程化的核心问题:如何把不稳定的模型行为放进清晰的状态、动作、工具和反馈闭环里。
二、方法:用效用分数让记忆参与推理与重排
背景
本段介绍 Agent RX:一个运行时层,让大语言模型 Agent 在不重新训练、不微调、不手工改提示词的情况下,从经验中改进。核心机制是效用分数:检索不只看关键词或语义相似度,还要按历史上该记忆对任务执行和结果的帮助或伤害进行加权,并在积累足够多的记忆后把推理沉淀进技能。
一个关键点是,它把记忆当成推理,而不是事实。它不是没有上下文、没有历史的静态事实,而是推理。比如,如果有一个客服机器人在处理退款,你不会真的说:用户偏好深色主题,或者用户喜欢别人用短一点的名字称呼他。它实际上要围绕查询来推理:如果有人要求退款,你应该先检查结算记录,再进行退款,这样客户就不会被重复退款两次。
本段介绍 Agent RX:一个运行时层,让大语言模型 Agent 在不重新训练、不微调、不手工改提示词的情况下,从经验中改进。核心机制是效用分数:检索不只看关键词或语义相似度,还要按历史上该记忆对任务执行和结果的帮助或伤害进行加权,并在积累足够多的记忆后把推理沉淀进技能。
兴趣匹配度很高。它对应的是 Agent 工程化的核心问题:如何把不稳定的模型行为放进清晰的状态、动作、工具和反馈闭环里。
三、演示:SQL 产品搜索如何从失败反馈中改变工具调用
背景
演讲者展示一个产品 SQL 演示:Agent 起初找不到游戏鼠标,尽管数据库里有无线鼠标;失败被提交后,系统从轨迹和工具质量中形成记忆。再次搜索时,Agent 的搜索轨迹发生变化,能把游戏鼠标和鼠标相关产品联系起来,并基于效用分数检索到更有用的记忆。
我接着看另一个基准测试,也就是 AgentBench with Actions,它本质上衡量 Agent 是否真的做出了正确的推理、规划,并且遵循了要求。它本质上测试模型在扩展的多步骤工作流中推理、规划和使用工具的能力,而不是衡量静态 Q&A。这里可以看到,假设 Human Last Exam with Drug 这个任务,你会得到 47.5。
演讲者展示一个产品 SQL 演示:Agent 起初找不到游戏鼠标,尽管数据库里有无线鼠标;失败被提交后,系统从轨迹和工具质量中形成记忆。再次搜索时,Agent 的搜索轨迹发生变化,能把游戏鼠标和鼠标相关产品联系起来,并基于效用分数检索到更有用的记忆。
兴趣匹配度很高。它对应的是 Agent 工程化的核心问题:如何把不稳定的模型行为放进清晰的状态、动作、工具和反馈闭环里。
四、结尾与联系方式
背景
演讲者邀请观众访问网站、试用运行时经验层,并留下联系方式。
如果你想了解更多细节,可以访问我们的网站,也可以联系我,如果我还保留着我的 grace@alishascollection.com,我会回复。谢谢。
兴趣匹配度很高。它对应的是 Agent 工程化的核心问题:如何把不稳定的模型行为放进清晰的状态、动作、工具和反馈闭环里。
整体判断
这篇最值得保留的不是某个单点技巧,而是它把「用户信号死在检索边界」放进了更完整的工程框架里:问题:Agent 缺少从结果中学习的检索层、方法:用效用分数让记忆参与推理与重排、演示:SQL 产品搜索如何从失败反馈中改变工具调用。这些内容可以作为汉松后续写 AI 工程、Agent 系统和团队工作流时的素材。
更重要的是,它提供了一种判断 AI 系统的方式:先看问题如何被拆成状态、动作、工具、评估和人的边界,再看模型能力如何嵌进去。只有这样,视频里的做法才会从一次演示变成可迁移的方法。