跳到正文
汉松札记
返回

你的 Agent 在生产环境失败了。祝你好运复现它

AI Highlight

来源

文本来源是 AI Engineer 频道视频《你的 Agent 在生产环境失败了。祝你好运复现它》的修复版中文稿。下面按汉松兴趣画像优先保留机制解释、反常识判断和可复用工作流,而不是做普通摘要。

开头可以先抓住一句:这场来自 AI Engineer 频道的演讲讨论了 AI Agent 在生产环境中失败后为什么很难复现,以及为什么团队应该把目标从追求模型的逐位确定性(bitwise determinism),转向记录完整运行轨迹、实现可重放性(replayability),并通过边界记录、桩替换、断言和测试,把失败转化为可调试、可回归的工程资产。

一、生产事故与复现困境

背景

讲者用股票交易 Agent 把金额误当成数量的例子说明:API 返回 200、监控全绿,并不代表业务状态正确。团队常见的反应是重放提示词、调低 temperature、试图让模型具备确定性,但这无法复现真正造成损失的那一次运行。

正确的问题是:对于一次无法复现的运行,我怎样调试并重新测试它?因为确定性从来不是北极星,调试才是。我们一直混在一起用的两个词,我现在要讲清楚:逐位确定性和可重放性。逐位确定性指的是相同输入得到相同输出。这是可控性。你无法从托管 API 得到它,而且你其实也不想要它,因为随机性正是模型有用的原因。比如当模型探索更多时,你会得到更有创造性的答案。另一个词是可重放性,意思是对已经发生过的一次运行进行足够好的重新验证,以便调试。这是可观测性。你不需要模型具备确定性。你需要把运行记录下来。你不冻结模型,而是捕获它做过什么。

讲者用股票交易 Agent 把金额误当成数量的例子说明:API 返回 200、监控全绿,并不代表业务状态正确。团队常见的反应是重放提示词、调低 temperature、试图让模型具备确定性,但这无法复现真正造成损失的那一次运行。

兴趣匹配度很高。它对应的是 Agent 工程化的核心问题:如何把不稳定的模型行为放进清晰的状态、动作、工具和反馈闭环里。

二、从逐位确定性转向可重放性

背景

本段区分逐位确定性与可重放性,强调调试需要记录运行,而不是冻结模型。Chronicle 通过边界标注记录 Agent 工作流中每个节点的输入、输出、模型版本、代码版本等上下文,让失败运行成为可查看的运行轨迹。

正确的问题是:对于一次无法复现的运行,我怎样调试并重新测试它?因为确定性从来不是北极星,调试才是。我们一直混在一起用的两个词,我现在要讲清楚:逐位确定性和可重放性。逐位确定性指的是相同输入得到相同输出。这是可控性。你无法从托管 API 得到它,而且你其实也不想要它,因为随机性正是模型有用的原因。比如当模型探索更多时,你会得到更有创造性的答案。另一个词是可重放性,意思是对已经发生过的一次运行进行足够好的重新验证,以便调试。这是可观测性。你不需要模型具备确定性。你需要把运行记录下来。你不冻结模型,而是捕获它做过什么。

本段区分逐位确定性与可重放性,强调调试需要记录运行,而不是冻结模型。Chronicle 通过边界标注记录 Agent 工作流中每个节点的输入、输出、模型版本、代码版本等上下文,让失败运行成为可查看的运行轨迹。

兴趣匹配度很高。它对应的是 Agent 工程化的核心问题:如何把不稳定的模型行为放进清晰的状态、动作、工具和反馈闭环里。

三、用运行轨迹做测试与回归验证

背景

本段展示如何用已记录的运行轨迹为未修改节点做桩替换,让修改过的工具或护栏现场运行,并通过断言验证修复是否生效。最后总结:不要追逐 API 层面的逐位确定性,要记录完整运行封套,用重放来调试,并保留生成时的变化性。

工具和 LLM。我们刚刚看到,Chronicle 不仅记录你的 Agent 会话,还会把这些记录用作测试用例。现在,当我们谈论 AI Agent 的测试时,我想在这里做一个非常清晰的区分。测试 AI Agent 有两种方式,两者同样重要。一种是确定性测试,另一种是行为测试。确定性测试显然适用于 Agent 图中的确定性节点。这可能是你的护栏,也可能是你的工具调用。这正是 Chronicle 发挥作用的地方,因为正如刚才看到的,Chronicle 会把整个 Agent 运行冻结为上下文。所以你可以用 LLM 节点的上下文来替换 LLM 输出。

本段展示如何用已记录的运行轨迹为未修改节点做桩替换,让修改过的工具或护栏现场运行,并通过断言验证修复是否生效。最后总结:不要追逐 API 层面的逐位确定性,要记录完整运行封套,用重放来调试,并保留生成时的变化性。

兴趣匹配度很高。它对应的是 Agent 工程化的核心问题:如何把不稳定的模型行为放进清晰的状态、动作、工具和反馈闭环里。

整体判断

这篇最值得保留的不是某个单点技巧,而是它把「你的 Agent 在生产环境失败了。祝你好运复现它」放进了更完整的工程框架里:生产事故与复现困境、从逐位确定性转向可重放性、用运行轨迹做测试与回归验证。这些内容可以作为汉松后续写 AI 工程、Agent 系统和团队工作流时的素材。

更重要的是,它提供了一种判断 AI 系统的方式:先看问题如何被拆成状态、动作、工具、评估和人的边界,再看模型能力如何嵌进去。只有这样,视频里的做法才会从一次演示变成可迁移的方法。

AI Highlight RSS
分享这篇文章:


上一篇
你无法提示整个房间:AI 最后无法取代的技能
下一篇
你的 Agent 正在浪费 Token,而你还不知道