跳到正文
汉松札记
返回

递归式编程 Agent

AI Highlight

来源

文本来源是 AI Engineer 频道视频《递归式编程 Agent》的修复版中文稿。下面按汉松兴趣画像优先保留机制解释、反常识判断和可复用工作流,而不是做普通摘要。

开头可以先抓住一句:Raymond Weitekamp(OpenProse)在 AI Engineer 大会演讲,阐述如何把递归语言模型(RLM)的思想应用到编程 Agent:以”被误管理的天才”为切入点,解释为什么可靠性而非智能才是当前 Agent 的真正瓶颈,并展示 RLM、Y-pi、OpenProse 等工具如何让编程 Agent 真正具备递归能力。

一、第 1 段:动机与 RLM 基础概念

背景

Agent 的瓶颈不是智能,而是可靠性;引出”被误管理的天才”这一论点;解释什么是递归语言模型(RLM)及其核心机制。

你可以访问这个网站,点击幻灯片上的内容,所有东西都是可交互的。什么是递归语言模型?我喜欢这样说:在 RLM 中,上下文本身就是计算对象。它本质上是工具调用与推理的结合,下一张幻灯片会深入讲。关键在于:完整的提示词并不是一个简单的用户查询。

Agent 的瓶颈不是智能,而是可靠性;引出”被误管理的天才”这一论点;解释什么是递归语言模型(RLM)及其核心机制。

兴趣匹配度很高。它对应的是 Agent 工程化的核心问题:如何把不稳定的模型行为放进清晰的状态、动作、工具和反馈闭环里。

二、第 2 段:RLM 的能力证明与评测争议

背景

RLM 在记忆系统与长推理基准测试上达到最先进水平;Arc AGI-3 和 Long CoT 排行榜上的评测风波;RLM 与普通编程 Agent 的区分标准。

不做任何修改的 RLM,基本上已经是前十级别的记忆系统,可以媲美那些花了大量资金专门构建的记忆方案。稍加调整,它还能在记忆任务上取得更出色的结果。我还展示了最先进的成果:RLM 框架,尤其是它的 DSPy 实现,在长推理任务上达到了最先进水平。现在有一个新的基准测试叫 Long CoT,它的难点在于:问题需要极多推理步骤,导致绝大多数推理模型,包括顶尖模型,都无法维持足够长的连贯推理链。

RLM 在记忆系统与长推理基准测试上达到最先进水平;Arc AGI-3 和 Long CoT 排行榜上的评测风波;RLM 与普通编程 Agent 的区分标准。

兴趣匹配度很高。它对应的是 Agent 工程化的核心问题:如何把不稳定的模型行为放进清晰的状态、动作、工具和反馈闭环里。

三、第 3 段:递归式编程 Agent 的实验路径

背景

Y-pi 的诞生与实现:pi 调用 pi 的字面递归;RLM 生态项目盘点(DSPy、AXE、Unix RLM);讨论 Claude Code 是否是 RLM,以及动态工作流的意义。

当初有了递归式编程 Agent 的想法时,我想用 pi 来实现,但当时还无法只靠 pi 扩展做到这一点,所以不得不 fork 它。令我兴奋的是,为了这次演讲,我重新审视了这个问题,发现 pi 和它的扩展机制已经演化,现在完全可以通过纯扩展实现递归。我有一个纯扩展包 pi-recursive,也有一个叫 y-pi 的便捷封装。这真的是字面意义上的递归式编程 Agent:pi 调用 pi,pi 再调用 pi,递归深度可以自由设置。接下来我想介绍几个这个领域里值得关注的项目。最原始的实现是 Alex 的 RLM,DSPY pi.rlm 是我做基准测试时最常用的工具。

Y-pi 的诞生与实现:pi 调用 pi 的字面递归;RLM 生态项目盘点(DSPy、AXE、Unix RLM);讨论 Claude Code 是否是 RLM,以及动态工作流的意义。

兴趣匹配度很高。它对应的是 Agent 工程化的核心问题:如何把不稳定的模型行为放进清晰的状态、动作、工具和反馈闭环里。

四、第 4 段:OpenProse 语言与实际应用场景

背景

OpenProse 的设计理念:一种由编程 Agent 编译的 Markdown 规范语言;显式声明子 Agent 工作与依赖注入;展示四类实际用例。

你可以把问题拆分成若干子任务,分配给子 Agent,然后在父 Agent 的会话里验证这些子 Agent 的工作成果。更酷的是,在 OpenProse 里,你可以把技能和工具作为显式依赖来声明。可以想象这样的工作流:某个子 Agent 需要特定技能,才能完成它在工作流中的角色;或者必须访问某个特定的 CLI 工具,才能正常运行。

OpenProse 的设计理念:一种由编程 Agent 编译的 Markdown 规范语言;显式声明子 Agent 工作与依赖注入;展示四类实际用例。

兴趣匹配度很高。它对应的是 Agent 工程化的核心问题:如何把不稳定的模型行为放进清晰的状态、动作、工具和反馈闭环里。

五、第 5 段:总结与三点启示

背景

总结递归式编程 Agent 的价值;三点核心结论是:信任来自可靠性,RLM 是一种新范式,编程 Agent 可以成为 RLM 但不会自动成为 RLM。

递归式编程 Agent,太棒了。我真的认为这非常有力量。RLM 刚出来时彻底震撼了我,从这次演讲也能看出,我一直痴迷于把 RLM 的理念应用到编程 Agent 上。我希望你能从中带走三点:第一,信任来自可靠性。我们怎么可能信任一个不可靠的东西?“被误管理的天才”这个观点认为,下一步需要的不是更强的原始智能,而是行为层面的东西,也就是编排。

总结递归式编程 Agent 的价值;三点核心结论是:信任来自可靠性,RLM 是一种新范式,编程 Agent 可以成为 RLM 但不会自动成为 RLM。

兴趣匹配度很高。它对应的是 Agent 工程化的核心问题:如何把不稳定的模型行为放进清晰的状态、动作、工具和反馈闭环里。

整体判断

这篇最值得保留的不是某个单点技巧,而是它把「递归式编程 Agent」放进了更完整的工程框架里:第 1 段:动机与 RLM 基础概念、第 2 段:RLM 的能力证明与评测争议、第 3 段:递归式编程 Agent 的实验路径。这些内容可以作为汉松后续写 AI 工程、Agent 系统和团队工作流时的素材。

更重要的是,它提供了一种判断 AI 系统的方式:先看问题如何被拆成状态、动作、工具、评估和人的边界,再看模型能力如何嵌进去。只有这样,视频里的做法才会从一次演示变成可迁移的方法。

AI Highlight RSS
分享这篇文章:


上一篇
面向金融合规的 AI 多文档关联分析
下一篇
面向非确定性 AI Agent 的确定性基础设施