跳到正文
汉松札记
返回

浏览器 Agent 需要的不是更好的模型,而是更好的眼睛

AI Highlight

来源

文本来源是 AI Engineer 频道视频《浏览器 Agent 需要的不是更好的模型,而是更好的眼睛》的修复版中文稿。下面按汉松兴趣画像优先保留机制解释、反常识判断和可复用工作流,而不是做普通摘要。

开头可以先抓住一句:Kushan Raj 认为,浏览器 Agent 的主要瓶颈不在于模型能力,而在于模型看到网页、理解网页状态变化、规划长序列操作的环境表示太差。他展示了一个更紧凑的网页表示方案,可以用较少 token 给 Agent 提供整页视野和操作反馈,从而让便宜模型也能更快、更可靠地完成浏览器任务。

一、浏览器 Agent 的瓶颈与更好的网页表示

背景

讲者先用 Browser Challenge 展示现有浏览器 Agent 的迟缓与易卡住问题,指出模型本身已经足够聪明,真正薄弱的是 Agent 周围的基础设施和网页表示。随后他展示自己的实现:用压缩后的 Markdown 式网页表示、整页上下文和操作反馈,帮助 Agent 规划长序列任务、识别失败原因,并在下载 Aadhaar、预订徒步日期等任务上比 Claude 浏览器操作更快。最后他说明计划将项目开源,或以 API、网站、插件的形式提供能力。

一共有 30 步,而它只是点一个按钮就已经花了这么久。这个就先到这里。我想给大家看一下我一直在做的东西。还是同一个网站。我试着复现那种能看到发生了什么的体验,你可以看到浏览器 Agent 正在思考什么。但你也能看到,它快得多,而且我用的是便宜得多的模型。这里的假设是:模型其实很聪明,真正糟糕的是它们周围的基础设施。如果你注意刚才的视频,也许我会放一张截图,那个 Agent 正在试图调试发生了什么。它想点击某个东西,但它理解不了当前状况。所以我的核心观点是:给 Agent 一个好用的环境。也就是说,它可以规划长序列,可以弄清楚自己在哪里失败了、发生了什么,并且可以正确规划点击动作。

讲者先用 Browser Challenge 展示现有浏览器 Agent 的迟缓与易卡住问题,指出模型本身已经足够聪明,真正薄弱的是 Agent 周围的基础设施和网页表示。随后他展示自己的实现:用压缩后的 Markdown 式网页表示、整页上下文和操作反馈,帮助 Agent 规划长序列任务、识别失败原因,并在下载 Aadhaar、预订徒步日期等任务上比 Claude 浏览器操作更快。

兴趣匹配度很高。它对应的是 Agent 工程化的核心问题:如何把不稳定的模型行为放进清晰的状态、动作、工具和反馈闭环里。

整体判断

这篇最值得保留的不是某个单点技巧,而是它把「浏览器 Agent 需要的不是更好的模型,而是更好的眼睛」放进了更完整的工程框架里:浏览器 Agent 的瓶颈与更好的网页表示。这些内容可以作为汉松后续写 AI 工程、Agent 系统和团队工作流时的素材。

更重要的是,它提供了一种判断 AI 系统的方式:先看问题如何被拆成状态、动作、工具、评估和人的边界,再看模型能力如何嵌进去。只有这样,视频里的做法才会从一次演示变成可迁移的方法。

AI Highlight RSS
分享这篇文章:


上一篇
构建系统,而不是代码
下一篇
生产环境中的 Agent:OpenGov 如何构建并扩展 OG Assist