来源
- 原始链接:https://www.youtube.com/watch?v=JRTAtZ5iBkU
- 来源类型:视频逐字稿
- 来源标题:HTML 就够了:让 Agent 生成图形
文本来源是 AI Engineer 频道视频《HTML 就够了:让 Agent 生成图形》的修复版中文稿。下面按汉松兴趣画像优先保留机制解释、反常识判断和可复用工作流,而不是做普通摘要。
开头可以先抓住一句:这场来自 AI Engineer 频道的短讲提出一个观点:让 Agent 生成幻灯片、文档、视频等图形化产物时,关键不是强迫它操作画布或直接写 SVG 坐标,而是给它使用更符合语言模型思维方式的媒介。HTML 用标签、结构和语义表达布局,再由浏览器渲染成像素,因此比 PowerPoint、Figma 或 SVG 更适合作为 Agent 的编辑格式。
一、重新理解编程 Agent
背景
Amol 介绍 Nori 的 AI 员工,并提出编程 Agent 不只是写代码。只要能按 Agent 的思维方式给它任务,它可以处理幻灯片、文档甚至视频等视觉产物。
其中大部分时间并不是花在思考上,而是花在各种细节调整上。[音乐] 一个需要 10 小时完成的演示文稿,如果去掉所有格式、品牌规范和来回挪动元素的工作,其实应该只需要大约 25 分钟。假设你要做一页幻灯片,你会怎么做?你打开一个工具,PowerPoint、Slides、Figma、Canva,然后开始操作一块画布。这些工具全都是为人的双手和眼睛设计的。点击、拖拽、放置、缩放、吸附到网格,这些动作和模式都符合我们对世界的地理空间式理解。它们底层确实有数据结构,但格式只有对应应用能读取。
Amol 介绍 Nori 的 AI 员工,并提出编程 Agent 不只是写代码。只要能按 Agent 的思维方式给它任务,它可以处理幻灯片、文档甚至视频等视觉产物。
兴趣匹配度很高。它对应的是 Agent 工程化的核心问题:如何把不稳定的模型行为放进清晰的状态、动作、工具和反馈闭环里。
二、为什么传统图形工具让 Agent 表现很差
背景
传统工具围绕人的手和眼设计:点击、拖拽、缩放、对齐、吸附网格。Agent 被迫使用这些工具时,输出容易重叠、错位、不可读。SVG 这类坐标化格式也类似,它要求模型直接从数字墙推理图形。
不,我不这么认为。在我看来,问题不是模型,而是媒介。如果我让你,一个大概率是人类的人,手写一份骑自行车鹈鹕的 SVG,你也做不到。[音乐] SVG 就是一堵数字墙。你没办法从一堵数字墙直接走到一只鹈鹕,因为你根本不是那样看东西的。这不是人的思考方式。我们以图形方式思考,所以我们构建了能让自己在画布上绘制的工具。
传统工具围绕人的手和眼设计:点击、拖拽、缩放、对齐、吸附网格。Agent 被迫使用这些工具时,输出容易重叠、错位、不可读。SVG 这类坐标化格式也类似,它要求模型直接从数字墙推理图形。
兴趣匹配度很高。它对应的是 Agent 工程化的核心问题:如何把不稳定的模型行为放进清晰的状态、动作、工具和反馈闭环里。
三、换媒介:从像素和坐标换成语言与结构
背景
演讲者认为问题主要出在媒介,而不是模型能力。AI 的原生媒介是语言、token 和结构。HTML 正好用语义标签表达标题、图表、网格和布局,并由浏览器完成像素渲染,因此更适合 Agent 生成图形。
不,我不这么认为。在我看来,问题不是模型,而是媒介。如果我让你,一个大概率是人类的人,手写一份骑自行车鹈鹕的 SVG,你也做不到。[音乐] SVG 就是一堵数字墙。你没办法从一堵数字墙直接走到一只鹈鹕,因为你根本不是那样看东西的。这不是人的思考方式。我们以图形方式思考,所以我们构建了能让自己在画布上绘制的工具。
演讲者认为问题主要出在媒介,而不是模型能力。AI 的原生媒介是语言、token 和结构。HTML 正好用语义标签表达标题、图表、网格和布局,并由浏览器完成像素渲染,因此更适合 Agent 生成图形。
兴趣匹配度很高。它对应的是 Agent 工程化的核心问题:如何把不稳定的模型行为放进清晰的状态、动作、工具和反馈闭环里。
四、HTML 作为幻灯片、文档和视频的编辑格式
背景
PowerPoint 只是制作幻灯片的一种工具,幻灯片本身只是展示模式。既然观众关心的是最终呈现,就可以选择 Agent 擅长的 HTML 作为编辑格式,再根据需要导出 PDF 等格式。Nori 已经用 HTML 构建演示文稿、董事会演示文稿、销售演示文稿、文档和本视频。
PowerPoint 是你用来制作演示文稿的工具。演示文稿本身只是展示模式。而事实证明,观众不会关心你是怎么做出展示效果的。编辑格式完全可以自由选择。[音乐] 所以你完全可以选择 Agent 已经擅长的编辑格式,也就是 HTML。如果后续需要渲染成 PDF 这样的其他格式,也可以再处理。
PowerPoint 只是制作幻灯片的一种工具,幻灯片本身只是展示模式。既然观众关心的是最终呈现,就可以选择 Agent 擅长的 HTML 作为编辑格式,再根据需要导出 PDF 等格式。Nori 已经用 HTML 构建演示文稿、董事会演示文稿、销售演示文稿、文档和本视频。
兴趣匹配度很高。它对应的是 Agent 工程化的核心问题:如何把不稳定的模型行为放进清晰的状态、动作、工具和反馈闭环里。
五、让 Agent 端到端完成内容生产
背景
漂亮的演示文稿本身价值有限,真正重要的是内容。只要把通话记录、邮件等公司数据提供给模型,Agent 就能端到端生成演示文稿,让人把注意力放在愿景和叙事上。最后的核心要点是:停止像用户一样思考,开始像模型一样思考;对图形产物来说,HTML 就够了。
这里我们同样可以像模型一样思考。如果你把数据访问权限给模型,比如你的通话转写稿或邮件,你就可以让模型端到端构建演示文稿。让你的 Agent 做掉所有繁重杂活,而你专注在愿景和故事上。这就是 Nori Sessions 能让你做到的事。我曾经在通勤时坐在地铁上,用手机做完整个董事会演示文稿。为什么可以这样?因为我们的 Nori bot 就存在于公司的组织肌理里。
漂亮的演示文稿本身价值有限,真正重要的是内容。只要把通话记录、邮件等公司数据提供给模型,Agent 就能端到端生成演示文稿,让人把注意力放在愿景和叙事上。最后的核心要点是:停止像用户一样思考,开始像模型一样思考;对图形产物来说,HTML 就够了。
兴趣匹配度很高。它对应的是 Agent 工程化的核心问题:如何把不稳定的模型行为放进清晰的状态、动作、工具和反馈闭环里。
整体判断
这篇最值得保留的不是某个单点技巧,而是它把「HTML 就够了:让 Agent 生成图形」放进了更完整的工程框架里:重新理解编程 Agent、为什么传统图形工具让 Agent 表现很差、换媒介:从像素和坐标换成语言与结构。这些内容可以作为汉松后续写 AI 工程、Agent 系统和团队工作流时的素材。
更重要的是,它提供了一种判断 AI 系统的方式:先看问题如何被拆成状态、动作、工具、评估和人的边界,再看模型能力如何嵌进去。只有这样,视频里的做法才会从一次演示变成可迁移的方法。