来源
- 原始链接:https://www.youtube.com/watch?v=akk6KRlcwW4
- 来源类型:视频逐字稿
- 来源标题:手中的 OpenClaw:构建一个实体 AI 终端
文本来源是 AI Engineer 频道视频《手中的 OpenClaw:构建一个实体 AI 终端》的修复版中文稿。下面按汉松兴趣画像优先保留机制解释、反常识判断和可复用工作流,而不是做普通摘要。
开头可以先抓住一句:这场来自 AI Engineer 频道的演讲介绍了 Lech Kalinowski 如何构建一个实体 AI 终端 OpenClaw:它用 OLED 与电子纸双屏、ESP32 微控制器、本地后端和开源 LLM,把一个手持设备变成可控制 Agent、访问 DGX Spark、运行文字 RPG 的安静型 AI 原生终端。
一、发现与设计动机
背景
演讲者用一个类似科幻开场的故事引出 OpenClaw,并说明真正目标是做一个实体 AI 原生设备。最初它只是用来远程控制 DGX Spark 上的 OpenClaw 实例,随后演化成一个双屏、低功耗、可读写 LLM 的手持终端。
一方面,我只是想做一个远程控制器;另一方面,市场上存在一个很细分的空白,也就是 AI 原生操作系统。当我更认真地思考它时,我意识到可以为自己的目的构建这样一个系统。但不是用超级强大的计算机,而是用小型微控制器。
演讲者用一个类似科幻开场的故事引出 OpenClaw,并说明真正目标是做一个实体 AI 原生设备。最初它只是用来远程控制 DGX Spark 上的 OpenClaw 实例,随后演化成一个双屏、低功耗、可读写 LLM 的手持终端。
兴趣匹配度很高。它对应的是 Agent 工程化的核心问题:如何把不稳定的模型行为放进清晰的状态、动作、工具和反馈闭环里。
二、原型、显示系统与硬件架构
背景
这一段展示了设备原型和双屏交互方式:OLED 负责动态输入,电子纸负责稳定渲染。演讲者解释了固定缓冲区、一位图像渲染、无 Markdown 引擎、无 malloc 的 MCU 侧设计,也复盘了供电、I2C、GPIO、编码器和廉价元件带来的硬件问题。
我用尽可能优化的方式来服务这个模型,也就是使用 TensorRT 推理服务系统。我还暴露了 OpenAI 风格的接口,相当于一个 LLM 代理。原因是我在使用其他开源模型时撞了很多墙,因为并不是所有模型都符合 OpenAI API 的风格。
这一段展示了设备原型和双屏交互方式:OLED 负责动态输入,电子纸负责稳定渲染。演讲者解释了固定缓冲区、一位图像渲染、无 Markdown 引擎、无 malloc 的 MCU 侧设计,也复盘了供电、I2C、GPIO、编码器和廉价元件带来的硬件问题。
兴趣匹配度很高。它对应的是 Agent 工程化的核心问题:如何把不稳定的模型行为放进清晰的状态、动作、工具和反馈闭环里。
三、RPG 模式与 AI 原生终端体验
背景
演讲者介绍了让他意外喜欢的 RPG 模式:用 LLM 生成世界、NPC、角色、地图和氛围,把手持终端变成文字角色扮演设备。他也指出,这类设备适合安静、无干扰的场景,和以音频、视频、摄像头为中心的 AI 设备形成差异。
还有一个有趣的点,关于这里的知识产权领域。我做了一些相关研究,发现大家都想围绕音频接口、视频捕获这类东西来构建设备。但在安静的场所,当你只想坐下来、保持平静、玩自己的 RPG 游戏时,你并不需要彩色而强大的显示屏,也不需要那些跳出来的颜色、干扰、广告、网页和其他东西。有时你只是想坐下来,用 OpenClaw 做该做的事,或者和你的 LLM 聊天,在安静环境中阅读和写作,不受任何干扰。这里存在一个市场空白。
演讲者介绍了让他意外喜欢的 RPG 模式:用 LLM 生成世界、NPC、角色、地图和氛围,把手持终端变成文字角色扮演设备。他也指出,这类设备适合安静、无干扰的场景,和以音频、视频、摄像头为中心的 AI 设备形成差异。
兴趣匹配度很高。它对应的是 Agent 工程化的核心问题:如何把不稳定的模型行为放进清晰的状态、动作、工具和反馈闭环里。
四、项目规模、经验总结与演示开始
背景
这一段给出项目数字:约 3 个月、130 次提交、双显示屏、4 种模式、多个 RPG 世界、16 个类、单节锂聚合物电池供电。随后进入设备演示,包括启动、连接 Wi-Fi、帮助命令、教程,以及通过 OpenClaw Agent 检查 DGX Spark 磁盘空间。
也许还有一些评论和收获。让显示屏承担它该做的工作。市面上有很多显示屏可以选择。把模型放在金属之外,因为它真的很重。也就是说,到目前为止,我们还没有真正能在超小 MCU 上运行的这类模型,这里指的是 LLM。还要尝试叙事。上下文很重要,整体上比数字更重要。
这一段给出项目数字:约 3 个月、130 次提交、双显示屏、4 种模式、多个 RPG 世界、16 个类、单节锂聚合物电池供电。随后进入设备演示,包括启动、连接 Wi-Fi、帮助命令、教程,以及通过 OpenClaw Agent 检查 DGX Spark 磁盘空间。
兴趣匹配度很高。它对应的是 Agent 工程化的核心问题:如何把不稳定的模型行为放进清晰的状态、动作、工具和反馈闭环里。
五、游戏演示与收尾
背景
最后一段展示 RPG 世界选择、角色选择和生成式内容。演讲者调侃说,一个安静的文字游戏竟然需要 DGX Spark 上强大的 NVIDIA 处理器支撑,并总结这场演讲表面上是手持 Agent 控制终端,本质上也是一个和 LLM 一起玩的 Game Boy。
所以,一个带文本界面的安静游戏,需要世界上最强大的计算机显卡。也许另一个点是,这场演讲讲的是一个手持设备,用来控制 Agent 和 OpenClaw,并配合本地 LLM 使用;但整体来说,它其实是在讲一个 Game Boy。
最后一段展示 RPG 世界选择、角色选择和生成式内容。演讲者调侃说,一个安静的文字游戏竟然需要 DGX Spark 上强大的 NVIDIA 处理器支撑,并总结这场演讲表面上是手持 Agent 控制终端,本质上也是一个和 LLM 一起玩的 Game Boy。
兴趣匹配度很高。它对应的是 Agent 工程化的核心问题:如何把不稳定的模型行为放进清晰的状态、动作、工具和反馈闭环里。
整体判断
这篇最值得保留的不是某个单点技巧,而是它把「手中的 OpenClaw:构建一个实体 AI 终端」放进了更完整的工程框架里:发现与设计动机、原型、显示系统与硬件架构、RPG 模式与 AI 原生终端体验。这些内容可以作为汉松后续写 AI 工程、Agent 系统和团队工作流时的素材。
更重要的是,它提供了一种判断 AI 系统的方式:先看问题如何被拆成状态、动作、工具、评估和人的边界,再看模型能力如何嵌进去。只有这样,视频里的做法才会从一次演示变成可迁移的方法。