来源
- 原始链接:https://www.youtube.com/watch?v=-x5GEVnkuRw
- 来源类型:视频逐字稿
- 来源标题:结构化非结构化内容
文本来源是 AI Engineer 频道视频《结构化非结构化内容》的修复版中文稿。下面按汉松兴趣画像优先保留机制解释、反常识判断和可复用工作流,而不是做普通摘要。
开头可以先抓住一句:Red Hat 开源工程师 Cedric Clyburn 介绍 Docling——一个隶属于 Linux Foundation 的开源文档处理工具,演示如何将 PDF、图片等非结构化数据准确转换为 Markdown/JSON,并接入 RAG、Agent 式 RAG(无分块)和 MCP 服务器,搭建从本机到 API 服务的完整文档 AI 流水线。
一、非结构化数据的挑战与现有方案的不足
背景
介绍背景:上下文是 AI 应用的核心,大量企业数据以 PDF 等非结构化格式存在;比较简单 PDF 解析器(会截断、合并、丢失内容)与前沿 LLM 方案(质量好但成本高且不确定性强)各自的局限。
这正说明了确保数据处理准确、不产生幻觉,并能放心用于交付给用户和客户的应用,是多么重要。如果使用像 Docling 这样可以在本机运行的工具,就能看到那两个词实际上相距很远,根本不应该被合并。接下来我们就来学习如何正确提取文本。如果对一个包含表格、图片、标注和常规文本段落的 PDF 使用简单的 PDF 解析器,右侧的 Markdown 输出可能是这样的:运行速度快,甚至 CPU 就能跑,成本低;但问题在于大量文本被截断、被合并,连我作为人类都看不懂。
介绍背景:上下文是 AI 应用的核心,大量企业数据以 PDF 等非结构化格式存在;比较简单 PDF 解析器(会截断、合并、丢失内容)与前沿 LLM 方案(质量好但成本高且不确定性强)各自的局限。
兴趣匹配度很高。它对应的是 Agent 工程化的核心问题:如何把不稳定的模型行为放进清晰的状态、动作、工具和反馈闭环里。
二、Docling 核心能力与成本效益
背景
引入 Docling:可本地运行、速度快、成本低,支持 OCR 和视觉模型;覆盖表格、图片与结构化输出处理;介绍 Hugging Face 节省 50 倍成本的案例;开始用演示笔记本展示基础 PDF 转换。
这是 Linux Foundation 旗下的开源项目,完全可以自主使用。在演示之前,先聊一聊规模和成本问题。Hugging Face 的 Leandro 有一个公开案例:他从 Common Crawl 的 PDF 中提取结构,使用 OCR 和 Docling 去掉某些部分、清洗数据,最终产出了来自网络各类 PDF 的数千 token 数据集,可用于训练模型。他用 Docling 在 CPU 上运行这一流程,相比直接使用 VLM(视觉语言模型)和 OCR,成本节省了 50 倍,完全不需要 GPU。而且这不只是文档转换。这个例子是在为 PDF 准备训练数据,但如果我们有图片呢?
引入 Docling:可本地运行、速度快、成本低,支持 OCR 和视觉模型;覆盖表格、图片与结构化输出处理;介绍 Hugging Face 节省 50 倍成本的案例;开始用演示笔记本展示基础 PDF 转换。
兴趣匹配度很高。它对应的是 Agent 工程化的核心问题:如何把不稳定的模型行为放进清晰的状态、动作、工具和反馈闭环里。
三、表格/图片提取与无分块 RAG 演示
背景
演示从 PDF 提取 8 张表格并转为 DataFrame;可视化文档布局与边界框;使用本地 Granite 模型通过 VLM 为图片生成标注描述;演示 DocQuery 实现的无分块/Agent 式 RAG 模式(以 Markdown 大纲作为检索索引,无需嵌入模型和向量数据库)。
当用户提问时,完整的检索索引通常是数据库中的数千个向量,需要做语义相似度匹配,找出与问题最相关的部分。但在这里,我们只需要一份包含每个章节摘要大纲的 Markdown 文档。如果 LLM 在找关于如何开始使用 DocQuery 的内容,只需从这个文本引用中找到 DocQuery 可从 PyPI 安装的信息,这就是整个检索索引。假设用户问题是“DocQuery 中使用了哪些主要 AI 模型?”,我们设置一个 RAG Agent,对这个问题迭代大约 5 次。可以看到,提问时有 20 个章节可用。我们找到那段讲 AI 模型的文本,判断它是否与回答问题相关。
演示从 PDF 提取 8 张表格并转为 DataFrame;可视化文档布局与边界框;使用本地 Granite 模型通过 VLM 为图片生成标注描述;演示 DocQuery 实现的无分块/Agent 式 RAG 模式(以 Markdown 大纲作为检索索引,无需嵌入模型和向量数据库)。
兴趣匹配度很高。它对应的是 Agent 工程化的核心问题:如何把不稳定的模型行为放进清晰的状态、动作、工具和反馈闭环里。
四、大规模部署:Docling Serve 与 MCP 服务器
背景
介绍 Docling Serve 如何作为 REST API 微服务部署(容器/Kubernetes);介绍 Docling MCP 服务器如何把 Docling 能力通过 MCP 接入 Claude Code、Cursor 等 AI Agent;总结与致谢。
完成这一步后,就可以用模型和 MCP 服务器做这样的事情:“把这份文档转换一下,给我一个摘要”,或者“创建一个带有行动条目章节的文档,从另一个 PDF 中提取列表并导出为 Markdown”。可以通过 MCP 服务器使用所有 Docling 组件,让 AI Agent(比如 Cursor、Claude Code 或各种开源选项)以 Agent 式方式处理和解析这些文档。现在回到幻灯片做个总结。使用 Docling,我们已经看到可以将 PDF 转换为 Markdown 或 JSON,完全在本机本地运行,甚至不需要 GPU,速度快、成本低,最重要的是开源。建议大家都去试试。
介绍 Docling Serve 如何作为 REST API 微服务部署(容器/Kubernetes);介绍 Docling MCP 服务器如何把 Docling 能力通过 MCP 接入 Claude Code、Cursor 等 AI Agent;总结与致谢。
兴趣匹配度很高。它对应的是 Agent 工程化的核心问题:如何把不稳定的模型行为放进清晰的状态、动作、工具和反馈闭环里。
整体判断
这篇最值得保留的不是某个单点技巧,而是它把「结构化非结构化内容」放进了更完整的工程框架里:非结构化数据的挑战与现有方案的不足、Docling 核心能力与成本效益、表格/图片提取与无分块 RAG 演示。这些内容可以作为汉松后续写 AI 工程、Agent 系统和团队工作流时的素材。
更重要的是,它提供了一种判断 AI 系统的方式:先看问题如何被拆成状态、动作、工具、评估和人的边界,再看模型能力如何嵌进去。只有这样,视频里的做法才会从一次演示变成可迁移的方法。