来源
- 原始链接:https://www.youtube.com/watch?v=T0HhO4YtTfE
- 来源类型:视频逐字稿
- 来源标题:AI 系统设计:从想法到生产
文本来源是 AI Engineer 频道视频《AI 系统设计:从想法到生产》的修复版中文稿。下面按汉松兴趣画像优先保留机制解释、反常识判断和可复用工作流,而不是做普通摘要。
开头可以先抓住一句:来自 MongoDB 的开发者倡导者 Apoorva Joshi 分享了一套四阶段 AI 系统设计框架:产品需求、系统设计、评估与监控、优化。她以健康险理赔审核系统为例,讲解从量化业务问题到架构选型、护栏设计、指标体系的完整决策路径,核心主张是:现在最难的不是写代码,而是把规格说明定义清楚。
一、第 2 段:业务约束、AI 角色定义与数据策略
背景
梳理应用的业务约束(合规、数据驻留、人工审核要求)、性能需求、AI 在产品中的角色(辅助、被动、半自主),制定可量化的成功指标,并分析各数据源的来源与更新频率。
还需要患者的理赔历史,包括既往病史、接受过的手术以及对应时间等。假设临床指南和保障政策以 PDF 形式存储在 Confluence 之类的系统中,理赔记录则会在处理时实时写入 MongoDB。接下来要考虑数据更新频率:各个数据源更新得有多频繁?如果你需要对这些原始数据源做任何处理(通常都需要),数据管道就必须按合适的节奏运行,才能保持同步。
梳理应用的业务约束(合规、数据驻留、人工审核要求)、性能需求、AI 在产品中的角色(辅助、被动、半自主),制定可量化的成功指标,并分析各数据源的来源与更新频率。
兴趣匹配度很高。它对应的是 Agent 工程化的核心问题:如何把不稳定的模型行为放进清晰的状态、动作、工具和反馈闭环里。
二、第 3 段:数据处理、检索技术与 AI 设计模式概览
背景
讨论原始数据的处理方式(分块、生成向量表示、元数据提取、去除 PII)、各数据源对应的检索技术(向量搜索、混合搜索、精确匹配),以及 RAG、Agent、半自主系统、控制流、LLM 路由、人在回路、微调等常见设计模式。
还有一种模式是让 LLM 充当路由器:LLM 的自主权有限,它的任务只是对输入请求分类,并路由到不同的下游工作流。然后是人在回路:LLM 或 Agent 可以执行某些动作,但流程中的某个环节需要人工介入。最后是微调:如果你观察到 LLM 的失败发生在行为层面,而不是数据或编排层面,或者你在特定领域任务上需要更高性能,那么微调就是一项值得探索的技术。
讨论原始数据的处理方式(分块、生成向量表示、元数据提取、去除 PII)、各数据源对应的检索技术(向量搜索、混合搜索、精确匹配),以及 RAG、Agent、半自主系统、控制流、LLM 路由、人在回路、微调等常见设计模式。
兴趣匹配度很高。它对应的是 Agent 工程化的核心问题:如何把不稳定的模型行为放进清晰的状态、动作、工具和反馈闭环里。
三、第 4 段:架构选型、UX 设计与技术栈决策
背景
将设计模式应用到理赔审核系统中(RAG + 控制流 + 人在回路),梳理 UX 关键问题(输入输出、触发条件、人工角色、解释机制、反馈收集),并提醒技术栈选型要结合约束,而不是盲目采纳 AI 建议。
在我们的案例中,系统通过提供引用来说明自己的推理:它引用了哪些临床指南和保障政策,来支撑自己的评估。最后,如何收集反馈?系统的使用者是医疗审核人员,他们可以通过覆盖 LLM 的裁决来提供反馈,并记录覆盖原因。我们还可以让他们标记不相关的引用:如果 LLM 幻觉出了不存在的临床指南和政策,或者为某条理赔引用了错误来源,他们可以把这些问题标记出来。
将设计模式应用到理赔审核系统中(RAG + 控制流 + 人在回路),梳理 UX 关键问题(输入输出、触发条件、人工角色、解释机制、反馈收集),并提醒技术栈选型要结合约束,而不是盲目采纳 AI 建议。
兴趣匹配度很高。它对应的是 Agent 工程化的核心问题:如何把不稳定的模型行为放进清晰的状态、动作、工具和反馈闭环里。
四、第 5 段:护栏设计、评估指标体系与生产监控
背景
说明护栏的必要性(输入和输出两侧),定义输入合规指标、输出合规指标、响应质量指标(忠实度)、领域专属指标、系统健康指标;区分离线评估与生产监控,提出人工覆盖率、审核耗时等隐性成功信号。
好,当你有了一个经过评估、精度看起来也不错的原型,是不是就该推进到生产了?先等等,成本、延迟和可靠性呢?这些约束在推进到生产时绝对不能妥协。所以在“精度看起来不错”和“进入生产环境”之间,你可能还需要做几轮迭代、评估和测试。
说明护栏的必要性(输入和输出两侧),定义输入合规指标、输出合规指标、响应质量指标(忠实度)、领域专属指标、系统健康指标;区分离线评估与生产监控,提出人工覆盖率、审核耗时等隐性成功信号。
兴趣匹配度很高。它对应的是 Agent 工程化的核心问题:如何把不稳定的模型行为放进清晰的状态、动作、工具和反馈闭环里。
五、第 6 段:优化技术与结尾要点
背景
介绍精度优化(提示词工程、重排序、记忆)、成本与延迟优化(语义缓存、批处理)、可靠性优化(结构化输出),最后总结三条核心要点。
最后是可靠性优化。大多数可靠性优化技术对我们的场景都有用,因为它们主要针对 API 失败问题。但我特别想提一下结构化输出,它对确保系统始终输出包含决策和引用的结构化结果非常有价值。到这里,我的演讲也接近尾声了。我想留给你几个关键要点。
介绍精度优化(提示词工程、重排序、记忆)、成本与延迟优化(语义缓存、批处理)、可靠性优化(结构化输出),最后总结三条核心要点。
兴趣匹配度很高。它对应的是 Agent 工程化的核心问题:如何把不稳定的模型行为放进清晰的状态、动作、工具和反馈闭环里。
整体判断
这篇最值得保留的不是某个单点技巧,而是它把「AI 系统设计:从想法到生产」放进了更完整的工程框架里:第 2 段:业务约束、AI 角色定义与数据策略、第 3 段:数据处理、检索技术与 AI 设计模式概览、第 4 段:架构选型、UX 设计与技术栈决策。这些内容可以作为汉松后续写 AI 工程、Agent 系统和团队工作流时的素材。
更重要的是,它提供了一种判断 AI 系统的方式:先看问题如何被拆成状态、动作、工具、评估和人的边界,再看模型能力如何嵌进去。只有这样,视频里的做法才会从一次演示变成可迁移的方法。