跳到正文
汉松札记
返回

当所有上下文都重要:扩展型缓存增强生成

AI Highlight

来源

文本来源是 AI Engineer 频道视频《当所有上下文都重要:扩展型缓存增强生成》的修复版中文稿。下面按汉松兴趣画像优先保留机制解释、反常识判断和可复用工作流,而不是做普通摘要。

开头可以先抓住一句:Luis Romero Sevilla 讨论了一个约束很强的知识表示场景:所有文档都与用户问题相关,文档之间关系密集,并且数据会频繁整体替换。他比较了简单 RAG、GraphRAG 和缓存 Augmented Generation(CAG)的取舍,提出用多个并行 CAG 缓存桶分摊上下文,再由监督模型向各个桶提问并综合答案,从而在频繁更新的数据环境中兼顾速度、成本和回答质量。

一、问题设定与方案演进

背景

从所有上下文都重要的文档集合出发,演讲依次解释简单 RAG、GraphRAG 和 CAG 的能力边界,并提出用多个并行缓存桶承载上下文,由监督模型探索并综合信息。

这里的问题是,上下文窗口是有限的;如果把上下文窗口塞得太满,答案质量也会下降。解决方案是:如果我们并行使用更多 CAG,并把文档分发到不同的上下文桶里,会怎么样?这样一来,每个缓存都可以回答关于自身内容的问题。然后,我们只需要某个东西,把正确的问题问给正确的桶。为此,我们可以使用一个更聪明的模型来询问每个桶,并最终综合出答案。

从所有上下文都重要的文档集合出发,演讲依次解释简单 RAG、GraphRAG 和 CAG 的能力边界,并提出用多个并行缓存桶承载上下文,由监督模型探索并综合信息。

兴趣匹配度很高。这直接落在上下文工程上:关键不是塞更多材料,而是让系统在正确边界内拿到可维护、可审计、可复用的材料。

二、成本权衡与结尾

背景

演讲补充说明 KV 缓存的成本问题,指出可以通过优化缓存生命周期降低开销,同时强调检索策略需要根据计算、成本和速度之间的取舍来匹配具体问题。

你可能会想:KV 缓存可能相当昂贵。你完全说对了。但也有办法通过优化每个缓存的存活时长来降低成本。最终,检索策略有很多种,每一种都有自己的取舍,包括计算、成本和速度。目前没有一种放之四海而皆准的方案。所以,每种方案都需要贴合我们非常具体的问题来设计。

演讲补充说明 KV 缓存的成本问题,指出可以通过优化缓存生命周期降低开销,同时强调检索策略需要根据计算、成本和速度之间的取舍来匹配具体问题。

兴趣匹配度很高。这直接落在上下文工程上:关键不是塞更多材料,而是让系统在正确边界内拿到可维护、可审计、可复用的材料。

整体判断

这篇最值得保留的不是某个单点技巧,而是它把「当所有上下文都重要:扩展型缓存增强生成」放进了更完整的工程框架里:问题设定与方案演进、成本权衡与结尾。这些内容可以作为汉松后续写 AI 工程、Agent 系统和团队工作流时的素材。

更重要的是,它提供了一种判断 AI 系统的方式:先看问题如何被拆成状态、动作、工具、评估和人的边界,再看模型能力如何嵌进去。只有这样,视频里的做法才会从一次演示变成可迁移的方法。

AI Highlight RSS
分享这篇文章:


上一篇
在生产工作流中使用规格驱动开发
下一篇
手中的 OpenClaw:构建一个实体 AI 终端