跳到正文
汉松札记
返回

我们用本地代码索引减少了 94% 的 AI 编程 token

AI Highlight

来源

文本来源是 AI Engineer 频道视频《我们用本地代码索引减少了 94% 的 AI 编程 token》的修复版中文稿。下面按汉松兴趣画像优先保留机制解释、反常识判断和可复用工作流,而不是做普通摘要。

开头可以先抓住一句:Rajkumar Sakthivel 分享了他们如何通过本地代码索引层减少 AI 编程过程中的输入上下文,把每次查询发送给模型的 token 大幅压缩,同时用混合搜索、结果压缩、调用关系追踪和评分过滤维持代码检索准确率。

一、问题来源与输入成本

背景

Raj 说明他们在日常使用 AI 编程工具时遇到费用暴涨,排查后发现主要成本来自向模型发送过多无关上下文。他比较了缩短提示词、调整模型参数、压缩输出三种方案,指出真正需要优化的是输入 token。

我们开始排查到底发生了什么,然后发现了一件出乎意料的事。大部分钱并不是花在 AI 的思考上,而是花在发送了太多上下文上。很多文件其实 AI 并不需要。上下文很重要,但大量不相关的代码每次还是会被一起发送出去。所以我和朋友 Foss 开始做一个东西来解决这个问题。这次分享讲的就是我们做了什么,以及从中学到了什么。

Raj 说明他们在日常使用 AI 编程工具时遇到费用暴涨,排查后发现主要成本来自向模型发送过多无关上下文。他比较了缩短提示词、调整模型参数、压缩输出三种方案,指出真正需要优化的是输入 token。

兴趣匹配度很高。它对应的是 Agent 工程化的核心问题:如何把不稳定的模型行为放进清晰的状态、动作、工具和反馈闭环里。

二、本地搜索层、评估结果与限制

背景

本段讲解本地代码索引层的实现:把代码切成函数、类、方法等有意义的片段,同时运行语义搜索和关键词搜索,再用压缩、调用关系追踪和评分过滤减少无效上下文。演讲者给出 FastAPI 测试数据,也说明在大而混杂的代码库上召回率会下降。

阈值会根据当前结果动态调整。这个过程只需要 0.4 毫秒,不需要额外的 AI 调用。我们学到的经验是:大多数时候,简单公式胜过复杂模型。我们需要数字,而不只是故事。所以这里是我们的数据。我们测试了一个真实的开源项目 FastAPI,它有 53 个文件,以及 20 个开发者真的会问的问题。不使用我们的工具时,每个问题需要 83K token。使用我们的工具后,每个问题需要 4.9K token。

本段讲解本地代码索引层的实现:把代码切成函数、类、方法等有意义的片段,同时运行语义搜索和关键词搜索,再用压缩、调用关系追踪和评分过滤减少无效上下文。演讲者给出 FastAPI 测试数据,也说明在大而混杂的代码库上召回率会下降。

兴趣匹配度很高。它对应的是 Agent 工程化的核心问题:如何把不稳定的模型行为放进清晰的状态、动作、工具和反馈闭环里。

三、开源工具与结论

背景

结尾强调:先修正输入,模型选择的重要性会下降。演讲者给出 CCE 这个免费开源工具,邀请开发者在自己的项目中测试节省效果。

修正输入之后,模型选择的重要性会比你想的更低。可以用一个命令试试:CCE。它免费、开源。你会在屏幕上看到代码。试一下,看看数字,然后告诉我们你省了多少。谢谢。祝你编程愉快。

结尾强调:先修正输入,模型选择的重要性会下降。演讲者给出 CCE 这个免费开源工具,邀请开发者在自己的项目中测试节省效果。

兴趣匹配度很高。它对应的是 Agent 工程化的核心问题:如何把不稳定的模型行为放进清晰的状态、动作、工具和反馈闭环里。

整体判断

这篇最值得保留的不是某个单点技巧,而是它把「我们用本地代码索引减少了 94% 的 AI 编程 token」放进了更完整的工程框架里:问题来源与输入成本、本地搜索层、评估结果与限制、开源工具与结论。这些内容可以作为汉松后续写 AI 工程、Agent 系统和团队工作流时的素材。

更重要的是,它提供了一种判断 AI 系统的方式:先看问题如何被拆成状态、动作、工具、评估和人的边界,再看模型能力如何嵌进去。只有这样,视频里的做法才会从一次演示变成可迁移的方法。

AI Highlight RSS
分享这篇文章:


上一篇
手中的 OpenClaw:构建一个实体 AI 终端
下一篇
把 10,994 条笔记变成记忆