来源
- 原始链接:https://www.youtube.com/watch?v=fWXJM-J0ZB8
- 来源类型:视频逐字稿
- 来源标题:端侧前沿成果
文本来源是 AI Engineer 频道视频《端侧前沿成果》的修复版中文稿。下面按汉松兴趣画像优先保留机制解释、反常识判断和可复用工作流,而不是做普通摘要。
开头可以先抓住一句:演讲者 Rachel Lee Nabors(来自 Arize)介绍了如何通过评估和选用端侧小语言模型(SLM)替代 GPT、Claude 等大型云端模型,从而降低推理成本、提升隐私安全与响应速度,并以自己的社交客户端 Mima 为实战案例,演示了完整的模型评估与提示词优化流程。
一、第 1 段
背景
本段为按时间切分的阅读章节,用于快速定位原文。
大型推理服务不可用会损害生产力——无论是服务中断、身处无法连接 Wi-Fi 的地方,还是处于高度安全的环境中。近来 token 成本虽然在下降,但推理总支出却在上升,因为 Agent 和推理型负载消耗 token 的速度远超价格下降的速度。但我们完全可以消除其中大部分成本,这一切从问自己一个问题开始:这到底花了我多少钱?我们真的需要一个 LLM 来完成这项工作吗?
兴趣匹配度很高。这直接落在上下文工程上:关键不是塞更多材料,而是让系统在正确边界内拿到可维护、可审计、可复用的材料。
二、第 3 段
背景
本段为按时间切分的阅读章节,用于快速定位原文。
于是我先用 Claude 做了原型,验证效果足够好。你可以看到那些小摘要,它对谁在讨论什么的概括做得相当不错。第一步是收集一组输入和输出,也就是说,我需要收集一批对话串,以及我希望如何总结它们。在这个案例里,Claude 的总结结果让我觉得足够好。于是我导出了一个”黄金数据集”。所谓黄金数据集,是一组经过精心筛选的高质量输入 - 输出对,最好由人工标注,用作评估、验证和基准测试模型的基准真值。
兴趣匹配度很高。这直接落在上下文工程上:关键不是塞更多材料,而是让系统在正确边界内拿到可维护、可审计、可复用的材料。
三、第 4 段
背景
本段为按时间切分的阅读章节,用于快速定位原文。
但你可能在想,那个差距怎么办?90% 的准确率,听起来可能是个问题。其实,我们可以通过提示词工程从小模型中榨取更好的性能。这在你无法控制使用哪个模型的情况下尤为重要。有些人可能会创建一个经过蒸馏的模型,专门训练它来做好这一项任务。但如果你在做移动应用,可能不想用蒸馏模型,因为每次增加新能力,你可能都需要重新训练模型,然后每次都要向用户推送一个新的 1 到 2 GB 模型。这就是一个典型的例子:“我觉得我没办法控制那个模型。一旦它在用户设备上,我不会要求他们再下载新的,那会耗尽他们的流量套餐。
兴趣匹配度很高。这直接落在上下文工程上:关键不是塞更多材料,而是让系统在正确边界内拿到可维护、可审计、可复用的材料。
四、第 5 段
背景
本段为按时间切分的阅读章节,用于快速定位原文。
至于引用一致性和长度问题,这些实际上可以在测试框架内部和后处理阶段解决。比如确保引用数量正确——你只需要看看对话串有多长,如果引用数量超过了对话参与者的数量,那就是错误的。至于摘要太长,直接截断就好。
兴趣匹配度很高。这直接落在上下文工程上:关键不是塞更多材料,而是让系统在正确边界内拿到可维护、可审计、可复用的材料。
五、第 6 段
背景
本段为按时间切分的阅读章节,用于快速定位原文。
那么,从哪里开始?有多少个 Claude 调用可以换成 Llama 调用?我向你发出挑战:今天回去之后,看看你发给 LLM 的内容,问问自己:这件事一个小模型能处理吗?如果能,我能省多少钱?在做 AI 项目时,留意那些可能已经在设备上的 SLM 和专用模型。比如 Chrome 和提示词 API,它们可以访问随 Chrome 原生内置的 Gemini Nano,这非常有用,因为这意味着你不需要向任何使用浏览器的用户单独推送模型,直接利用现成的就好。
兴趣匹配度很高。这直接落在上下文工程上:关键不是塞更多材料,而是让系统在正确边界内拿到可维护、可审计、可复用的材料。
整体判断
这篇最值得保留的不是某个单点技巧,而是它把「端侧前沿成果」放进了更完整的工程框架里:第 1 段、第 3 段、第 4 段。这些内容可以作为汉松后续写 AI 工程、Agent 系统和团队工作流时的素材。
更重要的是,它提供了一种判断 AI 系统的方式:先看问题如何被拆成状态、动作、工具、评估和人的边界,再看模型能力如何嵌进去。只有这样,视频里的做法才会从一次演示变成可迁移的方法。