技术笔记
工程实践、系统设计、编程语言和技术原理的长期笔记。
-
Harness 工程实践:如何让 Agent 完成自主迭代
一个人一天最多跑一次迭代实验,但每周上百个 badcase 追着我们跑——我们团队用 Harness 工程让 AI 自主运行 17 小时、完成 16 轮迭代实验,最终上线了实验。这篇文章复盘了整个搭建过程。
-
不写代码的工程师,才是 AI 时代最值钱的人
我已经很久没写过一行代码了。
-
从零实现 vLLM (1.4):RMSNorm 如何解决训练不稳定
在上篇文章《从零实现 vLLM(1.3):如何加速 Attention 计算》中,我们深入分析了 Qwen3Attention 组件,学习了 FlashAttention 如何通过在线 Softmax 和分块计算技术。
-
从零实现 vLLM (1.3):如何加速 Attention 计算
在上篇文章《从零实现 vLLM (1.2):如何实现张量并行》中,我们深入到 Qwen3DecoderLayer 的第一个核心组件:Qwen3Attention。
-
大模型分布式训练(1):FSDP 的原理与实践
在大模型出现之前,分布式训练最常用的技术是 数据并行(Data Parallelism, DP) 。
-
从零实现 vLLM (1.2):如何实现张量并行
在上篇文章《从零实现 vLLM (1.1):并行词嵌入 VocabParallelEmbedding》中,我们分析了 Qwen3Model 模型中第一个组件:VocabParallelEmbedding 的源码。
-
从零实现 vLLM (1.1):并行词嵌入 VocabParallelEmbedding
我一直都喜欢通过代码学习各种技术,特别是各种从零开始实现 XX 的。
-
DeepSeek 新论文 SPCT:让奖励模型学会“先定规则后点评,再打分”
现在大语言模型(LLM)是越来越火,能力也越来越强。
-
AutoGLM 技术探秘:让 AI 学会“点点点”的挑战与策略
最近 AI 领域有个挺火的方向,就是让 AI 像人一样去操作图形界面(GUI),比如自动帮你订外卖、处理邮件等等。
-
不需要人类教练的 o3:OpenAI 用强化学习训练出编程"六边形战士"
OpenAI 在最近的发表的对比研究中发现:在编程竞赛任务中,人类精心设计的策略败给了强化学习训练的通用模型。