半年前我还在写 dontAsk 配置教程、给 AI 装 PUA Skill,现在这些全都用不上了。AI 迭代速度快到工具文章保质期只有几个月,那人的保质期呢?聊聊 vibe coding 的下一站,以及 T 型人才为什么正在让位给 π 型。
llm-anatomy 正传收官:先讲 NSP 这个 BERT 时代的'标配预训练任务'是怎么被 RoBERTa 们证伪、被行业悄悄埋掉的;再把冻结头和手写 LoRA(不用 peft,30 行注入 BERT)放在同一个中文情感分类任务上真刀真枪对比——1,538 vs 296,450 vs 理论上的 102,269,186 个可训练参数,acc 和耗时全是真实跑出来的数字。
llm-anatomy 连载第 3 章:用 PyTorch 手写一个可配置的 decoder-only Transformer,先按 2017 原版组装跑通,再逐件换成 LLaMA 件——LayerNorm→RMSNorm、post-norm→pre-norm、可学习位置→RoPE、MHA→GQA、GELU→SwiGLU,每件讲清'为什么被换'。语料用我自己的博客文章,两套配置同预算实测对比,所有数字与生成样本真实可复现。
llm-anatomy 连载第 2 章:用 numpy 手撕加性/乘性/缩放点积三种注意力打分函数,用真实实验数据回答三个问题——点积为什么赢、√d 为什么不能省、KV cache 到底省了哪一步。顺路把 GQA/MLA/FlashAttention 钉在公式的对应位置上。
拆开 LLM 连载第 1 章:不到两百行 numpy 写出一个能跑的自动微分引擎,用中心差分给它判卷(最大相对误差 7.6e-9),再沿着一条指数加权平均公式从零推出 Momentum、RMSProp、Adam,四个优化器在双螺旋数据上同台对比。所有数字都是真实跑出来的。
开一个新连载:不调库,用 numpy 把 LLM 的每个零件亲手造一遍——autograd、注意力、Transformer、LoRA。这一篇先把 2013→2026 的架构史压成一条修 bug 链:RNN 的串行与梯度消失、Seq2Seq 的信息瓶颈、Transformer 革的到底是谁的命、RoPE/GQA/MLA/KV cache/FlashAttention 又都在救哪条公式。五章封顶,所有实验数字真实跑出来。
credis 连载第 1 章:用一个定长结构体数组 + 线性查找,让它第一次'有用'——SET/GET/DEL 全通。顺路讲透 C 字符串的所有坑、strtok 的野蛮美学,以及 .h/.c/static 三件套构成的 C 式封装。
开一个新连载:用纯 C 从零手写一个迷你键值数据库 credis。这一篇先把 C 的知识体系画成一张地图,再交付第 0 章——一个能编译、能运行、能打印版本号的项目骨架。仓库公开,跟着 commit 走。