大语言模型专栏导览
本专栏收录大语言模型自身的知识:架构怎么演进、输出怎么采样、输入怎么切分。
它与相邻专栏的边界是关注点而不是技术栈:
| 不收 | 去哪看 | 本专栏只关心 |
|---|---|---|
| 经典机器学习算法与数学基础 | AI/ml/ | 这些算法怎么演化成大模型 |
| 与模型的交互与工程 —— 提示怎么写、上下文怎么组装、Harness 怎么搭、规则边界、评测闭环 | AI/agent/,从 Prompt Engineering 起 | 模型自身能做什么、边界在哪 |
| 模型怎么跑在硬件上 —— 算子、显存、调度、部署 | AI/infra/ | 模型结构对运行时提出了什么要求 |
目录
- 01 · 语言模型演进:N-gram 到 RNN —— 从 n-gram 到 RNN 的演进,以及各自的失效点
- 02 · Transformer 架构 —— 整机骨架:自注意力与多头、前馈、残差与归一化、位置编码
- 03 · Decoder-Only 与自回归 —— 为什么砍掉编码器,因果掩码挡住了什么
- 04 · 采样参数 —— Temperature、Top-k、Top-p 的原理与优先级
- 05 · 文本分词与子词算法 —— 算法 / 工具 / 粒度三层概念,各家方案的现状与生产坑
- 06 · 缩放法则 —— 损失与参数量、数据量、计算量的幂律关系,以及涌现的阈值效应
- 07 · 模型幻觉 —— 三类幻觉的成因与四个层次的缓解手段
- 08 · 模型选型 —— 八个考量维度,API 与本地部署怎么取舍
- 09 · 位置编码 —— 从正弦余弦到 RoPE 与外推方法,以及评判标准为什么会翻转
- 10 · KV Cache 与推理优化 —— 显存账本、两阶段瓶颈、注意力变体与缓存复用
- 11 · Self-Attention 机制 —— QKV 的检索直觉、五步计算与维度跟踪、复杂度与多头参数量
- 12 · FFN 与激活函数 —— FFN 的角色、激活函数演进、参数量守恒与切分方式
- 13 · 归一化与残差连接 —— 残差为什么必需、LayerNorm 与 RMSNorm 的取舍、Pre/Post-Norm
- 14 · 长上下文技术 ——
的两笔账、稀疏与线性注意力、SSM 路线、长上下文怎么评 - 15 · 多模态 LLM —— 视觉信息怎么接进自回归框架,各压缩方案的取舍
阅读顺序
01 → 03 是一条架构演进线:先看 Transformer 之前的模型为什么不够用,再看 Transformer 怎么解决,最后看为什么主流大模型只保留解码器。09 是这条线的补完——位置信息怎么注入、这件事怎么决定了模型能处理多长的输入。
04 → 08 是「怎么用、有什么边界、怎么选」:采样参数决定怎么从分布里取词,分词决定输入被切成什么,缩放法则解释能力从哪来,幻觉说明它会在哪里不可靠,选型把前面几条收成一张决策表。
08 之前先读 06 和 07——能力涌现决定选型的下限,幻觉缓解手段决定能不能降低对模型自身准确性的依赖。
11 → 13 是 Transformer 内部组件的深入篇,与 02 是「总览 vs 分件」的关系:02 给出整机骨架,11/12/13 分别把 Attention、FFN、归一化与残差拆到算子与显存层面。要动模型结构或写 kernel 时就往这三篇走(配套的算子实现见 ../infra/cuda/)。
10 vs ../infra/infer/:10 算的是 KV Cache 的显存账本与注意力布局(模型侧);infer/ 讲的是引擎怎么把这块显存管起来(块表、引用计数、抢占)。同一个对象两个层次。
14 与 09 是一条线:09 讲位置编码怎么外推(PI / NTK-aware / YaRN / Dynamic NTK),14 接着讲位置之外的两件事 —— 注意力结构本身能不能降到线性(稀疏 / 线性注意力 / SSM),以及长上下文到底怎么算有效(NIAH / RULER / Lost in the Middle)。系统侧的跨设备切分在 ../infra/train/11-长序列训练与上下文并行。
15 是唯一一篇跨模态的:它把文本之外的信息接进同一套自回归框架,核心机制仍是 token 化(图像切 patch、音频切帧)与注意力。视频理解实际依赖 14 的长上下文能力。
YJ