Skip to content

大语言模型专栏导览 ​

标签
AI/llm
字数
1351 字
阅读时间
6 分钟

本专栏收录大语言模型自身的知识:架构怎么演进、输出怎么采样、输入怎么切分。

它与相邻专栏的边界是关注点而不是技术栈:

不收去哪看本专栏只关心
经典机器学习算法与数学基础AI/ml/这些算法怎么演化成大模型
与模型的交互与工程 —— 提示怎么写、上下文怎么组装、Harness 怎么搭、规则边界、评测闭环AI/agent/,从 Prompt Engineering 起模型自身能做什么、边界在哪
模型怎么跑在硬件上 —— 算子、显存、调度、部署AI/infra/模型结构对运行时提出了什么要求

目录 ​

  • 01 · 语言模型演进:N-gram 到 RNN —— 从 n-gram 到 RNN 的演进,以及各自的失效点
  • 02 · Transformer 架构 —— 整机骨架:自注意力与多头、前馈、残差与归一化、位置编码
  • 03 · Decoder-Only 与自回归 —— 为什么砍掉编码器,因果掩码挡住了什么
  • 04 · 采样参数 —— Temperature、Top-k、Top-p 的原理与优先级
  • 05 · 文本分词与子词算法 —— 算法 / 工具 / 粒度三层概念,各家方案的现状与生产坑
  • 06 · 缩放法则 —— 损失与参数量、数据量、计算量的幂律关系,以及涌现的阈值效应
  • 07 · 模型幻觉 —— 三类幻觉的成因与四个层次的缓解手段
  • 08 · 模型选型 —— 八个考量维度,API 与本地部署怎么取舍
  • 09 · 位置编码 —— 从正弦余弦到 RoPE 与外推方法,以及评判标准为什么会翻转
  • 10 · KV Cache 与推理优化 —— 显存账本、两阶段瓶颈、注意力变体与缓存复用
  • 11 · Self-Attention 机制 —— QKV 的检索直觉、五步计算与维度跟踪、复杂度与多头参数量
  • 12 · FFN 与激活函数 —— FFN 的角色、激活函数演进、参数量守恒与切分方式
  • 13 · 归一化与残差连接 —— 残差为什么必需、LayerNorm 与 RMSNorm 的取舍、Pre/Post-Norm
  • 14 · 长上下文技术 —— O(n2) 的两笔账、稀疏与线性注意力、SSM 路线、长上下文怎么评
  • 15 · 多模态 LLM —— 视觉信息怎么接进自回归框架,各压缩方案的取舍

阅读顺序 ​

01 → 03 是一条架构演进线:先看 Transformer 之前的模型为什么不够用,再看 Transformer 怎么解决,最后看为什么主流大模型只保留解码器。09 是这条线的补完——位置信息怎么注入、这件事怎么决定了模型能处理多长的输入。

04 → 08 是「怎么用、有什么边界、怎么选」:采样参数决定怎么从分布里取词,分词决定输入被切成什么,缩放法则解释能力从哪来,幻觉说明它会在哪里不可靠,选型把前面几条收成一张决策表。

08 之前先读 06 和 07——能力涌现决定选型的下限,幻觉缓解手段决定能不能降低对模型自身准确性的依赖。

11 → 13 是 Transformer 内部组件的深入篇,与 02 是「总览 vs 分件」的关系:02 给出整机骨架,11/12/13 分别把 Attention、FFN、归一化与残差拆到算子与显存层面。要动模型结构或写 kernel 时就往这三篇走(配套的算子实现见 ../infra/cuda/)。

10 vs ../infra/infer/:10 算的是 KV Cache 的显存账本与注意力布局(模型侧);infer/ 讲的是引擎怎么把这块显存管起来(块表、引用计数、抢占)。同一个对象两个层次。

14 与 09 是一条线:09 讲位置编码怎么外推(PI / NTK-aware / YaRN / Dynamic NTK),14 接着讲位置之外的两件事 —— 注意力结构本身能不能降到线性(稀疏 / 线性注意力 / SSM),以及长上下文到底怎么算有效(NIAH / RULER / Lost in the Middle)。系统侧的跨设备切分在 ../infra/train/11-长序列训练与上下文并行。

15 是唯一一篇跨模态的:它把文本之外的信息接进同一套自回归框架,核心机制仍是 token 化(图像切 patch、音频切帧)与注意力。视频理解实际依赖 14 的长上下文能力。

贡献者 ​

文件历史 ​