CH.08 终章

压缩的未来

从 Shannon 1948 到 TurboQuant 2025,压缩技术走过了 77 年。
但最激动人心的篇章或许才刚刚开始。

01

极限挑战:1-bit LLM

BitNet b1.58 (Microsoft, 2024)

权重只有三个值:{-1, 0, 1}。每个权重 1.58 bit(log₂3)。矩阵乘法变成加法和减法——不需要浮点乘法器。在 3B 参数规模下匹配 FP16 模型的 perplexity。这不是 post-training 量化,而是从头训练的 1-bit 原生模型。

三元权重:矩阵乘法变加减法 传统神经网络:y = W × x(每个权重是浮点数,需要乘法)

BitNet b1.58:每个权重只有三种可能 {-1, 0, 1},矩阵乘法变成:

权重 = 1 → 加上对应的输入值(y += x[j])
权重 = -1 → 减去对应的输入值(y -= x[j])
权重 = 0 → 跳过(什么都不做)

完全不需要乘法运算!只有加法和减法。乘法器占芯片面积大、耗电多。消除乘法 = 推理速度和能效的巨大飞跃。

为什么是 1.58 bit?三种状态的信息量 = log₂(3) ≈ 1.585 bit。不是 1 bit(只有 {0,1} 两种),也不是 2 bit({0,1,2,3} 四种),而是正好"两种状态多一点"。
🔢

MatMul-free LLM (NeurIPS 2024)

比 BitNet 更激进:用三值加法完全替代矩阵乘法。不只是量化权重,而是重新设计注意力机制和前馈网络的计算范式。在 13B 参数下与传统 Transformer 竞争力相当。

02

硬件协同进化

压缩算法和硬件正在协同进化——算法推动硬件支持更低精度,硬件反过来让更激进的压缩方案实用化。

硬件原生支持意义
NVIDIA Blackwell (2024)FP4 原生4-bit 推理无性能损失
Groq TSPTruePoint numerics自定义数值格式,专为 LLM 推理优化
Apple M4 Neural EngineINT8 / FP16端侧 LLM 推理(如 Apple Intelligence)
Google TPU v6eINT8 / BF16云端大规模推理
03

四层正交优化

LLM 推理优化不是一维的"量化"问题,而是四个正交层次同时推进:

层次优化什么代表方案
IO 效率内存带宽利用率FlashAttention(减少 HBM 读写)
内存分配显存碎片化PagedAttention / vLLM
数值表示每个值的 bit 数TurboQuant / GPTQ / AWQ / BitNet
内容选择保留哪些 KVStreamingLLM / H₂O(丢弃不重要的 KV)
四层优化像什么? 想象优化一家快餐店的出餐速度:

数值精度(原料处理):把大块牛肉换成预制肉饼 → 每份用料减半,口感几乎一样
→ 本教程的主线:FP16 → INT4 → 1.58-bit

硬件利用(厨房设备):用专门的肉饼机替代通用炉灶 → 同样时间出更多份
→ NVIDIA FP4 芯片、Google TPU、Apple Neural Engine

IO 效率(点单到厨房的传菜流程):不是做一份传一份,而是攒一批一起传
→ FlashAttention 把内存读写合并,减少 GPU↔内存的来回搬运

内容选择(菜单精简):去掉没人点的菜品,只备畅销菜的原料
→ StreamingLLM / H₂O:丢弃不重要的历史 token,只保留关键 KV

四个维度正交(互不干扰),乘积效应远大于单维极限推进。

TurboQuant 解决的是第三层。但最优解是四层联合优化——FlashAttention 减少 IO + PagedAttention 管理内存 + TurboQuant 压缩存储 + StreamingLLM 选择性丢弃。

04

压缩 = 智能的闭环

回到 Chapter 0 的命题:压缩 = 智能。

现在我们可以画出一个完整的闭环:

更强的模型
↓ 能更好地压缩数据(Ch0: Chinchilla 8.3% vs gzip 32.3%)
更好的压缩
↓ 使模型本身更小更快(Ch4-7: 从 FP16 到 3-bit)
更高效的模型
↓ 可以用更多数据训练更大模型
更强的模型 → 循环继续
"If you can compress data well, you understand it. If you understand it well, you can compress it." — 这个循环,就是智能的本质
终极对比:压缩能力 = 理解能力 同样压缩 Wikipedia(enwik8,100MB 英文文本):

gzip(1992,统计字符频率):压缩到 32.3% → 理解层次:字符重复模式
bzip2(1996,块排序变换):压缩到 25.3% → 理解层次:短程文本结构
LSTM(2019,循环神经网络):压缩到 12.8% → 理解层次:语法和局部语义
Chinchilla 70B(2023,大语言模型):压缩到 8.3% → 理解层次:世界知识和因果关系

压缩率从 32% 到 8%,对应的"理解"从"字符频率"到"世界模型"。
更惊人的是:Chinchilla 只在文本上训练,但压缩图片也超过 PNG,压缩音频也超过 FLAC——因为它学到的不是"文字",而是世界如何运转的因果结构

旅程结束。理解开始。

从 Shannon 1948 的信息论,到 Lloyd 1957 的最优量化器,
从 PQ 2011 的分而治之,到 GPTQ 2022 的神经网络压缩,
从 JL 引理 1984 的随机投影,到 TurboQuant 2025 的集大成,

每一次突破都源于同一个追问:
如何用更少的 bit 表达更多的含义?

这个问题的答案,就是智能的度量。

🎯 全旅程回顾

📋 人物档案

本章提及
Microsoft Research(BitNet 团队)
2024 · 美国 · Microsoft Research

提出 BitNet b1.58——将 Transformer 权重限制为 {-1, 0, 1} 三个值(log₂3 ≈ 1.58 bit/权重)。在 3B 参数规模上匹敌 FP16 模型的困惑度(perplexity),同时将矩阵乘法简化为加减法运算。这代表了"从训练开始就低精度"的范式转变——不是训好再量化,而是直接训练低 bit 模型。

Claude Shannon(克劳德·香农)
1916–2001 · 美国 · Bell Labs / MIT

在本章作为整个旅程的起点和终点出现。从 1948 年信息论到 2025 年 TurboQuant,77 年的发展印证了 Shannon 的核心洞察:信息的本质是可以被度量、压缩和最优编码的。本教程的每一章技术都是对 Shannon 理论的一次具体实现。

Andrey Kolmogorov & Ray Solomonoff
Kolmogorov: 1903–1987 | Solomonoff: 1926–2009

在本章结尾重新出现,呼应第零章的核心命题:压缩 = 预测 = 理解 = 智能。Kolmogorov 的复杂度理论和 Solomonoff 的归纳推理理论共同构成了"智能即压缩"的数学基础。当代 LLM 的成功(通过 next-token prediction 学习世界模型)是这一理论的最强实证。

📐 公式详解

本章公式
BitNet b1.58 权重空间
W ∈ {-1, 0, 1}^(m×n), 每权重 log₂3 ≈ 1.58 bit

直觉:每个权重只有三种可能的值。矩阵乘法 y = Wx 变成了纯加减法——对于 w=1 的位置加上 x,w=-1 的位置减去 x,w=0 的位置跳过。完全消除了乘法运算,适合专用硬件实现。

{-1, 0, 1} — 三元权重集
log₂3 ≈ 1.58 — 三个状态的信息量
m × n — 权重矩阵维度
四层正交优化框架
总效率 = 数值精度 × 硬件利用 × IO效率 × 内容选择

直觉:未来的推理优化不是单点突破,而是四个正交维度的协同。本教程覆盖了"数值精度"这条线(量化),但硬件(FP4 芯片)、IO(FlashAttention)、内容选择(StreamingLLM)各自独立贡献优化。四维的乘积效应远大于单维的极限推进。

数值精度 — 本教程主线:FP16 → INT8 → INT4 → 1.58-bit
硬件利用 — NVIDIA FP4、Google TPU、Apple Neural Engine
IO 效率 — FlashAttention、PagedAttention
内容选择 — StreamingLLM、H₂O(选择性丢弃不重要的 KV)
压缩 ≡ 智能(闭环)
Chinchilla: 8.3% 压缩率 vs gzip: 32.3%

直觉:DeepMind 的实验证明:一个训练好的语言模型(Chinchilla 70B)压缩 Wikipedia 的效率远超专用压缩算法 gzip。更惊人的是,LLM 甚至能压缩图片和音频(跨模态)——因为它学到的不是字符模式,而是世界的因果结构。"理解"就是最好的压缩。

8.3% — Chinchilla 70B 对 enwik8 的压缩率
32.3% — gzip 的压缩率
跨模态 — LLM 压缩图片/音频优于 PNG/FLAC(特定条件下)