从 Shannon 1948 到 TurboQuant 2025,压缩技术走过了 77 年。
但最激动人心的篇章或许才刚刚开始。
权重只有三个值:{-1, 0, 1}。每个权重 1.58 bit(log₂3)。矩阵乘法变成加法和减法——不需要浮点乘法器。在 3B 参数规模下匹配 FP16 模型的 perplexity。这不是 post-training 量化,而是从头训练的 1-bit 原生模型。
比 BitNet 更激进:用三值加法完全替代矩阵乘法。不只是量化权重,而是重新设计注意力机制和前馈网络的计算范式。在 13B 参数下与传统 Transformer 竞争力相当。
压缩算法和硬件正在协同进化——算法推动硬件支持更低精度,硬件反过来让更激进的压缩方案实用化。
| 硬件 | 原生支持 | 意义 |
|---|---|---|
| NVIDIA Blackwell (2024) | FP4 原生 | 4-bit 推理无性能损失 |
| Groq TSP | TruePoint numerics | 自定义数值格式,专为 LLM 推理优化 |
| Apple M4 Neural Engine | INT8 / FP16 | 端侧 LLM 推理(如 Apple Intelligence) |
| Google TPU v6e | INT8 / BF16 | 云端大规模推理 |
LLM 推理优化不是一维的"量化"问题,而是四个正交层次同时推进:
| 层次 | 优化什么 | 代表方案 |
|---|---|---|
| IO 效率 | 内存带宽利用率 | FlashAttention(减少 HBM 读写) |
| 内存分配 | 显存碎片化 | PagedAttention / vLLM |
| 数值表示 | 每个值的 bit 数 | TurboQuant / GPTQ / AWQ / BitNet |
| 内容选择 | 保留哪些 KV | StreamingLLM / H₂O(丢弃不重要的 KV) |
TurboQuant 解决的是第三层。但最优解是四层联合优化——FlashAttention 减少 IO + PagedAttention 管理内存 + TurboQuant 压缩存储 + StreamingLLM 选择性丢弃。
回到 Chapter 0 的命题:压缩 = 智能。
现在我们可以画出一个完整的闭环:
从 Shannon 1948 的信息论,到 Lloyd 1957 的最优量化器,
从 PQ 2011 的分而治之,到 GPTQ 2022 的神经网络压缩,
从 JL 引理 1984 的随机投影,到 TurboQuant 2025 的集大成,
每一次突破都源于同一个追问:
如何用更少的 bit 表达更多的含义?
这个问题的答案,就是智能的度量。
提出 BitNet b1.58——将 Transformer 权重限制为 {-1, 0, 1} 三个值(log₂3 ≈ 1.58 bit/权重)。在 3B 参数规模上匹敌 FP16 模型的困惑度(perplexity),同时将矩阵乘法简化为加减法运算。这代表了"从训练开始就低精度"的范式转变——不是训好再量化,而是直接训练低 bit 模型。
在本章作为整个旅程的起点和终点出现。从 1948 年信息论到 2025 年 TurboQuant,77 年的发展印证了 Shannon 的核心洞察:信息的本质是可以被度量、压缩和最优编码的。本教程的每一章技术都是对 Shannon 理论的一次具体实现。
在本章结尾重新出现,呼应第零章的核心命题:压缩 = 预测 = 理解 = 智能。Kolmogorov 的复杂度理论和 Solomonoff 的归纳推理理论共同构成了"智能即压缩"的数学基础。当代 LLM 的成功(通过 next-token prediction 学习世界模型)是这一理论的最强实证。
直觉:每个权重只有三种可能的值。矩阵乘法 y = Wx 变成了纯加减法——对于 w=1 的位置加上 x,w=-1 的位置减去 x,w=0 的位置跳过。完全消除了乘法运算,适合专用硬件实现。
{-1, 0, 1} — 三元权重集log₂3 ≈ 1.58 — 三个状态的信息量m × n — 权重矩阵维度
直觉:未来的推理优化不是单点突破,而是四个正交维度的协同。本教程覆盖了"数值精度"这条线(量化),但硬件(FP4 芯片)、IO(FlashAttention)、内容选择(StreamingLLM)各自独立贡献优化。四维的乘积效应远大于单维的极限推进。
数值精度 — 本教程主线:FP16 → INT8 → INT4 → 1.58-bit硬件利用 — NVIDIA FP4、Google TPU、Apple Neural EngineIO 效率 — FlashAttention、PagedAttention内容选择 — StreamingLLM、H₂O(选择性丢弃不重要的 KV)
直觉:DeepMind 的实验证明:一个训练好的语言模型(Chinchilla 70B)压缩 Wikipedia 的效率远超专用压缩算法 gzip。更惊人的是,LLM 甚至能压缩图片和音频(跨模态)——因为它学到的不是字符模式,而是世界的因果结构。"理解"就是最好的压缩。
8.3% — Chinchilla 70B 对 enwik8 的压缩率32.3% — gzip 的压缩率跨模态 — LLM 压缩图片/音频优于 PNG/FLAC(特定条件下)