Inference Notes · 论文精读

English

← 全部笔记

Disaggregated Quantization: Specializing LLM Prefill and Decode

Andrei Panferov, Maximilian Kleinegger, Sweta Priyadarshi, Tijmen Blankevoort, Dan Alistarh · NVIDIA, ISTA

在解决通过解决计算密集型预填充阶段和内存带宽密集型解码阶段相互冲突的量化需求,在不牺牲准确率的情况下加速大语言模型推理。

结论证明了将预填充(原生计算格式)和解码(纯权重格式)的量化解耦可以显著提高准确率和速度,但 SSD 流式加载优化 (ODP) 对 MoE 架构和短上下文请求无效。

Inference
发表 · arXiv 2609.26333 · 代码
精读于2026-09-23
可信度机制与指标置信度高。1-bit 带来的巨大收益是真实的,但依赖于本身受损严重的纯权重基线;在稠密模型上泛化良好,但不适用于 MoE。
阅读范围Full LaTeX source, all 13 files incl. appendix given in full; 0 of 19 figures viewed by the reader
精读Gemini 3.1 Pro · 经独立审校

1. 任务

试图解决的问题:大型语言模型(LLM)的推理包含两个计算特征迥异的阶段:预填充(Prefill,处理输入提示,受计算瓶颈限制)和解码(Decode,逐个自回归生成 token,受内存带宽瓶颈限制)。

为什么重要且困难:为了最大化效率必须进行量化,但标准的量化方案通常对两个阶段强制使用相同的格式。如果使用纯权重(Weight-only)压缩,会加速受内存限制的解码阶段,但相比硬件原生的计算格式会拖慢预填充;反之,如果使用同时量化权重和激活的格式(如 NVFP4),会加速预填充,但会损害准确率,并且在解码时无法最大化内存带宽。

本文目标:本文通过提出“解耦量化”(Disaggregated Quantization, DQ)来解决这一僵化的权衡。DQ 针对预填充和解码阶段的不同瓶颈,分别专门定制计算格式、权重格式,甚至权重的存储位置。

2. 核心思路

DQ 不再强制整个模型采用单一的量化方案,而是对推理的每个阶段进行独立优化。其最极端的版本(完全解耦)训练模型在预填充阶段使用硬件原生、计算高效的权重(如 NVFP4)来快速构建 KV Cache,而在解码阶段使用极度压缩的纯权重表示(如 1-3 bit LUT)以最大化内存带宽。这两个阶段在训练时被联合优化,确保解码器能够完美理解预填充阶段生成的表示。

3. 机制 + 心智模型

  1. 解耦量化感知蒸馏(QADD): 从教师模型中进行蒸馏。前向传播使用标签掩码来选择路径:提示(Prompt)token 通过预填充量化格式处理,而生成的 token 使用解码格式。
  2. 格式解耦(Format Disaggregation): 一种简单的插入式干预,主权重共享,但仅在解码时完全禁用激活量化(例如,预填充使用 NVFP4,解码使用 NVFP4A16)。
  3. 完全解耦(Full Disaggregation): 维护两套完全独立的权重。预填充使用专属的 NVFP4 权重,而解码使用自己的 2-3 bit 纯权重。
  4. 卸载式解耦预填充(ODP): 为了避免在有限的显存中同时存放两套权重,预填充权重被置于 SSD 上。在预填充期间,这些权重被逐块流式传输到设备内存中,将加载与矩阵计算重叠,并临时借用空闲解码权重的空间。

心智模型: 预填充是计算密集型的,因此给它配备硬件原生的量化计算格式(NVFP4);解码是内存带宽密集型的,因此给它配备极致紧凑的权重(1-4 bit),且剔除激活量化带来的准确率惩罚。

4. 指标 / 数据集

5. 对比 baseline

6. 开源

代码和 llama.cpp 的 fork 版本已开源:https://github.com/IST-DASLab/disaggregated-quantization 与 https://github.com/IST-DASLab/disaggregated-llama.cpp。 权重(Qwen3.8-27B NVFP4 prefiller)已发布在 Hugging Face Hub 上。

7. 关键数字核实

说法 出处 实际条件 成立? 备注
在解码重度任务上移除解码激活量化可提高准确率,且不增加推理成本 §摘要, §3.2, Tab 1 格式解耦使 Qwen 3 和 Gemma 3 在未解耦方案上平均准确率提升 1.9 和 3.1 点 (NVFP4)。 零额外的权重存储或预填充计算成本。
在 8K 提示长度下,ODP 的首字时间比纯权重快 1.78 倍 (llama.cpp) §摘要, §3.2, Fig 1 Qwen3.8-27B,8K 上下文,llama.cpp,对比 IQ1_S 纯权重基线。 ⚠️ 8K 是最有利的配置。在 < 4K 的上下文中,由于固定的 SSD 流式传输开销,ODP 实际上比纯权重预填充更慢。
训练 NVFP4 预填充器使 1-bit 的 MMLU-Pro 和 MMMU-Pro 准确率分别提升 32.5 和 35.3 §摘要, §3.2, Tab 4 Qwen3.8-27B 使用 IQ1_S 解码器并搭配 NVFP4 预填充器。 ⚠️ 这个头条数据来自最有利的配置 (1-bit),其基线性能本身已严重受损。在 3-bit 时,NVFP4 预填充器反而会降低准确率。
大规模 PTQ 格式解耦在 13 个模型-基准组合中的 11 个上提升了点估计值 §3.3, Tab 2 针对高达 2.8T 参数模型进行 4-bit PTQ 测试 (MMLU-Pro & MMMU-Pro)。 其中 6 项提升具有统计显著性;没有出现显著的性能下降。
完全解耦方案优于 LUT2A16 纯权重基线 4.5 至 12.5 个百分点 §3.2, Tab 1 2-bit LUT2 解码 + NVFP4 预填充 (Qwen 3 和 Gemma 3)。 ⚠️ 完全解耦使用了一个额外的 4-bit (NVFP4) 预填充权重,如果不使用 ODP,这实际上使权重存储需求翻倍。如果不进行流式传输,将其与纯 2-bit 模型进行对比在模型容量上是不公平的。

8. 摘要没说的

9. 可达性与启发

10. 置信度与下一步

11. 审校记录