什麼是 Quantization(量化)?

Quantization 是把模型權重(weights)從高精度數字格式(如 32-bit 或 16-bit 浮點數)轉換成低精度格式(如 8-bit 或 4-bit 整數)的技術。精度降低代表每個參數佔用的位元數變少,結果是模型體積縮小數倍、推理速度變快、顯存(VRAM)需求大幅下降。傳統認知是「量化=犧牲一點準確度換取效率」,但這個 trade-off 正在被打破。

Hugging Face 近期提出的「Quantization-Aware Healing」技術,透過在量化過程中額外修復關鍵權重,讓壓縮後的 4-bit 模型在特定任務上表現甚至超越原始全精度版本——這對業界是個訊號:量化不再只是「妥協」,而可能是「更好」。實戰上,這類技術是把 70B 級模型塞進單張消費級 GPU 的關鍵一步,也是邊緣裝置(手機、Jetson、樹莓派)能跑 LLM 的核心原因。對自架團隊來說,選對量化方案(GGUF、GPTQ、AWQ 等)往往比換更貴的硬體更划算。