---
title: "訓練後量化（Post-Training Quantization）"
slug: post-training-quantization
language: zh-TW
source: https://aiterms.tw/terms/post-training-quantization
updated_at: 2026-06-23
tags: [量化, 模型壓縮, 模型推理, 深度學習]
ipas_term: false
---

# 訓練後量化（Post-Training Quantization）

在模型訓練完成後應用的量化技術，通過將浮點參數轉換為低精度整數或定點數來減少模型大小和計算成本，實現過程簡單但精度損失相對較大。

## 完整說明

訓練後量化（PTQ）是最直接的模型壓縮方法，在訓練完成的全精度模型上直接應用量化。它將 32 位浮點權重和激活值轉換為 8 位、4 位或更低精度的整數，同時為了最小化精度損失，PTQ 會統計模型在校準數據集上的激活值分佈，據此選擇最優的量化範圍。相比於量化感知訓練，PTQ 無需重新訓練，計算成本極低，但通常會損失 1-5% 的精度，特別是在低位寬場景下。

## 常見問題

### 校準數據集的選擇如何影響訓練後量化效果？

校準集的代表性直接影響量化參數的準確性。如果校準集分佈與實際推理數據不一致，估計的激活值範圍會偏離，導致量化時要麼丟棄重要信息（範圍過小），要麼保留過多雜訊（範圍過大）。例如，一個在 ImageNet 訓練的分類模型如果用 10 張完全不同領域的圖像作為校準集，量化效果會很差。建議選擇與真實推理數據分佈相同的隨機子集，大小為全訓練集的 1-5%。若數據多樣性高，可以增加校準集比例到 10%。對於流數據場景，可以從實時推理日誌中定期採樣，不斷更新量化參數。

### 熵最小化校準法相比最小最大值法的優勢是什麼？

最小最大值法簡單但對異常值敏感。如果權重或激活值中出現幾個很大的異常值，量化範圍就會被迫擴大，導致正常值的量化精度下降。熵最小化法通過 KL 散度衡量量化前後分佈的相似性，選擇使信息損失最小的範圍，對異常值具有魯棒性。具體地，熵法會遍歷多個可能的量化邊界（如 Min-Max 的 50%-100%），測試每個邊界下量化分佈與原始分佈的 KL 散度，選擇最小的。實驗表明，在激活值差異大的任務上（如某些 NLP 模型），熵法精度保留比最小最大值法高 1-2%。代價是計算成本增加 10-20%，但校準通常只需要做一次。

### 為什麼某些層對量化更敏感，應該如何處理？

不同層對量化的敏感度不同，主要原因是信息流和梯度流的不同。首層（input layer）和尾層（output layer）通常最敏感，因為它們直接關係到輸入輸出質量；深層特徵層對量化相對不敏感。此外，某些非線性層（如 softmax 前層）敏感度高，因為其輸出分佈差異影響下游計算。處理方法包括混合精度量化（首尾層用 16 位，中層用 8 位）、逐通道量化（為每個輸出通道單獨計算量化參數而非全層共用一個），和分組量化（將層分成幾個組分別量化）。實踐中，通過逐層評估量化後模型的輸出變化量（如 cosine 相似度下降），可以識別敏感層，對其應用保守的量化策略。

---

來源：https://aiterms.tw/terms/post-training-quantization
快查頁：https://aiterms.tw/terms/post-training-quantization
最後更新：2026/06/23
深度解說：https://aiterms.tw/learning/what-is-post-training-quantization