---
title: "變分推論（Variational Inference）"
slug: variational-inference
language: zh-TW
source: https://aiterms.tw/terms/variational-inference
updated_at: 2026-06-23
tags: [貝葉斯方法, 機器學習, 深度學習, 推論, 最優化]
ipas_term: false
---

# 變分推論（Variational Inference）

將貝葉斯推論問題轉化為最優化問題，用易於計算的分布逼近複雜的後驗分布。

## 完整說明

變分推論（Variational Inference，VI）是在複雜的後驗分布難以精確計算時進行貝葉斯推論的通用方法。其核心思想是，用一族易於處理的分布（變分族，variational family）中的簡單分布 q(Z) 逼近真實後驗 p(Z|X)，透過最小化兩者之間的 Kullback-Leibler 散度（KL 散度），將推論問題轉化為最優化問題。變分推論是現代貝葉斯深度學習（如變分自動編碼器 VAE）的理論基礎。

## 常見問題

### 變分推論與馬可夫鏈蒙地卡羅（MCMC）有什麼優缺點？

兩者都是近似貝葉斯推論的方法，但特性不同。MCMC（如 Gibbs 採樣）的優點是不需假設變分族形式，能逼近任意後驗；缺點是收斂慢、難以判斷是否收斂、上手門檻高。變分推論的優點是快速（梯度最優化通常比 MCMC 採樣快數個數量級），容易實現（特別是有自動微分的現代框架），適合大規模資料；缺點是需假設變分族，欠估計後驗方差與多峰性，結果質量依賴假設。實踐中，傳統小規模貝葉斯模型用 MCMC；大規模深度學習模型用變分推論；高精度需求時結合兩者（如用 MCMC 驗證 VI 結果）。

### ELBO 的兩項「重構」和「正則化」各代表什麼？

在 VAE 的脈絡下，ELBO = 𝔼_q[log p(X|Z)] - KL(q(Z|X) || p(Z))。第一項「重構項」𝔼_q[log p(X|Z)] 衡量：給定潛變數 Z，模型能否重構觀測 X，鼓勵潛表示包含足夠資訊。第二項「KL 正則化項」約束潛變數的後驗分布 q(Z|X) 接近先驗 p(Z)（通常假設為標準常態分布 N(0,I)），防止潛變數過度適配於訓練資料、喪失泛化性。兩項的權衡由隱變數維度自動決定：高維潛變數 → KL 項大 → 潛表示傾向「簡潔」；反之亦然。在某些應用（如影像生成）中，會手動加權 KL 項（β-VAE），控制重構精度與潛表示規律性的平衡。

### 變分推論在實務上什麼時候比 EM 演算法更好用？

EM 演算法在隱變數模型的參數學習中適用，但假設隱變數後驗能解析計算（或在 E-step 中能精確推導）；變分推論則在後驗難以精確計算、模型複雜時提供通用框架。當模型層級深（如層階貝葉斯模型）、隱變數與資料高維時，EM 的 E-step 可能不可行，此時需變分推論。另外，變分推論能自然整合神經網路參數化（如 VAE），支援大規模隨機優化；EM 則傳統上用於低階參數模型。但兩者不衝突：變分 EM 結合兩者優點，用變分推論逼近 E-step，提升效率。選擇上看具體問題，簡單模型用 EM 更直接；複雜深度模型用變分推論更現實。

---

來源：https://aiterms.tw/terms/variational-inference
快查頁：https://aiterms.tw/terms/variational-inference
最後更新：2026/06/23
深度解說：https://aiterms.tw/learning/what-is-variational-inference