---
title: "瓦瑟施泰因生成對抗網路（Wasserstein GAN）"
slug: wasserstein-gan
language: zh-TW
source: https://aiterms.tw/terms/wasserstein-gan
updated_at: 2026-06-22
tags: [生成式AI, 深度學習, 機器學習, 神經網路]
ipas_term: false
---

# 瓦瑟施泰因生成對抗網路（Wasserstein GAN）

使用瓦瑟施泰因距離作為損失函數的 GAN 變體，提供更穩定的梯度信號，減輕訓練不穩定性和模式崩潰問題。

## 完整說明

瓦瑟施泰因生成對抗網路（Wasserstein GAN, WGAN）是對原始 GAN 框架的重要改進。傳統 GAN 使用 Jensen-Shannon 散度衡量生成分佈與真實分佈的距離，導致訓練不穩定。WGAN 採用瓦瑟施泰因距離（Wasserstein Distance），這是一種衡量兩個概率分佈之間差異的度量方式。WGAN 的損失函數提供了更平滑的梯度信號，使得訓練過程更加穩定，同時在減輕模式崩潰方面取得了顯著成效。WGAN 的提出標誌著對 GAN 訓練理論的深刻理解。

## 常見問題

### 為什麼瓦瑟施泰因距離比 KL 散度和 JS 散度更適合 GAN？

這涉及梯度信息的質量。當兩個分佈沒有重疊時，KL 散度和 JS 散度分別變為無窮和常數 log2，無法提供梯度信息。這導致訓練早期，當生成分佈與真實分佈完全不重疊時，生成器無法從損失函數獲得有用的梯度，梯度為零。而瓦瑟施泰因距離即使在分佈不重疊的情況下，仍然提供非零的梯度，這對訓練非常有幫助。此外，瓦瑟施泰因距離通常提供更平滑的梯度信息，使得優化過程更加穩定。這就是為什麼 WGAN 的訓練比傳統 GAN 穩定得多。

### WGAN-GP 中的梯度懲罰是什麼，為什麼需要它？

梯度懲罰是 WGAN 原始權重裁剪方法的改進。權重裁剪強制判別器的梯度有界，但這種方法粗糙且效率低。梯度懲罰在損失函數中添加一項，直接懲罰判別器梯度過大的情況。具體來說，它在真實和生成數據之間的插值點上計算判別器梯度的範數，並要求其等於 1。這確保了判別器是 1-Lipschitz 的，但方式更加靈活。梯度懲罰的優勢是：更高效（無需裁剪權重的迭代成本），效果更好（允許權重有更大的動態範圍），並且在理論上更加合理。大多數現代 WGAN 實現都使用梯度懲罰而不是權重裁剪。

### WGAN 真的完全解決了模式崩潰問題嗎？

WGAN 大幅減輕了模式崩潰，但並未完全消除它。WGAN 改進的是訓練的穩定性和梯度信號的質量，這有助於生成器更好地探索數據分佈。但在極其複雜或高維的數據分佈上，模式崩潰仍然可能發生，儘管頻率和嚴重程度要低得多。為了進一步減輕模式崩潰，通常結合其他技術，如 Minibatch Discrimination、Spectral Normalization 或使用更複雜的網路架構。此外，後續的改進方法（如 Progressive GAN 和 StyleGAN）在 WGAN 的基礎上添加了額外的技巧，實現了更好的多樣性。

---

來源：https://aiterms.tw/terms/wasserstein-gan
快查頁：https://aiterms.tw/terms/wasserstein-gan
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-wasserstein-gan