---
title: "SMOTE 過採樣（SMOTE）"
slug: smote
language: zh-TW
source: https://aiterms.tw/terms/smote
updated_at: 2026-06-22
tags: [機器學習, 資料處理, 模型訓練, 統計方法]
ipas_term: false
---

# SMOTE 過採樣（SMOTE）

SMOTE 是一種處理資料不平衡問題的過採樣技術，透過合成少數類別樣本來平衡資料分佈，提升模型學習效果。

## 完整說明

SMOTE 是一種合成少數過採樣技術，旨在解決分類任務中資料集類別不平衡問題。它透過分析少數類別樣本，並在其最近鄰居之間合成新的樣本，以增加少數類別的資料量，從而平衡資料分佈。這能提升模型對少數類別的識別能力，常見應用於金融詐欺偵測、醫療診斷等關鍵少數事件場景。

## 常見問題

### SMOTE 應在什麼情況下使用？

SMOTE 主要應用於分類任務中，當資料集存在嚴重的類別不平衡問題時。例如，一個類別的樣本數量遠少於另一個類別，導致模型在訓練時偏向多數類別，對少數類別的預測性能不佳。常見場景包括金融詐欺偵測、醫療疾病診斷、工業缺陷檢測、網路入侵偵測等，這些領域的關鍵事件往往屬於少數類別。使用 SMOTE 可以透過合成少數類別樣本來平衡資料分佈，提升模型對少數類別的識別能力和預測準確性，尤其是在需要高召回率的應用中，SMOTE 能有效降低少數類別的漏報率。

### 使用 SMOTE 可能會遇到哪些限制或潛在缺點？

SMOTE 雖有效，但也有其局限。首先，它可能在少數類別樣本分佈密集且與多數類別重疊的區域生成噪音樣本，因為合成過程是基於線性插值。其次，對於高維度資料，距離度量可能失去意義，導致合成樣本缺乏代表性。再者，SMOTE 預設特徵為數值型，對類別型特徵直接應用會產生無意義的值，需要專門的變體。此外，過度採樣可能導致模型過度擬合於合成樣本，降低泛化能力。最後，如果少數類別本身包含大量噪音或離群值，SMOTE 可能會放大這些問題。

### SMOTE 與簡單的重複採樣有何不同？為何 SMOTE 更優？

SMOTE 與簡單重複採樣的核心區別在於樣本生成方式。簡單重複採樣是直接複製現有的少數類別樣本，這雖然增加了數量，但沒有為模型提供任何新的資訊。模型會反覆看到完全相同的樣本，容易導致過度擬合，且無法學習到少數類別更廣泛的模式。SMOTE 則透過在少數類別樣本及其最近鄰居之間進行線性插值，生成「合成」的新樣本。這些新樣本雖然基於原始資料，但並非完全相同，它們在特徵空間中略有不同，從而擴展了少數類別的決策邊界，提供了更多樣化的學習資訊，有效降低了過度擬合的風險，並提升了模型的泛化能力。

---

來源：https://aiterms.tw/terms/smote
快查頁：https://aiterms.tw/terms/smote
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-smote