---
title: "隨機欠採樣（Random Undersampling）"
slug: random-undersampling
language: zh-TW
source: https://aiterms.tw/terms/random-undersampling
updated_at: 2026-06-22
tags: [類別不平衡, 資料前處理, 採樣技術, 不平衡學習, iPAS]
ipas_term: false
---

# 隨機欠採樣（Random Undersampling）

處理類別不平衡資料的技術，從多數類別中隨機移除樣本，使各類別數量趨於平衡。

## 完整說明

隨機欠採樣（Random Undersampling）是一種資料層面的類別不平衡處理方法，透過從多數類別（Majority Class）中隨機刪除部分樣本，縮小多數類別與少數類別之間的樣本數差距，讓模型訓練時不會過度偏向多數類別。

## 常見問題

### 隨機欠採樣和 SMOTE 過採樣哪個更好？

兩者各有適用場景，沒有絕對優劣。隨機欠採樣的優點是速度快、簡單，適合多數類別樣本數量極大（百萬級別以上）的場景，可以顯著加速訓練。缺點是會丟失多數類別的資訊。SMOTE 過採樣則透過對少數類別進行插值合成新樣本，不刪除任何原始資料，保留了所有資訊，但會增加訓練集大小，計算成本更高，且合成樣本可能在高維空間中引入雜訊。實務上，結合兩者的效果通常優於單獨使用，例如先用 SMOTE 增加少數類別樣本，再用隨機欠採樣減少多數類別，達到雙向平衡。

### 欠採樣後，資料集應該達到什麼樣的比例才算合理？

常見目標是讓正負例比例達到 1:1 或 1:2，但「最佳比例」並非固定值，需要透過交叉驗證實驗確定。完全平衡（1:1）不一定是最優選擇，因為真實世界中的測試資料通常仍保持原始的不平衡比例。有研究指出，輕度欠採樣（如從原始的 1:100 調整到 1:10 或 1:20）有時比完全平衡更有效，因為保留了部分多數類別的代表性。建議在不同採樣比例下訓練模型，以 F1 分數或 AUC-PR 等指標評估，找出最適合當前業務場景的比例。

### 欠採樣後評估模型時應該注意什麼？

欠採樣後的評估有幾個重要注意事項。第一，驗證集與測試集不應進行欠採樣，只有訓練集才需要調整，確保評估時反映真實資料分佈。第二，不要用準確率（Accuracy）作為主要指標，因為在類別不平衡的測試集上，準確率會被多數類別主導。應改用 F1 分數、召回率（針對少數類別）、Precision-Recall AUC 或 ROC AUC。第三，建議多次隨機欠採樣並取平均結果，因為每次隨機刪除的樣本不同，可能導致結果波動。使用整合欠採樣（Ensemble Undersampling）讓多個欠採樣子集各自訓練模型再集成，能更穩定地利用所有多數類別資料。

---

來源：https://aiterms.tw/terms/random-undersampling
快查頁：https://aiterms.tw/terms/random-undersampling
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-random-undersampling