---
title: "分層抽樣（Stratified Sampling）"
slug: stratified-sampling
language: zh-TW
source: https://aiterms.tw/terms/stratified-sampling
updated_at: 2026-06-22
tags: [機器學習, 資料處理, 統計方法, 模型評估]
ipas_term: false
---

# 分層抽樣（Stratified Sampling）

分層抽樣是一種統計抽樣方法，將母體依據特定特徵劃分為互斥的子群體（層），再從各層中獨立抽樣。這確保了各層在樣本中的代表性，能有效降低抽樣誤差，特別適用於處理不平衡資料集。

## 完整說明

分層抽樣是一種統計抽樣技術，將異質性母體依據特定特徵劃分為若干個互斥且內部同質的子群體（層）。隨後，從每個層中獨立抽取樣本，最終合併成整體樣本。此法確保各層特徵在樣本中得到適當反映，能有效降低抽樣誤差，提高估計精確度。尤其適用於處理類別不平衡資料或需精確估計各子群體參數的場景，常見於民意調查及機器學習。

## 常見問題

### 分層抽樣與簡單隨機抽樣相比，主要優勢是什麼？

分層抽樣的主要優勢在於它能顯著提高樣本的代表性和統計估計的精確度，特別是當母體內部存在顯著異質性或包含重要的稀有子群體時。簡單隨機抽樣雖然操作簡便，但在異質母體中，可能因隨機性而導致某些重要子群體在樣本中比例過低或完全缺失，進而產生較大的抽樣誤差。分層抽樣透過將母體劃分為同質的「層」，並從每層獨立抽樣，確保了各層的特徵在最終樣本中得到適當反映，從而降低了估計的變異數，使得基於樣本的推斷更為可靠和精準。這對於需要精確分析各子群體特徵的研究尤為關鍵，例如在機器學習中確保不平衡類別的代表性。

### 在機器學習中，分層抽樣有哪些具體應用場景？

在機器學習中，分層抽樣主要應用於資料集準備和模型評估階段，特別是處理分類問題中的類別不平衡情況。例如，在建立訓練集、驗證集和測試集時，若不平衡資料集直接進行隨機抽樣，可能導致測試集中少數類別的樣本過少，無法有效評估模型對該類別的性能。分層抽樣能確保這些子集中各類別的比例與原始資料集保持一致，從而使模型訓練更穩定，評估結果更具代表性。此外，在交叉驗證（如K折交叉驗證）中，分層抽樣也確保了每個折疊（fold）中的類別分佈與整體資料集相似，避免了因隨機劃分導致的評估偏差，提高了模型性能估計的可靠性，這對於建立穩健的AI模型至關重要。

### 選擇分層變數時應考慮哪些因素？

選擇分層變數是分層抽樣成功的關鍵。首先，應選擇那些與研究目標或因變數高度相關的變數。如果分層變數與研究結果無關，則分層抽樣的效率提升將有限。其次，分層變數應該能夠將母體劃分為內部相對同質、但層間差異顯著的子群體。這種「層內同質，層間異質」的特性是分層抽樣減少變異數的基礎。再者，分層變數的資料必須是可獲取且易於識別的，以便於實際操作中對母體進行劃分。最後，應避免選擇過多或過細的分層變數，以免導致層數過多，使得某些層的樣本量過小，增加抽樣難度和成本，甚至影響統計推斷的穩定性，應在效率與精確度之間取得平衡。

---

來源：https://aiterms.tw/terms/stratified-sampling
快查頁：https://aiterms.tw/terms/stratified-sampling
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-stratified-sampling