---
title: "標準差（Standard Deviation）"
slug: standard-deviation
language: zh-TW
source: https://aiterms.tw/terms/standard-deviation
updated_at: 2026-07-29
tags: [統計基礎, 資料處理, 特徵工程, 機器學習基礎]
ipas_term: false
---

# 標準差（Standard Deviation）

衡量資料集各數值與平均值之間平均離散程度的統計指標，反映資料的變異性。

## 完整說明

標準差（SD/σ）是統計學中衡量資料分散程度的核心指標，計算為各數值與均值差的平方平均後取根號，單位與原始資料相同，越大代表資料越分散，是機器學習特徵標準化與異常偵測的基礎。

## 常見問題

### 樣本標準差為何除以 n-1 而不是 n？這個差別在實務上重要嗎？

這是 Bessel's correction（貝塞爾修正），理由如下：從樣本估計母體標準差時，樣本均值 x̄ 本身也是估計量，它天然地「靠近」樣本內的資料點（因為 x̄ 是使所有點到均值距離平方和最小的值），導致以 n 為分母計算的標準差系統性地低估母體標準差。除以 n-1 可修正這個偏差，讓樣本標準差成為母體標準差的無偏估計量（無偏意味著若重複多次取樣，期望值等於真實母體標準差）。在實務重要性上：當 n ≥ 50 時，n 和 n-1 的差異通常在 1-2% 以內，影響可忽略；但在 n=5 的小樣本中，分母差異是 16.7%，對估計結果有顯著影響，此時 Bessel's correction 至關重要。

### 標準差和標準誤差（Standard Error）的用途有何不同？什麼時候用哪個？

兩者描述的是截然不同的不確定性。標準差（SD）描述資料集中個別觀測值的分散程度，是資料本身的屬性，與樣本量 n 無關（增加樣本量不會讓資料本身變得更集中）。標準誤差（SE = SD / √n）描述的是樣本均值的精度，是估計量的屬性，樣本量越大 SE 越小（均值越可靠）。使用原則：要描述研究對象（如某群人的身高有多分散）→ 用 SD；要描述研究結論的精度（如這批人的平均身高估計有多準）→ 用 SE。報告信賴區間（CI）時用 SE（CI ≈ 均值 ± 1.96×SE）；報告資料的變異性時用 SD。

### 在特徵工程時，什麼情況下不應該用 StandardScaler（基於標準差的標準化）？

有四種主要情況應考慮替代方案：1）特徵有大量離群值時，StandardScaler 的均值和標準差都會受到拉偏，正常資料的標準化結果也因此失真，改用 RobustScaler（基於中位數和 IQR，對離群值不敏感）；2）特徵分布高度偏態（非正態）時，先做 Log 轉換或 Box-Cox 轉換使分布更對稱，再做標準化效果更好；3）特徵有明確物理邊界（如圖像像素 0-255，用 MinMaxScaler 歸一到 0-1 更合理）；4）樹狀模型（決策樹、隨機森林、XGBoost、LightGBM）完全不受特徵尺度影響，因為它們的分裂是基於閾值比較而非距離，標準化對這類模型沒有幫助，反而增加不必要的前處理步驟。

---

來源：https://aiterms.tw/terms/standard-deviation
快查頁：https://aiterms.tw/terms/standard-deviation
最後更新：2026/07/29
深度解說：https://aiterms.tw/learning/what-is-standard-deviation