---
title: "頻譜圖（Spectrogram）"
slug: spectrogram
language: zh-TW
source: https://aiterms.tw/terms/spectrogram
updated_at: 2026-06-23
tags: [時頻分析, 訊號處理, 音訊特徵, 傅立葉變換, 視覺化]
ipas_term: false
---

# 頻譜圖（Spectrogram）

時頻表示，將音訊訊號分解為時間與頻率的二維矩陣，視覺化與分析訊號特徵的基本工具。

## 完整說明

頻譜圖（Spectrogram）是將音訊訊號分幀進行短時傅立葉變換（STFT），得到時-頻-能量的三維關係，通常以二維圖像表示（橫軸時間、縱軸頻率、色深或灰度表示能量）。頻譜圖既是音訊分析的基本視覺工具，也直接作為機器學習模型的輸入特徵（特別是梅爾頻譜）。頻譜圖使人類與機器都能直觀識別音訊中的聲學事件、音樂特徵、聲音異常等。

## 常見問題

### 頻譜圖上的時間-頻率解析度取捨是什麼？

這源於 Heisenberg 時間-頻率不確定性原則：無法同時達到任意好的時間解析度與頻率解析度。幀長越長（如 2048 點），FFT 輸出的頻率 bin 越多，頻率解析度越高，但每幀代表的時間較長，時間解析度差（無法精確定位快速變化事件，如爆破音）。幀長越短，時間解析度好但頻率解析度差（低頻的相鄰頻率分不開）。實踐中：語音用 20-25 ms 幀長達到良好平衡；音樂用 46+ ms 以捕捉和弦與低頻結構。

### 梅爾頻譜圖相比線性頻譜圖有什麼好處？

梅爾刻度將頻率軸轉換為符合人耳感知的非線性尺度，低頻區間密集、高頻稀疏。對於機器學習模型，梅爾頻譜圖有幾個優勢：一、信息密度均勻（低頻的小變化與高頻的大變化都被等權對待），神經網路更易學習；二、減少高頻噪聲的影響，特別是在有背景雜訊的環境；三、梅爾頻譜常用於音樂與語音處理，已有大量預訓練模型基於它。缺點是喪失了原始頻率信息，若需要精細頻率分析（如樂器識別中的諧波檢測），線性頻譜更合適。

### 為什麼神經網路需要 SpecAugment，而傳統方法不用？

深度神經網路有強大的擬合能力，容易過擬合特定訓練集的視覺模式。SpecAugment 是一種正則化技巧，透過隨機遮罩時間和頻率區間，強迫模型學習更魯健、不依賴特定時頻位置的特徵。這相當於告訴模型：「聲音內容可能偏移時間、被雜訊遮蓋」，因此必須學習對這些變化不敏感的表示。傳統方法（如 GMM-SVM）的模型容量有限，不容易過擬合，因此不需要額外的資料增強。但現代深度模型（CNN、Transformer）若不用 SpecAugment，訓練集上表現好但測試集表現大幅下滑。

---

來源：https://aiterms.tw/terms/spectrogram
快查頁：https://aiterms.tw/terms/spectrogram
最後更新：2026/06/23
深度解說：https://aiterms.tw/learning/what-is-spectrogram