---
title: "音訊特徵提取（Audio Feature Extraction）"
slug: audio-feature-extraction
language: zh-TW
source: https://aiterms.tw/terms/audio-feature-extraction
updated_at: 2026-06-23
tags: [訊號處理, 音訊分析, 深度學習, 特徵工程, 自監督學習]
ipas_term: false
---

# 音訊特徵提取（Audio Feature Extraction）

從原始音訊訊號中自動計算或學習具有代表性的低維特徵向量，用於後續機器學習任務。

## 完整說明

音訊特徵提取（Audio Feature Extraction）是音訊訊號處理的基礎步驟，將高維的原始波形轉換為更低維、更有訊息量的特徵表示。傳統方法包括梅爾倒譜係數（MFCC）、梅爾頻譜（Mel-Spectrogram）等手工設計特徵；現代方法透過深度神經網路在無標注音訊上進行自監督學習（如 Wav2Vec2、HuBERT），自動習得更通用的特徵表示。特徵提取直接影響下游任務（語音辨識、音樂信息檢索、聲音分類）的效能。

## 常見問題

### 為什麼要對聲學特徵取對數（log）？

對數變換有幾個好處：一、人耳對聲強的感知呈對數關係（分貝刻度），對數特徵更符合人類感知；二、音訊信號的動態範圍很大（0 到 1 以上），對數可以壓縮範圍，使神經網路更好地學習；三、對數變換會減輕極端值的影響，讓特徵分布更正常。缺點是對數無法處理零值（需要加一個小常數避免 log(0))。

### Mel-Spectrogram 和線性頻譜有什麼區別？

線性頻譜是原始 FFT 的輸出，頻率軸線性均勻分布。Mel-Spectrogram 將頻率軸轉換為梅爾刻度，低頻區間更密集，高頻區間更稀疏，模擬人耳的非線性頻率感知。對神經網路來說，Mel-Spectrogram 更「友善」，因為它強調了人類敏感的低頻區域，減弱了高頻雜訊的影響。但若任務需要精細的高頻信息（如樂器識別中的諧波分析），線性頻譜可能更好。

### 自監督預訓練表示（如 Wav2Vec）相比傳統特徵有什麼優勢？

傳統特徵（MFCC、Mel-Spectrogram）是人工設計，包含了對「聲學什麼重要」的先驗假設，但這些假設可能不適用於所有任務。Wav2Vec2.0 這類預訓練表示是在大規模未標注語音上自動學習的，無需人工設計，自動發現任務相關的表示。此外，預訓練表示可直接遷移到多種下游任務（ASR、聲者識別、語言識別），避免了為每個任務單獨調整特徵。缺點是預訓練計算成本高，且預訓練與微調任務相差太大時可能效果下降。

---

來源：https://aiterms.tw/terms/audio-feature-extraction
快查頁：https://aiterms.tw/terms/audio-feature-extraction
最後更新：2026/06/23
深度解說：https://aiterms.tw/learning/what-is-audio-feature-extraction