---
title: "聲學建模（Acoustic Modeling）"
slug: acoustic-modeling
language: zh-TW
source: https://aiterms.tw/terms/acoustic-modeling
updated_at: 2026-06-23
tags: [聲學建模, 深度學習, 訊號處理, 語音辨識, 神經網路]
ipas_term: false
---

# 聲學建模（Acoustic Modeling）

在語音識別、語音合成等任務中，建立音訊特徵與語言單位（音素、詞彙）對應關係的機器學習模型。

## 完整說明

聲學建模（Acoustic Modeling）是語音相關任務（ASR、TTS）的核心，透過機器學習從訓練資料學習音訊訊號特徵與語言單位（音素、音節、詞彙）的映射。聲學模型通常以梅爾倒譜係數（MFCC）或梅爾頻譜（Mel-Spectrogram）作為輸入特徵，現代系統普遍採用深度神經網路（如 CNN、RNN、Transformer），相比傳統 GMM-HMM 提供了顯著的準確度提升。

## 常見問題

### 為什麼需要將原始波形轉換成梅爾頻譜，而不直接用波形訓練？

原始波形有幾個問題：一、樣本率高（44.1k-48kHz）導致序列極長，計算與記憶體成本高；二、相鄰樣本高度相關，神經網路難以有效學習獨立特徵；三、人耳對音訊的感知是非線性的（梅爾刻度近似人耳頻率感知），直接在頻域處理更符合認知。梅爾頻譜將波形轉換為 64-128 維的時頻表示，維度大幅縮小，時間跨度也加大（通常 10ms 一幀），神經網路訓練效率大幅提升。現代方法也有直接在波形上操作的（原始波形輸入模型），但通常在前幾層加卷積進行局部下採樣。

### 聲學建模中的 HMM 為什麼還有用，既然有深度神經網路？

HMM 在傳統混合 DNN-HMM 系統中仍有價值，因為它顯式建模語言的序列結構（例如音素的強制對齐、跨越多幀的狀態遷移）。純深度神經網路（如端到端的 CTC）可直接預測序列，但訓練資料或對齐標籤充足時，DNN-HMM 混合系統通常更穩健。此外 HMM 的解碼過程（維特比演算法）數學清晰、可解釋性強，對某些應用（如強制對齐、實時漸進輸出）更有利。現在是 DNN-HMM 與端到端模型並存的時代，選擇取決於應用場景與資料條件。

### Conformer 相比 Transformer 為什麼在語音上效果更好？

語音訊號具有強烈的局部結構（相鄰時間幀的聲學特徵高度相關），同時也有全局韻律與語言依賴（遠距離音素的共現關係）。Conformer 的設計正針對此：卷積模塊捕捉局部時頻模式（低計算成本），Transformer 模塊捕捉全局相依性（允許任意時間點對之間的注意力）。這種混合在語音辨識基準上的表現超越純 Transformer 或純卷積模型，同時計算成本更低。簡單說，Transformer 對語音「看得太寬」（全局），Conformer 則「既看局部也看全局」，更符合語音的物理性質。

---

來源：https://aiterms.tw/terms/acoustic-modeling
快查頁：https://aiterms.tw/terms/acoustic-modeling
最後更新：2026/06/23
深度解說：https://aiterms.tw/learning/what-is-acoustic-modeling