---
title: "語音辨識（Speech Recognition）"
slug: speech-recognition
language: zh-TW
source: https://aiterms.tw/terms/speech-recognition
updated_at: 2026-07-29
tags: [語音辨識, Speech Recognition, L11402, 聲學模型, 初級]
ipas_term: true
---

# 語音辨識（Speech Recognition）

> **你有沒有在你對手機說話，想把聲音變成文字或指令，發現只看表面常常不夠？**
>
> 你可以把它想成讓機器先聽懂你說了什麼，再把聲音轉成文字。
>
> 語音助理、字幕、會議轉錄都靠它把口語變成可處理的文字。
>
> 你可以把它想成一個把抽象概念拉回日常判斷的提示，先知道它解決什麼問題，再看技術細節。

### 容易混淆
> **語音合成**
> 語音辨識是「聽」的技術，把聲音變成文字。
> 語音合成是「說」的技術，把文字變成聲音。一個是把人的話讓機器懂，另一個是讓機器能用人的方式說話。
>
> 最關鍵的區別：先看它是在比意思、比結構，還是在做任務輸出。

### 記住這句就好
> 把聲音變文字，就是語音辨識。

### 實際案例
> 手機語音輸入把你的口述轉成訊息內容。
> 會議錄音轉文字，方便後續搜尋和摘要。

### 算法與應用
> 核心元件常包含聲學模型、語言模型和解碼器，現在也常用端到端深度學習架構。
> 評估常看詞錯誤率，因為一個字辨錯就可能影響整句意思。

### 中英對照與常見說法

| 說法 | 出現場合 |
| --- | --- |
| 語音辨識 | 台灣正式用語 |
| 语音识别 | 簡體寫法 |
| Speech Recognition | 英文原名 |
| ASR（Automatic Speech Recognition） | 學術與產品文件裡的標準縮寫 |
| STT（Speech-to-Text，語音轉文字） | 業界常用的說法，指同一件事 |

> 相反方向是 **TTS（Text-to-Speech，文字轉語音）**。兩者常被搞混，判斷方式看輸入：語音辨識輸入聲音、輸出文字。

### 現在的做法跟以前差在哪

| | 傳統流程（2010 年代前） | 端到端（現在） |
| --- | --- | --- |
| 組成 | 聲學模型、發音詞典、語言模型三塊分開訓練 | 一個模型直接從聲音到文字 |
| 需要的資料 | 音素層級的標註，昂貴 | 只需要音檔與逐字稿配對 |
| 新語言與新詞 | 要更新詞典 | 靠資料涵蓋 |
| 代表技術 | HMM 加 GMM、後來的 HMM 加 DNN | CTC、注意力式編碼解碼、Whisper 這類大規模預訓練模型 |

> 端到端讓建置門檻大幅下降，代價是**不好局部修正**。傳統做法要讓模型認得一個新的專有名詞，改詞典就好；端到端模型通常得靠提示、外掛的偏置詞表或重新微調。

### 評估指標與實務難點

> <strong>字錯誤率（WER，Word Error Rate）</strong>是標準指標：把插入、刪除、替換三種錯誤加起來除以參考文字的總詞數。中文一般改用**字元錯誤率（CER）**，因為中文沒有空格分詞。
>
> WER 可能超過 100%，因為插入錯誤沒有上限。看到一個 WER 數字要問清楚三件事：哪個資料集、有沒有做文字正規化（大小寫、標點、數字寫法）、以及是不是乾淨錄音。安靜錄音室與真實會議室的 WER 常常差兩倍以上。
>
> **實務上最難的不是安靜環境的一般對話**，而是：多人重疊說話（需要語者分離與語者辨識）、專業術語與人名、口音與語碼轉換（中英夾雜在台灣特別常見）、以及遠場麥克風的迴音與噪音。
>
> **標點與斷句通常是另一個模型做的**。原始輸出常常是一長串沒有標點的文字，可讀的逐字稿需要額外的標點還原步驟，評估時要分清楚錯的是辨識還是後處理。

### 情境判斷
> **Q1（直覺題）：** 你按住麥克風對手機說話，這就是語音辨識的典型應用嗎？
>
> → 是。把聲音轉成文字或指令，正是它的主場。
>
> **Q2（判斷題）：** 如果環境很吵、講話又重疊，準確率通常會怎樣？
>
> → 會下降。看情況，噪音和重疊語音都會讓辨識變難。

### iPAS 考題
> 出題方向： 常考基本定義、聲學模型與語言模型的分工、以及詞錯誤率這個評估指標。
> 題目： 語音辨識系統的主要目的是什麼？
> 答案： → 把人類語音轉換成機器可處理的文字或指令。

### 常見問題
> **Q：什麼是語音辨識？**
> 語音辨識是一種將人類語音轉換為機器可理解的文字或指令的技術，使電腦能夠聽懂並處理人類語言。它結合了聲學模型和語言模型，在人機交互中扮演重要角色。
>
> **Q：語音辨識在 iPAS 考試中怎麼考？**
> iPAS 初級考試（L11402）中，語音辨識的考點包括基本概念、核心技術（聲學模型、語言模型）、評估指標（詞錯誤率）和實際應用。常見題型有選擇題、簡答題和案例分析。
>
> **Q：語音辨識和哪個術語最常被混淆？**
> 語音辨識最常與語音合成混淆。語音辨識是將語音轉換為文字，而語音合成則是將文字轉換為語音。兩者功能相反，但都是語音處理的重要組成部分，應用於不同場景。

### 相關術語
> - **自然語言處理**：先懂 NLP 的整體範圍，才知道這個概念在文字任務裡扮演哪一段。
> - **機器學習**：很多應用的底層都離不開機器學習。
> - **深度學習**：Sigmoid 和 Softmax 都是深度學習裡最基本的輸出工具。
> - **循環神經網路**：語音和序列任務常先從它開始理解。
> - **長短期記憶網路**：語音辨識的傳統基礎模型之一。

---

來源：https://aiterms.tw/terms/speech-recognition
快查頁：https://aiterms.tw/terms/speech-recognition
外部參考：https://ipd.nat.gov.tw/ipas/certification/AIAP/news/ffdba0fcdbda40baadeef2a1bdc0230e
最後更新：2026/07/29
深度解說：https://aiterms.tw/learning/what-is-speech-recognition