---
title: "自動語音辨識（ASR (Automatic Speech Recognition)）"
slug: asr-automatic-speech-recognition
language: zh-TW
source: https://aiterms.tw/terms/asr-automatic-speech-recognition
updated_at: 2026-06-22
tags: [語音AI, 深度學習, NLP, 語音轉文字, Transformer]
ipas_term: false
---

# 自動語音辨識（ASR (Automatic Speech Recognition)）

將人類口語音頻訊號自動轉換為文字的技術，是語音 AI 的基礎元件，廣泛應用於語音助理、會議記錄、字幕生成等場景。

## 完整說明

自動語音辨識（Automatic Speech Recognition，ASR），又稱語音轉文字（Speech-to-Text，STT），是一種將連續音頻訊號中的語音內容自動辨識並轉換為對應文字的技術。現代 ASR 系統通常基於深度學習架構，結合聲學模型、語言模型和解碼器三個核心元件，能夠處理多語言、多口音、背景噪音等複雜真實環境中的語音輸入。

## 常見問題

### ASR 和 TTS 有什麼關係？它們可以組合使用嗎？

ASR（Automatic Speech Recognition，自動語音辨識）和 TTS（Text-to-Speech，文字轉語音）是互補的語音 AI 技術，方向相反：ASR 將語音轉換為文字，TTS 將文字轉換為語音。兩者組合是語音對話系統的核心架構：使用者說話 → ASR 辨識成文字 → NLU 理解意圖 → 系統生成回應文字 → TTS 合成語音播放。現代語音助理（如 Siri、Alexa）都採用這樣的管線架構。近期也出現了端對端的語音對話模型（如 GPT-4o 語音模式），試圖直接建模語音到語音的轉換，以降低延遲並保留說話人的情感韻律資訊，但 ASR+TTS 管線仍是大多數商業系統的主流選擇。

### Whisper 模型和傳統 ASR 相比有什麼優勢？

Whisper 是 OpenAI 於 2022 年發布的開源 ASR 模型，其主要優勢在於幾個方面。第一，多語言支援：一個模型同時支援 99 種語言，無需為每種語言訓練獨立模型。第二，零樣本泛化能力強：在 68 萬小時多樣化語音資料（包含多種口音、背景噪音、說話風格）上訓練，對未見過的說話人和場景有較強的泛化能力。第三，同時支援語音翻譯：可以直接從非英語語音翻譯到英語文字，無需 ASR + 機器翻譯兩步驟。第四，完全開源：社群基於 Whisper 開發了許多優化版本（如 faster-whisper、WhisperX），支援更低延遲的應用場景。局限性在於推理速度相對較慢（大模型），在嚴格即時辨識場景下需要量化或其他優化。

### 字錯率（WER）低就代表 ASR 夠好用了嗎？

WER 是重要的評估指標，但不是衡量 ASR 是否「夠好用」的唯一標準。在實際應用中，還需要考慮以下面向：首先，不同詞的錯誤代價不同，辨識錯「的」「了」等虛詞和辨識錯專有名詞（如品牌名稱、人名、術語）的影響截然不同，而 WER 等同對待所有詞的錯誤。其次，延遲（Latency）對即時應用至關重要，WER 很低但延遲高的模型可能不適合實時對話。第三，特定領域（如醫療、法律）的術語辨識率需要額外評估，通用 WER 不能反映這些場景的實際效果。第四，說話者適應性（Speaker Adaptation）也很重要，對非標準口音或語速的適應能力需要在目標用戶群上單獨測試。因此，評估 ASR 是否適合特定應用，應在目標場景的代表性測試集上進行完整的用戶驗收測試，而不只看整體 WER 數字。

---

來源：https://aiterms.tw/terms/asr-automatic-speech-recognition
快查頁：https://aiterms.tw/terms/asr-automatic-speech-recognition
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-asr-automatic-speech-recognition