---
title: "文字轉語音（Text-to-Speech）"
slug: text-to-speech
language: zh-TW
source: https://aiterms.tw/terms/text-to-speech
updated_at: 2026-07-29
tags: [機器學習, 深度學習, 自然語言處理, 語音辨識, 模型訓練, AI應用, AI基礎, Python程式, 神經網路]
ipas_term: false
---

# 文字轉語音（Text-to-Speech）

> **你有沒有看文章看到一半，想直接讓手機念給你聽？**
> 你可以把文字轉語音想成「把文字變成可聽見的聲音」
> 模型先讀懂文字，再決定怎麼發音、停頓和語氣
> 它很適合做無障礙閱讀、客服播報和有聲內容，但自然度仍會受模型影響
>
> 你可以把它想成一個把抽象概念拉回日常判斷的提示，先知道它解決什麼問題，再看技術細節。

### 容易混淆
> **文字轉語音 vs 語音辨識**
> 文字轉語音是把字念出來
> 語音辨識是把聲音轉成文字
> 最關鍵的區別：一個是文字到聲音，一個是聲音到文字
>
> **文字轉語音 vs 語音合成技術**
> 文字轉語音是常見任務名稱
> 語音合成技術是更大的技術範圍
> 最關鍵的區別：任務名稱和技術家族不要混在一起
>
> **文字轉語音 vs 錄音**
> 文字轉語音是模型即時產生
> 錄音是人先把聲音錄好
> 最關鍵的區別：一個是生成，一個是預先保存
>

### 記住這句就好
> 先讀懂文字，再把聲音的節奏和情緒補上去。

### 實際案例
> **無障礙閱讀**
> 視障使用者打開網頁後，系統自動把文章念出來，資訊就能直接聽懂，不必依賴螢幕閱讀文字
>
> **客服播報**
> 店家把公告轉成語音播放，能快速產生多語版本，也能讓排班或叫號流程更省人力
>

### 算法與應用
> | 文字分析 | 先看標點、數字、專有名詞 | 這會影響停頓和讀法 |
> | 音素轉換 | 把文字拆成發音單位 | 不同語言規則差很多 |
> | 韻律控制 | 調整重音、速度、語氣 | 自然度常在這裡拉開差距 |
> | 聲碼器 | 把聲學特徵變成實際聲波 | 這一步影響聲音是否像真人 |

### 中英對照與常見說法

| 說法 | 出現場合 |
| --- | --- |
| 文字轉語音 | 台灣正式用語 |
| 文本转语音、语音合成 | 簡體寫法 |
| Text-to-Speech | 英文原名 |
| TTS | 標準縮寫 |
| 語音合成（speech synthesis） | 學術上的正式名稱，涵蓋範圍略廣 |

> 相對的方向是 **STT（Speech-to-Text，語音轉文字）**，也叫自動語音辨識（ASR）。兩者常被搞混，判斷方式是看輸入是什麼：TTS 輸入文字、輸出聲音；STT 輸入聲音、輸出文字。

### 現代 TTS 的兩段式架構

> **第一段，聲學模型（acoustic model）**：把文字轉成中間的聲學表示，通常是梅爾頻譜圖（mel-spectrogram）。這一段決定念什麼、怎麼斷句、語調起伏。代表模型有 Tacotron 系列與 FastSpeech 系列。
>
> **第二段，聲碼器（vocoder）**：把頻譜圖還原成實際的音訊波形。這一段決定音質好不好、有沒有雜音。代表模型有 WaveNet、HiFi-GAN。
>
> 近年也有直接從文字到波形的端到端模型（例如 VITS），以及把語音當成離散 token 用語言模型生成的做法，後者讓 TTS 能力併進大型語言模型，是目前變化最快的方向。

### 評估與實務要點

> **主觀評分 MOS（Mean Opinion Score）** 仍是主要評估方式：請人聽並給 1 到 5 分。客觀指標（例如頻譜距離）跟人耳感受的相關性有限。
>
> **中文 TTS 的特殊難點是多音字與變調。** 「行」要念 xíng 還是 háng、「重」要念 zhòng 還是 chóng，得靠上下文判斷，這一步叫做字音轉換（G2P）。第三聲連續時的變調規則也需要處理，否則聽起來會很生硬。
>
> **數字、單位、縮寫要先正規化。** 「2026/07/29」該念成年月日、「3.5」該念成三點五、「AI」該逐字母念，這些規則在文字前處理階段就要決定，不是模型的問題。
>
> **語音複製（voice cloning）現在只需要幾秒鐘的樣本。** 這帶來明確的濫用風險，使用他人聲音前必須取得授權，多數服務也要求聲明。

### 情境判斷
> **Q1（直覺題）：你要把教學文章做成可聽內容，應該用它嗎？**
> → 可以，這是文字轉語音最典型的用途之一。
>
> **Q2（判斷題）：你要辨識會議錄音裡每個人說了什麼，還適合嗎？**
> → 不適合，那是語音辨識的工作，不是文字轉語音。
>
### 常見問題
> **Q：文字轉語音可以模仿真人聲嗎？**
> 可以到相當接近，但要看資料品質、模型設計和是否有足夠的韻律控制。
>
> **Q：它為什麼有時候念錯專有名詞？**
> 因為模型需要知道詞語切分和讀音規則，遇到新詞時容易判斷錯。
>
> **Q：TTS 和人類朗讀哪個更適合長篇內容？**
> 長篇、重複播報通常是 TTS 更省力，情感表達和臨場感則常是人類朗讀更強。
>

### 相關術語
> - **語音合成技術**：先看整個技術家族，再回頭看 TTS 的位置
> - **語音辨識**：這是最容易和 TTS 混淆的相反任務
> - **梅爾頻譜圖**：很多語音模型會先處理這種聲學表示
> - **自然語言處理**：文字分析這一步通常要靠它

---

來源：https://aiterms.tw/terms/text-to-speech
快查頁：https://aiterms.tw/terms/text-to-speech
最後更新：2026/07/29
深度解說：https://aiterms.tw/learning/what-is-text-to-speech