---
title: "文字生成音訊（Text-to-Audio）"
slug: text-to-audio
language: zh-TW
source: https://aiterms.tw/terms/text-to-audio
updated_at: 2026-07-29
tags: [生成式AI, 深度學習, AI應用, 神經網路, 自然語言處理]
ipas_term: false
---

# 文字生成音訊（Text-to-Audio）

> **你有沒有想過，一段文字描述能不能直接變成一整段聲音，而不只是把它唸出來？**
>
> 你可以把它想成請一位配樂師讀你的腳本，然後直接交出成品。
> 文字生成音訊的重點是：你寫「雨中的城市街道，遠處有車聲」，模型就合成出那個聲音場景。
> 它重要，是因為影音內容的聲音部分過去只能靠素材庫或錄音，現在多了一條用文字下指令的路。

### 容易混淆
> **文字生成音訊 vs 文字轉語音**
> 文字生成音訊：生成音樂、音效以及環境音
> 文字轉語音：生成人在說話的聲音
> 最關鍵的區別：文字轉語音的輸出一定是「有人在唸字」，文字生成音訊的輸出通常沒有人聲。這兩個英文名字只差一個字，中文卻是兩件事，查資料時最容易在這裡搞混。
>
> **文字生成音訊 vs 音樂生成**
> 文字生成音訊：輸入一定是文字，輸出可以是音樂以外的任何聲音
> 音樂生成：專指產出音樂，輸入不一定是文字，也可能是旋律片段或和弦
> 最關鍵的區別：音樂生成是「輸出限定音樂」，文字生成音訊是「輸入限定文字」，兩者重疊但不等於。
>
> **文字生成音訊 vs 語音合成技術**
> 文字生成音訊：屬於生成式 AI 的音訊分支
> 語音合成技術：專門處理把文字變成語音的整套技術
> 最關鍵的區別：語音合成技術是文字轉語音的底層，跟文字生成音訊是兩條並行的線，不是上下游。

### 記住這句就好
> 輸出裡有沒有人在說話，就能分辨你看到的是文字生成音訊還是文字轉語音。

### 實際案例
> **案例：短影音要配一段 15 秒的背景音樂**
> 用文字描述情緒與樂器，直接生成一段可用的配樂，不用翻素材庫比對授權
>
> **案例：遊戲需要「木門在石造地窖裡緩慢推開」的音效**
> 這種指定得很細的音效在素材庫不一定找得到，用文字描述生成比錄製快
>
> **案例：Podcast 想要一段雨聲當轉場**
> 環境音用生成的就夠，不必外出實地錄音

### 算法與應用
> 主流做法是先把聲音壓成一種比較好處理的表示，再讓模型依照文字條件一步步生成，最後還原成波形
> 常見的代表性系統：Meta 的 [AudioCraft](https://audiocraft.metademolab.com/)，底下 MusicGen 負責文字生成音樂、AudioGen 負責文字生成音效；Stability AI 的 [Stable Audio](https://stability.ai/stable-audio)，依官方頁面目前標示為 Stable Audio 3.0；學術端常被引用的 [AudioLDM](https://audioldm.github.io/) 走的是 latent diffusion（潛在擴散）路線
> 實務上影響成品的通常是三件事：描述寫得夠不夠具體、要生成的長度，以及模型本身擅長音樂還是音效
> 商用之前要看清楚該模型的授權條款，不同系統對輸出內容的商用權利規定並不一致

### 情境判斷
> **Q1（直覺題）：** 你要讓網站的無障礙功能把文章唸給視障使用者聽，該用文字生成音訊嗎？
> → 不是，那是文字轉語音的工作。文字生成音訊產出的通常沒有人聲。
>
> **Q2（判斷題）：** 你要幫一支產品影片配背景音樂，一定要用文字生成音訊嗎？
> → 看情況。如果只要一段情緒對的通用配樂，授權音樂庫可能更快也更安全；如果需要的氛圍很特定、素材庫翻不到，用生成的才划算。

### 常見問題
> **Q：文字生成音訊跟文字轉語音是同一件事嗎？**
> 不是。文字轉語音（Text-to-Speech）生成的是人在說話的聲音，文字生成音訊（Text-to-Audio）生成的是音樂、音效或環境音。兩者英文只差一個字，是最常見的混淆點。
>
> **Q：生成出來的音樂可以商用嗎？**
> 要看你用的是哪一個系統，各家對輸出內容的商用權利規定不一樣，使用前要讀該模型或該服務的官方授權條款，不要憑印象假設可以。
>
> **Q：為什麼同一段描述每次生成的結果都不一樣？**
> 這類模型本身就帶隨機性，加上描述的具體程度、長度設定與模型版本都會影響結果。要穩定就把描述寫得更具體，並且固定其他設定。
>
> **Q：它能生成人聲唱歌嗎？**
> 部分系統做得到，但那通常是獨立的歌聲合成功能，跟一般理解的文字生成音訊不完全是同一條技術線，要看該系統的官方說明。

### 相關術語
> - **音樂生成**：輸出限定音樂的近親概念，先看它能分清邊界
> - **文字轉語音**：最常被搞混的對照組，一起看才不會用錯
> - **擴散模型**：不少音訊生成系統的底層生成框架
> - **音訊特徵提取**：處理聲音資料的基礎，補在前面比較好懂

---

來源：https://aiterms.tw/terms/text-to-audio
快查頁：https://aiterms.tw/terms/text-to-audio
最後更新：2026/07/29
深度解說：https://aiterms.tw/learning/what-is-text-to-audio