---
title: "擴散語言模型（Diffusion Language Models）"
slug: diffusion-language-models
language: zh-TW
source: https://aiterms.tw/terms/diffusion-language-models
updated_at: 2026-07-30
tags: [生成式AI, 擴散模型, 語言模型, 自回歸, 文字生成, 自然語言處理]
ipas_term: false
---

# 擴散語言模型（Diffusion Language Models）

將擴散模型的去雜訊生成機制應用於文字序列生成的語言模型，透過迭代精化而非自回歸逐步生成文字。

## 完整說明

擴散語言模型（Diffusion Language Models）是將圖像生成領域的擴散模型（Diffusion Models）原理移植到自然語言生成任務的一類模型架構。不同於傳統自回歸語言模型（如 GPT 系列）從左至右逐字生成文字，擴散語言模型在訓練時學習對文字序列進行噪聲加入（Forward Process）與去除（Reverse Process），在生成時從雜訊狀態開始，透過多步去雜訊迭代精化出連貫的文字序列，天生支援全局一致性生成與無限制編輯。

## 常見問題

### 擴散語言模型和 GPT 這類自回歸語言模型，生成文字的方式有哪些根本差異？

自回歸語言模型（如 GPT 系列）是從左到右逐一生成每個 Token，每次生成下一個 Token 時只能看到前面已生成的序列，無法預先規劃後面的內容。擴散語言模型則完全不同：它從一個「雜訊狀態」的序列開始（所有位置同時存在，但充滿不確定性），透過多輪迭代去雜訊，逐步把整個序列精化成連貫文字。兩種方式的核心差異是：自回歸是線性的單向過程，一旦生成的字確定就無法改變；擴散是全局的迭代精化過程，模型可以在迭代中調整整個序列的各個部分，理論上更容易維持長距離的語意一致性。

### 擴散語言模型真的比 GPT 類模型更快嗎？

這個問題沒有簡單的是否答案。理論上，擴散模型的去雜訊過程可以在一次推論中同時更新所有 Token 的估計值，而自回歸模型每次只能生成一個 Token，所以擴散模型有並行生成的潛力。但實際上，擴散模型需要執行幾十步甚至上百步的去雜訊迭代，如果每步都需要一次完整的 Transformer 前向傳播，總計算量可能反而更大。2025 年出現了使用「少步蒸餾」技術訓練的商業擴散語言模型（如 Mercury），只需幾步迭代就能生成高質量文字，在特定任務（如程式碼生成）上展現出比自回歸模型更高的 Token 生成速度。目前這仍是活躍的研究領域，速度優勢是否能普遍化尚無定論。

### 擴散語言模型在實際應用中已經可以用了嗎，還是只停留在研究階段？

截至 2025 年中，擴散語言模型已從純學術研究走向初步商業化，但整體成熟度仍遠低於自回歸模型。學術層面，Diffusion-LM、MDLM、D3PM 等一系列研究工作已奠定理論基礎；商業化方面，Inception Labs 在 2025 年發布了 Mercury 系列擴散語言模型，並提供 API，在程式碼補全任務上達到 GPT-4 級別的效果。Gemini 團隊也發表了擴散語言模型的研究。但在通用問答、複雜推理、長文生成等自回歸模型的強項上，擴散語言模型目前仍有差距。對於 AI 應用規劃師來說，現階段更適合將擴散語言模型視為值得關注的新興技術趨勢，而非即時可廣泛採用的生產技術。

---

來源：https://aiterms.tw/terms/diffusion-language-models
快查頁：https://aiterms.tw/terms/diffusion-language-models
最後更新：2026/07/30
深度解說：https://aiterms.tw/learning/what-is-diffusion-language-models