---
title: "連續詞袋模型（Continuous Bag of Words）"
slug: continuous-bag-of-words
language: zh-TW
source: https://aiterms.tw/terms/continuous-bag-of-words
updated_at: 2026-07-30
tags: [自然語言處理, 詞向量, Word2Vec, 神經網路, 語言模型]
ipas_term: false
---

# 連續詞袋模型（Continuous Bag of Words）

Word2Vec 中根據上下文詞預測目標詞的神經網路架構，是 CBOW 的完整名稱。

## 完整說明

連續詞袋模型（CBOW, Continuous Bag of Words）是 Word2Vec 框架中的一種方法，它使用目標詞周圍的上下文詞（如前後各 5 個詞）預測目標詞本身。相比 Skip-gram（根據目標詞預測上下文），CBOW 的訓練速度更快，在高頻詞上性能通常更好，適合語料較大、計算資源有限的場景。

## 常見問題

### CBOW 為什麼對上下文詞取平均而不是連接？

如果連接所有上下文詞向量（如左 5 個 + 右 5 個 = 10 個詞向量連接），隱層寬度會擴展到 10 × d，其中 d 是每個詞向量的維度。若 d=300，隱層就變成 3000 維，參數量爆炸。取平均（只有 d 維）的設計保持隱層寬度恆定，大幅減少參數量和計算成本，是 CBOW 高效的關鍵。這個設計也有語義上的合理性：上下文中各詞對目標詞的貢獻可視為「民主化」的平等投票，平均聚合這個想法。

### 負採樣是什麼？為什麼要用它而不是完整的 Softmax？

完整的 Softmax 要求計算目標詞相對於詞表中所有詞的機率，複雜度是 O(|V|)（詞表大小）。若詞表有 100 萬個詞，每次梯度更新都要計算 100 萬個輸出，極為昂貴。負採樣巧妙地把問題轉化為二元分類：模型學會區分真實的 (上下文, 目標詞) 對與隨機組合的假對。每次訓練只涉及 1 個正樣本 + k 個負樣本（k 通常 5–20），複雜度降至 O(k)，訓練速度快數十倍。這是一個優雅的近似：理論上負採樣略低於精確 Softmax，但實務性能幾乎相同，是值得的 trade-off。

### CBOW 的詞向量和 Skip-gram 的詞向量有區別嗎？

有小幅區別，但足以在應用中觀察到。CBOW 訓練的詞向量對高頻詞優化更充分，對低頻詞的表示相對較弱。Skip-gram 因為每個詞都被多次用作預測目標，反覆接收梯度，所以對各頻率詞都有較均勻的優化。在詞類比任務（如「Paris - France」類比）上，Skip-gram 通常準確度 1–3% 更高。然而在文本分類等下游應用中，兩者的實際性能差異往往不超過 1%。選擇上更多考慮計算預算而非精度差異。

---

來源：https://aiterms.tw/terms/continuous-bag-of-words
快查頁：https://aiterms.tw/terms/continuous-bag-of-words
最後更新：2026/07/30
深度解說：https://aiterms.tw/learning/what-is-continuous-bag-of-words