---
title: "詞嵌入（Word Embeddings）"
slug: word-embeddings
language: zh-TW
source: https://aiterms.tw/terms/word-embeddings
updated_at: 2026-06-22
tags: [自然語言處理, NLP, 表示學習, Word2Vec, GloVe, 語義向量, iPAS中級, 向量資料庫]
ipas_term: false
---

# 詞嵌入（Word Embeddings）

將詞彙映射到連續向量空間的技術，使語義相似的詞在向量空間中距離相近，是自然語言處理的基礎表示學習方法。

## 完整說明

詞嵌入（Word Embeddings）是自然語言處理（NLP）中將離散詞彙表示為連續稠密向量的技術。透過在大量文本語料上訓練，詞嵌入捕捉詞彙的語義與句法關係，使「語義相似的詞」在向量空間中距離相近，並能進行向量運算（如 king - man + woman ≈ queen）。代表性模型包括 Word2Vec、GloVe 與 FastText，是現代大型語言模型的前身基礎技術。

## 常見問題

### 詞嵌入（Word Embeddings）和 BERT 的嵌入有什麼不同？

傳統詞嵌入（如 Word2Vec、GloVe）為每個詞賦予一個固定的靜態向量，無論這個詞出現在什麼上下文中，其向量表示都相同。這導致無法處理一詞多義問題：「蘋果」在「蘋果手機」和「蘋果汁」的語境中會有完全相同的向量。BERT 等現代語言模型產生的是語境化嵌入（Contextualized Embeddings）：相同的詞在不同句子中會根據周圍上下文產生不同的動態向量表示，能有效區分不同語義。BERT 使用多層 Transformer Encoder，每個詞的輸出向量融合了整個句子的語境資訊。在大多數 NLP 下游任務上，語境化嵌入的表現顯著優於靜態詞嵌入，但計算成本也更高。

### 為什麼詞嵌入可以做向量加減法並產生有意義的語義結果？

詞嵌入的向量加減法之所以有意義，是因為訓練過程中，語義相關的詞往往出現在相似的上下文中，模型學到的向量在方向上隱含地編碼了詞之間的關係（如性別、國家與首都、時態等）。以最著名的例子 vector(king) - vector(man) + vector(woman) ≈ vector(queen) 為例：king 和 queen 的向量差異類似 man 和 woman 的向量差異（代表某種「性別軸」），因此這個加減法可以找到最接近的詞。這個性質被稱為詞向量的線性結構（Linear Structure），但需要注意它並非完美：類比的精度因詞對而異，且不是所有語義關係都能被線性捕捉。這個現象反映了分散式表示在向量空間中對語義結構的隱含組織。

### 在實務專案中，應該自己訓練詞嵌入還是使用預訓練的詞嵌入？

大多數情況下，直接使用預訓練詞嵌入（如 Word2Vec on Google News、GloVe on Common Crawl）作為起點是更實際的選擇，原因是：自行從頭訓練詞嵌入需要大量文本語料（通常數十億詞以上），對一般專案而言成本高昂且容易訓練不充分。若下游任務的領域語言與通用預訓練語料差異不大，直接凍結使用或微調預訓練詞嵌入效果通常已很好。若有大量特定領域語料（如醫療、法律、金融），可以選擇在通用預訓練詞嵌入的基礎上繼續在領域語料上訓練（Domain-Specific Fine-tuning），以捕捉領域專有詞彙。若使用的是 BERT 等現代語言模型，則通常直接微調整個模型而非單獨關注詞嵌入層。

---

來源：https://aiterms.tw/terms/word-embeddings
快查頁：https://aiterms.tw/terms/word-embeddings
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-word-embeddings