---
title: "分詞器（Tokenizer）"
slug: tokenizer
language: zh-TW
source: https://aiterms.tw/terms/tokenizer
updated_at: 2026-06-22
tags: [自然語言處理, 預處理, 中文分詞, 子詞, 詞表]
ipas_term: false
---

# 分詞器（Tokenizer）

將文本分割成詞元（tokens）的工具，詞元可以是詞、子詞或字符，是 NLP 模型的輸入預處理步驟。

## 完整說明

分詞器（Tokenizer）是自然語言處理流水線中的基礎工具，將連續文本分割成離散的詞元（tokens）。根據粒度不同，詞元可以是完整的詞（Word Tokenization）、詞根/詞幹（Stemming）、或子詞單元（Subword Tokenization，如 BPE、WordPiece）。分詞看似簡單卻涉及複雜的語言學與工程問題，選擇不當會影響下游模型性能。

## 常見問題

### 中文分詞為什麼比英文難？

英文單詞之間有空格邊界，分詞只需識別標點與特殊符號（如 "don't"）；中文沒有空格，分詞需依賴詞典或統計模型推斷詞邊界。另外，中文存在嚴重的詞邊界歧義："銀行的行長"中"行"可屬於"銀行"也可屬於"行長"，需上下文判斷。英文中這樣的歧義相對少見。此外，新詞創造速度快（互聯網時代），中文詞典難以跟上，導致 OOV（詞表外詞）率高。對比英文，多數新詞可歸納為已知詞根的組合（如"smartphone" = "smart" + "phone"），分詞相對容易。

### BPE 分詞如何選擇詞表大小？

詞表大小的權衡：詞表大（如 64k）→ OOV 率低，詞語義邊界清晰，但模型參數多、訓練慢。詞表小（如 8k）→ 模型輕量，訓練快，但子詞細碎、模型需學習更多組合。實務規律：英文通常 32k–50k，多語言 16k–32k，資源受限環境 8k–16k。選擇時可對開發集做實驗，測試 8k、16k、32k、64k 在下游任務上的性能，選擇性能與效率最優的。現代 Transformer 模型（BERT、GPT）多採 32k–50k，是業界較成熟的選擇。

### 分詞錯誤會如何影響模型性能？

分詞錯誤會級聯影響整個 NLP 流水線。例如在命名實體識別任務中，若分詞器誤將"紐約大學"分為"紐|約|大|學"（逐字）而非"紐約|大學"，模型會將"紐約"作為獨立實體，而"大學"作為另一實體，完全錯誤。實驗表明，分詞準確度從 99% 降至 95% 時，下游任務（NER、分類）性能通常下降 2–5%。解決方案：第一，使用高質量分詞器（如 jieba、pkuseg）。第二，在神經模型中使用子詞（BPE）代替詞級，避免詞級 OOV。第三，對預期誤分詞的詞彙（如新詞、複合詞）添加後處理規則或詞典約束。

---

來源：https://aiterms.tw/terms/tokenizer
快查頁：https://aiterms.tw/terms/tokenizer
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-tokenizer