---
title: "缺失標記（Missing Token）"
slug: missing-token
language: zh-TW
source: https://aiterms.tw/terms/missing-token
updated_at: 2026-06-22
tags: [自然語言處理, 遮罩語言模型, BERT, 預訓練, iPAS中級]
ipas_term: false
---

# 缺失標記（Missing Token）

語言模型處理序列時用於表示遮蔽或缺失位置的特殊符號，常見於遮罩語言模型訓練與填空推論任務。

## 完整說明

Missing Token（缺失標記）指在自然語言處理管線中，用來佔位或標示輸入序列中被遮蔽、損毀或刻意省略之位置的特殊 token。在 BERT 類遮罩語言模型（MLM）的預訓練階段，隨機選取輸入 token 並以 [MASK] 替換，模型需根據上下文預測原始詞彙，藉此學習雙向語境表示。在推論時，Missing Token 技術可用於文本填空、拼寫糾錯及語料增補。

## 常見問題

### Missing Token 和 Padding Token 有什麼差異？

Missing Token（[MASK]）代表「此位置有真實詞彙但被刻意遮蔽或未知」，模型需預測其內容，攜帶語意訊息。Padding Token 則純粹是為了將批次中長度不同的序列補齊至相同長度的佔位符，不攜帶任何語意，模型透過 Attention Mask 矩陣得知哪些位置是填充並予以忽略。在設計 NLP 資料前處理管線時，兩者必須明確分開處理，混用會導致模型訓練時計算錯誤的損失值。

### 為什麼 BERT 的遮罩策略不全部用 [MASK] 替換，而要混入隨機詞和原詞？

若 100% 使用 [MASK] 替換，模型在推論時永遠不會看到 [MASK] 符號（因為推論時輸入是真實文字），造成訓練與推論之間的分佈落差（Pre-train/Fine-tune Discrepancy）。BERT 論文採用三階段混合策略（80% [MASK]、10% 隨機詞、10% 原詞），讓模型在看到任意 token 時都需保持語境推理能力，而非只在看到 [MASK] 時才啟動，從而提升表示學習的穩健性。

### Fill-in-the-Middle（FIM）與傳統 MLM 的 Missing Token 有何不同？

傳統 MLM（如 BERT）的 Missing Token 是在序列內部隨機遮蔽多個離散位置，模型以雙向編碼器一次性預測所有被遮罩的 token，適合理解任務。FIM（填中間）是 GPT 類自回歸模型的訓練策略，將輸入重排為「前綴 + 後綴 → 中間段」的格式，讓單向生成模型同時利用目標位置前後的語境生成完整中間段，特別適合程式碼補全場景，如在函式開頭與結尾已知的情況下自動補全函式主體。

---

來源：https://aiterms.tw/terms/missing-token
快查頁：https://aiterms.tw/terms/missing-token
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-missing-token