成分句法分析(Constituency Parsing)是什麼?

將句子分解為層級詞組結構,建構樹形解析樹以顯示詞語與詞組的組成與支配關係。|本頁含完整原理、應用場景、iPAS 考試重點與 3 個常見問答。

英文
Constituency Parsing
主題標籤
自然語言處理、句法分析、語法結構
考點定位
非 iPAS 核心術語
最後更新
2026/06/23
成分句法分析(Constituency Parsing)是什麼? 自然語言處理句法分析
術語快查

搜尋意圖: 如果你在找「成分句法分析 是什麼」或「成分句法分析 和相近概念差在哪」,先看這頁的短定義、完整說明與延伸比較。

TL;DR: 將句子分解為層級詞組結構,建構樹形解析樹以顯示詞語與詞組的組成與支配關係。

實用情境: 適合用在閱讀 AI 文章、產品文件或和同事討論時,先用一頁快速對齊概念。

下一步: 先讀完定義,再往下看延伸比較與對應工具,把概念轉成實際應用。

將句子分解為層級詞組結構,建構樹形解析樹以顯示詞語與詞組的組成與支配關係。

成分句法分析(Constituency Parsing)是將自然語言句子分解為層級成分的過程,是理解句子語法結構的經典方法。

基本概念

成分與詞組(Constituents & Phrases)

成分指能作為一個單位被移動、替代或刪除的詞語或詞組。例如「那個在山頂上的紅房子」可作為單個成分被替代為「它」,顯示這整個短語是一個成分。

常見詞組類型(按詞性表示):

  • NP(名詞短語):"the quick brown fox"
  • VP(動詞短語):"saw the cat"
  • AP(形容詞短語):"very happy"
  • PP(介詞短語):"in the house"
  • S(句子):完整的主謂結構

解析樹(Parse Tree)

S(句子)為根,逐層分解:

         S
       / | \
      NP VP NP
     /|   \  |
    Det N  V Det N
    |  |  |  |  |
   The cat saw a mouse

詞性標註(Part-of-Speech Tagging)與基礎成分

成分分析依賴準確的詞性標籤(名詞、動詞、形容詞等),現代系統多併行進行。

分析方法的演進

  1. 文法規則導向(1960-1990) 手工撰寫上下文無關文法(CFG)規則,精度高但規則爆炸、維護困難。

  2. 概率上下文無關文法(PCFG, 1990-2010) 為每條文法規則賦予機率,使用 CKY(Cocke-Kasami-Younger)演算法進行最大機率分析。

  • 優點:訓練簡單,計算高效
  • 缺點:無法精確捕捉長距離依賴、詞彙選擇的條件機率
  1. 詞典化 PCFG(Lexicalized PCFG, 2000-2010) Klein & Manning 等引入詞彙條件,改進機率估計,但計算複雜度上升。

  2. 神經網路分析器(2015 年後)

  • 轉移系統分析器(Transition-Based):貪心地進行 shift、left-arc、right-arc 操作逐步構造解析樹。特點是高效但可能錯過全局最優。
  • 圖分析器(Graph-Based):計算所有可能樹的分數,選擇最高分者,保證全局最優但計算耗時。
  • 基於 Span 的分析器:直接預測每個跨度(span)是否為成分及其標籤,無需約束樹結構,計算簡便。
  1. Transformer 時代(2019 至今) BERT、GPT 等預訓練模型提供強大的上下文表徵,結合簡單解碼層(如雙仿射分類器預測跨度成分性)。

重要特性

覆蓋性與分析歧義

多數句子在不同分析方法下有多個合法解析樹。例如「I saw the man with the telescope":

  • 讀法 1:(我用望遠鏡看那個人)
  • 讀法 2:(我看那個拿著望遠鏡的人)

處理方法:(1)返回概率最高的單一分析;(2)返回 k-best 解析;(3)建造分析森林(packed forest)隱式表示所有解析。

評估指標

  • Unlabeled Recall / Precision:忽略詞組標籤,只判斷邊界正確性
  • Labeled Recall / Precision:同時考慮標籤
  • 括號交叉率(Crossing Brackets):預測樹與黃金樹的結構衝突數
  • 現代最佳模型在 PTB(Penn Treebank)標準測試集上達 96%+ F1

應用場景

  1. 語法檢查與語言教育 識別句子的語法結構,檢測違反文法規則的成分組合。

  2. 文本簡化與改寫 分析複雜句結構,識別可簡化或重組的成分(如從句)。

  3. 機器翻譯 源語言的成分結構可指導譯文的詞序與成分組合。

  4. 語義角色標注(SRL) 成分結構幫助定位論元邊界與層級關係。

  5. 信息擷取與文件理解 識別主句與從句,提取關鍵成分。

  6. 風格與可讀性分析 較複雜的成分結構(深樹、長成分)通常對應更複雜的句式。

成分分析 vs. 依存分析

特性 成分分析 依存分析
節點 詞組與詞語 詞語
邊 成分支配 修飾與依存
層級 多層(詞→小短語→大短語→句) 扁平(單層詞語依存)
直觀性 符合文法教學,易於人工檢驗 對語義應用更直觀
計算複雜度 通常較高(指數級) 通常較低(多項式級)

當代挑戰

  1. 長句與複雜結構 Tree 深度增加導致分析難度指數上升;深層變壓器模型的長序列注意力也面臨性能下降。

  2. 跨語言標準不一 不同語言的成分結構習慣差異大,難以建立通用標準。中文的分析標準與英文差異顯著。

  3. 領域與風格適應 新聞語料與社群媒體文本的成分分析模型準度差異大,領域遷移需額外微調。

  4. 稀有現象處理 協調結構(coordination)、省略、非標準文法等邊界案例仍是難題。

實踐建議

  1. 對於應用,評估是否需要完整成分樹(資訊擷取、風格分析)還是依存結構(SRL、翻譯)足夠。
  2. 使用預訓練模型的成分分析往往足夠(spaCy、Stanford CoreNLP、Berkeley Neural Parser),除非領域特性特殊。
  3. 進行人工評審時,重點檢查長成分、協調結構、從句邊界等易錯項。
  4. iPAS 考試中,成分分析通常在理解複雜句式、教育應用等場景出現,掌握基本分析方法有助於解題。

常見問題

什麼時候用成分分析,什麼時候用依存分析?

成分分析適合需要詞組層級理解的任務:語法檢查、教育應用、風格分析。依存分析適合語義應用:資訊擷取、語義角色標注、語義相似度。在實踐中,兩者可互相轉換(自動化程度有限),選擇應基於應用的具體需求與現有工具支援。

為什麼成分分析計算成本比依存分析高?

成分分析的搜索空間是指數級(Catalan 數),一個 n 詞句子有 O(4^n/n^1.5) 種可能樹;依存分析搜索空間是多項式級,只需 O(n²) 邊。現代神經分析器使用動態規劃與束搜索(beam search)降低計算,但理論複雜度仍是基本限制。

新預訓練模型怎樣改善了成分分析?

BERT 等模型提供高質量上下文表徵,減少了對手工特徵工程的依賴;Span-based 分析器利用這些表徵直接預測成分,無需複雜的樹搜索,既提升準度又降低計算成本。此外,多任務預訓練(如同時學習成分與依存分析)進一步提升性能。