---
title: "實例分割（Instance Segmentation）"
slug: instance-segmentation
language: zh-TW
source: https://aiterms.tw/terms/instance-segmentation
updated_at: 2026-07-30
tags: [電腦視覺, 影像分割, 物件偵測, Mask R-CNN, 深度學習]
ipas_term: false
---

# 實例分割（Instance Segmentation）

在影像中同時偵測物件並為每個獨立個體生成精確像素級遮罩，區分同類中的不同個體。

## 完整說明

實例分割（Instance Segmentation）是電腦視覺中最精細的影像理解任務之一，結合了物件偵測與語意分割的能力。不同於語意分割只標記每個像素屬於哪個類別，實例分割能夠區分同一類別中的不同個體，並為每個獨立物件生成一個精確的像素級遮罩（pixel-wise mask）。代表性模型包括 Mask R-CNN 及後續的 YOLACT、SOLOv2 等。

## 常見問題

### 實例分割和語意分割有什麼核心差異？

語意分割的輸出是一張與輸入影像等大的標籤圖，每個像素被賦予一個類別標籤（如「人」「車」「道路」），但同一類別的不同個體共用同一個標籤，無法被區分開來。實例分割則更進一步，不僅標記像素的類別，還為每個獨立的物件個體生成一個獨立的遮罩 ID，即使兩個人站得很近、像素互相觸碰，系統仍能明確區分「這是第一個人的像素」和「這是第二個人的像素」。從輸出格式來說，語意分割輸出單一的類別圖；實例分割輸出一組（類別標籤、邊界框、二元遮罩）的三元組集合，每個物件個體各有一組。這個差異使得實例分割在需要計數或追蹤個體的場景（如細胞計數、人群分析）中不可或缺。

### Mask R-CNN 是如何實現實例分割的？

Mask R-CNN 在 Faster R-CNN 的兩階段物件偵測架構上增加了第三個並行分支。Faster R-CNN 已經能夠輸出每個物件的類別標籤和邊界框；Mask R-CNN 在此基礎上，對每個 RoI（感興趣區域）額外執行一個全卷積網路（FCN），預測一個 28×28 的二元遮罩，指示哪些像素屬於該物件。為了讓遮罩分支的輸入特徵與空間位置精確對齊，Mask R-CNN 引入了 RoIAlign 操作（取代 Faster R-CNN 的 RoIPool），透過雙線性插值保留精確的空間對應關係，顯著提升了遮罩邊界的精準度。訓練時，遮罩損失、分類損失與邊界框迴歸損失三者同時最佳化，使整個網路能夠端對端地學習。

### 實例分割在 iPAS 考試中的常見考點有哪些？

iPAS AI 應用規劃師中級考試中，實例分割的考題主要圍繞以下幾個面向。第一是概念區辨：能清楚說明物件偵測、語意分割、實例分割、全景分割四種任務的差異與輸出形式，這是最常見的選擇題考點。第二是代表性模型辨識：Mask R-CNN 是必考架構，考生應了解其在 Faster R-CNN 基礎上新增遮罩分支的設計，以及 RoIAlign 的作用。第三是應用場景對應：題目會給出一個具體場景（如自動駕駛中的行人分析、醫療影像中的細胞計數），要求考生選出最適合的視覺任務類型。考生若能同時掌握評估指標（COCO mAP、遮罩 IoU）與主要挑戰（密集物件、即時推論需求），則能應對更進階的分析題型。

---

來源：https://aiterms.tw/terms/instance-segmentation
快查頁：https://aiterms.tw/terms/instance-segmentation
最後更新：2026/07/30
深度解說：https://aiterms.tw/learning/what-is-instance-segmentation