---
title: "行動識別（Action Recognition）"
slug: action-recognition
language: zh-TW
source: https://aiterms.tw/terms/action-recognition
updated_at: 2026-06-23
tags: [電腦視覺, 深度學習, AI應用]
ipas_term: false
---

# 行動識別（Action Recognition）

從視頻中識別和分類人體或物體執行的動作，將視頻片段分配給預定義的動作類別。

## 完整說明

行動識別（也稱動作識別或活動識別）是視頻理解的核心任務，目標是將視頻片段分類為特定的動作類別。系統分析視頻中人物或物體的運動模式，判斷正在執行什麼動作（如「跑步」「跳躍」「揮手」）。行動識別應用於體育分析、視頻搜索、監控系統和人機互動等領域。

## 常見問題

### 雙流網絡中為什麼要分離空間流和時間流？為什麼不直接用 3D CNN？

分離有幾個優點：（1）效率：分別優化空間和時間特徵提取，計算複雜度低於全 3D CNN；（2）靈活性：可以使用不同的預訓練權重（空間流可用 ImageNet 預訓練，時間流用光流數據預訓練）；（3）通用性：光流作為中間表示，可以處理各種類型的動作，不受視覺外觀限制。例如，同一動作在不同光線或背景下外觀不同，但光流相似。當然，3D CNN 是更新且更簡潔的方法，也有很多成功應用，特別是在計算資源充足時。

### 光流特徵為什麼比幀差更好地表示運動？

幀差是相鄰幀的像素值差異，直接反映像素變化但很粗糙。光流是經過處理的運動向量，表示每個像素的運動方向和速度。光流有幾個優點：（1）平滑：光流算法（如 Lucas-Kanade）基於光流方程，輸出平滑的運動場；（2）不變性：光流對亮度變化相對不敏感（只要物體形狀不變，光流相同）；（3）信息豐富：光流直接編碼運動方向和速度，易於理解；（4）可視化：光流易於可視化為箭頭或色彩圖。缺點是光流計算需要額外開銷，且在快速運動或邊界處容易出錯。

### 如何處理視頻長度變化的問題？只採樣固定幀數會丟失信息嗎？

這確實是個挑戰。方法包括：（1）固定採樣：選擇均勻分佈的幀（如 8 幀、16 幀）。缺點是長視頻的中間內容被跳過，可能丟失動作峰值。優點是簡單、計算固定；（2）自適應採樣：根據視頻長度調整採樣密度或幀數。但這增加複雜度；（3）分片處理：將長視頻分成多個短片段，分別識別，最後聚合。這保留更多信息，但增加計算；（4）循環網絡：逐幀處理視頻，維持動態狀態。這最靈活，可處理變長序列。在實踐中，多數應用假設輸入視頻長度有界，採用固定採樣。

---

來源：https://aiterms.tw/terms/action-recognition
快查頁：https://aiterms.tw/terms/action-recognition
最後更新：2026/06/23
深度解說：https://aiterms.tw/learning/what-is-action-recognition