---
title: "視覺語言動作模型（VLA (Vision-Language-Action Model)）"
slug: vla-vision-language-action-model
language: zh-TW
source: https://aiterms.tw/terms/vla-vision-language-action-model
updated_at: 2026-06-22
tags: [AI Agent, 具身AI, 多模態, 機器人學習, 視覺語言模型]
ipas_term: false
---

# 視覺語言動作模型（VLA (Vision-Language-Action Model)）

整合視覺感知、語言理解與動作執行的多模態 AI 模型，能依據視覺輸入與語言指令直接輸出機器人控制動作。

## 完整說明

視覺語言動作模型（Vision-Language-Action Model，VLA）是多模態 AI 的前沿架構，在視覺語言模型（VLM）的基礎上新增動作輸出能力，使模型能夠感知視覺場景（如相機畫面）、理解自然語言指令（如「把紅色杯子放到托盤上」），並直接輸出機器人的控制動作（如關節角度、末端執行器位置）。VLA 代表了從純感知推理到具身 AI（Embodied AI）的關鍵跨越，是機器人通用操控能力的核心研究方向。

## 常見問題

### VLA 和一般的視覺語言模型（VLM）有什麼不同？

視覺語言模型（VLM）的輸出通常是文字（如圖像描述、問答、分析）。VLA 在此基礎上新增了動作輸出能力，輸出不再是文字，而是機器人可直接執行的控制指令（如末端執行器位置、關節角速度、夾爪開合程度）。可以理解為：VLM 是「能看、能說」，VLA 是「能看、能說、還能做」。VLA 通常在 VLM 的預訓練基礎上，透過機器人操控示範數據的微調獲得動作能力，因此能借助 VLM 廣泛的語言與視覺知識加速泛化到新任務。

### VLA 能讓機器人理解任何自然語言指令嗎？

目前的 VLA 在訓練數據覆蓋的任務範圍內具備相當的語言指令理解能力，並對新穎表述有一定的泛化能力。然而，VLA 的泛化能力仍有明顯邊界：對於訓練集從未見過的操控技能（如特定工具的使用方法）、需要長時程規劃的複雜多步驟任務、以及在高度不同的環境中（燈光、物件形狀、場景佈局差異很大），模型的成功率會顯著下降。現實中的部署通常需要在目標場景中收集少量示範數據進行微調，或搭配任務規劃模組分解複雜指令。通用化的 VLA 仍是長期研究目標，而非當前完整實現的能力。

### 訓練 VLA 需要什麼類型的數據？

VLA 通常需要兩類數據：首先是視覺語言預訓練數據（大規模圖文對、影片字幕等），為模型提供視覺語義理解基礎；其次是機器人操控示範數據（Teleoperation Demonstrations），記錄人類操控機器人完成各種任務時的「視覺觀測 + 語言指令 + 動作序列」三元組。後者的採集非常耗時且成本高，通常透過遙操作（Teleoperation）設備（如 VR 手套、主從機械臂）由人類操作者示範完成。Open X-Embodiment（Google + 多家大學合作的開放數據集）整合了多個機器人平台的操控數據，顯著降低了訓練數據的採集門檻。此外，機器人模擬器（Simulation）中的數據也被廣泛用於預訓練，再透過 Sim-to-Real 遷移到真實機器人。

---

來源：https://aiterms.tw/terms/vla-vision-language-action-model
快查頁：https://aiterms.tw/terms/vla-vision-language-action-model
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-vla-vision-language-action-model