---
title: "安全護欄（Guardrails）"
slug: guardrails
language: zh-TW
source: https://aiterms.tw/terms/guardrails
updated_at: 2026-07-29
tags: [AI倫理與治理, 大型語言模型, Prompt工程, AI應用, 自然語言處理]
ipas_term: false
---

# 安全護欄（Guardrails）

> **你有沒有怕過 AI 一不小心就講出不該講的話？**
>
> 你可以把 guardrails 想成替 AI 設的安全邊界。
> 它的目的是讓模型在可用的範圍內自由發揮，但不要越線、亂答或做出危險建議。
>
> 你可以把它想成一個把抽象概念拉回日常判斷的提示，先知道它解決什麼問題，再看技術細節。

### 容易混淆

> **guardrails vs 人工審核**
> guardrails 是系統自動設的限制
> 人工審核是人最後把關
> 最關鍵的區別是機器先攔，還是人後看
>
> **guardrails vs 提示工程**
> 提示工程是把指令寫得更好
> guardrails 是在輸入輸出層加保護
> 最關鍵的區別是誘導行為，還是限制行為
>
### 記住這句就好

> 先設欄，再讓模型自由跑。

### 實際案例

> **客服機器人**
> 客服系統可以先用 guardrails 擋掉醫療、法律或暴力相關的危險內容，再把安全問題交給模型回答。
>
> **金融建議**
> 當 AI 要回應投資建議時，guardrails 可以先限制它不要冒充專家或亂給保證。
>
### 深入了解

> guardrails 常結合關鍵字規則、分類器、政策檢查和輸出過濾。
> 好的護欄不是把模型關死，而是讓它在可接受的空間裡工作。

### 中英對照與三層護欄

| 中文 | 英文 | 說明 |
| --- | --- | --- |
| 護欄 / 安全護欄 | guardrails | 限制 AI 系統行為邊界的機制總稱 |
| 輸入過濾 | input filtering | 在請求進模型前先擋 |
| 輸出過濾 | output filtering | 在回應給使用者前先檢查 |
| 對齊 | alignment | 訓練階段讓模型行為符合期望，不是護欄 |

> 要分清楚護欄與對齊：對齊是在訓練時做的，改變模型本身；護欄是在執行時做的，包在模型外面。對齊會失效（越獄提示就是在攻擊對齊），所以正式系統一定要有護欄當第二道防線。

### 護欄實際要擋什麼

> **輸入端。** 提示注入（prompt injection）、越獄提示、個資與機密外洩、超出服務範圍的請求。這一層最重要的是提示注入防護：使用者輸入或檢索回來的文件裡可能藏著「忽略以上指令」這類內容，必須把使用者資料與系統指令明確隔離。
>
> **輸出端。** 幻覺內容、不當言論、洩漏系統提示、給出超出授權的建議（醫療、法律、投資）。輸出護欄常見的做法包括關鍵字比對、分類模型、以及用另一個模型當評審。
>
> **工具與行動端。** 這一層在 AI agent 上最關鍵。模型可以呼叫工具時，護欄要規定哪些工具能用、參數範圍、需不需要人工確認。刪除資料、寄信、付款這類不可逆的動作，預設就該要求確認。

### 設計護欄的四個原則

> **預設拒絕。** 白名單優於黑名單。列舉「允許做什麼」比列舉「禁止做什麼」可靠，因為攻擊者只需要找到一個你沒想到的說法。
>
> **不可逆的動作要人工確認。** 判斷標準是「做錯了能不能撤銷」，不是「風險高不高」。
>
> **護欄本身要能被稽核。** 擋下了什麼、為什麼擋，要留紀錄。沒有紀錄就無法知道護欄是太鬆還是太緊。
>
> **假陽性也是成本。** 護欄擋掉正常請求會讓使用者放棄使用。上線後要同時追兩個數字：漏放率與誤擋率，只看其中一個一定會把系統調到另一個極端。

### 情境判斷

> **Q1：** 模型開始回答自殺方法，最需要什麼？
> → 先加安全護欄，攔下高風險輸出。
>
> **Q2：** 你只是想讓回覆語氣更有禮貌，這也算 guardrails 嗎？
> → 看情況，若只是語氣調整，可能更像提示工程；若是限制危險內容，才更像 guardrails。
>
### 常見問題

> **Q：guardrails 會不會讓模型變笨？**
> 會限制一部分自由度，但換來的是可控性和安全性。
>
> **Q：只靠規則夠嗎？**
> 通常不夠，最好搭配模型判斷和人工流程。
>
> **Q：它只管文字嗎？**
> 不只，圖像、語音和工作流都可以加護欄。
>
### 相關術語

> - **人工智慧安全**：guardrails 是安全策略的一部分
> - **AI治理**：落地時常需要治理規則和責任分工
> - **人工智慧倫理**：知道什麼該擋，背後常有倫理判斷
> - **資料品質監控**：輸入資料有問題時，護欄也能先攔一層
> - **人機迴路**：危險情境下，常需要人類最後拍板

---

來源：https://aiterms.tw/terms/guardrails
快查頁：https://aiterms.tw/terms/guardrails
最後更新：2026/07/29
深度解說：https://aiterms.tw/learning/what-is-guardrails