---
title: "超級對齊（Superalignment）"
slug: superalignment
language: zh-TW
source: https://aiterms.tw/terms/superalignment
updated_at: 2026-04-29
tags: [AI倫理與治理, 機器學習, 強化學習, AI基礎, 模型訓練]
ipas_term: false
---

# 超級對齊（Superalignment）

> **你有沒有想過，模型越強，越需要先管住方向？**
>
> 你可以把它想成先替超強模型設好目標和邊界。
> 超級對齊 的重點是 超級對齊旨在確保遠超人類智慧的AI系統，其目標與人類價值觀對齊，避免潛在的失控風險。
> 它重要，是因為能力不等於可靠，安全和對齊做不好，部署風險會很高。

### 容易混淆
> **超級對齊 vs 通用人工智慧**
> 超級對齊：偏向 把模型能力拉回可控範圍
> 通用人工智慧：偏向 更大的目標形態
> 最關鍵的區別：超級對齊看的是「把模型能力拉回可控範圍」，通用人工智慧看的是「更大的目標形態」。
>
> **超級對齊 vs 人工智慧安全**
> 超級對齊：偏向 把模型能力拉回可控範圍
> 人工智慧安全：偏向 AI 安全的基礎概念
> 最關鍵的區別：超級對齊看的是「把模型能力拉回可控範圍」，人工智慧安全看的是「AI 安全的基礎概念」。
>

### 記住這句就好
> 不是只看會不會答，還要看會不會跑偏。

### 實際案例
> **案例：前沿模型上線前先做安全評測**
> 先測偏差、風險和失控情況，再談正式部署
>
> **案例：公司想訂出使用邊界**
> 先定規則，比事後補救更有效
>

### 深入了解
> 先看模型會不會偏離人類意圖
> 治理、評測和紅隊測試要一起做
> 不是把模型變弱，而是把模型變可控

### 情境判斷
> **Q1（直覺題）：** 模型只要答對問題，就代表安全嗎？
> → 不代表，還要看它會不會越界、幻覺或被誘導做錯事。
>
> **Q2（判斷題）：** 如果產品只是內部測試，就可以先不做對齊嗎？
> → 看情況，但只要會接觸敏感資料或真實使用者，基本安全檢查就不能省。
>

### 常見問題
> **Q：這個概念最先要看哪裡？**
> 先看模型會不會做出偏離目標、違反規範或造成風險的行為。
>
> **Q：能力更強一定代表更安全嗎？**
> 不一定，能力提升有時也會放大風險，所以要同步做治理與對齊。
>
> **Q：為什麼不能等出事再修？**
> 因為前沿模型一旦上線，修正成本和風險都會遠高於事前設計。
>

### 相關術語
> - **通用人工智慧**：先看它，能補基礎
> - **人工智慧安全**：對照它，能分清邊界
> - **對齊校準**：它常一起出現
> - **人工智慧倫理**：它能補常見使用情境

---

來源：https://aiterms.tw/terms/superalignment
快查頁：https://aiterms.tw/terms/superalignment
最後更新：2026/04/29
深度解說：https://aiterms.tw/learning/what-is-superalignment