---
title: "容錯性（Fault Tolerance）"
slug: fault-tolerance
language: zh-TW
source: https://aiterms.tw/terms/fault-tolerance
updated_at: 2026-06-22
tags: [分散式系統, AI 部署, 系統可靠性, 高可用性, 模型訓練]
ipas_term: false
---

# 容錯性（Fault Tolerance）

系統在部分元件發生故障時仍能持續正常運作的能力。

## 完整說明

容錯性（Fault Tolerance）是指系統在發生硬體故障、軟體錯誤或網路中斷等異常狀況時，依然能夠繼續提供服務或將損害降至最低的設計特性。在 AI 系統與分散式運算環境中，容錯設計是保障可靠性的基本要求。

## 常見問題

### 容錯性與容災（Disaster Recovery）有什麼差別？

容錯性（Fault Tolerance）著重於在故障發生的當下，系統透過備援機制自動維持服務，通常目標是達到零停機或極短暫的服務中斷。容災（Disaster Recovery, DR）則是更宏觀的概念，聚焦於當系統遭遇重大災難性事件（如資料中心火災、大規模自然災害）後，如何在一段時間內恢復整體業務運作。容災計畫通常涵蓋備份站點的切換流程、資料恢復步驟與業務持續計畫（BCP），是比容錯性範圍更廣的工程與管理議題。

### AI 模型訓練中的容錯機制是如何運作的？

在大規模 AI 模型訓練中，容錯機制主要透過兩種方式實現。第一是定期儲存模型檢查點（Checkpoint），訓練框架會在固定訓練步數或時間間隔後，將當前的模型權重、優化器狀態與訓練進度儲存到分散式檔案系統（如 HDFS 或雲端物件儲存）。一旦訓練節點發生故障，系統可以從最新的檢查點重新啟動，而非從頭開始。第二是工作重新調度，訓練框架的協調器（Coordinator）會持續監控各工作節點的健康狀態，偵測到節點失效後，自動將該節點的任務重新分配給其他可用節點，讓訓練流程得以繼續推進。

### 在設計 AI 推論服務時，如何評估所需的容錯等級？

評估 AI 推論服務的容錯需求時，主要參考兩個業務指標：RTO（Recovery Time Objective，復原時間目標）與 RPO（Recovery Point Objective，復原點目標）。RTO 定義了服務中斷後可接受的最長恢復時間，例如金融交易 AI 系統可能要求 RTO 小於 30 秒，而內部分析系統可以接受數小時。RPO 則定義了可以容忍的最大資料損失量。根據這兩個指標，工程師可以決定是否需要多區域備援、同步或非同步資料複製、以及檢查點的儲存頻率，並在成本與可靠性之間做出合理的取捨決策。

---

來源：https://aiterms.tw/terms/fault-tolerance
快查頁：https://aiterms.tw/terms/fault-tolerance
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-fault-tolerance