---
title: "擷取、轉換、載入（ETL）"
slug: etl
language: zh-TW
source: https://aiterms.tw/terms/etl
updated_at: 2026-06-22
tags: [資料工程, MLOps, 資料管線, AI訓練, iPAS考試, RAG]
ipas_term: false
---

# 擷取、轉換、載入（ETL）

資料工程核心流程，將原始資料從來源系統擷取（Extract）、清洗轉換（Transform）後，載入（Load）至目標資料倉儲或 AI 訓練管線的三段式架構。

## 完整說明

ETL（Extract, Transform, Load，擷取、轉換、載入）是資料工程與 AI 管線建設的基礎架構模式。Extract 階段從資料庫、API、日誌或感測器等異質來源收集原始資料；Transform 階段進行資料清洗、格式標準化、特徵工程與品質驗證；Load 階段將處理後的資料寫入資料倉儲、資料湖或向量資料庫，供下游分析與 AI 模型訓練使用。ETL 管線的品質直接決定 AI 模型訓練資料的完整性與準確性，是「Garbage in, Garbage out」原則的關鍵防線。

## 常見問題

### ETL 和 ELT 有什麼差異，現代 AI 專案更常用哪一個？

ETL 是「先轉換再載入」，轉換在中介層完成後才寫入目標倉儲，適合轉換邏輯複雜且原始資料不宜保留的場景。ELT 是「先載入再轉換」，將原始資料直接寫入資料倉儲，再利用倉儲的計算能力做 SQL 或 dbt 轉換。現代 AI 專案更傾向 ELT，因為雲端資料倉儲儲存便宜、可以保留原始資料以供未來回溯分析，且轉換邏輯用 dbt 版本控制更易於維護。但對於需要即時轉換的串流資料管線（如即時詐騙偵測），仍會採用 ETL 架構。

### RAG 架構中的 ETL 管線需要做哪些特殊的轉換步驟？

RAG（Retrieval-Augmented Generation）的 ETL 管線相比傳統結構化資料 ETL 有幾個特殊步驟。在 Extract 階段，需要處理 PDF、Word、HTML 等非結構化格式的文件解析。在 Transform 階段，需要將長文件切分為語意完整的段落（Chunking），常見策略有固定大小切分（如 512 tokens）、遞迴切分（依段落、句子層級）及語意切分；接著對每個段落用 Embedding 模型（如 text-embedding-3-large）轉換為向量。在 Load 階段，將（段落文字、向量、來源 metadata）組合寫入向量資料庫（如 Pinecone、Weaviate）。Chunk 大小與 Embedding 模型的選擇直接影響 RAG 的檢索精度。

### ETL 管線出錯時對 AI 模型有什麼影響，如何監控？

ETL 管線出錯對 AI 模型的影響深遠，常見表現有：資料遺漏導致訓練樣本不足、資料格式錯誤導致模型解析失敗、類別標籤污染導致模型學到錯誤的對應關係，以及資料飄移（Data Drift）未被偵測導致模型使用過期的分佈假設。監控 ETL 管線需要建立資料品質指標追蹤：記錄每次執行的資料量、缺失率、異常值比例與執行時長，設定閾值並在超過時觸發警報。工具上可使用 Great Expectations 或 dbt Tests 在管線中插入資料品質斷言（Assertion），確保資料在進入模型訓練前通過品質門檻。

---

來源：https://aiterms.tw/terms/etl
快查頁：https://aiterms.tw/terms/etl
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-etl