---
title: "監督式微調（SFT (Supervised Fine-Tuning)）"
slug: sft-supervised-fine-tuning
language: zh-TW
source: https://aiterms.tw/terms/sft-supervised-fine-tuning
updated_at: 2026-06-22
tags: [後訓練, 指令遵循, LoRA, 對齊, 大型語言模型]
ipas_term: false
---

# 監督式微調（SFT (Supervised Fine-Tuning)）

使用人工標注的高品質示範資料，對預訓練語言模型進行有監督訓練以使其遵循指令的技術。

## 完整說明

監督式微調（Supervised Fine-Tuning，SFT）是大型語言模型後訓練（post-training）的第一個關鍵步驟，透過在高品質的人工標注示範資料（instruction-response pairs）上進行有監督學習，使預訓練模型從「文字補全」模式轉變為能夠理解並遵循使用者指令的對話助理。SFT 是 RLHF 和 RLVR 等進一步對齊技術的重要前置步驟。

## 常見問題

### SFT 和一般的機器學習微調（fine-tuning）有什麼不同？

廣義上兩者都是「在預訓練模型基礎上用特定資料繼續訓練」，但在 LLM 語境中，SFT 特指使用指令-回應對格式的有監督訓練，目的是讓模型學會指令遵循。一般的微調（如 BERT 用於分類任務）通常是在預訓練 encoder 後面加分類頭，針對特定任務進行有監督學習。SFT 在 LLM 後訓練中的特殊之處在於：訓練資料格式、損失遮罩策略（只對回應計算損失）、以及與 RLHF/RLVR 的搭配關係，使其成為一個相對專門的概念。

### SFT 資料需要多少才夠？

沒有絕對的數量門檻，品質遠比數量重要。LIMA 論文（2023）的研究結論是「1000 條精心策劃的高品質示範就能顯著提升對話能力」，挑戰了「SFT 需要海量資料」的直覺。實務上，數千到數萬條高品質示範通常足以建立基本的指令遵循能力；若要涵蓋特定領域知識或複雜推理任務，需要更多針對性資料。過多低品質資料（如批次生成但未經過濾的合成資料）反而可能引入錯誤格式或知識，降低模型品質。

### 在沒有大量 GPU 的情況下，個人或小團隊能做 SFT 嗎？

可以，LoRA 和 QLoRA 大幅降低了 SFT 的算力門檻。以 7B 參數的模型為例，使用 QLoRA（4-bit 量化 + LoRA）在單張消費級 GPU（如 RTX 3090/4090）上即可完成 SFT。工具鏈方面，Axolotl、LLaMA-Factory、Unsloth 等開源框架提供了友善的 SFT 訓練介面，降低了工程門檻。主要限制是訓練速度（資料量大時需要較長時間）和模型規模（70B 以上的全量微調仍需多卡環境）。Hugging Face 的 TRL 函式庫也提供了完整的 SFT 訓練器（SFTTrainer）。

---

來源：https://aiterms.tw/terms/sft-supervised-fine-tuning
快查頁：https://aiterms.tw/terms/sft-supervised-fine-tuning
最後更新：2026/06/22
深度解說：https://aiterms.tw/learning/what-is-sft-supervised-fine-tuning