---
title: "位元微調（BitFit）"
slug: bitfit
language: zh-TW
source: https://aiterms.tw/terms/bitfit
updated_at: 2026-06-23
tags: [參數高效, 微調, 模型壓縮, 深度學習]
ipas_term: false
---

# 位元微調（BitFit）

一種極致的參數高效微調方法，只訓練模型中偏置項（Bias）的某些位，相比全模型微調減少99.9%的訓練參數，成本極低但性能接近全參數微調。

## 完整說明

位元微調（BitFit）是一種超輕量級的微調技術，它凍結所有權重矩陣，只訓練模型各層的偏置項（Bias）向量。進一步地，BitFit 可以只訓練偏置向量中的某些位（比特），或只訓練特定層的偏置。这樣做的結果是只有 0.1% 甚至更少的模型參數需要訓練，同時在許多任務上達到接近全參數微調的性能。BitFit 特別適合超大規模模型的快速適配和多任務學習，是參數高效微調中最輕量的方案。

## 常見問題

### 偏置項為什麼能在模型中起如此關鍵作用？

偏置項的作用來自其在神經網絡中的位置和功能。每層的輸出是 y = W*x + b，偏置 b 直接調整整個激活向量，不受輸入 x 影響。這使偏置成為「全局校準」機制：可以整體上調或下調激活值範圍。在 Transformer 中，偏置項調整多頭注意力、前饋層等的輸出，影響特徵表示的分佈。預訓練模型的特徵表示是為通用任務優化的，微調時主要需要調整這些特徵的「零點」和「縮放」，而偏置項恰好控制著這些參數。此外，偏置項參與各層的特徵流動，即使參數少也能傳遞任務信息。實驗驗證：在 BERT 上凍結所有層直接訓練偏置，精度損失僅 2-5%；相比之下，隨機選擇 0.1% 的權重訓練，損失 20-30%。

### BitFit 的性能何時會顯著劣於全參數微調？

BitFit 的主要局限在於表達能力。當任務需要進行複雜的特徵轉換時，只修改偏置項可能不足。具體表現為：（1）任務類型差異大，如從文本分類轉向圖像描述，需要跨模態特徵轉換，BitFit 難以適配；（2）領域轉移距離遠，如從新聞文本轉向醫療文本且詞彙大幅不同，簡單的偏置調整無法捕捉詞彙語義的差異；（3）模型規模小，小模型的偏置參數數量同樣小，調整空間有限。實驗數據：在 GLUE 多個任務上，BitFit 平均達到全參數微調的 91%；在 RTE、CoLA 等小數據集任務上甚至達到 99%+；在 MNLI 這類大規模複雜分類上，性能損失 3-5%。解決方法是必要時升級到 LoRA（增加 100 倍參數但保持輕量）或適配器。

### BitFit 能否與其他微調方法組合使用？

可以。BitFit 經常用於分階段微調的初始階段。策略包括：（1）先用 BitFit 做快速初步適配（1-2 個 epoch），觀察性能是否滿足；如果滿足直接結束，省去大量訓練；如果不滿足，升級到 LoRA 或適配器再訓練；（2）BitFit + LoRA 混合，凍結權重但同時訓練偏置和 LoRA 矩陣，取得兩者優勢；（3）BitFit + 量化，一邊訓練偏置一邊進行模型量化，最小化最終模型；（4）BitFit + 知識蒸餾，用 BitFit 快速微調學生模型，再通過蒸餾進一步改進。實踐中，BitFit+LoRA 的混合方案在參數數與性能的平衡上效果最好，相比純 LoRA 參數少 30%，相比純 BitFit 性能好 2-3%，成為許多系統的標準配置。

---

來源：https://aiterms.tw/terms/bitfit
快查頁：https://aiterms.tw/terms/bitfit
最後更新：2026/06/23
深度解說：https://aiterms.tw/learning/what-is-bitfit