---
title: "上下文壓縮（Context Compression）"
slug: context-compression
language: zh-TW
source: https://aiterms.tw/terms/context-compression
updated_at: 2026-06-23
tags: [檢索增強, 自然語言處理, AI應用, 效率優化]
ipas_term: false
---

# 上下文壓縮（Context Compression）

將冗長的上下文內容壓縮為簡潔的摘要或關鍵信息，減少語言模型的輸入長度和計算成本。

## 完整說明

上下文壓縮是在使用大型語言模型時，將大量背景信息、對話歷史或文檔內容壓縮為精簡形式的技術。目的是在保留關鍵信息的前提下，減少輸入的 token 數量，從而降低計算成本、加快推理速度，並避免因過長的上下文導致的模型性能下降。上下文壓縮包括摘要、去重、關鍵詞提取、適應式選擇等多種技術方法。

## 常見問題

### 如何決定應該壓縮多少上下文？

這取決於多個因素：模型的 token 成本（某些模型輸出 token 成本是輸入的倍數，例如 Claude 3 的輸出成本是輸入的 3 倍），應用的延遲要求，以及保留關鍵信息的必要性。一般的策略是設定一個 token 預算（例如 2000 tokens），在此預算內最大化信息保留。通過離線評估（對壓縮後的上下文進行下游任務評測）可以找到最優平衡點。

### 對話歷史中應該保留多少輪對話？

這取決於對話的性質和任務。對於簡單的對話助手，保留最近 5-10 輪（通常 500-2000 tokens）足夠；對於複雜推理任務，可能需要更多背景。實用方法是使用滑動窗口（保留最近 N 輪）或基於重要性的選擇（提取關鍵信息片段）。系統應該對用戶提供控制選項，讓他們能選擇使用多少歷史信息，因為有時候用戶可能希望開始新的對話分支而非繼承完整歷史。

### 壓縮是否會影響模型的性能？

適度壓縮通常不會顯著影響性能，因為模型往往關注最相關的信息。但過度壓縮會導致性能下降，例如遺漏支持證據、破壞邏輯推理鏈等。建議通過 A/B 測試評估壓縮的影響：測試不同的壓縮率，度量最終任務的性能（準確率、用戶滿意度等）。通常 50-70% 的壓縮率在大多數任務上不會導致明顯性能下降，但應根據具體應用進行調整。

---

來源：https://aiterms.tw/terms/context-compression
快查頁：https://aiterms.tw/terms/context-compression
最後更新：2026/06/23
深度解說：https://aiterms.tw/learning/what-is-context-compression