---
title: "曼巴模型（Mamba）"
slug: mamba
language: zh-TW
source: https://aiterms.tw/terms/mamba
updated_at: 2026-07-29
tags: [深度學習, 自然語言處理, 模型訓練, 模型部署, 神經網路, AI基礎, 大型語言模型, 時序分析]
ipas_term: false
---

# 曼巴模型（Mamba）

> **你有沒有看過超長文本，模型一處理就變慢，還很吃記憶體？**
> 你可以把 Mamba 想成，處理長序列時更省力的序列模型。
> 它其實就是基於選擇機制的 state space model。
> 在長文、時間序列或高效率推論裡，它很有吸引力。
>
>
> 你可以把它想成一個把抽象概念拉回日常判斷的提示，先知道它解決什麼問題，再看技術細節。

### 容易混淆
> **Mamba vs Transformer**
> Transformer 依賴注意力，Mamba 走選擇式狀態空間路線。
> 一個重全局注意力，一個重線性效率。
>
> **Mamba vs LSTM**
> LSTM 靠門控記憶，Mamba 靠狀態空間與選擇機制。
> 兩者都想記長期資訊，但路線不同。
>
> **最關鍵的區別：** 大家都想處理長序列，但方法不同。
>
### 記住這句就好
> 長序列要快，還要能抓住重點。
>
### 實際案例
> **長文分析**
> 處理很長的文件或報告時，Mamba 能比傳統注意力模型更省記憶體。
>
> **時間序列預測**
> 在感測器資料或金融序列裡，Mamba 可以把長期模式抓得更有效率。
>
### 算法與應用
> 它用 selective scan 之類的設計，把長序列計算做得更接近線性成本。
> 核心優勢是長上下文效率和硬體友善度。
> 在需要大上下文但又想省算力的任務裡，常被拿來和 Transformer 比較。
>

### Mamba 想解決 Transformer 的什麼問題

> Transformer 的注意力機制讓每個 token 都能直接看到前面所有 token，效果很好，但代價是兩個成本都隨序列長度增長：
>
> 訓練時計算量與序列長度成平方
> 推論時 KV 快取的記憶體與已生成長度成正比
>
> 長上下文因此變得昂貴。Mamba 走的是另一條路：狀態空間模型（SSM）。它用一個固定大小的隱藏狀態把過去壓縮起來，計算量與長度成線性，推論時記憶體固定不變。

### 選擇性機制是關鍵，這是它跟舊 SSM 的差別

> 早期 SSM（例如 S4）的參數是固定的，也就是不管輸入什麼內容，遺忘與記憶的方式都一樣。這讓它在需要「依內容決定記不記住」的任務上表現很差，例如從一長串文字裡找出某個特定的名字。
>
> Mamba 的核心改動是讓 SSM 的參數隨輸入變化，這叫選擇性（selective）機制。模型因此能對每個 token 決定「這個重要，寫進狀態」或「這個沒用，跳過」。
>
> 但這個改動帶來一個工程問題：參數會變之後，原本用來平行訓練的卷積形式就不能用了，只能一步一步遞迴，訓練會非常慢。
>
> Mamba 的解法是硬體感知的平行掃描（hardware-aware parallel scan），把狀態更新的中間結果留在 GPU 的高速 SRAM 裡，不寫回主記憶體，並且用掃描演算法在序列維度上平行化。這是它能同時保有選擇性與訓練速度的原因。

### 現在的實際定位

| 項目 | Transformer | Mamba |
| --- | --- | --- |
| 訓練計算量 | 與長度成平方 | 與長度成線性 |
| 推論記憶體 | 隨長度增長 | 固定 |
| 精準回查特定內容 | 強，直接查 | 較弱，資訊經過壓縮 |
| 生態成熟度 | 極高 | 發展中 |

> 表中第三列是它目前最主要的限制。需要從長文中精確引用某一段時，注意力的直接查找仍然比壓縮狀態可靠。
>
> 所以現在的主流做法不是取代而是混合：把少量注意力層與大量 Mamba 層交錯排列，讓注意力負責需要精準回查的部分，Mamba 負責低成本的長距離記憶。Jamba 與 Zamba 這類模型走的都是這個路線。

### 情境判斷
> **Q1（直覺題）： 如果你要處理很長的序列，又不想記憶體爆掉，會想到什麼模型？**
>
> → Mamba 很值得考慮，因為它對長序列較省資源。
>
> **Q2（判斷題）： Mamba 出來後，Transformer 就沒有用了嗎？**
>
> → 不是，兩者各有適合場景，還是要看任務、成本和精度需求。
>
### 常見問題
> **Q：Mamba 為什麼受關注？**
> 因為它在長序列上有較好的效率和硬體利用率。
>
> **Q：Mamba 和注意力機制是一樣的嗎？**
> 不一樣，Mamba 不是靠傳統注意力來做長距離建模。
>
> **Q：Mamba 適合所有任務嗎？**
> 不一定，還是要看資料型態和模型需求。
>
### 相關術語
> - **Transformer**：先看它，再看 Mamba 才知道差在哪。
> - **長短期記憶網路**：它也是長序列模型的重要對照組。
> - **循環神經網路**：Mamba 常被放在這條序列模型演化線上討論。
> - **注意力機制**：理解它，才知道 Mamba 為何會被拿來比較。

---

來源：https://aiterms.tw/terms/mamba
快查頁：https://aiterms.tw/terms/mamba
最後更新：2026/07/29
深度解說：https://aiterms.tw/learning/what-is-mamba