---
title: "音樂資訊檢索（Music Information Retrieval）"
slug: music-information-retrieval
language: zh-TW
source: https://aiterms.tw/terms/music-information-retrieval
updated_at: 2026-06-23
tags: [音樂分析, 音訊信號, 訊號處理, 深度學習, 資訊檢索]
ipas_term: false
---

# 音樂資訊檢索（Music Information Retrieval）

從音樂內容提取結構化資訊（如流派、演唱者、節拍、旋律）或進行檢索與推薦的技術與研究領域。

## 完整說明

音樂資訊檢索（Music Information Retrieval，MIR）是處理音樂資訊的多學科領域，結合訊號處理、機器學習、資訊檢索等技術，從音訊或樂譜中自動提取與分析音樂特徵，用於流派分類、藝人識別、推薦系統、樂譜轉錄、和弦識別、節拍追蹤等任務。MIR 既是學術研究熱點，也直接支撑 Spotify、Apple Music 等商業音樂服務的核心功能。

## 常見問題

### Shazam 是如何在一秒內辨認出一首歌的？

Shazam 採用聲紋識別技術，而非完整的音訊比對。它計算一個短時間窗口（如 11.9 秒）的頻譜圖的「星圖」（constellation map）：抽取頻譜圖中的頂峰（局部最大值）與它們的相對時頻關係，形成一個緊湊的哈希指紋。然後將該指紋與龐大的資料庫（數千萬首歌）比對。這樣設計的優勢是：可應對背景雜訊、音量變化、甚至不同版本的演唱，計算速度極快。為了達到這速度，Shazam 的指紋無需高精度，只需足夠區分不同歌曲即可。這是 MIR 中「系統設計勝過演算法複雜度」的經典例子。

### 為什麼和弦識別相比流派分類難很多？

流派分類是粗粒度分類任務（頂多 10-30 個類別），可以捕捉全局音樂風格特徵（樂器、速度、頻譜分布）就達到不錯的準確率。和弦識別是序列級細粒度任務：需要在每個時間步判斷和弦，錯一個位置就影響整個下游（如樂譜轉錄）。且和弦需要感知和聲（多個音符的組合）而非個別音素，多聲部音樂中聲部間的掩蔽（masking）讓聲學分析更複雜。此外，和弦標注本身存在歧義（同一個音集可標為 C major 或 A minor），增加評估難度。

### 音樂推薦系統是基於音訊內容還是用戶行為？

大型服務（Spotify、Apple Music）採用混合方法。用戶行為（協作過濾）提供最直接的信號：若 A 和 B 用戶喜歡相同的歌，A 就能發現 B 喜歡但 A 未聽過的歌。但協作過濾有冷啟問題：新歌、新用戶、小眾流派難以冷啟推薦。因此內容基推薦補充其不足：計算歌曲的聲學或元資訊（MIR 特徵），找相似歌曲。商業系統通常是：協作過濾為主（效果最好），加上內容過濾（多樣化、冷啟）、以及基於上下文（時間、地點、用戶活動）的混合排序。MIR 技術在這個流程中貢獻了「內容相似度」與「特徵工程」的部分。

---

來源：https://aiterms.tw/terms/music-information-retrieval
快查頁：https://aiterms.tw/terms/music-information-retrieval
最後更新：2026/06/23
深度解說：https://aiterms.tw/learning/what-is-music-information-retrieval