多工多視框視覺鋼琴轉譜
為何重要
這項研究填補了視覺鋼琴轉錄在「註解完整性」上的空白,特別是針對樂曲中長時間的持音與速度掌握。透過引入多視框(多時間粒度)與多工學習架構,證明瞭強大的時間上下文建模能有效解決樂譜感測的歧義性。對產業而言,這代表音樂感知 AI 從單點檢測走向完整樂句理解邁出關鍵一步,未來有助於提升自動編曲與精確樂譜辨識系統的實用性。
音訊系統在辨識鋼琴起音、音高和速度方面表現良好,但在區分延音踏板效果上存在盲點;而既有視覺轉錄系統僅專注於短視訊視窗的起音檢測,離鍵準確度與音符速度資訊較為不足。
- 發表首套完整的視覺鋼琴轉錄系統 V2N (Video to Notes),透過共享時序基底與特定任務頭部,同時處理起音、離鍵、鍵保持與速度四種資訊。
- 該系統採用「逐幀監督」進行聯合訓練,取代了僅依賴視窗中心的監督方式。
- 實驗顯示多工監督能改善離鍵與速度預測,並在 PianoVAM 和 R3 兩個基準測試上創下新的最佳成果(SOTA)。