視訊編碼最佳化:運用隨機海森矩陣估計強化人眼感知評估
為何重要
這項技術突破實質性地將「人眼感知最敏感」的影像品質指標匯入了視訊編碼器的最佳化 Loop 中;這意味著壓縮演算法不再只是追求數學誤差最小,而是直接針對人類視覺系統最佳化,為網路串流平臺與硬體廠商提供了在維持視覺品質的前提下降低頻寬成本的新路徑,解決了高階全參考指標無法平行計算的關鍵工程難題。
現今視訊編碼演算法面臨傳統誤差評估不切合人眼感知的瓶頸,研究提出將全參考影像品質指標近似為輸入依存二次失真(IDQD),透過海森矩陣估算與自動微分技術,讓複雜的評估指標能分塊計算並應用於編碼器內迴圈。
- 研究提出兩種海森矩陣近似方法(保留塊對角與僅保留對角)以及基於矩陣向量積的估計器,以支援區塊化運算。
- 在 VVC(基於下一代的視訊編碼標準)的 Kodak 和 CLIC 測試集中,IDQD-RDO 針對 5 個指標達到 14.2% 至 36.7% 的 BD-rate(位元率)節省。
- 該方法在目標指標下有顯著的畫質改善收益,編碼複雜度增加僅 10% 至 30%,且也無須修改解碼器。