工程師推出視覺化 LLM 注意力機制的互動式工具
為何重要
此工具將抽象的 Transformer 注意力機制轉化為具體的視覺證據,清楚揭示了模型如何透過篩選先前的標記來進行上下文學習與抄襲,而非完全依賴潛藏狀態。對工程師而言,這提供了檢視模型內部運作邏輯的全新視角,同時也展現了在 WebAssembly 環境中進行模型可解釋性分析的技術挑戰與解法。
- 專案透過 React 與 Transformers.js 建立的工具,讓使用者能懸停於生成的文字上,視覺化看到哪些過去的標記對當前生成具有高影響力(注意力權重)。
- 注意力權重計算方式為疊加所有層級與注意力頭的數值,並依其大小調整前序標記的透明度(最大值為 1,其餘線性插值)。
- 開發者使用了一個「600 million parameters」的小型模型,但需手動修改 .onnx 檔案以洩漏標準推理迴圈無法取得的內部變數。
- 為了避免在瀏覽器端等待數百 MB 模型下載,網站預先載入了好幾組範例提示詞(如「Office Move Summary」),以達到即時觀看的效果。