生活分享

可解釋性(Interpretability)是什麼:看懂模型為什麼這樣回答

可解釋性是讓人理解模型輸出從何而來的研究與方法,連定義都有分歧。以下並列 Doshi-Velez 與 Kim、Lipton、Rudin 與 NIST 的說法,分三類說明天生可讀的模型、SHAP 等事後歸因與機制可解釋性,解釋本身為何可能不忠實,以及讀到「AI 能解釋它的決定」時該追問哪三件事。

閱讀時間約 8 分鐘

放大鏡壓在深色方塊上,鏡片裡露出節點與連線,一條虛線連到旁邊的說明卡
圖片:Mokaair (© Mokaair)

可解釋性(interpretability)是讓人理解模型輸出從何而來的研究與方法,沒有公認定義,也還沒被解決;常被忽略的是,解釋本身也可能不忠實:讀來合理,卻沒反映模型實際的計算。中文常把 explainability 也譯成「可解釋性」,這裡依 Google 機器學習詞彙表繁中版,只用它指 interpretability。

以下並列幾種定義,分三類介紹方法,最後整理檢查「AI 能解釋它的決定」這類宣稱的三個問題。資料截至 2026 年 10 月;標「示例」的內容是教學編的,未實測。

定義本身就有分歧

Doshi-Velez 與 Kim(2017)把可解釋性定義為「以人能理解的方式解釋或呈現的能力」。他們認為需要解釋,是因為安全、公平這類目標無法完整寫成數學式;後果輕微或已充分驗證的系統未必需要。評估分三層:真人做真實任務、真人做簡化任務、不找人只看代理指標。

Lipton(2016)更保守:可解釋性沒有正式的技術意義,也不是單一概念,信任、因果、公平等動機有時互相衝突。他把相關性質分成透明(例如人能在腦中跑完模型)與事後解釋(文字、視覺化、舉例)兩群,並質疑線性模型一定比深度網路好懂:維度夠高一樣讀不完。

兩個英文詞是否同義也沒有共識。Doshi-Velez 與 Kim 用「解釋」定義可解釋性;Rudin(2019)則劃清界線:另做模型解釋黑盒叫 explainable,一開始就讓人看得懂才叫 interpretable。美國國家標準與技術研究院(NIST)2023 年的 AI 風險管理框架把運作機制歸給 explainability,interpretability 回答「為什麼」,和下文「機制可解釋性」用 interpretability 指內部運作的方向不同。先問是誰的定義。以下採較寬的用法:和 Lipton 一樣,把事後解釋也算進可解釋性。

三類方法:天生可讀、事後歸因、看進內部

第一類是天生可讀的模型,例如變數少的線性模型、短規則清單或淺決策樹。解釋就是模型本身,Rudin 認為因此忠實,並主張在特徵有意義的結構化資料上,準確度不一定要犧牲。

第二類是事後歸因:模型不動,另外估算各特徵對這次輸出的貢獻。LIME 在單筆預測附近用簡單模型局部近似;SHAP(Lundberg 與 Lee,2017)用賽局理論的 Shapley 值,從「不知道任何特徵時的平均預測」加到這次輸出,並證明同類方法中,滿足局部準確等三個性質的解只有一個。實際多靠近似計算。

示例(數字為教學編造,未實測):航班延誤模型對某班晚間航班輸出 0.62,SHAP 式拆解可能是:平均預測 0.20,目的地天候 +0.25、晚間時段 +0.12、前段航班延誤 +0.08、週末 −0.03,合計 0.62。加總對不上輸出,代表不滿足局部準確或近似誤差大;對得上,也只說明模型怎麼分分數,不是天候在現實中造成多少延誤。

第三類是機制可解釋性(mechanistic interpretability):打開,找出內部代表概念的「特徵」與連接它們的「電路」。Olah 等人(2020)的主張自稱帶有推測性:特徵對應活化空間中的方向,經權重連成電路,即網路的計算子圖。難處是一個神經元常身兼數職:他們分析的影像模型裡,有個神經元同時回應貓臉、車頭與貓腿。

三條路徑對照:天生可讀的模型以決策樹表示,事後歸因以航班延誤示例的 SHAP 加總表示,機制可解釋性以內部特徵與電路表示,三者最後都要接受忠實度檢查
由左到右是三類方法;中間的數字是教學示例,未實測;下方是三類都要再問的忠實度問題。 · 圖片:Mokaair (© Mokaair)
三類方法的比較,整理自文中引用的論文;資料截至 2026 年 10 月。
類別能回答的問題要小心的地方
天生可讀的模型模型整體怎麼算出輸出規則或變數一多就讀不完;「天生就忠實」的說法也有人質疑
事後歸因(SHAP、LIME、顯著圖)這筆輸出各特徵分到多少貢獻是模型怎麼分分數,不是現實因果;可能失真或被刻意騙過
機制可解釋性模型內部用哪些特徵、怎麼連接只找到一部分特徵;結論限於特定模型與方法

代表研究:從大型語言模型拆出特徵

以 Anthropic 2024 年的 Scaling Monosemanticity 為例:他們在自家一個中型商用語言模型的中間層殘差流(各層輸出逐層累加的向量)上訓練稀疏自動編碼器,把活化拆成少數「特徵」的加權總和;三個版本約有 100 萬、400 萬與 3,400 萬個特徵,重建至少解釋原活化 65% 的變異。

他們找到跨語言、也對圖片起反應的抽象特徵。一個金門大橋特徵在前向計算中被強制設成最大活化值的 10 倍後,模型開始自稱是金門大橋,可見它會影響輸出,不只相關。

限制也寫在論文裡:作者不認為已找到全部特徵,只看中間層都可能差好幾個數量級;模型能列出倫敦所有行政區,3,400 萬特徵的版本只找到約 60% 的對應特徵。找到和欺騙相關的特徵,也不代表模型會欺騙。這是一個模型、一層、一種方法的結果,不能讀成「已經看懂模型」。

這類研究常和與安全一起討論,作者希望可解釋性將來能當「安全的測試集」,但也強調觀察非常初步。

解釋本身也可能不忠實

Jacovi 與 Goldberg(2020)把兩個常被混用的標準分開:說得通(plausibility)是對人有多少說服力,忠實(faithfulness)是多準確反映模型實際的推理過程。兩者可以只滿足一個,忠實度也不能靠人覺得合理來評。NISTIR 8312 也把「解釋準確」和決策準確分開:答案對了,解釋仍可能沒說中原因。

實驗也有反例。Adebayo 等人(2018)把影像分類模型換成同架構、隨機初始化的網路,有些顯著圖(標出重要像素的熱圖)方法的結果幾乎不受較高層參數影響,看起來依然合理。Slack 等人(2020)做出只看種族(德國信用資料改看性別)的分類器,外加一層辨認解釋工具擾動樣本的外殼;在他們的三個資料集上,LIME 都被騙過,SHAP 在多數資料點上也沒把這個敏感特徵排第一。

處理文字的模型也一樣。的權重,Jain 與 Wallace(2019)在文字分類、問答等任務的模型上發現,常和梯度式重要度不相關,換一組很不同的權重,預測卻不變;的步驟,Turpin 等人(2023)加入偏向某答案的線索後,模型常替被帶偏的答案找理由,卻不提線索。兩者都只能當線索。

讀到「AI 能解釋它的決定」時,問三件事

  1. 解釋給誰:開發者除錯、使用者決定採不採用、受影響者提出異議,需要的不同;NIST 的「有意義」原則要求預期對象看得懂。
  2. 用什麼方法:模型本身、事後歸因、內部特徵分析,還是另一段生成的理由?方法決定它能回答什麼。
  3. 忠實度驗證過嗎:有沒有做隨機化檢查、改動輸入看輸出是否跟著變,並說明解釋何時會失準。

示例(虛構情境,未實測):訂房網站在推薦旁寫「因為你常訂靠近車站的住宿」。對象是一般使用者;方法沒說明,可能是事後歸因,也可能只是文案範本;外部難驗證忠實度,但可看跡象:是否每個推薦都套同一句、住宿是否真的靠近車站。對不上就只當行銷文字。

相鄰名詞可從繼續找。

  • 生活分享

    世界模型(World Model)是什麼:讓 AI 預測「接下來會怎樣」

    世界模型指 AI 內部用來預測「這樣做之後會怎樣」的模型,但這個詞至少有三種用法:強化學習代理在想像中練習用的環境模型、LeCun 主張預測抽象表示的架構路線,以及能隨操作即時生成畫面的互動環境。內容用示例說明怎麼在想像中規劃,並列出大型語言模型有沒有世界模型的正反研究,附讀新聞時的檢查問題。

  • 生活分享

    視覺語言模型(VLM)是什麼:讓 AI 讀圖片、再用文字回答

    視覺語言模型(VLM)能同時接收圖片與文字,再用文字回答。內容拆解視覺編碼器、連接層與語言模型三段結構,說明 CLIP、Flamingo、LLaVA 三篇論文各補上哪一塊,並和多模態 AI、文字生圖分清楚;也整理它常犯的錯:數錯數量、搞混位置、說出圖裡沒有的東西,附上讀收據時逐行核對的步驟。

  • 生活分享

    溫度(Temperature)是什麼:AI 回答變化程度的取樣參數

    溫度(temperature)是文字生成時調整取樣的參數,讓模型從下一個 token 的機率分布裡抽得更集中或更分散。用假想的台南早餐示例算出低溫與高溫的差別,說明 top-p 的來源和它與 top-k 的差別,並依官方文件與論文指出:調低溫度不代表更準,設成 0 也不保證每次相同,部分模型還不開放調整。

  • 生活分享

    合成資料(Synthetic Data)是什麼:兩種用途、品質控管與模型崩潰

    合成資料是由演算法或模型產生、模仿真實資料特徵的資料,常見用途有兩種:訓練模型,以及在隱私需求下替代真資料。內容依 Self-Instruct、模型崩潰研究(替換與累積資料的差別)與 NIST、ICO 的隱私文件,說明做法、抽查流程,以及它不能保證的事。

最新旅遊情報攻略

資料來源

生活分享