生活分享
可解釋性(Interpretability)是什麼:看懂模型為什麼這樣回答
可解釋性是讓人理解模型輸出從何而來的研究與方法,連定義都有分歧。以下並列 Doshi-Velez 與 Kim、Lipton、Rudin 與 NIST 的說法,分三類說明天生可讀的模型、SHAP 等事後歸因與機制可解釋性,解釋本身為何可能不忠實,以及讀到「AI 能解釋它的決定」時該追問哪三件事。
閱讀時間約 8 分鐘

可解釋性(interpretability)是讓人理解模型輸出從何而來的研究與方法,沒有公認定義,也還沒被解決;常被忽略的是,解釋本身也可能不忠實:讀來合理,卻沒反映模型實際的計算。中文常把 explainability 也譯成「可解釋性」,這裡依 Google 機器學習詞彙表繁中版,只用它指 interpretability。
以下並列幾種定義,分三類介紹方法,最後整理檢查「AI 能解釋它的決定」這類宣稱的三個問題。資料截至 2026 年 10 月;標「示例」的內容是教學編的,未實測。
定義本身就有分歧
Doshi-Velez 與 Kim(2017)把可解釋性定義為「以人能理解的方式解釋或呈現的能力」。他們認為需要解釋,是因為安全、公平這類目標無法完整寫成數學式;後果輕微或已充分驗證的系統未必需要。評估分三層:真人做真實任務、真人做簡化任務、不找人只看代理指標。
Lipton(2016)更保守:可解釋性沒有正式的技術意義,也不是單一概念,信任、因果、公平等動機有時互相衝突。他把相關性質分成透明(例如人能在腦中跑完模型)與事後解釋(文字、視覺化、舉例)兩群,並質疑線性模型一定比深度網路好懂:維度夠高一樣讀不完。
兩個英文詞是否同義也沒有共識。Doshi-Velez 與 Kim 用「解釋」定義可解釋性;Rudin(2019)則劃清界線:另做模型解釋黑盒叫 explainable,一開始就讓人看得懂才叫 interpretable。美國國家標準與技術研究院(NIST)2023 年的 AI 風險管理框架把運作機制歸給 explainability,interpretability 回答「為什麼」,和下文「機制可解釋性」用 interpretability 指內部運作的方向不同。先問是誰的定義。以下採較寬的用法:和 Lipton 一樣,把事後解釋也算進可解釋性。
三類方法:天生可讀、事後歸因、看進內部
第一類是天生可讀的模型,例如變數少的線性模型、短規則清單或淺決策樹。解釋就是模型本身,Rudin 認為因此忠實,並主張在特徵有意義的結構化資料上,準確度不一定要犧牲。
第二類是事後歸因:模型不動,另外估算各特徵對這次輸出的貢獻。LIME 在單筆預測附近用簡單模型局部近似;SHAP(Lundberg 與 Lee,2017)用賽局理論的 Shapley 值,從「不知道任何特徵時的平均預測」加到這次輸出,並證明同類方法中,滿足局部準確等三個性質的解只有一個。實際多靠近似計算。
示例(數字為教學編造,未實測):航班延誤模型對某班晚間航班輸出 0.62,SHAP 式拆解可能是:平均預測 0.20,目的地天候 +0.25、晚間時段 +0.12、前段航班延誤 +0.08、週末 −0.03,合計 0.62。加總對不上輸出,代表不滿足局部準確或近似誤差大;對得上,也只說明模型怎麼分分數,不是天候在現實中造成多少延誤。
第三類是機制可解釋性(mechanistic interpretability):打開神經網路神經網路(Neural Network)是什麼:由層與權重組成、能從資料學習的函數神經網路是由多層簡單單元組成的函數:單元做加權加總,多半再經非線性轉換,權重由資料調整。用雙開關走廊燈的手算示例,說明前向計算、損失、反向傳播與梯度下降,區分訓練與推論,並釐清參數數量、神經元數量與能力的差別,以及它與深度學習、Transformer 的關係。閱讀全文,找出內部代表概念的「特徵」與連接它們的「電路」。Olah 等人(2020)的主張自稱帶有推測性:特徵對應活化空間中的方向,經權重連成電路,即網路的計算子圖。難處是一個神經元常身兼數職:他們分析的影像模型裡,有個神經元同時回應貓臉、車頭與貓腿。
| 類別 | 能回答的問題 | 要小心的地方 |
|---|---|---|
| 天生可讀的模型 | 模型整體怎麼算出輸出 | 規則或變數一多就讀不完;「天生就忠實」的說法也有人質疑 |
| 事後歸因(SHAP、LIME、顯著圖) | 這筆輸出各特徵分到多少貢獻 | 是模型怎麼分分數,不是現實因果;可能失真或被刻意騙過 |
| 機制可解釋性 | 模型內部用哪些特徵、怎麼連接 | 只找到一部分特徵;結論限於特定模型與方法 |
代表研究:從大型語言模型拆出特徵
以 Anthropic 2024 年的 Scaling Monosemanticity 為例:他們在自家一個中型商用語言模型的中間層殘差流(各層輸出逐層累加的向量)上訓練稀疏自動編碼器,把活化拆成少數「特徵」的加權總和;三個版本約有 100 萬、400 萬與 3,400 萬個特徵,重建至少解釋原活化 65% 的變異。
他們找到跨語言、也對圖片起反應的抽象特徵。一個金門大橋特徵在前向計算中被強制設成最大活化值的 10 倍後,模型開始自稱是金門大橋,可見它會影響輸出,不只相關。
限制也寫在論文裡:作者不認為已找到全部特徵,只看中間層都可能差好幾個數量級;模型能列出倫敦所有行政區,3,400 萬特徵的版本只找到約 60% 的對應特徵。找到和欺騙相關的特徵,也不代表模型會欺騙。這是一個模型、一層、一種方法的結果,不能讀成「已經看懂模型」。
這類研究常和AI 對齊AI 對齊(Alignment)是什麼:對齊到誰的什麼,先問清楚AI 對齊沒有單一公認的定義:論文裡有依使用者意圖行事、有幫助誠實無害、更廣的價值對齊等說法。以下並列各家定義,說明 InstructGPT 如何把對齊變成可評分的工作、憲法式 AI 做了什麼,並分清對齊、安全防護與內容政策,讓你讀到「已對齊」時知道該追問哪一層。閱讀全文與安全一起討論,作者希望可解釋性將來能當「安全的測試集」,但也強調觀察非常初步。
解釋本身也可能不忠實
Jacovi 與 Goldberg(2020)把兩個常被混用的標準分開:說得通(plausibility)是對人有多少說服力,忠實(faithfulness)是多準確反映模型實際的推理過程。兩者可以只滿足一個,忠實度也不能靠人覺得合理來評。NISTIR 8312 也把「解釋準確」和決策準確分開:答案對了,解釋仍可能沒說中原因。
實驗也有反例。Adebayo 等人(2018)把影像分類模型換成同架構、隨機初始化的網路,有些顯著圖(標出重要像素的熱圖)方法的結果幾乎不受較高層參數影響,看起來依然合理。Slack 等人(2020)做出只看種族(德國信用資料改看性別)的分類器,外加一層辨認解釋工具擾動樣本的外殼;在他們的三個資料集上,LIME 都被騙過,SHAP 在多數資料點上也沒把這個敏感特徵排第一。
處理文字的模型也一樣。注意力機制注意力機制(Attention)是什麼:模型怎麼決定要參考哪些 token注意力機制讓序列中的每個位置,依 query 與 key 的比對算出權重,再把各位置的 value 加權平均成新的表示。內容從 2014 年的翻譯對齊講到 2017 年的 Transformer,用示例說明 Q、K、V、自注意力、交叉注意力與多頭注意力,也討論標準做法的計算量隨長度平方成長,以及注意力權重不能直接當成模型的理由。閱讀全文的權重,Jain 與 Wallace(2019)在文字分類、問答等任務的模型上發現,常和梯度式重要度不相關,換一組很不同的權重,預測卻不變;思維鏈思維鏈(Chain-of-Thought)是什麼:讓模型寫出步驟,以及步驟能信多少思維鏈是讓語言模型在答案之前先寫出中間步驟的做法,源自 2022 年的兩篇論文。接著說明少樣本與一句話兩種寫法、原論文在自己設定下的結果、推理(reasoning)模型把步驟內建後的提示建議,並整理研究為何指出步驟不一定忠實反映模型怎麼得出答案,最後示範把步驟當成可查的主張清單。閱讀全文的步驟,Turpin 等人(2023)加入偏向某答案的線索後,模型常替被帶偏的答案找理由,卻不提線索。兩者都只能當線索。
讀到「AI 能解釋它的決定」時,問三件事
- 解釋給誰:開發者除錯、使用者決定採不採用、受影響者提出異議,需要的不同;NIST 的「有意義」原則要求預期對象看得懂。
- 用什麼方法:模型本身、事後歸因、內部特徵分析,還是另一段生成的理由?方法決定它能回答什麼。
- 忠實度驗證過嗎:有沒有做隨機化檢查、改動輸入看輸出是否跟著變,並說明解釋何時會失準。
示例(虛構情境,未實測):訂房網站在推薦旁寫「因為你常訂靠近車站的住宿」。對象是一般使用者;方法沒說明,可能是事後歸因,也可能只是文案範本;外部難驗證忠實度,但可看跡象:是否每個推薦都套同一句、住宿是否真的靠近車站。對不上就只當行銷文字。
相鄰名詞可從AI 名詞總索引AI 名詞總索引:從 Loop Engineering 到生成式 AI想看懂 Loop Engineering、Harness Engineering、Context Engineering、RAG、MCP 與其他 AI 名詞,可以從這份總索引開始。依 2026 年 9 月查證範圍,把這些概念分組整理,每個詞連到白話專文,附依任務安排的閱讀路徑、容易混淆的層次,以及原始論文和官方定義的查核方式。閱讀全文繼續找。
同主題延伸閱讀
生活分享
世界模型(World Model)是什麼:讓 AI 預測「接下來會怎樣」
世界模型指 AI 內部用來預測「這樣做之後會怎樣」的模型,但這個詞至少有三種用法:強化學習代理在想像中練習用的環境模型、LeCun 主張預測抽象表示的架構路線,以及能隨操作即時生成畫面的互動環境。內容用示例說明怎麼在想像中規劃,並列出大型語言模型有沒有世界模型的正反研究,附讀新聞時的檢查問題。
生活分享
視覺語言模型(VLM)是什麼:讓 AI 讀圖片、再用文字回答
視覺語言模型(VLM)能同時接收圖片與文字,再用文字回答。內容拆解視覺編碼器、連接層與語言模型三段結構,說明 CLIP、Flamingo、LLaVA 三篇論文各補上哪一塊,並和多模態 AI、文字生圖分清楚;也整理它常犯的錯:數錯數量、搞混位置、說出圖裡沒有的東西,附上讀收據時逐行核對的步驟。
生活分享
溫度(Temperature)是什麼:AI 回答變化程度的取樣參數
溫度(temperature)是文字生成時調整取樣的參數,讓模型從下一個 token 的機率分布裡抽得更集中或更分散。用假想的台南早餐示例算出低溫與高溫的差別,說明 top-p 的來源和它與 top-k 的差別,並依官方文件與論文指出:調低溫度不代表更準,設成 0 也不保證每次相同,部分模型還不開放調整。
生活分享
合成資料(Synthetic Data)是什麼:兩種用途、品質控管與模型崩潰
合成資料是由演算法或模型產生、模仿真實資料特徵的資料,常見用途有兩種:訓練模型,以及在隱私需求下替代真資料。內容依 Self-Instruct、模型崩潰研究(替換與累積資料的差別)與 NIST、ICO 的隱私文件,說明做法、抽查流程,以及它不能保證的事。
引用本文的文章
最新旅遊情報攻略

情報
2026 韓國楓葉預測:雪嶽山 10 月 20 日、首爾近郊 10 月底、內藏山與漢拏山 11 月上旬
韓國山林廳 2026 年 9 月 22 日公布的楓紅高峰預測:雪嶽山 10 月 20 日,春川、國立樹木園到首爾植物園落在 10 月 28 日到 11 月 2 日,內藏山 11 月 4 日、漢拏山 11 月 6 日,整體比最近 5 年晚約 0.8 天。整理各地楓樹與銀杏的預測日、首爾出發怎麼排,以及出發前去哪裡看即時楓況。2026 年 10 月查證。
- 季節活動
- 自然
- 觀景

攻略胡志明市
胡志明市到頭頓一日遊:白藤碼頭搭高速船、船票與班次,下船就是胡梅纜車與耶穌基督像
人在胡志明市挪一天去頭頓看海:市中心的白藤高速船碼頭搭船,航程 120 分鐘到頭頓的胡梅碼頭,平日成人 320,000 越南盾、週末 350,000,回程末班平日 15:00。下船就是胡梅纜車站,同一條路上有白宮,小山頂上是耶穌基督像。平日一天只有兩班船,整天要從末班船倒推著排。
- 交通
- 行程範例
- 海灘

攻略沖繩
沖繩不開車攻略:單軌只到浦添,美麗海水族館要坐兩個多小時的巴士,回那霸的最後一班直達車 17:22 就開走
不租車的沖繩怎麼移動:那霸市區靠沖繩都市單軌電車(ゆいレール),那霸機場站到終點てだこ浦西 19 站、17 公里、37 分鐘,一日券 1,000 日圓;美麗海水族館有那霸機場直達的高速巴士,單程 2,000 日圓起、官方時刻表上 2 小時上下,下車後還要走 10 分鐘;古宇利島要在今帰仁村役場轉車,當天來回光坐車就六個半小時;回程的最後一班直達車 17:22 就從記念公園前開走(2026 年 9 月查證)。
- 交通
- 行程範例
- 預算
資料來源
- Doshi-Velez、Kim:Towards A Rigorous Science of Interpretable Machine Learning(arXiv:1702.08608) · 查證日期:
- Lipton:The Mythos of Model Interpretability(arXiv:1606.03490,ICML 2016 WHI 工作坊) · 查證日期:
- Rudin:Stop Explaining Black Box Machine Learning Models for High Stakes Decisions and Use Interpretable Models Instead(arXiv:1811.10154,Nature Machine Intelligence 2019) · 查證日期:
- NIST:Artificial Intelligence Risk Management Framework(AI RMF 1.0,NIST AI 100-1,第 3.5 節) · 查證日期:
- NIST:Four Principles of Explainable Artificial Intelligence(NISTIR 8312) · 查證日期:
- Google for Developers:機器學習詞彙表繁體中文版(可解釋性) · 查證日期:
- 黃詩淳:AI 可解釋性的法學意義及其實踐(臺大法學論叢 52 卷 S 期,2023;中文譯名用法) · 查證日期:
- Ribeiro、Singh、Guestrin:"Why Should I Trust You?": Explaining the Predictions of Any Classifier(arXiv:1602.04938,LIME) · 查證日期:
- Lundberg、Lee:A Unified Approach to Interpreting Model Predictions(arXiv:1705.07874,SHAP,NIPS 2017) · 查證日期:
- Olah 等:Zoom In: An Introduction to Circuits(Distill,2020) · 查證日期:
- Templeton 等(Anthropic):Scaling Monosemanticity(Transformer Circuits Thread,2024) · 查證日期:
- Jacovi、Goldberg:Towards Faithfully Interpretable NLP Systems: How should we define and evaluate faithfulness?(arXiv:2004.03685,ACL 2020) · 查證日期:
- Adebayo 等:Sanity Checks for Saliency Maps(arXiv:1810.03292,NeurIPS 2018) · 查證日期:
- Slack 等:Fooling LIME and SHAP: Adversarial Attacks on Post hoc Explanation Methods(arXiv:1911.02508,AIES 2020) · 查證日期:
- Jain、Wallace:Attention is not Explanation(arXiv:1902.10186,NAACL 2019) · 查證日期:
- Turpin 等:Language Models Don't Always Say What They Think: Unfaithful Explanations in Chain-of-Thought Prompting(arXiv:2305.04388,NeurIPS 2023) · 查證日期: