一句話說明
Explainable AI(可解釋 AI,簡稱 XAI)是讓人類能理解 AI 決策過程和結果的技術和方法。
為什麼 AI 需要「可解釋」
大多數現代 AI 模型是黑盒子。你給它一張照片,它告訴你「這是貓」,信心度 98%。但它是根據耳朵的形狀判斷的,還是根據背景裡的貓砂盆判斷的?你不知道。
在日常聊天中,這不是大問題。但在以下場景中,不知道 AI 「為什麼」做出某個決定會有嚴重後果:
銀行用 AI 審核貸款申請,拒絕了你的申請。你有權知道原因——是因為信用分數、收入水平、還是其他因素?如果 AI 其實是因為你的居住地區(間接對應種族或社經地位)而拒絕的,這就是歧視。
醫院用 AI 輔助診斷,建議某個治療方案。醫生需要理解 AI 的判斷依據,才能結合自己的專業做最終決定。如果 AI 說「建議手術」但沒辦法解釋為什麼,醫生很難據此做出攸關生命的決策。
保險公司用 AI 定價,某個客戶的保費特別高。監管機關要求保險公司解釋定價邏輯。如果 AI 模型是黑盒子,公司無法提供合理的解釋,可能面臨法律風險。
人資部門用 AI 篩選履歷,自動淘汰了某些候選人。如果 AI 學到了「畢業於特定學校」或「名字聽起來像某個族裔」這種偏見,但因為模型不可解釋,歧視行為可能一直持續到被告上法庭才被發現。
可解釋性的層級
可解釋性不是「有」或「沒有」的二元問題,它有不同的層級和面向:
全域可解釋性(Global Interpretability)。理解模型整體的行為模式——哪些特徵最重要、不同特徵之間怎麼互動、模型在什麼情況下表現好或差。這對模型開發者和稽核人員最有用。
局部可解釋性(Local Interpretability)。理解模型對某一筆特定資料的決策原因——為什麼這個貸款申請被拒絕、為什麼這張 X 光被判定為異常。這對最終使用者和受 AI 決策影響的人最重要。
模型透明度(Model Transparency)。理解模型的內部運作機制——每一層做了什麼計算、每個神經元學到了什麼特徵。這對 AI 研究者最有意義。
可解釋性的兩種途徑
內建可解釋(Intrinsic Interpretability):模型本身的結構就是可解釋的。線性迴歸是最典型的例子——每個特徵有一個權重,你可以直接看到每個因素對結果的貢獻。決策樹也是,你可以追蹤從根節點到葉節點的每一個判斷條件。邏輯迴歸、GAM(Generalized Additive Model)、以及規則學習演算法也屬於這類。
缺點是這類模型通常比較簡單,在複雜問題上的表現不如深度學習模型。但在某些應用場景中(例如醫療診斷的輔助判斷、金融的信用評分),使用可解釋模型是值得的取捨。
事後解釋(Post-hoc Explanation):用另一個方法來解釋一個已經訓練好的黑盒模型。你不改變原本的模型,而是在它做出預測後,用工具分析它的決策是基於哪些因素。LIME 和 SHAP 屬於這一類。
事後解釋的優勢是不需要犧牲模型效能——你可以用最強的深度學習模型,然後用解釋工具來理解它的決策。缺點是解釋本身是「近似」,不一定百分之百反映模型的真實邏輯。
主要的 XAI 技術
LIME(Local Interpretable Model-agnostic Explanations)
LIME 的概念是:即使整個模型很複雜,在某一個特定預測的「附近」,行為可能是相對簡單的。
做法是:針對一筆你想解釋的資料,LIME 會在它附近產生很多稍微修改過的版本(例如把圖片中不同區域遮住,或把文字中某些詞移除),然後觀察模型對這些修改版本的預測會怎麼變化。根據變化的規律,LIME 建立一個簡單的局部模型(通常是線性模型)來近似原本的複雜模型在這個點附近的行為。
例如一個情感分析模型判斷一則評論為「負面」。LIME 可能會告訴你:移除「太慢了」這三個字後,模型的判斷會變成「正面」。這代表「太慢了」是這次判斷的關鍵因素。
LIME 的使用範例(Python):
from lime.lime_text import LimeTextExplainer
explainer = LimeTextExplainer(class_names=['正面', '負面'])
exp = explainer.explain_instance(
"這家餐廳服務太慢了,餐點普通",
model.predict_proba,
num_features=5
)
exp.show_in_notebook()
LIME 的限制:每次只能解釋一筆預測,無法看到模型的全貌。局部線性近似在模型決策邊界附近可能不準確。不同次執行可能產生略有不同的解釋(因為隨機取樣)。
SHAP(SHapley Additive exPlanations)
SHAP 基於賽局理論中的 Shapley 值。概念是:把每個特徵想像成一個團隊中的成員,Shapley 值衡量的是每個成員對團隊總成績的「公平」貢獻度。
實際計算方式是考慮所有可能的特徵組合,計算加入或移除某個特徵後對預測結果的影響。SHAP 值可以是正的(推動預測往某個方向)或負的(推動往反方向)。
例如在貸款審核模型中,SHAP 可能顯示:年收入 (+0.3)、信用分數 (+0.2)、負債比 (-0.4)、工作年資 (+0.1)。這代表負債比是拒絕貸款的最主要因素。
SHAP 比 LIME 更有理論基礎(Shapley 值有數學上的公平性保證),但計算成本較高,特別是在特徵數量多的時候。
SHAP 的使用範例(Python):
import shap
explainer = shap.TreeExplainer(model)
shap_values = explainer.shap_values(X_test)
shap.summary_plot(shap_values, X_test)
SHAP 的幾種變體:TreeSHAP(針對樹模型,計算速度快)、DeepSHAP(針對深度學習模型)、KernelSHAP(模型無關的通用版本,但速度最慢)。
Attention Visualization
針對 Transformer 架構的模型(包括 GPT、BERT、Claude 等),可以視覺化模型的注意力機制(Attention),看模型在處理某個輸入時「注意到」了哪些部分。
例如在翻譯任務中,可以看到模型在產生「貓」這個字時,注意力集中在原文中的「cat」上面。這種視覺化可以提供一些直覺上的理解,但研究顯示注意力權重不一定準確反映模型真正的決策過程——模型可能注意到某個詞,但最終決定是由更深層的計算產生的。
工具推薦:BertViz(視覺化 BERT/GPT 的 attention)、ecco(視覺化語言模型的隱藏層)。
Grad-CAM(Gradient-weighted Class Activation Mapping)
專門用於視覺模型(CNN)的解釋技術。它透過計算模型對某個分類結果的梯度,產生一張「熱力圖」,標示出圖片中哪些區域對分類決定影響最大。
例如,一個醫療影像模型判斷 X 光片上有肺結節。Grad-CAM 可以產生一張熱力圖,標示出模型「看到」的疑似結節位置。如果熱力圖標示的位置和放射科醫師認為可疑的位置一致,就增加了對模型判斷的信心。如果熱力圖標示的位置很離譜(例如標在骨頭上),就知道模型可能學到了錯誤的特徵。
Counterfactual Explanations(反事實解釋)
回答「如果什麼條件不同,結果會改變?」的問題。
例如貸款被拒,反事實解釋會告訴你:「如果你的年收入從 50 萬增加到 65 萬,同時負債比從 40% 降到 30%,貸款就會被核准。」這對使用者來說是最實用的解釋形式——不只告訴你為什麼被拒,還告訴你要怎麼改善。
TCAV(Testing with Concept Activation Vectors)
由 Google 開發,讓你用人類理解的概念(而非原始特徵)來解釋模型。例如你可以問模型:「在判斷這張照片是醫生的時候,『穿白袍』這個概念有多重要?」
這比看單一像素的重要性更有意義,因為人類思考的單位是概念,不是像素。
XAI 技術比較表
| 技術 | 適用模型 | 解釋範圍 | 計算成本 | 理論基礎 | 易用性 |
|---|---|---|---|---|---|
| LIME | 任何模型 | 局部 | 中等 | 較弱 | 高 |
| SHAP | 任何模型 | 全域+局部 | 高 | 強(Shapley) | 中 |
| Grad-CAM | CNN 視覺模型 | 局部 | 低 | 中 | 高 |
| Attention | Transformer | 局部 | 低 | 較弱 | 中 |
| Counterfactual | 任何模型 | 局部 | 高 | 中 | 高 |
| TCAV | 深度學習 | 全域 | 高 | 強 | 低 |
法規要求
歐盟 AI Act 是全球第一個針對 AI 的專門法規。對於高風險 AI 系統(包括用於信用評分、招聘篩選、司法判決的 AI),明確要求「足夠的透明度」,讓使用者能理解 AI 的輸出並適當使用。具體要求包括:AI 系統必須附帶使用說明書、使用者必須能理解 AI 輸出的含義和限制、對於高風險應用必須有人類監督機制。
違反 EU AI Act 的罰款最高可達全球年營業額的 6%(禁止類 AI)或 3%(高風險 AI 違規)。這個金額足以讓大型企業認真對待可解釋性的要求。
美國目前沒有聯邦層級的 AI 專法,但有多項相關法規:Equal Credit Opportunity Act(ECOA)要求信貸機構解釋拒絕貸款的原因、Fair Housing Act 禁止基於特定因素的住房歧視。2023 年拜登政府的 AI 行政命令也強調了 AI 透明度的重要性。紐約市的 Local Law 144 要求使用 AI 招聘工具的雇主必須進行偏見稽核並公開結果。
台灣目前沒有專門的 AI 法規,但個資法中的「當事人得請求說明自動化決定的邏輯」原則,在 AI 應用中有可能被援引。金管會也有針對金融業 AI 應用的指引,要求模型決策過程要有可解釋性。2024 年行政院公布的「台灣 AI 基本法」草案中,也提到了 AI 系統的透明度和可課責性要求。
企業導入 XAI 的實務步驟
第一步:盤點你的 AI 應用,根據風險等級分類。高風險(影響人的權益、受法規管轄)需要嚴格的可解釋性,低風險(推薦文章、生成草稿)可以較寬鬆。
第二步:選擇適合的解釋技術。表格式資料用 SHAP(最成熟),影像用 Grad-CAM,文字用 LIME 或 Attention 視覺化。
第三步:建立解釋報告的範本。每次 AI 做出重要決策時,自動產生一份解釋報告,記錄:決策結果、主要影響因素、信心水準、建議的人工審核點。
第四步:訓練使用者理解解釋。給業務人員看 SHAP 圖不一定有用,需要把技術解釋轉換成業務語言。例如把「SHAP 值 -0.4」轉換成「負債比偏高是主要拒絕原因」。
第五步:建立回饋機制。讓使用者可以對 AI 的決策和解釋提出異議,並將異議納入模型改善的流程中。
安全與限制
解釋本身可能不準確。LIME 和 SHAP 產生的解釋是「近似」,不是模型真正的內部運作。特別是 LIME,它的局部線性近似在模型決策邊界附近可能不準確。把近似的解釋當成真理,可能比沒有解釋更危險。
解釋可能被操控。如果有人知道可解釋性工具的運作方式,理論上可以設計一個模型,讓它在被解釋時看起來很合理,但實際的決策邏輯完全不同。這被稱為 fairwashing——表面上看起來公平的解釋,掩蓋了實際的歧視性決策。學術研究已經示範了這種攻擊的可行性。
過度信任解釋的風險。當使用者看到一個「合理」的解釋,可能會降低對 AI 決策的質疑。例如 AI 說「拒絕貸款的主因是負債比過高」,使用者可能不再追問是否有其他不合理的因素在影響決策。解釋工具應該輔助人類判斷,而非取代人類判斷。
性能和可解釋性的取捨。通常越複雜的模型表現越好,但也越難解釋。在某些應用場景中(例如自動駕駛),你可能需要在「更好的表現」和「更好的可解釋性」之間做取捨。沒有一個放諸四海的標準答案,要看應用場景的風險等級和法規要求。
對 LLM 的可解釋性研究還在早期。目前的 XAI 技術主要針對傳統的機器學習模型(分類、迴歸)。對於像 ChatGPT 和 Claude 這樣的大型語言模型,為什麼它們會產生特定的回覆,現有的工具還沒辦法給出令人滿意的解釋。Anthropic 正在進行的 Mechanistic Interpretability 研究是目前最有前景的方向,他們成功辨識了 Claude 模型中的「特徵」(features),但整體而言仍處於研究階段,離可以在企業環境中應用還有很長的路要走。
隱私和可解釋性的衝突。有時候提供解釋本身就會洩漏敏感資訊。例如在醫療模型中,解釋某個病患被標記為高風險的原因,可能間接透露了其他病患的資料(模型從訓練資料中學到的模式)。需要在可解釋性和隱私保護之間取得平衡。
常見問題
可解釋 AI 是要讓 AI 解釋自己嗎?
分兩種情況。一種是用額外的工具(LIME、SHAP)來分析 AI 的決策,AI 本身不需要「解釋自己」。另一種是讓 AI 直接產生自然語言的解釋(例如 ChatGPT 說「我這樣回答是因為...」),但這種解釋不一定反映模型真正的運作方式,只是模型「編」出的合理化解釋。研究顯示,LLM 生成的自我解釋和真實的內部邏輯之間的相關性並不穩定,不能作為可靠的解釋依據。
企業導入 AI 一定需要可解釋性嗎?
取決於應用場景。如果 AI 用在低風險的場景(例如推薦文章、生成草稿),可解釋性不是優先考量。但如果用在會影響人的權益的場景(核貸、招聘、風控),可解釋性幾乎是法律和倫理上的硬需求。建議用風險矩陣來判斷:影響範圍大且可逆性低的決策,需要高可解釋性。
LIME 和 SHAP 哪個比較好?
各有優勢。LIME 更直觀、計算更快,適合快速了解單一預測的原因。SHAP 理論基礎更扎實、結果更一致,適合需要可靠性的正式分析和稽核報告。在企業環境中,建議用 SHAP 做正式報告和合規文件,用 LIME 做日常的快速檢查。兩者可以互補使用。
可解釋 AI 能防止 AI 歧視嗎?
可以幫助發現歧視,但不能自動防止。如果 SHAP 分析顯示模型的決策高度依賴郵遞區號(可能間接對應種族),這是一個警訊。但後續的修正——移除該特徵、重新訓練、重新驗證——仍然需要人類專家的介入。可解釋性是「診斷工具」,修正問題仍然需要人。
台灣企業需要關心可解釋 AI 嗎?
如果你的 AI 應用涉及個人資料處理或自動化決策(尤其是金融業),建議開始關注。台灣雖然還沒有專門的 AI 法規,但金管會和 NCC 等主管機關正在研擬相關規範。提前建立可解釋性的能力,可以降低未來合規的成本。而且,就算不考慮法規,可解釋性對內部稽核、客戶信任、和風險管理都有實際價值。
可解釋性工具有哪些免費的選擇?
SHAP(shap Python 套件,MIT 授權)、LIME(lime Python 套件,BSD 授權)、Captum(Facebook 開發,PyTorch 生態,BSD 授權)、InterpretML(Microsoft 開發,MIT 授權,整合了多種解釋方法)、Alibi(Seldon 開發,Apache 2.0 授權,提供反事實解釋和偵測 drift)。這些都是免費開源工具,企業可以直接使用。
可解釋 AI 和 Responsible AI 有什麼不同?
可解釋 AI 是 Responsible AI(負責任的 AI)的一個子領域。Responsible AI 還包括公平性(Fairness)、隱私保護(Privacy)、安全性(Security)、可靠性(Reliability)等面向。可解釋性是達成其他面向的基礎工具——你需要先理解模型在做什麼,才能判斷它是否公平、是否安全。
相關文章
參考資料
- Ribeiro et al.: "Why Should I Trust You?": Explaining the Predictions of Any Classifier (LIME)
- Lundberg & Lee: A Unified Approach to Interpreting Model Predictions (SHAP)
- EU AI Act 官方文件
- Anthropic Mechanistic Interpretability 研究
- Microsoft InterpretML 文件