一句話摘要

AI 導入的成功不能只看「省了多少時間」,還要看採用率、品質變化、安全事件數量、以及使用者滿意度。

為什麼需要多維度指標

只看效率指標的問題是:效率提升可能來自跳過安全審查、降低品質標準、或只有少數人在用。多維度指標才能反映 AI 導入的真實健康狀況。

飛飛在企業稽核時見過不少「數字漂亮但實際有問題」的案例。有一家公司報告說 AI 讓開發速度提升 40%,但仔細看才發現:只有 3 個工程師在用(採用率 15%)、上線後的 bug 數量增加了 25%、而且有兩次 AI 生成的程式碼洩漏了 API Key。

另一個案例是某家行銷公司,他們在季報中聲稱 AI 讓文案產量提升了三倍。但客戶滿意度調查卻下降了 12 個百分點。原因是大量 AI 產出的文案缺乏品牌調性,讀起來像是從教科書裡複製出來的。產量提升了,但品質和客戶信任卻同時下降。

這就是為什麼單一指標是不夠的。你需要一組互相制衡的指標,確保「效率」不是以犧牲其他面向為代價。

指標框架設計原則

在進入四個維度之前,先說明設計指標時的幾個原則:

指標要可量測。「員工對 AI 的感覺變好了」不是指標,「使用者滿意度從 3.2 升到 3.8」才是。每個指標都要有明確的數據來源和計算方式。

指標要有目標值和警戒線。光有數字沒有意義,你需要知道「多少算好、多少算差」。目標值可以參考業界標準或公司自己的基準線。

指標之間要平衡。不能只看採用率就忽略安全,也不能只看安全就不管效率。四個維度要一起看,任何一個維度出現嚴重問題都應該觸發檢視。

指標要跟角色掛鉤。CEO 看的指標和部門主管看的不一樣,部門主管看的和第一線員工又不一樣。設計指標時要考慮誰需要看什麼。

指標要能追蹤趨勢。一次性的快照沒有太大價值,重要的是方向和速度。月度變化比單月數字更有意義。

維度一:採用率

日活躍使用者比例(DAU / 總員工數)。目標值:導入 3 個月後達到 40%,6 個月後達到 60%。低於 20% 表示導入策略需要調整。

部門滲透率。各部門的使用比例。如果只有工程部門在用,其他部門沒跟上,表示培訓或工具選擇可能沒有覆蓋到非技術人員的需求。建議在儀表板上用長條圖呈現各部門的滲透率,目標是所有部門都達到至少 30%。

使用深度。分成三個層級——淺度使用(每週用 1-2 次,主要是簡單問答)、中度使用(每天使用,融入日常工作流)、深度使用(建立自動化流程或自訂工具)。健康的分布是淺度 30%、中度 50%、深度 20%。如果淺度使用超過 70%,代表員工只是在「試玩」而非真正融入工作。

棄用率。開始使用後又停止使用的比例。如果這個數字超過 30%,需要調查原因——通常是工具不符合期待、學習門檻太高、或主管不支持。調查方法可以用匿名問卷搭配一對一訪談,找出棄用的根本原因。

功能使用分布。追蹤員工使用了 AI 的哪些功能。例如在 ChatGPT 中,是只用文字對話、還是也用到了 Code Interpreter、上傳檔案、建立 GPTs?功能使用越多元,表示員工對工具的掌握度越高。

量測方法:大部分企業版 AI 工具有管理後台可以看使用數據。ChatGPT Team/Enterprise 提供 Admin Console,可以看到每位成員的使用量和活躍度。Claude Team 有 Usage Dashboard。如果是用 API,可以從 API 呼叫日誌統計,搭配 API Gateway(如 Kong、AWS API Gateway)來集中管理和記錄。如果是免費版工具,只能靠問卷調查(但準確度較低)。

採用率提升的實際做法:

設定「AI 辦公日」。每週指定一天鼓勵全公司用 AI 完成至少一項任務,並在 Slack/Teams 上分享成果。這個方法在飛飛協助的一家 150 人的科技公司中,三個月內將採用率從 22% 提升到 58%。

建立 Prompt 範本庫。很多員工不用 AI 是因為「不知道可以問什麼」。建立部門專屬的 Prompt 範本庫(放在 Notion 或 Confluence),降低使用門檻。

將 AI 使用融入既有流程。不要讓 AI 成為「額外」的工具,而是讓它成為既有工作流程的一部分。例如在 Jira 的 ticket template 中加入「AI 輔助分析」的欄位。

維度二:效率與品質

任務完成時間的變化。選定 3-5 個高頻任務,記錄導入 AI 前後的完成時間。注意要用中位數而非平均數,因為少數極端值會拉高平均。具體的選定方式:找出每個部門每天或每週固定要做的任務,例如工程部門的 code review、行銷部門的週報、客服部門的 FAQ 回覆。

效率指標的具體範例:

任務 導入前中位數 導入後中位數 變化率 備註
週報撰寫 90 分鐘 35 分鐘 -61% 3 個月後穩定
Code Review 45 分鐘/PR 30 分鐘/PR -33% Bug 數量不變
客服回覆 8 分鐘/件 3 分鐘/件 -63% CSAT 維持 4.2
合約審閱 4 小時 2 小時 -50% 仍需人工確認
市場報告 2 天 半天 -75% 需要交叉驗證

輸出品質的變化。根據任務類型設定品質指標。程式碼的品質指標:bug 數量、程式碼審查通過率、技術債增加速度、安全漏洞數量。文案的品質指標:客戶回覆滿意度、修改次數、品牌一致性評分。客服的品質指標:首次回覆解決率(FCR)、客戶滿意度評分(CSAT)、平均處理時間(AHT)。

返工率。使用 AI 產出的工作需要多少比例的修改才能通過審核。理想值是低於 30%。如果超過 50%,表示 AI 工具或 Prompt 策略需要調整。返工率也可以反映 Prompt 品質的變化趨勢,如果三個月後返工率仍然沒有下降,可能需要重新檢視培訓策略。

量測方法:在現有的專案管理工具(Jira、Linear、Asana)中加入標籤來區分「有使用 AI 輔助」和「未使用 AI 輔助」的任務,方便對比分析。具體做法是建立一個自訂欄位「AI 輔助」(是/否),要求團隊在完成任務時勾選。

成本效益分析。效率提升要轉換成金錢價值才有說服力。計算方式:節省的時間(小時)乘以員工平均時薪,減去 AI 工具的訂閱和管理成本。範例:50 位工程師每人每天節省 30 分鐘,月薪平均 8 萬台幣(時薪約 500 元),每月節省的價值約 50 x 0.5 x 22 x 500 = 275,000 台幣。ChatGPT Team 的費用是 50 人 x 25 美元 x 32 匯率 = 40,000 台幣。淨效益是每月 235,000 台幣。

維度三:安全指標

AI 相關安全事件數量。追蹤因為 AI 使用而產生的安全事件,包括:敏感資料上傳到 AI 平台、AI 生成的程式碼引入安全漏洞、AI 輸出包含不當內容、員工使用未經核准的 AI 工具(Shadow AI)。目標是逐月下降或維持在零。

安全事件嚴重性分級。不是所有安全事件都一樣嚴重,建議分成三級:

Level 1(低):使用未經核准的 AI 工具但未涉及敏感資料、在免費版 AI 中提問但內容不含機密。處理方式:記錄並提醒。

Level 2(中):將內部文件上傳到免費版 AI、AI 生成的程式碼包含已知漏洞但在 Code Review 中被發現。處理方式:記錄、通知主管、進行安全教育。

Level 3(高):客戶個資被上傳到 AI 平台、AI 生成的程式碼包含安全漏洞且已上線、AI 輸出包含其他客戶的敏感資訊。處理方式:啟動事件回應流程、通知資安團隊、評估是否需要通報主管機關。

政策遵循率。透過抽查或自動化工具檢查員工是否遵守 AI 使用政策。例如:是否使用核准的工具版本、是否在上傳前做資料分類、是否有人工審核 AI 的關鍵輸出。建議每月隨機抽查 10-15% 的 AI 使用記錄。

Shadow AI 偵測數量。透過 DLP(Data Loss Prevention)工具或網路日誌偵測未經核准的 AI 工具使用。這個數字如果很高,表示核准的工具不夠好用或員工不知道有核准的替代方案。常見的偵測方式包括:防火牆日誌中對 AI 平台的流量分析、端點管理軟體的應用程式使用記錄、以及 CASB(Cloud Access Security Broker)的 SaaS 使用報告。

量測方法:整合既有的 SIEM(Security Information and Event Management)系統,設定 AI 相關的告警規則。例如偵測到上傳到 openai.com 的流量中包含特定格式的資料(信用卡號、身分證字號)。具體的工具搭配範例:

偵測目標 工具選擇 預估成本
Shadow AI 使用 Netskope / Zscaler CASB 含在既有授權
資料外洩防護 Microsoft Purview DLP 含在 M365 E5
API Key 洩漏 GitGuardian / TruffleHog 免費版可用
程式碼漏洞掃描 Snyk / SonarQube 免費版可用
安全事件集中管理 Splunk / Elastic SIEM 依資料量

維度四:使用者滿意度

每季做一次匿名問卷,涵蓋以下面向:

工具好用程度(1-5 分)。如果低於 3.5,需要考慮換工具或加強培訓。低分的常見原因包括:回答品質不穩定、回應速度太慢、介面不直覺、與現有工作流整合不佳。

AI 輸出品質的信任程度(1-5 分)。如果低於 3,表示員工覺得 AI 的輸出不可靠,可能是工具選錯了或期待管理不夠。如果信任度太高(4.5 以上),反而要注意員工是否過度依賴 AI 而省略了人工驗證。

培訓和支援的充足程度(1-5 分)。如果低於 3,需要增加培訓資源或技術支援。可以進一步問「你最希望學到什麼」,根據回答設計下一季的培訓內容。

對工作流程影響的正面程度(1-5 分)。如果低於 3,表示 AI 反而增加了工作負擔,需要檢視流程設計。常見問題包括:多了一個需要檢查 AI 輸出的步驟但沒有減少其他步驟、AI 和既有工具之間需要手動複製貼上。

開放題:「AI 在什麼地方幫到你最多?」和「AI 在什麼地方讓你最困擾?」這兩個問題的答案通常比量化分數更有價值。

問卷設計的注意事項:問題不要超過 15 題,控制在 5-8 分鐘完成。提供中文介面,避免英文術語。每次問卷用相同的題目,方便追蹤趨勢。問卷工具可以用 Google Forms(免費)、Typeform(每月 25 美元起)、或 SurveyMonkey(每月 25 美元起)。

NPS(Net Promoter Score)也可以納入。問員工「你會不會推薦同事使用 AI 工具?(0-10 分)」。9-10 分是推薦者、7-8 分是中立者、0-6 分是批評者。NPS = 推薦者比例 - 批評者比例。正數表示正面,超過 30 算很好。

儀表板設計

建議用簡單的試算表或 Notion 頁面就好,不需要花大錢做 BI 系統。如果已經有 Power BI、Tableau、Looker 等工具的授權,當然可以用,但不要為了儀表板買新工具。

頂部放四個大數字(KPI 卡片):月活躍使用率、月均效率提升百分比、當月安全事件數、使用者滿意度均分。每個數字旁邊用箭頭標示跟上月的變化方向。

中間放趨勢圖:各指標的月度變化趨勢。重點看的是趨勢方向,而非絕對數值。建議至少看 6 個月的趨勢,3 個月以下的數據可能受季節或專案影響。

底部放行動項目:根據數據的異常值列出需要處理的事項。例如「行銷部門採用率從上月 45% 下降到 30%,需了解原因」。每個行動項目指派負責人和預計完成日期。

Notion 儀表板的具體建法:建立一個 Database,屬性包含「月份」「維度」「指標名稱」「數值」「目標值」「狀態」。用 Gallery View 做 KPI 卡片,用 Chart View(或嵌入 Google Sheets 圖表)做趨勢圖。每月初由負責人更新數據。

Google Sheets 版本的做法:建立四個分頁對應四個維度。每個分頁的第一列是月份,後續列是各指標的數值。用 SPARKLINE 函數在摘要頁面上顯示趨勢圖。用條件格式讓低於目標值的儲存格自動標紅。

每季檢視範本

每季召開 AI 導入檢視會議(1-2 小時),議程包括:

數據回顧(30 分鐘):四個維度的指標變化和趨勢分析。每個維度由負責追蹤的人報告。重點不是逐項唸數字,而是指出「值得注意的變化」和「需要行動的異常」。

成功案例分享(20 分鐘):2-3 個部門的具體成果分享。請實際使用者來分享,而非主管代為報告。重點放在「做了什麼」「省了什麼」「學到什麼」。

問題討論(30 分鐘):使用者回報的困難、安全事件的根因分析、政策需要調整的部分。這個環節要有結論和行動項目,不能只是「討論了但沒有結論」。

下一季計畫(20 分鐘):新工具評估、培訓計畫、政策更新。根據問卷的回饋和指標趨勢來決定優先順序。

會議參加者建議:AI 導入負責人、各部門代表(至少一位實際使用者)、資安代表、HR 代表(追蹤培訓效果)。高階主管建議每半年參加一次,而非每季都參加。

會後追蹤:行動項目在一週內建立追蹤清單(Jira、Asana、或簡單的試算表都可以),在下次會議前檢視完成狀況。

指標導入的時程建議

第一個月:選定 3-5 個核心指標(至少每個維度一個)、確認資料來源、建立簡單的追蹤機制(試算表即可)。不需要追求一開始就有所有指標。

第二到三個月:開始蒐集數據,建立基準線。這段期間的數據可能波動很大,不要急著下結論。同時發出第一次使用者問卷。

第四到六個月:開始看趨勢。第一次召開正式的季度檢視會議。根據前三個月的經驗調整指標定義和量測方式。

六個月後:指標體系穩定運作。可以開始考慮加入更細緻的指標(例如按部門或按任務類型細分)。可以開始做跨部門的對比分析。

常見的量測錯誤

只看平均值不看分布。「平均效率提升 30%」聽起來很好,但如果只有兩個人提升了 150% 而其他人都沒有變化,這個數字就有誤導性。除了平均值,也要看中位數、四分位數、和分布圖。

把相關當因果。AI 導入後銷售額提升了,不代表是 AI 的功勞。可能同時間做了其他改善。要盡量控制變因,或至少用 A/B 對照(有用 AI vs 沒用 AI 的團隊)來比較。

選擇性報告。只報告好看的指標,隱藏不好看的。這在向上報告時特別容易發生。建議制度化四個維度都要報告,不能挑著報。

指標設定後就不調整。業務環境和 AI 工具都在變化,指標的定義和目標值至少每半年檢視一次。

安全考量

指標數據本身的安全。AI 使用日誌可能包含敏感資訊(誰用了什麼工具處理了什麼類型的資料),這些日誌的存取權限需要管控,不能讓所有人都看得到。建議儀表板分成兩個版本:公開版(只有聚合數據,如部門採用率)和管理版(包含個人使用記錄,只有特定管理者可以看)。

避免指標驅動的不良行為。如果太強調採用率,員工可能會為了達標而不必要地使用 AI;如果太強調效率提升,員工可能會跳過品質審查。指標要平衡,不能只追求單一維度。績效考核中不要把 AI 使用量當成 KPI,而是把 AI 輔助的工作成果當 KPI。

匿名問卷的真正匿名。如果問卷收集了部門、職位等資訊,在小團隊中可能可以推斷出回覆者的身份。建議:5 人以下的部門不單獨統計、只問必要的分類資訊、使用第三方問卷工具而非公司內部系統。確保匿名性才能得到真實的回饋。

日誌留存與合規。AI 使用日誌的留存期限要符合公司的資料保留政策和法規要求。如果日誌中包含個人資料(如員工使用了 AI 處理客戶個資的記錄),留存和處理方式要符合個資法的規定。

常見問題

導入初期指標不好看怎麼辦?

正常。導入前三個月效率通常會先下降再上升(學習曲線),採用率也需要時間爬升。關鍵是看趨勢方向,如果第三個月比第一個月好,就在正確的軌道上。飛飛建議在導入前跟利害關係人溝通好「前三個月是投資期」,避免因為短期數字不好看就被質疑導入決策。

怎麼量化「品質提升」這種軟指標?

用代理指標。文案品質用「客戶修改要求次數」、程式碼品質用「上線後 bug 回報數」、客服品質用「客戶滿意度評分」。不需要精確到小數點,能看出趨勢就夠了。另一個方法是「盲測」:讓主管或客戶評分一組混合了 AI 輔助和非 AI 輔助的作品,看有沒有差異。

安全事件數量目標是零嗎?

理想上是零,但實務上難以達到。更重要的指標是「嚴重安全事件的數量」和「事件被發現到處理的時間」(Mean Time to Resolve, MTTR)。輕微違規(例如用個人帳號問了一個不涉及敏感資料的問題)可以記錄但不需要當成重大事件處理。目標是讓 Level 3 事件維持在零,Level 2 事件每季不超過 2 次。

小公司需要做這麼詳細的追蹤嗎?

不需要全做,但至少追蹤三個指標:誰在用(採用率)、用了之後效果如何(效率)、有沒有安全問題(安全事件)。一個月花 30 分鐘整理一次就夠了。10 人以下的團隊用一張 Google Sheet 就能搞定。

指標多久更新一次?

採用率和安全事件建議每月追蹤。效率和品質指標每季追蹤即可(需要足夠的樣本量才有意義)。使用者滿意度每季做一次問卷。但如果你的 AI 工具管理後台有即時數據,建議設定自動化報告,每週寄一封摘要給 AI 導入負責人。

不同部門的指標應該用同一套標準嗎?

核心指標的維度(採用率、效率、安全、滿意度)應該一致,但每個維度下的具體指標可以根據部門調整。例如工程部門的效率指標是 Code Review 時間,行銷部門的效率指標是文案產出數量。統一框架但允許部門自訂細節,是最務實的做法。

指標數據應該公開給全公司還是只給管理層看?

建議分層公開。聚合層級的數據(全公司採用率、平均滿意度)公開給全公司,有助於建立透明度和推動使用。部門層級的數據給各部門主管。個人層級的使用記錄只有直屬主管和 AI 導入負責人可以看。避免讓指標數據變成「監控工具」,否則員工會產生抵觸心理。