一句話說明
AI 試點專案是在小範圍驗證 AI 能不能解決特定問題,用數據決定要不要擴大導入。
為什麼不能直接全面導入
飛飛見過太多企業花了半年評估、談好廠商、簽好合約,然後一次在全公司推行 AI 工具——結果三個月後使用率剩不到 10%。
問題通常出在使用情境沒有被驗證過,工具本身反而是次要因素。行銷部覺得 AI 寫文案很好用,但客服部發現 AI 回覆客戶的語氣太生硬、法務部擔心 AI 生成的合約條款有錯。每個部門的需求和限制不同,不可能一個方案通吃。一家台灣的中型製造業告訴飛飛,他們花了 200 萬導入一套 AI 客服系統,上線後發現產品規格的查詢準確率只有 60%,因為產品型號的命名規則太複雜,AI 模型無法正確理解。如果先做試點,這個問題在花 200 萬之前就能發現。
試點專案的價值在於用小成本驗證假設:這個 AI 工具在這個情境下能不能帶來效益?風險能不能控制?員工願不願意用?試點的核心精神是「用數據說話」,而非依賴感覺或少數人的意見做決策。試點結束後,你應該能拿出具體的數字來支持「繼續」或「停止」的決定。
還有一個常被忽略的價值:試點過程中產出的知識和經驗,對後續的全面導入幫助非常大。試點團隊整理出來的有效 Prompt、工作流程、常見陷阱、審核檢查點,都是其他團隊可以直接使用的資產。如果跳過試點直接全面導入,每個團隊都要從零開始摸索,組織的學習成本會非常高。
試點的範圍怎麼定
建議用「1-1-90」原則:1 個團隊、1 個使用場景、90 天。這個原則的邏輯是:範圍越小,變數越少,越容易歸因。如果同時讓三個團隊試三個場景,90 天後你很難判斷是工具的問題、場景的問題、還是團隊的問題。
選團隊的標準:找一個對 AI 有興趣、主管支持、而且日常工作有明確痛點的團隊。不要選最忙的團隊(沒時間學新工具),也不要選最保守的團隊(抵觸變化)。理想的試點團隊有三個特徵:第一,團隊規模在 5-15 人之間,太小的話數據不夠有統計意義,太大的話管理複雜度會增加;第二,主管本人對 AI 有正面態度,而且願意投入時間參與(每週至少一小時),而非只是口頭支持;第三,團隊有量化的工作產出指標,例如每天處理多少張工單、每週產出多少篇報告。沒有量化指標的團隊很難評估試點效果。
選使用場景的標準:高頻率(每天或每週都要做)、有可量化的產出(寫了多少報告、回覆了多少客訴、審查了多少程式碼)、失敗的代價可控(不是直接面對客戶的關鍵決策)。飛飛建議用一個簡單的 2x2 矩陣來評估場景:橫軸是「AI 的預期效益」(高/低),縱軸是「失敗的風險」(高/低)。選擇落在「高效益、低風險」象限的場景。
好的試點場景舉例:
客服團隊用 AI 草擬客訴回覆信件(人類審核後才寄出)。這個場景的好處是:客訴回覆是高頻率任務、品質有客戶滿意度可以衡量、有人類審核作為安全網。一家台灣的電商公司在試點中發現,AI 草擬的客訴回覆可以將回覆時間從平均 25 分鐘縮短到 12 分鐘,而且客戶滿意度沒有下降。
工程團隊用 AI 輔助 Code Review(AI 抓出潛在問題,工程師決定要不要修)。這個場景適合試點是因為 Code Review 是工程師的日常工作、AI 的建議可以被完整追蹤(哪些被採納、哪些被忽略)、而且最終決策權在工程師手上。
行銷團隊用 AI 生成社群貼文草稿(行銷主管審核後發布)。社群貼文的產出頻率高、品質可以用互動率衡量、而且即使品質稍有波動,影響也是短期的。
不適合試點的場景:AI 自動核准貸款申請(風險太高)、AI 自動回覆客戶(沒有人類審核)、AI 取代整個部門的工作(範圍太大、政治太複雜)。任何涉及法律責任、財務決策、或人身安全的場景,在第一次試點時都應該避開。
試點前的準備工作
試點開始前有幾件事必須先完成,跳過這些準備直接開始,通常會導致試點在前兩週就陷入混亂。
工具選擇和帳號準備。根據試點場景選擇合適的 AI 工具,申請企業版帳號,確認所有試點成員都能正常登入和使用。企業版帳號的申請和審批在很多台灣企業要走採購流程,可能需要 2-4 週的時間,提前安排。
資安審查。確認選擇的 AI 工具符合公司的資安政策。需要確認的項目包括:資料是否會被用於模型訓練、資料儲存在哪個地區、是否支援 SSO 和 MFA、是否通過 SOC 2 或 ISO 27001 認證。如果公司有資安團隊,讓他們提前做工具的安全評估。
基線數據蒐集。在試點開始前蒐集至少兩週的基線數據,用來和試點期間的數據做對比。例如:客服團隊目前的平均回覆時間、工程團隊每次 Code Review 花的時間、行銷團隊每週產出多少篇社群貼文。沒有基線數據就無法量化試點的效果。
培訓。在試點正式開始前,安排 4-8 小時的培訓,教試點成員怎麼使用工具、怎麼寫有效的 Prompt、以及公司的 AI 使用政策(哪些資料可以上傳、哪些不行)。培訓的品質直接影響試點的結果,如果員工不知道怎麼用工具,試點的數據反映的是「培訓不足的效果」而非「AI 工具的效果」。
溝通計畫。告知相關利害關係人(其他部門主管、IT、資安、法務)試點的範圍和時程。避免試點進行到一半,突然有人跳出來說「我不知道你們在做這個」而要求暫停。
成功標準怎麼定
試點開始之前就要定好成功標準,不然 90 天後會陷入「感覺有用但說不清楚哪裡有用」的困境。成功標準應該在試點開始前由專案負責人、試點團隊主管、和高層主管一起確認並書面記錄。
效率指標:處理同一件任務的時間減少多少。例如客服回覆一封客訴信原本平均要 25 分鐘,用 AI 草擬後縮短到 15 分鐘。目標設在減少 20% 以上算成功。效率指標的測量方式要事先確定:是讓員工自己計時、用工具的時間戳推算、還是用抽樣觀察的方式。不同的測量方式會得到不同的結果,飛飛的經驗是員工自己計時通常會高估節省的時間。
品質指標:AI 輔助後的產出品質有沒有維持或提升。例如 AI 草擬的客訴回覆,客戶滿意度分數有沒有下降。品質不能犧牲。品質指標的設定要根據具體場景而定:客服看客戶滿意度分數、行銷看內容的互動率、工程看程式碼的 bug 率。如果品質下降了,即使效率提升了,試點也應該被視為失敗——或至少需要大幅調整流程。
採用率:試點團隊的成員中,有多少人在 90 天後還在持續使用。如果只有一兩個人在用,其他人都放棄了,就算效率提升了也代表可擴展性有問題。目標:70% 以上的成員每週至少使用 3 次。採用率低通常有三個原因:工具不好用(需要換工具)、培訓不足(需要加強培訓)、或者 AI 在這個場景下確實幫助不大(需要換場景)。
安全指標:試點期間有沒有發生資料外洩、AI 幻覺造成的錯誤、違反公司政策的行為。這些是底線,一次都不能有。安全指標要搭配稽核機制來追蹤,而非事後才去調查。
成本指標:AI 工具的訂閱費用、員工學習的時間成本,對比節省的效率,算出初步的 ROI。成本指標在試點階段通常不會太漂亮,因為學習成本在試點初期會比較高。飛飛建議把 90 天分成三個階段看:前 30 天(學習期)、中間 30 天(適應期)、後 30 天(穩定期)。ROI 的計算用後 30 天的數據會比 90 天平均更能反映真實效果。
90 天試點的時程規劃
第 1-2 週:啟動期。完成帳號設定、培訓、基線數據確認。正式開始使用 AI 工具。每天用 Slack 或 Teams 的頻道收集使用心得和問題。
第 3-4 週:磨合期。這個階段員工會遇到很多「AI 做不到」的情況,挫折感比較高。專案負責人要密集和團隊溝通,幫助他們調整 Prompt 和工作流程。每週至少一次 30 分鐘的小組討論,分享技巧和解決問題。
第 5-8 週:穩定期。使用模式開始穩定,效率數據開始有參考價值。這時候要開始追蹤正式的指標,而非只看使用感受。同時注意有沒有人開始停止使用——如果有,了解原因。
第 9-10 週:深化期。鼓勵員工嘗試更進階的用法,例如串接工作流程、建立 Prompt Template。這個階段的目的是探索 AI 的天花板在哪裡。
第 11-12 週:收斂期。蒐集最後的數據、整理成效報告、準備 Go/No-Go 的決策材料。讓試點團隊寫下他們整理出來的 Prompt、工作流程、和建議事項,作為後續推廣的知識庫。
第 13 週:決策週。用 Go/No-Go 框架做正式決策,並規劃下一步。
Go/No-Go 決策框架
90 天後,用以下框架決定下一步。這個決策不應該只由一個人做,建議由專案負責人準備報告,由試點團隊主管、IT 主管、資安主管、和至少一位高層主管組成的小組做決定。
Go(擴大導入):效率提升達標、品質沒有下降、採用率超過 70%、沒有安全事件、ROI 為正。達到 Go 的門檻通常表示 AI 工具在這個場景下已經被驗證有效,可以規劃向類似團隊擴展。Go 的決定應該附帶擴展計畫的大綱,包括時程、預算、和培訓需求。
Conditional Go(有條件擴大):大部分指標達標,但有一兩個需要調整。例如效率提升了但品質稍有下降——需要調整 Prompt 或加強審核流程後再擴大。Conditional Go 的關鍵是明確定義「條件」是什麼、誰負責滿足這些條件、以及時限是多久。飛飛見過很多 Conditional Go 最後變成無限期延宕,因為沒有人追蹤條件是否被滿足。
No-Go(暫停或放棄):多數指標沒達標、有安全事件、採用率低於 30%、ROI 為負。記錄失敗原因,評估是工具選錯、場景選錯、還是組織準備度不足。No-Go 不代表 AI 對這個組織沒有用,只代表這次的組合(工具 x 場景 x 團隊)沒有成功。失敗分析的品質決定了下次試點的成功率。
Pivot(轉向):原本的場景不行,但試點過程中發現了更好的使用場景。重新定義範圍,開始新的 90 天試點。Pivot 在實務中很常見。飛飛曾經協助一家企業,原本試點的場景是用 AI 做客服回覆,效果不好。但試點過程中客服主管發現 AI 用來整理客訴類別和趨勢分析非常好用——這個意外發現後來成為該企業最成功的 AI 應用。
從試點到全面導入
試點成功不代表可以直接複製到全公司。擴大的過程有幾個關鍵步驟需要注意。
第一波擴大:選 2-3 個和試點團隊情境類似的團隊。讓試點團隊的成員擔任內部教練,比外部訓練更有效,因為他們能用自己的實際經驗回答「這個情境可以用嗎」的問題。第一波擴大的目的是驗證試點的成功是否可以複製。如果第一波的三個團隊中有兩個達到類似的效果,可以增加信心繼續擴大;如果只有一個成功,需要分析差異在哪裡。
建立內部知識庫:把試點期間整理出來的有效 Prompt、工作流程、常見問題整理成文件。知識庫的格式不需要太正式,用公司內部的 Wiki 或 Notion 就好。關鍵是讓新加入的團隊不需要從零開始,可以直接參考前人的經驗。知識庫應該包含:各場景的 Prompt Template、常見問題的解決方法、AI 做不到的事情清單(避免新團隊踩同樣的坑)。
調整政策:根據試點經驗更新 AI 使用政策。試點期間發現的灰色地帶(例如某類資料原本不確定能不能上傳,試點後確認可以)要納入政策。政策更新應該在擴大導入之前完成,不要讓新團隊在模糊的政策下開始使用。
監控指標:擴大後繼續追蹤效率、品質、採用率、安全事件。全面導入的數據通常不會和試點一樣好,因為試點團隊是挑選過的。預期效率提升會打個七八折。飛飛的經驗是,試點團隊的效率提升如果是 30%,全面導入後大約是 20-25%,這是正常的。
常見的失敗模式
選錯試點團隊:選了老闆最關注的核心業務團隊,壓力太大,試點變成政治秀。試點應該選「可以安全失敗」的團隊。飛飛見過一個案例:某企業的 CEO 親自指定業務部門做 AI 試點,CEO 每週都來問進度,業務部門壓力大到不敢回報任何問題,試點報告全部是正面數據。結果全面導入後才發現一堆問題。
沒有定成功標準就開始:90 天後大家的感受不同,有人覺得有用,有人覺得沒用,主管無法做決定。更糟的情況是,因為沒有明確標準,決策變成了「聲音最大的人」或「老闆的直覺」決定。
工具選對了但培訓不夠:買了 Copilot Business 但只開了一場 30 分鐘的說明會,工程師不知道怎麼寫好的 Prompt,覺得 AI 生成的程式碼品質很差就不用了。培訓不足是試點失敗最常見的原因之一。
忽略安全和合規:試點期間覺得「反正只是試試看」,沒有設資料使用的限制,結果員工把客戶名單貼進免費版 ChatGPT。這類事件一旦發生,不但試點會被叫停,還可能影響整個組織對 AI 的信任。
試點成功但沒有記錄:試點結束後沒有把有效的做法文件化,擴大時其他團隊要從零開始摸索。飛飛見過很多企業的試點成果只存在試點團隊成員的腦袋裡,當這些人離職或調部門,所有的知識就消失了。
試點時程太短或太長:30 天太短,員工剛剛學會使用就結束了,數據沒有參考價值。180 天太長,試點變成常態,失去了「快速驗證並決策」的意義。90 天是大部分場景的甜蜜點。
安全與限制
試點不是免死金牌。即使是小範圍試點,資料安全的要求一樣不能降低。試點期間使用的 AI 工具必須符合公司的資安政策。試點成員在使用前應該簽署 AI 使用同意書,確認他們了解哪些資料可以上傳、哪些不行、違反規定的後果是什麼。
90 天不夠評估所有風險。某些風險(例如 AI 輸出的長期品質下降、員工對 AI 的過度依賴)需要更長的觀察期。試點只能驗證短期效果。飛飛建議在全面導入後的六個月做一次深度回顧,檢視是否出現了試點期間沒有發現的問題。
試點的結果有選擇偏差。因為你選的是最適合的團隊和場景,試點的成功率會比全面導入高。做決策時要考慮這個偏差。飛飛建議在 Go/No-Go 報告中明確標注「試點條件」(哪些因素使得這個試點比一般情況更容易成功),讓決策者有更完整的資訊。
試點期間的智慧財產權問題。如果員工用 AI 生成的內容(文案、程式碼、設計)作為公司的產品或服務,需要確認 AI 工具的服務條款中關於智慧財產權的規定。大部分企業版 AI 工具(ChatGPT Enterprise、Claude for Business)的條款中,AI 生成的內容著作權歸使用者所有,但免費版的條款可能不同。
常見問題
試點要花多少錢?
看工具選擇。如果用 ChatGPT Team(每人每月約 25 美元)給 10 人團隊用 3 個月,工具成本大約 750 美元。加上員工學習時間和專案管理的隱形成本,總預算通常在 5 萬到 20 萬台幣之間。如果使用的是 API 計費的工具,成本會根據使用量浮動,但可以設定用量上限來控制預算。
試點失敗了怎麼辦?
先分析原因:工具不對(換工具重試)、場景不對(換場景重試)、團隊準備不足(加強培訓後重試)、組織文化抵觸(先解決文化問題)。試點的價值就在於用小成本發現問題,失敗本身就是收穫。飛飛建議把每次試點的失敗分析整理成文件,包含:嘗試了什麼、結果如何、為什麼失敗、下次應該怎麼做。這份文件對組織的長期 AI 策略很有價值。
誰應該負責管理試點專案?
需要一個專案負責人(不一定是全職),通常是該團隊的主管或資深成員。這個人要負責收集數據、追蹤指標、協調問題。IT 和資安團隊提供技術和安全支援。飛飛建議專案負責人每週至少花 3-5 小時在試點管理上,包括和團隊成員溝通、整理數據、解決問題。如果專案負責人本身工作太忙,試點很容易因為沒人管理而失焦。
可以同時在多個團隊試點嗎?
如果資源充足可以,但每個試點應該獨立追蹤指標。同時進行太多試點會分散注意力,建議最多三個平行試點,而且最好是不同類型的使用場景,這樣可以更快了解 AI 在哪些情境下有效。平行試點的管理需要一個跨團隊的協調人,確保各試點的經驗可以互相分享。
試點期間員工用個人帳號怎麼辦?
這是 Shadow AI 的問題。試點開始前就要明確告知:只能用公司提供的帳號和工具。同時確保公司提供的工具足夠好用——如果公司版比免費版還難用,員工一定會用個人帳號。飛飛在推動試點時通常會問試點成員:「你覺得公司提供的工具和你自己用的免費版相比如何?」如果答案是「公司版沒有比較好」,就需要重新評估工具選擇。
試點結果如何向高層報告?
用數據說話。報告的結構建議:一頁摘要(結論和建議)、兩到三頁詳細數據(效率、品質、採用率、安全、成本)、一頁下一步計畫。避免用太多技術術語,高層關心的是「花了多少錢」、「效果如何」、「接下來怎麼做」。飛飛建議把報告控制在四頁以內,附上一張清楚的 Go/No-Go 決策摘要表。
延伸閱讀
- AI 治理框架:從政策到實踐的落地指南
- 企業 AI 就緒度評估:你的公司準備好了嗎?
- Shadow AI 是什麼?員工私用 AI 的風險管理