一句話解釋

資料要不要給 AI 用,判斷的重點在於這份資料外洩或被模型記住之後會造成什麼後果,重要程度只是參考,實際後果才是關鍵。

白話解釋

傳統的資訊安全講資料分類,通常是為了控制誰有權限讀取哪些檔案,重點放在存取控制。AI 工具出現之後,多了幾個傳統資料分類沒處理過的風險,對話內容可能被服務商拿去訓練下一代模型,平台可能把對話記錄留存一段時間,即使自己刪除也不代表資料真的消失,某些設定下,一個使用者輸入的內容甚至可能透過模型的記憶功能影響到其他使用者看到的結果。

這代表一份文件過去只要不外流出公司就算安全,現在多了一層問題,這份文件有沒有可能透過 AI 工具的後台流出去,即使沒有人主動外洩。資料分類因此需要一套專門的規則,處理這份資料能不能給 AI 看這個問題。

四級分類架構

第一級:公開,可以給任何 AI 工具

已經公開發布的內容、公開文件、開源程式碼、行銷素材、公司網站上看得到的資訊。這類資料本來就對外公開,就算被 AI 模型學走或被其他使用者看到,也不會產生新的風險。

適用範圍是任何 AI 工具,包含免費版的 ChatGPT、Claude、Gemini。

第二級:內部,限企業方案

內部文件、會議紀錄、還沒對外公布的產品規劃、不含敏感邏輯的原始碼。這類資料外流不會馬上造成重大損害,但公司通常不希望被競爭對手看到,也不希望被拿去訓練別家公司都能受益的模型。

適用範圍是有簽約資料保留條款的企業方案,例如 ChatGPT Team 或 Enterprise、關閉資料訓練選項的 Claude Team、Gemini Enterprise。使用前要確認方案的資料使用條款寫明不會用來訓練模型,並確認公司帳號的後台設定裡相關選項已經關閉,不要只相信預設值。

第三級:機密,僅限本地部署或不用 AI

客戶名單、財務報表、還沒公開的策略文件、併購相關資訊、內部薪資資料。這類資料一旦外洩,後果是實質的商業損失或法律責任。

適用範圍是本地部署的開源模型,例如透過 Ollama 在公司內部網路跑 Llama 或 Qwen 這類模型,資料不會離開公司的機器。如果沒有本地部署的能力,這一級的資料就不該給任何 AI 工具處理,寧可用傳統方式手動整理。

第四級:限制,不用 AI

個人身分資訊,例如身分證字號、護照號碼、病歷、訴訟中的法律文件、受出口管制或國安相關規範限制的資料。這類資料的處理方式通常已經有法規明確規定,額外把它送進任何 AI 工具都是在增加不必要的風險,即使是本地部署也要先確認公司的法遵政策是否允許。

平台比較

以下整理常見 AI 服務在資料訓練與保留政策上的大致差異,實際條款以各服務當下公告的使用條款和隱私權政策為準,訂閱方案內容也會隨時間調整,重大決策前務必直接查證官方說明。

ChatGPT 免費版與 Plus 個人版,預設會把對話內容用於改善模型,使用者可以在設定裡關閉這個選項,但關閉之後仍要留意企業內部是否禁止在個人帳號上處理公司資料。ChatGPT Team 與 Enterprise 方案在合約中明訂不會將對話內容用於訓練模型,並提供資料保留天數的設定。

Claude 免費版與 Pro 個人版,Anthropic 的政策是預設不將一般消費者對話用於訓練模型,但實際保留期限與例外情況,例如使用者主動提供意見回饋的內容,需要查閱當下的隱私權政策確認。Claude Team 與 Enterprise 方案額外提供資料保留設定與更明確的合約保障,適合處理公司內部資料。

Gemini 免費版,使用 Google 帳號的一般消費者版本,對話可能被人工審閱用於改善服務,除非另外調整設定。Gemini Advanced 屬於個人訂閱,資料處理政策與免費版接近。企業要處理內部資料建議使用 Google Workspace 搭配的 Gemini 企業方案,合約中會涵蓋資料不用於訓練的保證。

這張比較真正該記住的一點是,同一家服務商的不同方案,資料保護的等級可能差很多,付費版不代表自動安全,要實際確認合約條款和後台設定。

混合分類情境的處理

實務上常常遇到一份資料同時包含不同等級的內容,比如一份營運報告裡有內部策略分析,也附了幾個客戶的真實姓名和消費紀錄作為案例。

處理方式是先把資料拆開,而不是整份丟給 AI 再期待它不會記住敏感部分。具體做法,先把客戶姓名、聯絡方式這類可識別個人的欄位替換成代號或直接刪除,只保留分析所需的匯總數字,把處理過的版本送進企業方案的 AI 工具,原始的完整資料留在公司內部系統處理,不假手 AI。

如果去識別化的工作量太大,或是報告裡的個資是分析的核心而無法拆開,這種情況下就回到第三級或第四級的規則,不要因為報告的大部分內容看起來是內部等級,就把整份文件送出去。

台灣情境的法規考量

個人資料保護法對於蒐集、處理、利用個人資料有明確規定,把含有客戶個資的文件貼進 AI 工具,如果因此造成個資外洩或被用於原本蒐集目的以外的用途,公司可能要負相關的法律責任。金融業另外受金管會的監理規範約束,對客戶資料、交易紀錄的處理方式通常有更嚴格的要求,導入 AI 前建議先跟法遵或資安部門確認是否符合現行的內控規範。

公部門與委外廠商如果在專案中使用 AI 工具處理政府資料,需留意各機關自訂的 AI 使用規範,部分機關明確要求機密等級以上的公文不得使用雲端 AI 服務處理,這類規定通常比一般企業的內規更嚴格,執行前要以主管機關的公告為準。

決策流程

判斷一份資料能不能給 AI,可以照著這個順序問自己。

這份資料已經公開了嗎,是的話任何 AI 工具都可以用,不是的話往下一題。

這份資料外洩會不會造成實質損害,比如財務損失、法律責任、客戶信任受損,不會的話屬於內部等級,用企業方案處理,會的話往下一題。

這份資料是不是包含個人身分資訊、病歷或法律文件,是的話不要用 AI 處理,維持人工作業,不是的話屬於機密等級,只能用本地部署的模型處理,或先做去識別化再考慮企業方案。

這個流程沒辦法涵蓋所有邊界情況,遇到不確定的資料,選擇比較保守的分類等級,寧可多花一點人工時間,也不要事後才發現資料外洩。

常見錯誤

把整份資料庫的匯出檔案貼進 AI 工具找規律或做摘要,這種做法常見於分析人員想省事,卻沒意識到資料庫裡通常混雜了各種等級的欄位,一次貼上去等於把所有敏感欄位都送出去。

在 Prompt 裡直接貼 API 金鑰或密碼,方便 AI 幫忙除錯程式碼。這類憑證一旦進入任何雲端 AI 服務的對話紀錄,就應該視為已經外洩,正確做法是先撤銷並重新產生金鑰,再把程式碼裡的憑證換成佔位符之後才貼給 AI 看。

上傳含有客戶姓名的合約請 AI 幫忙檢查條款,即使目的只是想確認法律用語,合約裡的客戶身分資訊已經構成個資,應該先把姓名等欄位遮蔽掉,只保留需要檢查的條文內容。

安全與限制

這套四級分類架構是一個實用的起點,但有幾個地方需要留意。

服務商的政策會變動,這篇文章列出的平台比較僅供參考,實際使用前一定要查閱該服務當下的隱私權政策與服務條款,不同地區、不同方案版本的條款也可能不同。

本地部署不等於絕對安全,把模型架在公司內部網路能避免資料離開公司環境,但仍然要處理伺服器本身的存取控制、備份資料的保護、誰有權限查詢這些基本的資安措施,不能因為是本地部署就忽略基本防護。

分類制度需要搭配教育訓練才有效,寫了規則但沒有讓同仁理解為什麼要遵守,實務上還是會有人為了方便把資料貼進不合規的工具,這部分需要搭配公司內部的政策宣導與定期提醒。

知識檢測

讀完文章後,測試一下你對這個主題的理解。

常見問題

免費版的 AI 工具真的完全不能用在工作上嗎?

可以用在公開等級的資料上,比如幫忙潤飾一篇已經打算公開的文章、查詢公開的技術文件。問題出在把內部或機密資料貼進免費版工具,這才是需要避免的行為。

企業方案關閉訓練選項之後,資料就完全安全嗎?

關閉訓練選項降低了資料被用於訓練模型的風險,但資料仍然會經過服務商的伺服器處理,仍然存在傳輸和儲存過程中的一般資安風險,也可能因為合約的保留期限而在一段時間內留存在服務商的系統裡。安全程度提高了,不代表零風險。

去識別化之後的資料還算機密等級嗎?

如果去識別化做得徹底,確實無法從殘留內容反推出個人身分,通常可以降級處理。但去識別化很容易做得不夠完整,比如刪掉姓名卻留下很獨特的職稱加上部門加上事件時間,組合起來一樣能反推出是誰,判斷時要保守一點。

本地部署模型需要很高的技術門檻嗎?

用 Ollama 這類工具在一台夠力的電腦或內部伺服器上跑開源模型,技術門檻比大家想像的低,一般 MIS 或工程師背景的人員可以在幾小時內架起來。挑戰通常在於模型能力跟雲端的商用模型還有差距,需要評估這個落差對實際任務是否可以接受。

誰該負責制定公司的 AI 資料分類規則?

理想上由資安或法遵部門主導,但需要業務單位一起參與,因為只有業務單位知道哪些資料在日常工作中真的會被拿去問 AI。純粹由資安部門關起門來訂規則,容易訂出不符合實際工作情境、大家會直接繞過的規定。

相關文章

參考資料