不想把敏感資料餵給 public AI?我會先做這一道去識別關卡
最近幾個朋友問我,會不會把公司文件、客戶資料,甚至自己的醫療或財務紀錄貼進 ChatGPT 一類的 public AI 做分析。我的答案很簡單:不是不能用,而是不能就這樣複製貼上。
Public AI 的分析力確實很強,但使用它的同時,我們也把資料交到了第三方服務手上。它可能會被保留、被用來改進模型、被外包商接觸,也可能因為安全漏洞或人為失誤而外洩。AI agent 的風險更高,因為它可能連結你的電郵、檔案庫或資料庫,代替你執行動作。NIST 與 FTC 都提醒過,把內部文件或客戶資料交給 AI 服務,會帶來隱私與保密風險。
所以我習慣先把資料分級,再決定用哪一種 AI,而不是讓方便凌駕安全。
第一步:把資料分三級,決定 AI 環境
我會用一個很簡單的框架來分類資料。重點不是「用不用 AI」,而是「在哪一種環境下用」。
| 資料類型 | 建議使用的 AI 環境 |
|---|---|
| 公開或非敏感資訊 | Public AI 工具,一般可接受 |
| 內部但低風險資料 | 經企業核准、有存取控制的 AI |
| 商業機密、合約、策略文件 | 私有 API / 企業部署,附帶合約與技術保護 |
| 高度敏感或受規管資料 | 自架模型、私有雲,或徹底匿名化後再分析 |
| 密碼、API key、私鑰、核心商業機密 | 不要提供給任何外部模型 |
一個我經常提醒自己的規則是:如果你不敢把這份資料寄給一位不認識的外包顧問,就不要把它貼進未經核准的 public AI。
第二步:去識別,讓分析繼續有用、但資料不再認人
很多時候我們需要 AI 幫忙分析的是「模式」和「結構」,而不是某個人叫什麼名字、帳號是幾號。這時候,去識別就是一個很低門檻但很有用的中間層。
做法是先把原始資料放進一個「去識別閘道」,把能認出個人或組織的細節換掉,再把乾淨後的版本送去 AI。分析完成後,如果需要,才在內部環境把識別碼對照回來。
我會考慮的幾個工具
【待查證:各工具的官方文件、最新功能與服務條款會不時更新,部署前請與資訊安全或法務團隊核實。】
| 工具 | 最適合的資料 | 特點與注意 |
|---|---|---|
| Microsoft Presidio | 電郵、合約、對話紀錄、CSV/JSON、經 OCR 後的影像 | 開源、可在本機或私有伺服器運行,支援偵測、遮罩、雜湊、加密,也能自訂公司內部識別碼。但自動偵測不保證找齊所有敏感項目,仍需人工覆核。 |
| ARX | 試算表、客戶或員工表格、調查數據 | 有圖形介面的開源軟件,支援 k-anonymity、l-diversity 等統計匿名技術,適合分析用數據集。對處理「組合起來可能認出人」的欄位特別有用。 |
| Google Sensitive Data Protection | 文字與表格型資料 | 若組織已使用 Google Cloud,可統一偵測與遮罩 PII。需確認合約、保留政策與資料駐留設定。 |
| Amazon Comprehend PII | 英文與西班牙文文字 | 支援即時與批次偵測/redaction,適合已有 AWS 環境的團隊。 |
| Azure AI Language PII | 文字、文件、客服對話紀錄 | 支援多輪對話與不同說話者識別,適合 call log 或 chat transcript。 |
| Microsoft Office Document Inspector | Word、Excel、PowerPoint | 可移除文件屬性、隱藏文字、註解、自訂 XML 等。記得在副本上操作,部分移除無法復原。 |
| Adobe Acrobat Pro Redact | 可永久移除文字與影像,並清理 metadata。切勿只用黑色方塊遮蓋,那不算真正的 redaction。 |
我特別不建議把原始文件上傳到隨機的「免費線上 PDF 去識別」網站,因為這本身就可能造成資料外洩。
第三步:建立簡單的日常做法
工具只是輔助,最重要的是持續做對的小事。以下是我會堅持的幾個習慣:
1. 用一致的 placeholder 字典
不要只把名字刪掉,而是用有系統的代號,讓 AI 仍能理解「誰對誰做了什麼」:
| 敏感項目 | 替代方式 |
|---|---|
| 人名 | [PERSON_001]、[PERSON_002] |
| 客戶名稱 | [CUSTOMER_004] |
| 公司名稱 | [COMPANY_002] |
| 電郵 | [EMAIL_001] |
| 帳號 / 會員編號 | [ACCOUNT_003] |
| 產品 / 專案名稱 | [PROJECT_ALPHA] |
| 確切日期 | [DATE_001] 或只保留年月 |
| 地址 | [LOCATION_001] |
對照表要存放在加密且內部可控的位置。只要你保留了這張對照表,嚴格來說就只是「假名化」(pseudonymization),而不是完全匿名化,資料仍需當作敏感資料保護。
2. 泛化細節,保留分析價值
很多時候不需要精確數字,也能得到有用的結論:
- 47 歲 → 45–49 歲
- 年薪 $127,430 → $120K–$140K
- 郵遞區號 10017 → 紐約地區
- 2026 年 3 月 14 日上午 9:42 → 2026 年 3 月
3. 自訂公司內部的敏感詞庫
一般的 PII 工具擅長抓姓名、電話、身分證號,但未必認得:
- 未發布的產品代號
- 內部專案名稱
- 客戶名稱
- 保密定價
- 安全漏洞細節
- 併購或合作計畫名稱
我會額外準備一份公司專屬的敏感詞清單,讓去識別工具也能處理這些項目。
4. 兩道檢查才送出
自動化處理後,我會再用人眼掃一次,特別留意:
- @ 符號與電郵域名
- 長串數字
- 電話號碼格式
- 人名縮寫
- 完整地址
- 含有識別資料的網址
- 頁首、頁尾、註解、附件與 metadata
NIST 也提醒過,去識別後的資料仍有可能被重新識別,所以輸出前必須驗證,而不是假設安全。
我的簡單操作原則
綜合以上,我會把 AI 使用分成四級:
公開資料用 public AI;內部資料用企業 AI;高度敏感資料用隔離環境或自架模型;密碼與核心機密絕不進任何外部模型。
即使在企業 AI 或私有環境中,也要遵循最小資料原則:只給分析所需的最少資訊,並且預設 AI 的輸出仍有錯誤,重要的法律、財務、醫療、人力資源或策略決策,必須有人工覆核。
帶得走的提醒
下次想把一段文字、一份合約或一張表格貼進 public AI 之前,先停三秒:把姓名換成 [PERSON_001]、把帳號換成 [ACCOUNT_001]、把確切日期換成年月,然後再重讀一次。這個小動作,往往是保護自己與他人的最關鍵一步。