不想把敏感資料餵給 public AI?我會先做這一道去識別關卡

最近幾個朋友問我,會不會把公司文件、客戶資料,甚至自己的醫療或財務紀錄貼進 ChatGPT 一類的 public AI 做分析。我的答案很簡單:不是不能用,而是不能就這樣複製貼上。

Public AI 的分析力確實很強,但使用它的同時,我們也把資料交到了第三方服務手上。它可能會被保留、被用來改進模型、被外包商接觸,也可能因為安全漏洞或人為失誤而外洩。AI agent 的風險更高,因為它可能連結你的電郵、檔案庫或資料庫,代替你執行動作。NIST 與 FTC 都提醒過,把內部文件或客戶資料交給 AI 服務,會帶來隱私與保密風險。

所以我習慣先把資料分級,再決定用哪一種 AI,而不是讓方便凌駕安全。

第一步:把資料分三級,決定 AI 環境

我會用一個很簡單的框架來分類資料。重點不是「用不用 AI」,而是「在哪一種環境下用」。

資料類型 建議使用的 AI 環境
公開或非敏感資訊 Public AI 工具,一般可接受
內部但低風險資料 經企業核准、有存取控制的 AI
商業機密、合約、策略文件 私有 API / 企業部署,附帶合約與技術保護
高度敏感或受規管資料 自架模型、私有雲,或徹底匿名化後再分析
密碼、API key、私鑰、核心商業機密 不要提供給任何外部模型

一個我經常提醒自己的規則是:如果你不敢把這份資料寄給一位不認識的外包顧問,就不要把它貼進未經核准的 public AI。

第二步:去識別,讓分析繼續有用、但資料不再認人

很多時候我們需要 AI 幫忙分析的是「模式」和「結構」,而不是某個人叫什麼名字、帳號是幾號。這時候,去識別就是一個很低門檻但很有用的中間層。

做法是先把原始資料放進一個「去識別閘道」,把能認出個人或組織的細節換掉,再把乾淨後的版本送去 AI。分析完成後,如果需要,才在內部環境把識別碼對照回來。

我會考慮的幾個工具

【待查證:各工具的官方文件、最新功能與服務條款會不時更新,部署前請與資訊安全或法務團隊核實。】

工具 最適合的資料 特點與注意
Microsoft Presidio 電郵、合約、對話紀錄、CSV/JSON、經 OCR 後的影像 開源、可在本機或私有伺服器運行,支援偵測、遮罩、雜湊、加密,也能自訂公司內部識別碼。但自動偵測不保證找齊所有敏感項目,仍需人工覆核。
ARX 試算表、客戶或員工表格、調查數據 有圖形介面的開源軟件,支援 k-anonymity、l-diversity 等統計匿名技術,適合分析用數據集。對處理「組合起來可能認出人」的欄位特別有用。
Google Sensitive Data Protection 文字與表格型資料 若組織已使用 Google Cloud,可統一偵測與遮罩 PII。需確認合約、保留政策與資料駐留設定。
Amazon Comprehend PII 英文與西班牙文文字 支援即時與批次偵測/redaction,適合已有 AWS 環境的團隊。
Azure AI Language PII 文字、文件、客服對話紀錄 支援多輪對話與不同說話者識別,適合 call log 或 chat transcript。
Microsoft Office Document Inspector Word、Excel、PowerPoint 可移除文件屬性、隱藏文字、註解、自訂 XML 等。記得在副本上操作,部分移除無法復原。
Adobe Acrobat Pro Redact PDF 可永久移除文字與影像,並清理 metadata。切勿只用黑色方塊遮蓋,那不算真正的 redaction。

我特別不建議把原始文件上傳到隨機的「免費線上 PDF 去識別」網站,因為這本身就可能造成資料外洩。

第三步:建立簡單的日常做法

工具只是輔助,最重要的是持續做對的小事。以下是我會堅持的幾個習慣:

1. 用一致的 placeholder 字典

不要只把名字刪掉,而是用有系統的代號,讓 AI 仍能理解「誰對誰做了什麼」:

敏感項目 替代方式
人名 [PERSON_001]、[PERSON_002]
客戶名稱 [CUSTOMER_004]
公司名稱 [COMPANY_002]
電郵 [EMAIL_001]
帳號 / 會員編號 [ACCOUNT_003]
產品 / 專案名稱 [PROJECT_ALPHA]
確切日期 [DATE_001] 或只保留年月
地址 [LOCATION_001]

對照表要存放在加密且內部可控的位置。只要你保留了這張對照表,嚴格來說就只是「假名化」(pseudonymization),而不是完全匿名化,資料仍需當作敏感資料保護。

2. 泛化細節,保留分析價值

很多時候不需要精確數字,也能得到有用的結論:

  • 47 歲 → 45–49 歲
  • 年薪 $127,430 → $120K–$140K
  • 郵遞區號 10017 → 紐約地區
  • 2026 年 3 月 14 日上午 9:42 → 2026 年 3 月

3. 自訂公司內部的敏感詞庫

一般的 PII 工具擅長抓姓名、電話、身分證號,但未必認得:

  • 未發布的產品代號
  • 內部專案名稱
  • 客戶名稱
  • 保密定價
  • 安全漏洞細節
  • 併購或合作計畫名稱

我會額外準備一份公司專屬的敏感詞清單,讓去識別工具也能處理這些項目。

4. 兩道檢查才送出

自動化處理後,我會再用人眼掃一次,特別留意:

  • @ 符號與電郵域名
  • 長串數字
  • 電話號碼格式
  • 人名縮寫
  • 完整地址
  • 含有識別資料的網址
  • 頁首、頁尾、註解、附件與 metadata

NIST 也提醒過,去識別後的資料仍有可能被重新識別,所以輸出前必須驗證,而不是假設安全。

我的簡單操作原則

綜合以上,我會把 AI 使用分成四級:

公開資料用 public AI;內部資料用企業 AI;高度敏感資料用隔離環境或自架模型;密碼與核心機密絕不進任何外部模型。

即使在企業 AI 或私有環境中,也要遵循最小資料原則:只給分析所需的最少資訊,並且預設 AI 的輸出仍有錯誤,重要的法律、財務、醫療、人力資源或策略決策,必須有人工覆核。

帶得走的提醒

下次想把一段文字、一份合約或一張表格貼進 public AI 之前,先停三秒:把姓名換成 [PERSON_001]、把帳號換成 [ACCOUNT_001]、把確切日期換成年月,然後再重讀一次。這個小動作,往往是保護自己與他人的最關鍵一步。