文件去識別化工具

純前端、資料不出電腦的文件去識別化工具。上傳 PDF、Word、Excel、TXT、Markdown 或貼上文字,自動偵測姓名、身分證字號、手機、市話、地址、電子郵件、公司名稱、統一編號與自訂識別碼;預覽、人工覆核後下載去識別化文件與 CSV 編碼表,之後可完整還原。

關於文件去識別化工具

文件去識別化工具是一個免費、開源、純前端的線上工具,用來把 PDF、Word、Excel、TXT、Markdown 文件或貼上的文字中的個人資料(姓名、身分證字號、手機、市話、地址、電子郵件、公司名稱、統一編號、自訂識別碼)自動偵測並以唯一編碼取代,同時產出 CSV 編碼表,日後可憑編碼表完整還原。所有處理都在瀏覽器內完成,檔案不會上傳到任何伺服器,離線也能使用。

使用方式

  1. 在「去識別化」頁籤拖入檔案或貼上文字,按「開始去識別化」。
  2. 在依原格式排版的預覽中檢視自動偵測結果:遮罩以 王OO0912-***-678A12******9 等樣式呈現,滑鼠停留可看原文與實際輸出標記。
  3. 人工覆核:點擊標記取消誤判、點擊種類整批取消、圈選文字新增漏抓的項目。
  4. 下載去識別化文件(與上傳相同格式,檔名加 .deid)與 CSV 編碼表;多個檔案可一鍵打包成 ZIP。
  5. 需要復原時,到「還原」頁籤上傳去識別化文件與編碼表,即可下載還原檔。

支援格式

格式輸入輸出與限制
TXT/Markdown/貼上文字.txt、.md 或直接貼上同格式輸出;貼上的文字可一鍵複製結果
Word.docx保留樣式、表格、頁首頁尾;不支援舊版 .doc
Excel.xlsx保留儲存格樣式與工作表結構;僅處理文字型儲存格,數值型電話、公式結果不在範圍
PDF需含文字層依原座標重建文字並內嵌中文字型,不保留圖片、圖形與原字型;掃描影像 PDF 無法處理

單檔上限 20 MB,一次最多 10 個檔案;內建規則以台灣常見格式為主。

常見問題

什麼是文件去識別化?

文件去識別化是把文件中可以直接或間接辨識特定個人的資訊(例如姓名、身分證字號、手機、地址、電子郵件),以遮罩或編碼取代,讓文件在交給第三方、AI 服務或研究單位時不會洩漏個資。本工具會把每筆敏感資訊換成唯一的隨機編碼,並產出 CSV 編碼表供日後還原。

我的檔案會被上傳到伺服器嗎?

不會。文件解析、個資偵測、遮罩與輸出全部在你的瀏覽器內以 JavaScript 完成,沒有任何後端;載入頁面後即使離線也能使用。瀏覽器只會儲存你的偵測規則設定,文件內容與編碼表都不會落地。

支援哪些檔案格式?

支援 PDF(需含文字層)、Word(.docx)、Excel(.xlsx)、TXT、Markdown,也可以直接貼上文字。單檔上限 20 MB,一次最多 10 個檔案混合處理。不支援舊版 .doc、.xls 與掃描影像 PDF。

可以偵測哪些個人資料?

內建九種類別:中文姓名、身分證字號(含檢核碼驗證)、手機、市話、地址、電子郵件、公司/組織名稱、統一編號(含檢核碼驗證)與自訂識別碼;也可以用正規表達式新增自訂規則。規則以台灣常見格式為主。

去識別化後可以還原嗎?

可以。每筆敏感資訊都換成 [類別:編碼] 形式的唯一標記,對應關係存在 CSV 編碼表中。在「還原」頁籤上傳去識別化文件與編碼表,即可取得原格式的還原檔。編碼表是還原的唯一憑證,請妥善保管。

輸出的文件會保留原本的格式嗎?

Word 與 Excel 直接改寫文字節點,樣式、表格、頁首頁尾與工作表結構都保留;PDF 依原始座標重建文字版面並內嵌中文字型,但圖片、圖形與原字型不會保留。

PDF 為什麼不是用黑框蓋住敏感文字?

用色塊覆蓋的 PDF,底層文字仍然可以被複製或擷取出來。本工具改以文字重建的方式輸出 PDF,敏感文字會真正從檔案中移除,不會殘留在輸出檔內。

自動偵測會不會有誤判或漏抓?

會。中文姓名與地址無法靠規則做到零誤判、零漏抓,所以自動偵測只是建議:預覽畫面可以點擊標記取消誤判、點擊種類整批取消,或圈選文字手動新增漏抓的項目,確認後再下載。

這個工具要收費嗎?可以自行架設嗎?

完全免費,並以 MIT 授權開源。執行 npm run build 產出的 dist/ 是純靜態網站,可以放到 GitHub Pages、內網檔案伺服器或任何靜態空間自行架設,也可以直接以檔案方式開啟。

完整操作說明與截圖見 GitHub 專案頁;範例檔皆為程式產生的虛構資料。