跳到主要內容

LV.02

PHI 結界

哪些東西不能貼進 ChatGPT

BOSS
複製貼上幽靈
時間
約 30 分鐘
建議先過
LV.01

一個很容易發生的瞬間

你在病房寫完一份出院病摘,覺得很長很雜,順手想:「叫 ChatGPT 幫我整理一下好了。」Ctrl+C,Ctrl+V,貼上去,按送出。

就這幾秒鐘,一份有姓名、病歷號、診斷的文字,已經離開了醫院。這就是本關 Boss「複製貼上幽靈」:它不是惡意的駭客,而是我們自己順手的動作。

這一關的任務是畫一道「結界」:先弄清楚什麼東西不能隨手貼,以及為什麼「改用本地模型」雖然有幫助,卻不能解決所有問題。本章是教學層級的整理,不是個案法律意見;實際專案請洽院內法遵、個資窗口與 IRB。

什麼是 PHI

PHI 是 protected health information(受保護的健康資訊)的縮寫,原本是美國 HIPAA 的用語。HIPAA 的 Safe Harbor 去識別化方法列出 18 類識別碼,例如姓名、比州更小的地理資訊、除了年份以外的日期、電話、電子郵件、病歷號、裝置序號、完整臉部照片等(45 CFR §164.514(b)(2),出處:https://www.law.cornell.edu/cfr/text/45/164.514)。這份清單在台灣**沒有法律效力**,但很適合當作你的檢查表。

台灣的法規沒有這樣的清單,只有一個比較抽象的原則:資料要達到「無從識別特定當事人」。個資法施行細則 §17 說明,指以代碼、匿名、隱藏部分資料或其他方式,無從辨識該特定個人(出處:https://law.moj.gov.tw/LawClass/LawAll.aspx?pcode=I0050022)。條文沒有寫哪些欄位要拿掉、也沒有量化門檻,所以實務上更依賴機構與 IRB 的個案判斷。

提醒兩個常見的誤解。第一,只遮姓名不等於去識別化:日期、罕見疾病、住址、醫師署名、自由文字裡的敘述,都可能把人認出來。第二,假名化不等於匿名:把病歷號換成代碼,但院方手上還有對照表,對院方而言通常很難稱為無從辨識。

病歷是特種個資

個人資料保護法 §6 I 本文把病歷、醫療、基因、性生活、健康檢查與犯罪前科的個資,原則上列為不得蒐集、處理或利用,但書另有六款例外,例如法律明文規定、公務機關或學術研究機構基於醫療衛生目的並且資料「無從識別」、或經當事人書面同意等(出處:https://law.moj.gov.tw/LawClass/LawAll.aspx?pcode=I0050021)。

有兩個重點容易被忽略:

  • 「處理」的定義很寬(§2 第 4 款,含記錄、輸入、儲存、複製、輸出)。所以把病歷存在自己電腦上,也算處理,不是只有上傳才算。
  • 但書例外的條件,是「資料經去識別化」與「主體是特定機關」,不是「資料放在本機」。個人學生單純自學,不宜假設自動適用學術研究機構的例外。

個資法於 2025-11 有部分條文修正公布,其中部分條文的施行日由行政院另訂,截至本站研究時(2026-10)我們未查到明確的施行公告,發布前仍需再核對。

本地解決了什麼,沒有解決什麼

把這一段當成整站最重要的觀念:

本地解決的:資料不用送到雲端 API,也不用交給境外廠商。因此傳輸過程被攔截、第三方保存或再利用、跨境傳輸這幾類風險會降低。這是實實在在的好處,也是本站主線要做「斷網執行」的原因。

本地沒解決的:

  1. 合法基礎。你有沒有資格處理這份資料,是個資法 §6 與院方授權的問題,跟資料在哪裡無關。
  2. 保密義務。醫療法 §72 規範醫療機構及其人員不得無故洩漏因業務而知悉的病人資訊,醫師法 §23 有類似的規定。把病歷複製到個人電腦,仍需符合機構自己的隱私與資安規定。
  3. 研究倫理。用病歷資料分析或訓練模型,通常落在人體研究法 §4 所稱的人體研究範疇,宜先由 IRB 判斷是否需審查或免審。這點在 LV17 會詳細展開。
  4. 模型本身的記憶。fine-tune 後的模型權重可能記得訓練資料,這份權重是否仍屬個資、能不能分享,目前條文沒有明說,我們也沒有查到官方見解。

簡單說:本地 ≠ 合法。本地只改變資料流向,不改變「這是不是個資、你有沒有合法基礎、算不算研究」。

醫學生與畢業生的位置

醫師法 §28 I 第 1 款,是把「在認可醫療機構、於醫師指導下實習的醫學生或畢業生」從無照執行醫療業務的刑責中除外,它不是授權你取得或複製病歷。實習生能接觸哪些資料,通常依院方實習規範與系統權限;比較常見的做法是:只在授權系統內、因學習或照護需要而看;不匯出、不拍照、不貼到個人裝置或雲端工具;寫病例報告時先去識別化。以上屬機構慣例,不是單一條文。若是畢業後、尚未取得執照的階段,自行取用病歷做個人專案,目前沒有明文的授權依據,更宜先洽院方。

國外也有類似的規範可參考:Stanford 醫學院的相關報導指出,公開的 AI 平台不得貼入 PHI(來源:https://medicine.stanford.edu/news/stories/2025/04/stanford-tech-tools.html,部分內容為二手報導,僅作對照)。

實作:建立「只放合成資料」的工作資料夾

這一關沒有程式要寫,只要做一件小事:建立資料夾並寫下約定。

🍎 Mac:

mkdir -p ~/local-llm-lab                                   # 建立工作資料夾(已存在也不會報錯)
cd ~/local-llm-lab                                         # 走進去
echo "This folder contains SYNTHETIC data only." > README  # 寫一份說明檔
cat README                                                 # 讀回來確認

逐行解釋:mkdir -p 的 -p 代表「已經存在就不要報錯」;~ 代表你的家目錄;echo ... > README 把引號中的句子寫進叫 README 的檔案;cat 把檔案內容印出來。這份 README 是寫給「未來忘記規則的自己」看的。

☁️ Colab:沒有程式。請理解一件事:你上傳到 Colab 的檔案,位於 Google 的伺服器上,所以屬於「資料離開自己電腦」。因此不要上傳任何真實病歷。完成後對照下面的自我檢核表。

自我檢核表(有任一項答「否」,請停手):

  • 我要處理的文字,是我自己寫的虛構內容,或是由程式合成的嗎?
  • 裡面沒有任何真實病人的姓名、日期、病歷號、聯絡方式嗎?
  • 我沒有把這個資料夾與院內系統、真實病歷連在一起嗎?

本關重點

  1. 病歷是個資法 §6 的特種個資;本機處理仍屬「處理」。
  2. 去識別化不等於只遮姓名;台灣條文只有「無從識別」原則,沒有識別碼清單,HIPAA 的 18 項只能當檢查表。
  3. 本地降低傳輸與第三方揭露風險,但不解決合法基礎、保密義務、研究倫理與模型記憶。
  4. 實習與畢業階段接觸病歷,宜依院方授權規範;不匯出、不貼個人裝置。
  5. 本站全程使用合成資料,Colab 也一樣。下一站:AI 家族譜。

BOSS 戰:複製貼上幽靈

HP0/4
  1. 依台灣個人資料保護法 §6,病歷資料屬於哪一類資料?

  2. 「把病歷放在自己電腦,用本地模型處理」解決了下列哪一項?

  3. 阿明是醫學生,想把實習時看到的真實病歷截圖,貼進自己電腦上的本地模型練習摘要。較符合本站建議的做法是?

  4. 本站全程使用合成病歷,最主要的理由是?