先看 Boss:新聞稿浮誇獸
浮誇獸的招式是:「15 秒生成病歷摘要!」「節省 14% 工時!」這些句子可能是真的,但它們是宣稱,不是驗證。這一關是整個冒險的結業殿,要做的事情有兩個:學會分辨證據層級,以及規劃你自己的進階路線。
兩個層級:宣稱與已驗證
本站把案例分成兩欄閱讀:
- 宣稱:院方自報、新聞轉述、廠商部落格、model card 的自我描述。
- 已驗證:同儕審查論文中,有明確比較對象、資料量與評估方法的結果。
研究筆記對來源另標可信度:A 是院方或機構官方公告、官方 model card;B 是新聞或產業媒體轉述;C 是社群或個人專案;V 是廠商行銷稿。即使是 A 級來源,也只代表「那個機構這樣說」,不等於獨立驗證。
先把底線說清楚:本次查證(2026-10-06)沒有找到任何一個地端 fine-tuned LLM 已進入常規臨床。所有案例都是研究階段,或只是「可在院內硬體執行」。唯一自稱「早期臨床應用」且全程在院內的案例(Heidelberg,PMID 42752478),也仍是回溯分析,沒有前瞻性部署或臨床結局證據。
為什麼案例頁要固定兩欄
新聞與論文的寫作目的不同。新聞稿的目的是讓人記住成果,所以常見的寫法是一個漂亮的數字加一個願景;論文的目的是讓別人檢查,所以會交代資料從哪裡來、和誰比較、哪裡失敗。把兩種文字放在同一個畫面上,你會很快發現:宣稱欄的句子通常短而肯定,已驗證欄的句子通常長而有但書。這不代表宣稱一定是假的,而是提醒你,在看到比較對象與失敗率之前,宜先把它當作待驗證的說法。對醫學生而言,這個習慣和讀 RCT 時先看對照組、再看信賴區間是同一種訓練。
同儕審查案例:宣稱 vs 已驗證
數字皆依摘要,建議引用前回原文核對。
| 案例 | 宣稱 | 已驗證 |
|---|---|---|
| Strata(PMID 41286063,Sci Rep 2025,美國多校) | 小模型加少量資料,可在本地做報告結構化抽取 | 每個資料集至多 100 份訓練報告、單張桌機級 GPU;LoRA 微調 Llama-3.1 8B 在四個資料集上與第二位人類標註者相比為 non-inferior,平均 exact match 90.0 ± 1.7;zero-shot GPT-4 除腎臟病理外也 non-inferior。研究環境本地執行,並非全面勝過 GPT-4 |
| Bordeaux 去識別化(PMID 40605780,JMIR AI 2025,法國) | 院內資料、本地訓練,PHI 不出院 | 超過 42.5 萬份急診紀錄,QLoRA 微調;Mistral 7B 的 PII 層級 F1 為 0.9673;3,000 份測試中有 4 份的姓名未完全移除(其中 1 份為病人姓名)。是否進入常規流程,摘要未載 |
| QSkin(PMID 42424371,PLOS Digit Health 2026,澳洲) | on-premise 為必要條件 | 26,179 份皮膚病理報告,Llama-3.1-8B-Instruct 以 LoRA(rank 8、4-bit)微調,單張 V100 32GB;四個目標亞型 F1 皆高於 0.90;外部驗證(217 份)F1 為 0.73 到 0.86。研究環境本地執行 |
| MEDAL(PMID 42753937,J Biomed Inform 2026,美國) | 跨機構聯邦式 fine-tune,不傳病人層級資料 | 在三個獨立資料集及虛擬站點上,F1 接近集中式訓練的上限,摘要所載與 GPT-5 的最大差距為 16.6 個百分點;仍是研究環境的協作與模擬,非常規部署 |
| Heidelberg(PMID 42752478,2026,德國) | 全程院內,早期臨床應用 | Llama-3.1-70B,以 500 封標註信件評估;DOAC 比例由 2012 年的 16.9% 到 2020/21 年的 59.9%;回溯分析 |
| Mukherjee(PMID 37815442,Radiology 2023,美國 NIH) | 本地開源模型可做報告標註 | Vicuna-13B(他人已微調的模型,作者未再微調),以提示詞法在 3,269 份 MIMIC-CXR 報告與 25,596 份 NIH 報告上標註;100 份專家標註子集的中位數 AUC 為 0.84,11 項發現中 9 項與兩個既有標註器相當。概念驗證 |
一個不能當作「本地 LLM」的案例
PMID 38271060(JMIR 2024,台灣中英夾雜去識別化)要特別說明:該研究 fine-tune 的是BERT 類模型,不是生成式 LLM;其中「LLM」的部分,是經由 OpenAI API 的 ChatGPT 做 zero-shot,論文自己也說明該服務只能透過線上 API 使用。所以它不是本地 fine-tuned LLM 案例。本站只把它當作兩件事的背景:台灣病歷為什麼是中英夾雜,以及「本地 fine-tuned BERT 對雲端提示詞法 LLM」的對照。語料為 1,700 份出院摘要。
另一個常見的小錯誤是年份:Mukherjee 的研究是 2023 年發表在 Radiology(PMID 37815442),不是 2024 年。
台灣院方案例:多為院方自報
以下案例的「已驗證」欄皆為「未見獨立驗證」(查證日 2026-10-06),僅供對照宣稱的形式:
| 案例 | 宣稱(院方自報) | 已驗證 | 備註 |
|---|---|---|---|
| 臺大醫院 ICD 編碼 | 院內去識別化病歷精調、地端、節省 14% 人力工時、約 1 秒產生編碼 | 未見獨立驗證 | 官方稿經媒體轉載(A 或 B 級);任務屬分類,模型可能是 encoder 類而非生成式 LLM;搜尋摘要所見的準確率數字未回原文核對,本站不引用 |
| 臺中榮總與陽明交大 Healthcare GPT(2024-04-18) | 地端私有雲,自動病歷摘要約 15 秒完成 | 未見對照組或準確度資料 | 新聞轉述(B 級);基礎模型未公開,微調方法未明示 |
| 長庚醫院 Llama 3-Taiwan 70B 與院內 AI 推論服務(2024-09-05) | 集中管理院內 LLM 應用,地端 | 未公開數字 | 院方網頁(A 級);是否以院內資料再微調未明示;模型卡寫明不適用於醫療診斷等高風險用途 |
這三個案例很適合練習批判閱讀:每一個都有「地端」、都有漂亮的數字或願景,但沒有一個提供獨立評估,也沒有說明錯誤時由誰負責。
國際案例:NYUTron 與生成式 LLM 的差別
NYUTron(Nature 2023,PMID 37286606,美國 NYU Langone)是「院內資料 fine-tune」最早的標竿之一。它是約 1.09 億參數的 BERT 類 encoder,以院內大量病歷預訓練,再針對任務微調,用於 30 天再入院、院內死亡、住院天數等預測。論文報告 AUC 為 78.7% 到 94.9%(依研究筆記整理,宜回原文核對)。它有同儕審查、院方也公開,可信度高,但不是生成式 LLM,不能當作「本地 fine-tuned 生成式 LLM 已進入臨床」的證據。
開源與社群:可以動手,但自述多為「非臨床使用」
- Llama3-Med42、Llama3.1-Aloe-Beta、OpenBioLLM 等開源醫療模型,model card 都明言不適用於臨床;Aloe-Beta 另為非商用授權。
- MedGemma 有大量社群 LoRA 範例,多為研究或競賽用途,沒有臨床部署證據。
- 本地 scribe 開源專案(例如 OpenScribe)多數沒有 fine-tune,自述尚不符合 HIPAA。
「本地跑得動」與「可以用在病人身上」中間,隔著驗證、審查與法規,見 LV17。
練習:宣稱或已驗證?
試著把下列句子分類,答案在後面。
- 「本系統讓病歷摘要從 7.5 分鐘縮短到 30 秒。」
- 「LoRA 微調的 8B 模型在四個資料集與第二位人類標註者相比為 non-inferior。」
- 「我們的醫療模型在九個生醫 benchmark 平均 86%,勝過 GPT-4。」(廠商 model card)
- 「3,000 份測試報告中,4 份的姓名未完全移除。」
答案:1 是宣稱(院方自報,沒有說明品質與對照);2 是已驗證(同儕審查、有比較對象,但仍屬研究環境);3 是宣稱(廠商自報,且該 model card 自述僅供研究);4 是已驗證,而且是一個誠實揭露失敗率的好例子。
進階路線
學完這張地圖之後,可以往四個方向走:
- DPO(偏好對齊):目前 LoRA 教的是「照範例做」,DPO 教的是「兩個答案裡哪個比較好」。類比:主治醫師比較兩份病歷,說明哪一份寫得較好。開源醫療模型 Aloe-Beta 就使用了 DPO 對齊。
- RAG(檢索增強生成):不改模型,而是在回答前先檢索資料。研究筆記查到的部分案例(例如護理紀錄映射標準術語,PMID 42054561,部署位置未說明)是用 RAG 加少量範例而非 fine-tune。適合知識常更新的任務。
- 聯邦學習:MEDAL 展示了「adapter 依序跨機構訓練、不傳病人層級資料」的想法,目前仍是研究階段。
- 開源資料集貢獻:本站的合成資料集放在 GitHub(或本站下載),歡迎提出改進。貢獻前宜注意:資料是否完全虛構、生成工具的授權或服務條款(見 LV17 的雲端條款一節)、以及資料卡是否清楚聲明「合成」。
學習資源方面,常見的免費路線有 Hugging Face LLM Course、smol-course、Maxime Labonne 的 llm-course(GitHub)、Sebastian Raschka 的教材,以及 Karpathy 的 nanochat(只取概念,不建議當作醫療專案的起點)。以上資源為作者整理的方向,使用前請自行確認版本與內容。本站的 notebook 可下載,合成資料集放在 GitHub(或本站下載)。
結業
走到這裡,你應該能做到:解釋 LLM 如何運作、在自己的 Mac 或 Colab 上微調一個小模型、用合成資料評估它、知道哪些任務不該用它、知道「本地」不等於合法,並且能用「宣稱 vs 已驗證」的眼光讀新聞。最後再提醒一次:本站全程只使用合成資料,任何真實病歷的使用,都應先取得院方核准並經 IRB 評估。
本關重點
- 把證據分成「宣稱」與「已驗證」兩欄;院方自報與廠商稿未經獨立驗證前,只能當宣稱。
- 本次查證沒有找到任何地端 fine-tuned LLM 已進入常規臨床,案例皆為研究階段或「可在院內硬體執行」。
- PMID 38271060 是 BERT 加 ChatGPT API 的對照,不是本地 LLM 案例;Mukherjee 研究為 2023 年。
- Strata 的重點是 non-inferior 且硬體門檻低,不是全面勝過 GPT-4;NYUTron 是 BERT 類 encoder,不是生成式 LLM。
- 進階方向:DPO、RAG、聯邦學習、開源資料集貢獻;任何走向真實資料的步驟,先回到 LV17。