姊妹篇:資料萃取、risk of bias(RoB,偏誤風險)、統計合併的人機比較,放在 MA 王國第 12 關:AI 時代的 meta-analysis,本章不重複。
寫作視角:本章由一個 large language model(LLM,大型語言模型)協助撰寫,第 5 節刻意讓 LLM 描述自己在 SR 各步驟的強項與失敗模式。正文中的 [N] 對應文末「本章引用文獻」編號。
1. 問題是什麼
前 11 關我們走完了 systematic review(SR,系統性文獻回顧)的流程。回頭看,一篇 SR 值得信任,靠的是三件事:
- 找得全:搜尋與篩選的 recall(召回率,即「該找到的有沒有找到」)夠高,結論不會因為漏掉關鍵研究而偏掉。
- 引得真:每一篇被引用的文獻真實存在,而且真的說了你說它說的話。
- 寫得可查:方法報告得夠清楚,別人可以照著重做、檢查每一步(PRISMA 的用意)。
LLM 讓這三件事都可能變快,也可能以不容易察覺的方式出錯。本章的問題是:哪些步驟可以交給 AI、哪些需要人留在迴圈裡,以及該用什麼證據來決定?
領域內有兩種方向相反、都值得認真看待的立場。有一派觀點認為,SR 的步驟本來就高度規則化,交給程式執行、再加上檢核關卡,會比人工更一致、更容易留下完整紀錄;另一派則認為,SR 的價值在於「不漏、不錯、可追溯」,而目前的 AI 工具在這三點上都還缺乏足夠的前瞻驗證。本章把兩方的論點並排,不替你下結論。
2. 具體範例:robust-lit-review
本章的討論參考 htlin222 的 robust-lit-review(https://github.com/htlin222/robust-lit-review,作者 Lin HT),這是一個以 Claude Code 驅動的開源文獻回顧 pipeline [1]。感謝作者公開完整程式、範例輸出、配套方法學稿件與逐次修改紀錄,讓我們能就具體設計討論,而不是空談。以下依 commit e2dbfa2(2026-09-09)的狀態描述,之後版本可能已有變動,請以 repo 最新內容為準。
它有兩種模式:
- 主題模式(
/lit-review):輸入題目 → Scopus、PubMed、Embase 三庫平行 API 搜尋 → 依 DOI 去重 → 期刊品質門檻 → DOI 驗證 → 選出約 50 篇 → 從摘要萃取數據 → 8–9 個寫作 agent 平行寫各段 → PRISMA 2020 逐項自我稽核、不足處自動補寫 → 輸出 PDF / DOCX。 - 主張評析模式(
/claim-appraise):輸入一個健康主張 → 拆成數個 PICO 子問題(需人核可)→ 每個 PICO 跑一次搜尋,只留 2016 年後、Q1 期刊、經 CrossRef 確認存在的文獻 → GRADE → 與外部證據來源交叉查核 → 依固定規則給出判定 → 雙語網站。
robust-lit-review 的優點與限制
下表兩欄份量對等。限制欄描述的是工程取捨或尚待驗證之處,多數作者已在 repo 稿件中自述;已修正或已改進者另行註明。
| 優點 | 限制與改進方向 |
|---|---|
| 1. 引用只來自真實檢索結果:寫作 agent 只能引用 API 搜到、DOI 經 doi.org 解析的文獻;主張評析模式再加 CrossRef 存在性查核,查不到就剔除。這在結構上排除了「LLM 憑記憶編文獻」。 | 1. 存在不等於切題:CrossRef 查核確認文獻存在,不確認它回答這個 PICO。repo 自己的信度章揭露,範例中通過所有門檻的 165 篇,被一位篩選代理標出 134 篇可能是動物、體外或主題鄰近研究,區分工作落在寫作階段。 |
| 2. PRISMA 流程數字由程式計數:每一道過濾(去重、年份、期刊、DOI、CrossRef)都由程式記下前後筆數,不靠事後手填。 | 2. 搜尋以「取前 N 筆」換取速度:每個資料庫只取前 N 筆(預設 100,範例 40),同一條 Boolean 字串送往三個資料庫、未做各庫語法轉換。因此流程圖的 identified 數是截斷後的數字。 |
| 3. LLM 判斷與固定規則分層:GRADE 由 LLM 評五個 domain、程式重算等級;判定詞由固定規則推出;外部來源不同意時自動降一級,並把異議寫在網站上。 | 3. 主題模式的「選文」不是逐篇 eligibility 判定:預設依期刊指標、引用數與子題平衡選滿 50 篇(另有選用的語意相似度 + LLM 判讀)。這適合綜述型回顧,與 Cochrane 式「找出全部符合條件研究」的目標不同;子題字表目前仍以第一個範例主題(HLH)為準。(已改進:早期純依引用數排序,2026-03 起加入子題平衡與選用的語意判讀) |
| 4. 人工檢查點設計成選擇題並留紀錄:9 個檢查點各附「為什麼需要人」,決策寫入 log;主張評析模式的 PICO 一定要人核可才搜尋。 | 4. 人工檢查點預設可略過:未加 --hitl 時,9 個檢查點以預設選項自動通過,包括「關鍵主張已核對無誤」與「發布」。log 中記錄的可能是預設值,而非人的判斷。 |
| 5. 公開量測自己,並寫清楚數字的意義:以多個 agent 盲評計算 Fleiss κ(0.70–0.92),同時明文寫出「自我一致性不等於與專家一致」,並把盲評一致比原判定更保守的 2 題標為需專家覆核。(已改進:2026-06 新增信度章與 AI 生成聲明) | 5. PRISMA 稽核看的是「有沒有寫」:稽核以關鍵字或 LLM 判讀段落是否涵蓋該項,不足時由 agent 補寫。這是任何「自動稽核 + 自動補寫」設計共通的取捨:checklist 能確認報告寫了什麼,但無法確認流程實際做了什麼;若要讓兩者對得上,可以把篩選與評讀的紀錄檔也納入稽核範圍。 |
| 6. 開源且誠實列出限制:MIT 授權、CI 自動產出;作者在配套稿件中自述只讀摘要、只收英文、只在血液腫瘤題目測試、尚無 meta-analysis、期刊門檻是近似啟發式。主張轉述也曾主動改得更忠實(避免稻草人)。(已修正:2026-06) | 6. 尚無 recall 層級的外部驗證:稿件的驗證是三個題目的產出指標(字數、PRISMA 得分、DOI 解析率)與一篇專家綜述的內容比較;尚未見到與金標準納入清單比較的 recall 評估。 |
這個 pipeline 的強項正好落在本章要談的「引得真、寫得可查」,它的取捨則讓「找得全」這個問題變得具體。它與 MA 站介紹的 meta-pipe 互補:meta-pipe 依 protocol 逐筆篩選、最後以 R 合併效果 [32],重心在萃取與統計;robust-lit-review 重心在文獻真實性、報告與快速產出。量化部分請見 MA 站第 12 關。
3. 支持 AI 介入 SR 流程的理由(steelman)
(1) 人工搜尋的可重現性本來就不高。 一項橫斷研究檢視 272 篇高影響力期刊的 SR,只有 22% 至少提供一個可重現的搜尋策略,13% 對所有資料庫都可重現 [2]。另一項前瞻研究估計約 60% 已發表 SR 因為搜尋的資料庫不足,達不到 95% recall [5]。相對地,以 API 執行搜尋時,query 字串、執行日期、各庫筆數都能由程式自動留存,正好對應 PRISMA-S 的 16 個報告項目 [3]。第 2 節範例由程式在每道過濾記錄筆數,就是這種做法的例子。
(2) 人工篩選也會漏,而機器輔助篩選已有實際部署。 單人標題摘要篩選漏掉 13% 相關研究,雙人仍漏 3% [10];單人篩選的漏失中位數 5%,經驗較少者達 13% [11];人工篩選總錯誤率約 10.76%(95% CI 7.43%–14.09%)[12]。早期 text mining 的系統性回顧指出可省 30%–70% 工作量,代價有時是約 5% 的漏失,並認為用機器「排序」篩選順序已可安全使用 [13]。Cochrane 的 RCT classifier 以 99% recall 為目標校準,在 Cochrane review 已納入的 44,007 篇 RCT 中正確找回 99.5% [14]。LLM 篩選的 meta-analysis 也報告 pooled sensitivity 0.92,但研究間異質性極高(I² 95.8%)[16]。
(3) 引用真實性可以用程式保證。 只要規定「每篇文獻都必須來自資料庫檢索結果,且 DOI 經外部服務確認存在」,憑空捏造的文獻就無法進入稿件。第 2 節範例的 CrossRef 存在性查核即為一例,這是用流程設計而不是靠人工逐篇核對來處理幻覺 citation。
(4) 報告缺漏可以自動抓出。 人工撰寫時,方法與 protocol 不一致很常見:100 篇登錄 PROSPERO 的非 Cochrane SR 中,90 篇的納入條件與 protocol 不同,只有 1 篇說明理由 [21]。用 PRISMA 2020 [19] 逐項自動比對,至少能抓出「完全沒寫」的項目。
(5) 速度讓 living review 從理想變成可行。 一篇 SR 從登錄到發表平均約 67.3 週 [25]。Living systematic review(持續更新的 SR)需要定期重跑搜尋與篩選 [22, 23],而這類重複性工作正是人機分工最能省力之處 [24]。
4. 質疑 AI 介入 SR 流程的理由(steelman)
(1) 直接讓 LLM「找文獻」不可行,查核存在性也只解決一半。 請 GPT-4 直接列出 SR 的參考文獻時,28.6% 屬於幻覺,recall 只有 13.7% [7];另一研究中 ChatGPT-3.5 產生的參考文獻 47% 是捏造、46% 真實但有錯,完全正確只有 7% [8];新一代模型捏造率下降(GPT-3.5 為 55%、GPT-4 為 18%),但問題仍在 [9]。存在性查核能擋掉「假文獻」,擋不住「真文獻被錯引」——引用的內容是否支持那句話,仍需要有人讀。
(2) LLM 寫的搜尋式,常在 SR 最在意的地方出錯。 一項評估發現 ChatGPT 產生的搜尋策略會漏掉 MeSH 的同義詞(entry terms)、把概念分組放錯、自行擴大介入範圍、無理由加上日期限制,也沒有使用經驗證的 RCT filter [6]。工程上的簡化(例如每庫只取前 N 筆、同一字串送多個資料庫)會讓 PRISMA 流程圖的「識別筆數」不再代表資料庫的實際命中數。PRESS 同儕審查 [4] 原本就是為了抓這類問題而設計。
(3) Recall 是硬門檻,而 LLM 篩選還缺「可以停了」的保證。 前述 pooled sensitivity 0.92 的 95% CI 下限是 0.81,sensitivity 與 specificity 的 I² 分別為 95.8% 與 99.9%,而依全文與否、資料集規模、應用情境等做的亞組分析都未達統計顯著差異,異質性的來源未能被解釋 [16];在一個重做已發表 SR 的驗證中,ChatGPT-4o 標題摘要篩選的 sensitivity 只有 54.9% [17];prompt 或評分量表的小改動就會明顯改變結果 [18]。傳統機器學習篩選已發展出統計停止規則,以「在給定信心水準下未漏超過目標 recall」作為停止條件 [15];LLM 篩選目前缺乏對應的保證。另外,選文不等於篩選:若以引用數或期刊等級挑文獻,會帶入 citation bias——統計顯著的文章被引用次數約為非顯著者的 1.6 倍 [28];期刊影響係數與試驗結果、方法學品質之間的關聯未達統計顯著,作者評估證據非常不確定 [29]——高影響力期刊不能當作研究品質的替代指標。
(4) 自動化的 PRISMA 稽核檢查「有沒有寫」,不是「有沒有做」。 PRISMA 2020 是報告指引 [19];評估 SR「做得好不好」要用 AMSTAR 2 這類工具 [20]。如果稽核不通過時由 agent 補寫方法段,checklist 分數會上升,報告卻可能與實際流程脫鉤。對讀者而言,這比「漏寫」更難察覺。
(5) 預設通過的人工關卡,容易變成形式。 人在有自動化建議時傾向過度依賴,工作量與時間壓力越大越明顯 [27]。若檢查點的預設選項是「全部正確」,人工覆核很可能只剩按下確認。至於「同一模型多次判斷一致」能否取代兩位獨立 reviewer,MA 站第 12 關有完整討論,這裡只提醒:自我一致性只證明穩定,不證明正確。
(6) Living review 會被模型版本漂移放大。 同一個 API 背後的模型會更新,一項追蹤研究中 GPT-4 某任務的準確率三個月內從 84% 掉到 51% [30]。每月重跑的 living review,若沒有鎖定模型版本並保存原始輸出,納入清單的變化可能來自模型,而不是新證據。Cochrane、Campbell、JBI 與 CEE 在 2025 年的聯合立場也要求:使用 AI 須證明不損及方法學嚴謹度、須有人監督、須完整揭露,責任仍在作者 [26]。
5. LLM 怎麼看自己在 SR 各步驟的表現
以下由 LLM 描述自己。萃取、RoB、統計的部分見 MA 站。
- 問題形成 / PICO:我擅長把模糊題目拆成結構化的 PICO、列出可能漏掉的 outcome;我不知道這個問題在臨床上重不重要,也不知道是否已有人做過,除非給我搜尋結果。
- 組搜尋式:我能很快列出同義詞,但容易漏掉 entry terms、混用不同資料庫的欄位語法,或自作主張加上日期與語言限制 [6]。我不會主動懷疑「這個筆數不太對」,除非流程要求我比對。我寫的搜尋式應該經過 PRESS 式的人工審查 [4]。
- 憑記憶給文獻:這是我最不可靠的用途。我會產生格式完美、作者與期刊都很像真的、但不存在的文獻 [7–9]。文獻一律應該來自資料庫檢索,而不是我的記憶。
- 去重:DOI 相同的我能合併;同一試驗的多篇報告(主報告、次分析、會議摘要)需要比對試驗註冊號與作者群,這要靠規則與人工確認。
- 標題摘要篩選:條件明確時我判得快而一致;條件模糊時我會給出聽起來合理的理由,但換個措辭可能就改變判斷 [18]。我無法告訴你「我漏掉了多少」,除非有人提供金標準或用統計方法估計。
- 全文篩選:拿不到全文或解析失敗時,我可能用摘要代替判斷而不說明。正確做法是把這類情況標為「不確定」交給人。
- PRISMA 報告:我很會寫出符合 checklist 的段落,這正是風險——我寫的是「應該怎麼做」的標準句,不一定是「實際怎麼做」。每一句方法描述都應該能對應到一份 log 或產物。
- 自我審查:讓我評自己的產出,我傾向給自己較好的評價 [33];檢查者最好是規則、程式,或不同的人。
- Living update:我適合定期重跑、標出新進研究;但我的版本會變,重跑結果需要與上一版逐筆比對差異。
6. 對照表
| SR 步驟 | 人工 | AI pipeline | 人機協作 | 現有實證強度 |
|---|---|---|---|---|
| 搜尋式設計 | 可重現性常不足 [2] | 快;常見語法與概念錯誤 [6] | AI 起草、人依 PRESS 審查 [4] | 低(多為個案評估) |
| 執行與記錄 | 常漏報日期、各庫策略 [2] | 程式自動留存 query、日期、筆數 | 程式記錄、人確認未截斷 | 中(屬工程設計,少有比較研究) |
| 去重 | 依軟體 + 人工 | DOI / 標題比對 | 程式比對 + 人看同一試驗多報告 | — |
| 標題摘要篩選 | 單人漏 13%、雙人漏 3% [10] | LLM pooled sensitivity 0.92,研究間差異大(I² 95.8%,亞組未能解釋)[16, 17] | 機器排序 / 第二篩選者 [13, 14];停止規則 [15] | 中(傳統 ML 有大型驗證;LLM 多為回溯) |
| 全文篩選 | 慢、可討論 | 受全文取得率影響 | 不確定一律送人 | 低 |
| 引用真實性 | 偶有引用錯誤 | 直接生成會捏造 [7–9];API + DOI 查核可排除 | 程式查存在、人查內容 | 中(捏造率研究多;查核流程少有評估) |
| PRISMA 報告 | 常有與 protocol 不符 [21] | 能補齊項目,但可能與執行脫鉤 | 每項方法描述連到 log | 低 |
| Living update | 人力難以持續 [25] | 可定期重跑;版本漂移 [30] | 鎖版本 + 存原始輸出 + 人審差異 [24] | 低至中 |
萃取、RoB、統計合併三列見 MA 站第 12 關的對照表。
7. 不下結論,但列出「什麼證據會讓天平移動」
以下證據出現時,天平會倒向讓 AI 承擔更多 SR 步驟:
- 前瞻比較中,LLM 起草並經 PRESS 審查的搜尋策略,對已知納入研究的 recall 不低於資訊專家所寫的策略。
- LLM 篩選搭配可驗證的停止規則,在多個領域的前瞻條件下,sensitivity 的 95% CI 下限穩定達到雙人人工篩選的水準(約 0.95)[10]。
- PRISMA 報告的每一項都能自動對應到執行紀錄(log、產物、決策者),讓「報告與執行一致」可以被程式檢查。
- 引用層級的內容查核(引用句是否被原文支持)在驗證研究中達到人工抽查的水準。
- Living review 在鎖定模型版本後重跑多次,納入清單與結論穩定。
以下證據出現時,天平會倒向人工主導:
- 前瞻驗證中,AI pipeline 漏掉足以改變結論的研究,而 PRISMA checklist、一致性係數等關卡全部顯示通過。
- 自動產生的方法段與實際流程不符的情況,在已發表 SR 中被系統性發現。
- 人機協作研究顯示,覆核者在 AI 預設建議下錯誤率上升 [27]。
- AI 產生的 SR 大量湧入,重複題目與低品質回顧進一步增加 [31]。
給醫學生的實用建議:不管你偏向哪一邊,今天就能養成的習慣是——文獻只從資料庫檢索取得,不從 LLM 記憶取得;保存每個資料庫的完整搜尋式、日期與命中數;每一句方法描述都要能指到一份紀錄;人工檢查點不要用預設值帶過;量測工具的一致性時,也像第 2 節的範例一樣寫清楚那個數字「不代表什麼」。
本章引用文獻
編號與正文 [N] 對應;全部經 PubMed、PMC 全文、arXiv 頁面或 GitHub 實讀查證(2026-10-06)。全站書目見參考文獻。
- Lin HT. Robust Literature Review Pipeline [software]. GitHub. Version 1.0.0; commit e2dbfa29ddd295053a319eb9fb2e47c156fe9fbf (2026-09-09). github.com/htlin222/robust-lit-review
- Koffel JB, Rethlefsen ML. Reproducibility of search strategies is poor in systematic reviews published in high-impact pediatrics, cardiology and surgery journals: a cross-sectional study. PLoS One. 2016;11(9):e0163309. PubMed 27669416|DOI
- Rethlefsen ML, et al. PRISMA-S: an extension to the PRISMA Statement for Reporting Literature Searches in Systematic Reviews. Syst Rev. 2021;10:39. PubMed 33499930|DOI
- McGowan J, et al. PRESS Peer Review of Electronic Search Strategies: 2015 Guideline Statement. J Clin Epidemiol. 2016;75:40-6. PubMed 27005575|DOI
- Bramer WM, et al. Optimal database combinations for literature searches in systematic reviews: a prospective exploratory study. Syst Rev. 2017;6:245. PubMed 29208034|DOI
- Guimarães NS, et al. Development of search strategies for systematic reviews in health using ChatGPT: a critical analysis. J Transl Med. 2024;22:1. PubMed 38167166|DOI
- Chelli M, et al. Hallucination rates and reference accuracy of ChatGPT and Bard for systematic reviews: comparative analysis. J Med Internet Res. 2024;26:e53164. PubMed 38776130|DOI
- Bhattacharyya M, et al. High rates of fabricated and inaccurate references in ChatGPT-generated medical content. Cureus. 2023;15(5):e39238. PubMed 37337480|DOI
- Walters WH, Wilder EI. Fabrication and errors in the bibliographic citations generated by ChatGPT. Sci Rep. 2023;13:14045. PubMed 37679503|DOI
- Gartlehner G, et al. Single-reviewer abstract screening missed 13 percent of relevant studies: a crowd-based, randomized controlled trial. J Clin Epidemiol. 2020;121:20-28. PubMed 31972274|DOI
- Waffenschmidt S, et al. Single screening versus conventional double screening for study selection in systematic reviews: a methodological systematic review. BMC Med Res Methodol. 2019;19:132. PubMed 31253092|DOI
- Wang Z, et al. Error rates of human reviewers during abstract screening in systematic reviews. PLoS One. 2020;15:e0227742. PubMed 31935267|DOI
- O’Mara-Eves A, et al. Using text mining for study identification in systematic reviews: a systematic review of current approaches. Syst Rev. 2015;4:5(勘誤 Syst Rev. 2015;4:59). PubMed 25588314|DOI
- Thomas J, et al. Machine learning reduced workload with minimal risk of missing studies: development and evaluation of a randomized controlled trial classifier for Cochrane Reviews. J Clin Epidemiol. 2021;133:140-151. PubMed 33171275|DOI
- Callaghan MW, Müller-Hansen F. Statistical stopping criteria for automated screening in systematic reviews. Syst Rev. 2020;9:273. PubMed 33248464|DOI
- Xie C, et al. Performance of large language models in automated medical literature screening: a systematic review and meta-analysis. J Evid Based Med. 2026. PubMed 42499245|DOI
- Purewal A, et al. Human versus artificial intelligence: evaluating ChatGPT’s performance in conducting published systematic reviews with meta-analysis in chronic pain research. Reg Anesth Pain Med. 2026. PubMed 39956557|DOI
- Dennstädt F, et al. Title and abstract screening for literature reviews using large language models: an exploratory study in the biomedical domain. Syst Rev. 2024;13:158. PubMed 38879534|DOI
- Page MJ, et al. The PRISMA 2020 statement: an updated guideline for reporting systematic reviews. BMJ. 2021;372:n71. PubMed 33782057|DOI
- Shea BJ, et al. AMSTAR 2: a critical appraisal tool for systematic reviews that include randomised or non-randomised studies of healthcare interventions, or both. BMJ. 2017;358:j4008. PubMed 28935701|DOI
- Hu K, et al. Inconsistencies in study eligibility criteria are common between non-Cochrane systematic reviews and their protocols registered in PROSPERO. Res Synth Methods. 2021;12:394-405. PubMed 33522101|DOI
- Elliott JH, et al. Living systematic reviews: an emerging opportunity to narrow the evidence-practice gap. PLoS Med. 2014;11:e1001603. PubMed 24558353|DOI
- Elliott JH, et al. Living systematic review: 1. Introduction—the why, what, when, and how. J Clin Epidemiol. 2017;91:23-30. PubMed 28912002|DOI
- Thomas J, et al. Living systematic reviews: 2. Combining human and machine effort. J Clin Epidemiol. 2017;91:31-37. PubMed 28912003|DOI
- Borah R, et al. Analysis of the time and workers needed to conduct systematic reviews of medical interventions using data from the PROSPERO registry. BMJ Open. 2017;7:e012545. PubMed 28242767|DOI
- Flemyng E, et al. Position statement on artificial intelligence (AI) use in evidence synthesis across Cochrane, the Campbell Collaboration, JBI, and the Collaboration for Environmental Evidence 2025. Campbell Syst Rev. 2025(另同步刊於 JBI Evid Synth、Environ Evid). PubMed 41230118|DOI
- Goddard K, Roudsari A, Wyatt JC. Automation bias: a systematic review of frequency, effect mediators, and mitigators. J Am Med Inform Assoc. 2012;19:121-7. PubMed 21685142|DOI
- Duyx B, et al. Scientific citations favor positive results: a systematic review and meta-analysis. J Clin Epidemiol. 2017;88:92-101. PubMed 28603008|DOI
- Saginur M, et al. Journal impact factor, trial effect size, and methodological quality appear scantly related: a systematic review and meta-analysis. Syst Rev. 2020;9:53. PubMed 32164791|DOI
- Chen L, Zaharia M, Zou J. How is ChatGPT’s behavior changing over time? arXiv:2307.09009. 2023. arxiv.org/abs/2307.09009
- Ioannidis JP. The mass production of redundant, misleading, and conflicted systematic reviews and meta-analyses. Milbank Q. 2016;94:485-514. PubMed 27620683|DOI
- Lin HT, Yeh JT. meta-pipe: AI-assisted, end-to-end meta-analysis pipeline with reproducible tooling [software]. GitHub. commit 5c5c3f0 (2026-09-23). github.com/htlin222/meta-pipe
- Panickssery A, Bowman SR, Feng S. LLM evaluators recognize and favor their own generations. arXiv:2404.13076. 2024. arxiv.org/abs/2404.13076