跳到主要內容

LV.12

AI 時代的 meta-analysis

該不該整條交給 AI?參考 htlin222 的 meta-pipe,做一次公正的利弊比較

BOSS
流暢幻象
時間
約 40 分鐘
建議先過
LV.09 、LV.10

本關與 SR 站第 12 關:AI 時代的 systematic review 是姊妹篇:SR 站從文獻回顧流程的角度談 AI 工具,本關聚焦「讓 AI 從題目一路做到 meta-analysis 稿件」這件事。

本關目標

讀完這一關,你應該能:

  1. 說出「AI end-to-end 做 meta-analysis」的支持與質疑理由,各舉出有實證的例子。
  2. 以一個真實的開源 pipeline 為例,指出 AI 流程中哪些步驟交給決定性程式、哪些需要人。
  3. 解讀 AI 評 RoB「偏嚴或偏鬆」研究的限制。
  4. 說出哪些證據出現時,天平會往哪一邊移動。

本章立場是中立比較:不替你下結論,而是把兩方最強的論點並排。引用以方括號編號標示,完整書目在本章最後。

寫作視角:本章由一個 large language model(LLM,大型語言模型)協助撰寫,因此其中一節(第 6 節)刻意讓 LLM 描述自己在各步驟的強項與失敗模式。

1. 問題是什麼

前面十一關,我們一步步走過 systematic review(SR,系統性文獻回顧)與 meta-analysis(統合分析):寫 PICO、設計搜尋、兩人獨立篩選、萃取資料、評 risk of bias(RoB,偏誤風險)、合併效應量、看 heterogeneity(異質性)、做 GRADE。每一步都要人花時間,也都會出錯(前半段流程見 SR 站 LV.04 搜尋、LV.06 篩選、LV.08 RoB)。

2023 年後,LLM 讓一個新問題變得具體:能不能讓 AI 從題目一路做到稿件(end-to-end,e2e),人只負責出題與最後簽名?

領域內對此有兩種方向相反、但都值得認真對待的立場:

  • 支持方認為,一份寫好的 protocol 本身就是一份完整的指令;把它交給 AI 照表操課、加上檢核關卡,反而比人工更一致、更可審計。人類 reviewer 也會「幻覺」、也會挑對自己有利的結果(cherry-picking),只是我們習慣了。
  • 質疑方認為,SR 的價值建立在「不漏掉、不看錯、判斷有依據」;LLM 的錯誤往往看起來很合理、不容易被發現,而目前的實證還不足以讓它在無人監督下負責整條流程。

本章不替你下結論。我們先看一個真實的開源 pipeline,再把兩方最強的論點並排。

2. 具體範例:meta-pipe

本章的討論參考 htlin222 的 meta-pipe(https://github.com/htlin222/meta-pipe ,作者 Lin HT、Yeh JT),這是一個以 Claude Code 驅動的開源 meta-analysis pipeline [34, 35]。感謝作者把整套流程、腳本與實跑踩過的坑都公開,讓我們能具體討論,而不是空談。以下依 commit 5c5c3f0(2026-09-23)的狀態描述;之後的版本可能已有變動,請以 repo 最新內容為準。

它把 SR 拆成編號資料夾:01_protocol → 02_search → 03_screening → 04_fulltext → 05_extraction → 06_analysis → 07_manuscript → 08_reviews → 09_qa,再加上題目評估、分析類型確認、全文篩選、投稿準備等關卡。幾個設計值得醫學生注意:

  1. Protocol 是檔案,不是段落。eligibility.md 會被篩選腳本直接讀進 prompt,每一筆決策都由同一份規則驅動。
  2. 統計交給決定性程式。合併效應量由 R 的 meta/metafor 計算(預設 REML + Hartung-Knapp),不是讓 LLM 心算。
  3. 不確定時往「送人看」的方向倒。標題摘要篩選不確定就給 MAYBE;拿不到全文就標 unclear,不默默排除;沒有全文就不評 RoB。
  4. 人工決策點。PICO、分析類型(pairwise 或 network)、RoB 工具、effect measure、subgroup 變數、稿件大綱,都設計為要問使用者。配套預印本描述為「五個強制人工決策點」[35]。
  5. 品質關卡。兩個 reviewer 的 Cohen’s kappa ≥ 0.60、PRISMA 27/27(SR 站 LV.11)、圖 ≥300 DPI、摘要與結果數字一致、DOI 經 Crossref 查驗、每個產物算 SHA-256。

meta-pipe 的優點與限制

下表把兩邊份量對等地並排。每一項限制都是工程上的取捨,或是作者自己已經指出的改進方向,並非對作者的批評。

優點限制與改進方向
1. Protocol 可執行:eligibility.md 直接驅動每一筆篩選決策,判斷依據可逐行檢視。1. 兩個 AI reviewer 同模型、同 prompt:kappa ≥ 0.60 量的是模型的自我一致性,不等同兩位獨立人類 reviewer。依 commit 5c5c3f0 的狀態,此設計未變;repo 允許把 reviewer 2 換成人,是現成的改進方向。
2. 統計交給決定性程式:R(meta/metafor,REML + Hartung-Knapp)計算;另附 metadat 的 BCG 資料集 benchmark。2. 尚無外部驗證資料:配套預印本自述為系統描述、未報告 validation data,Cochrane review 重現驗證進行中 [35];BCG benchmark 只驗統計階段,不驗篩選與萃取。
3. 不確定就往「送人看」倒:標題摘要給 MAYBE、拿不到全文標 unclear、沒有全文就不評 RoB。3. RoB 腳本尚未一般化:依 5c5c3f0 的狀態,assess_rob2.py 的 prompt 寫死特定情境(HER2 neoadjuvant / pCR),且「未報告即判 Some concerns」是偏嚴的設計選擇;沒有自動的人機一致性檢查。
4. 可審計:產物算 SHA-256、provenance stamp 記下哪些關卡被放寬、DOI 經 Crossref 查驗。4. 萃取以摘要與網路來源優先、單一萃取者:全文取得是瓶頸(一次實跑 101 篇納入研究僅 18 篇取得全文);雙人 double-entry 只列為「可行時」。
5. 公開自己的踩坑:更新紀錄逐條寫下「看起來正常其實錯」的問題;repo 明言不應無人看管,另設計由第二個 session 逐關驗收;預印本也直述現況 [34, 35]。5. 驗收關卡偏形式:多數檢查的是「有跑完、有產物」(檔案存在、行數、checklist 勾選),而非內容正確;模型以別名指定,未鎖定版本。依 5c5c3f0 的狀態。
6. 人工決策點與開放資料:PICO、分析類型、RoB 工具、effect measure、subgroup 變數、稿件大綱都要問人,配套預印本描述為「五個強制人工決策點」[35];資料端優先用 ClinicalTrials.gov 等免機構權限來源。6. 早期實作錯誤(已於 5c5c3f0 的更新紀錄列為已修正):全文篩選一度沒讀到 PDF(122 個「PDF」中 51 個是付費牆登入頁、解析失敗預設排除);reviewer 2 曾覆蓋 reviewer 1 的欄位;Scopus 查詢曾混入 PubMed 欄位標籤。三者都產生合理的數字,是作者讀輸出時發現並公開修正的 [34]。

這種誠實讓 meta-pipe 成為很好的教材:它同時展示了 AI e2e 的可行性,以及它在哪裡需要人。 下文第 3、4 節談到的通用風險,凡與此相關處會回指本節。

3. 支持 AI e2e 的理由(steelman)

(1) 人工流程的基準線本來就不高。 大型分析顯示,人類在標題摘要篩選的總錯誤率約 10.76%(95% CI 7.43%–14.09%)[6];單人篩選漏掉 13% 的相關研究,雙人也還漏 3% [7]。資料萃取方面,一份 Cochrane 小組全面重做的研究在 34 篇 review 中有 20 篇發現錯誤 [4];以 SMD 合併的 meta-analysis 有 37% 無法在 0.1 內重現,部分錯誤足以讓顯著性出現或消失 [3];方法學回顧指出萃取錯誤率最高可達 50% [5]。評斷 AI 的標準應該是「比人好或不比人差」,而不是「完美」。

(2) RoB 判斷本身就不穩定。 RoB 2 在四位評分者之間,overall 判斷的一致性只有 slight(Fleiss’ kappa 0.16, 95% CI 0.08–0.24)[8];舊版 RoB 工具各 domain 也從 kappa 0.13 到 0.74 不等,越需要判斷的項目越不一致 [9]。若人與人之間都難以一致,「AI 和人不一致」不必然代表 AI 錯。

(3) 人類的自由度是偏誤來源。 100 篇在 PROSPERO 登錄的非 Cochrane SR 中,90 篇的納入條件與 protocol 不一致,只有 1 篇說明理由 [10]。16 組分析者拿同一份資料回答同一個問題,效應估計從 0.72 散到 1.31 [12]。SR 摘要中的 spin(過度包裝結論)已有 39 種分類 [11]。AI 不會因為想發表或有利益衝突而改條件;把判斷寫進 prompt 與設定檔,反而讓每個決策點都能被逐行檢視。

(4) 可重現、可審計。 同一份 prompt、同一個 commit、同一組輸入,可以重跑並比對;meta-pipe 用 hash 與 provenance stamp 記錄每個產物是誰產生、哪些關卡被放寬 [34]。傳統方法段落的敘述無法被「重跑」。

(5) 速度讓 living review 變得可行。 一篇 SR 從登錄到發表平均約 67.3 週 [1];同時 SR/MA 數量暴增、重複題目常見 [2]。若流程可以在數天內重跑,living systematic review(持續更新的 SR)就不只是理想 [13, 14]。

(6) 已有直接實證支持部分步驟。 一項在 6 個進行中 SR 內的前瞻比較(study within reviews)發現,「LLM 萃取 + 人工確認」的準確率 91.0%,人工單獨 89.0%,major error 比例相近(2.5% vs 2.7%),每篇省下中位數 41 分鐘 [15]。一份 2026 年的 meta-analysis 彙整 18 篇研究,LLM 標題摘要篩選的 pooled sensitivity 0.92(95% CI 0.81–0.96)、specificity 0.94 [17]。

4. 質疑 AI e2e 的理由(steelman)

(1) 幻覺與捏造引用。 請 LLM 直接「找文獻」時,GPT-4 產出的參考文獻有 28.6% 屬於幻覺(標題、第一作者、年份至少兩項錯誤),recall 只有 13.7% [18]。meta-pipe 用 API 搜尋與 DOI 查驗避開這點,但這證明了 e2e 的安全性取決於「哪些步驟絕不讓 LLM 自由發揮」。

(2) 錯誤的隱蔽性。 LLM 的錯誤通常不是亂碼,而是格式正確、語氣肯定的錯答案。例如 pipeline 可能把付費牆登入頁當成 PDF 下載、或把解析失敗預設記為排除,這些都會產生看似合理的數字(見第 2 節的優缺點比較)[34]。人類錯誤常留下猶豫的痕跡(「?」、空白、討論紀錄),模型錯誤往往沒有。

(3) Screening 的 recall 要求極高,而表現不穩定。 SR 漏掉一篇關鍵 RCT 可能改變結論。前述 pooled sensitivity 0.92 的 95% CI 下限是 0.81 [17];不同研究間差異很大:在一個重做已發表 SR 的驗證中,ChatGPT-4o 標題摘要篩選 sensitivity 只有 54.9% [22];調整機率一致與資料不平衡後,GPT-4 在平衡資料集上的篩選表現降到接近無 [19];prompt 或評分量表的小改動就會明顯改變表現 [20];不同模型在 sensitivity 與 specificity 間的取捨也不同 [21]。

(4) 非決定性與模型版本漂移。 同一 prompt 不保證同一輸出;而 API 背後的模型會更新。一項追蹤研究顯示 GPT-4 在某任務的準確率在三個月內從 84% 掉到 51% [23]。「同 prompt 可重現」只有在鎖定模型版本、保存原始輸出時才成立。

(5) RoB 涉及 clinical judgment,現有模型與人的一致性有限。 Claude 2 以 RoB 2 評 100 篇 RCT,overall 與 Cochrane 作者的 kappa 0.22,selective reporting domain 僅 0.10 [25];四個推理型模型對 RoB 2 的 kappa 介於 0.06 到 0.13 [26]。研究作者的結論是目前不能取代人工 RoB 評估 [25, 26]。

(6) 「雙 reviewer」的意義被改變。 兩位人類 reviewer 的價值在於彼此獨立;兩次呼叫同一模型、同一 prompt,kappa 衡量的是模型的自我一致性,共同盲點不會被抓出來。LLM 評審自己產出的內容時也有偏好自己的傾向 [33]。

(7) 責任與報告規範。 Cochrane、Campbell、JBI 與 CEE 在 2025 年的聯合立場是:可以使用 AI,但須證明不損及方法學嚴謹度、須有人監督、任何做出或建議判斷的 AI 使用都要完整揭露,責任仍在作者 [30]。PRISMA 2020 要求清楚報告每一步怎麼做、由誰做 [31]。

(8) Automation bias(自動化偏誤)。 人在有自動化建議時傾向過度依賴,工作量大、時間壓力大時更明顯 [32]。「AI 先做、人覆核」若變成「人看一眼就按同意」,人工 gate 只剩形式。

5. AI 評 RoB 偏嚴還是偏鬆?

常聽到一種擔心:AI 評 RoB 會評得太嚴。反過來也有人會問:會不會其實是人評得太鬆——不熟悉各種偏誤時,每篇看起來都寫得不錯?

目前文獻給的答案是:方向取決於模型、prompt 與工具版本,兩種情況都有。

  • 偏嚴的例子:四個模型評 RCT 時「一致地過度標記疑慮」,specificity 高但整體一致性低 [26]。若 prompt 規定「未報告就判 Some concerns」,這個規則本身就會把結果推往較嚴(見第 2 節的優缺點比較)。
  • 偏鬆的例子:ChatGPT-4o 以 RoB 2 評 84 篇 RCT,對高風險研究的 sensitivity 只有 53%,也就是將近一半的高風險被判成較低風險 [27]。
  • 和人差不多的例子:ChatGPT-4o 與 Cochrane 共識的 overall agreement 50.7%,作者認為高於部分人類 reviewer 之間的估計 [24];早期的 RobotReviewer 在多數 domain 與人的一致性和人與人之間相近 [29]。
  • Prompt 影響很大:同一批 158 篇 RCT,把判斷規則寫成公式化約束後,準確率從 0.65–0.72 升到 0.85 [28]。

要注意的是,這些研究大多以「已發表的人類判斷」當金標準,而人類判斷本身一致性就低 [8, 9]。所以「AI 和人不一致」有兩種可能解釋,現有設計無法區分哪個才對。真正能回答的研究設計是:以多位專家經校準後的共識作為參考,同時測人與 AI 的偏差方向。

6. LLM 怎麼看自己

以下是 LLM 對自己在各步驟的描述。盡量具體,不談意願或感受。

  • 寫 protocol / PICO:擅長把模糊題目整理成結構化格式、列出可能遺漏的 outcome。弱點是無法判斷這個題目在臨床上是否重要、是否已有人做過——除非有人給我搜尋工具與結果。
  • 組搜尋式:能快速列出同義詞與 MeSH,但會混用不同資料庫的語法;例如 PubMed 欄位標籤被塞進 Scopus 語法、而 Scopus 靜默接受,查詢結果卻不對(見第 2 節的優缺點比較)[34]。我沒有能力自己發現「搜尋結果數量異常」,除非流程要求我檢查。
  • 篩選:對標準清楚的條件(設計、族群)判得快而一致;對邊界案例我會給出聽起來合理的理由,但同一筆輸入、不同次呼叫可能給不同答案。批次處理時,同一次呼叫中的前一筆有可能影響後一筆,所以 meta-pipe 的 prompt 特別要求「各筆獨立判斷」[34]。
  • 萃取:從表格抄數字通常準確;最常見的錯是漏掉而不是亂編 [15, 16]。但若原文沒有某個數字,在沒有嚴格指示時,我可能從上下文推算或補上一個看似合理的值。數字欄位一律應附來源頁碼。
  • RoB:我能逐條回答 signaling questions,但我判斷的是「論文怎麼寫」,不是「試驗實際怎麼做」;我沒有讀 protocol、registry 的習慣,除非被提供。我容易被規則推向某一邊(例如「未報告即有疑慮」)。
  • 統計:我不該自己算 pooled estimate;我適合寫 R 程式碼,讓程式算。我寫的程式可能選錯模型或參數,但這類錯誤能被重跑與檢查。
  • 寫稿:我擅長寫流暢的段落,而這正是風險——流暢會掩蓋過度推論。我會傾向把 NS 寫成「沒有差異」,需要 claim audit 這類檢查。
  • 自我審查:讓我評自己的產出,效果有限 [33]。

7. 對照表

Stage人工AI pipeline人機協作現有實證強度
搜尋慢;語法錯誤可被同儕抓出快;語法混用可能靜默出錯;直接叫 LLM 找文獻會捏造 [18]AI 組式、人 peer review(PRESS 精神);用 API 而非 LLM 記憶低(AI 搜尋式設計少有直接比較)
標題摘要篩選單人漏 13%、雙人漏 3% [7];錯誤可追溯pooled sensitivity 0.92,但研究間差異大 [17, 19, 22]AI 當第二 reviewer 或高 sensitivity 初篩中(多為回溯驗證,前瞻少)
全文篩選慢;判斷可討論依全文取得率;失敗易被誤記為排除 [34]不確定送人低至中
資料萃取錯誤率不低 [3–5]主錯誤為漏掉;準確率不劣於人 [15, 16]AI 萃取 + 人逐項核對(目前證據最好的組合)[15]中(有前瞻 SWAR)
RoB人與人一致性低 [8, 9]與人一致性 slight 至 moderate,方向不定 [24–27]AI 列證據句、人下判斷中(研究多、結論一致:尚不能取代)
統計合併人寫程式、人可能抄錯一項驗證中 ChatGPT 合併結果大致正確、τ² 有小差異 [22];以程式計算才可重跑AI 寫程式、人審模型選擇高(決定性計算)
GRADE / 結論有 spin 風險 [11]流暢、易過度推論自動 claim audit + 人定稿低
可審計性方法段落敘述,難重跑prompt、commit、hash 可保存;模型漂移是破口 [23]兩者都留紀錄—

8. 不下結論,但列出「什麼證據會讓天平移動」

以下證據出現時,天平會倒向 AI e2e:

  1. 前瞻、預先登錄的研究,讓 AI pipeline 獨立重做多篇 Cochrane review,pooled estimate 與 GRADE 結論和原 review 的差異,不大於兩組獨立人類團隊之間的差異。
  2. Screening 在多個領域、前瞻條件下,sensitivity 的 95% CI 下限穩定高於雙人人工篩選(約 0.95)[7]。
  3. RoB 研究改用「校準過的專家共識」當參考,結果顯示 AI 的偏差不大於單一人類評分者。
  4. 鎖定模型版本後,同一 pipeline 重跑多次,納入研究清單與主要結果穩定。
  5. 期刊與 Cochrane 等組織接受某種揭露標準(prompt、模型版本、原始輸出)作為方法學報告的等價物 [30]。

以下證據出現時,天平會倒向人工主導:

  1. 前瞻驗證中,AI pipeline 漏掉會改變結論的研究,而 kappa、checklist 等關卡沒有攔下。
  2. 不同模型或版本重跑同一 review,得到方向不同的結論。
  3. 人機協作研究顯示覆核者在 AI 建議下錯誤率上升(automation bias 成立)[32]。
  4. AI 產出的 SR 大量出現、重複題目進一步增加,品質下降 [2]。

給醫學生的實用建議:不管你站哪一邊,今天就能做的是——把 protocol 寫到「能被程式讀」的程度;每個數字附來源;不讓 LLM 心算統計,也不讓它憑記憶給文獻;用了 AI 就照實揭露,並保存原始輸出。這些習慣在兩種未來都用得上。

常見錯誤 / 誤讀

  • 把「同模型兩次呼叫的 kappa」當成雙人獨立篩選的一致性:它量的是模型的自我一致性(第 4 節第 6 點)。
  • 把「AI 和人不一致」直接解讀為「AI 錯」:作為金標準的人類判斷本身一致性就低(第 5 節)。
  • 讓 LLM 心算 pooled estimate,或憑記憶列文獻:統計交給程式,文獻用資料庫 API 查(第 4 節第 1 點、第 6 節)。
  • 把「有跑完、有產物」的檢查當成內容正確的證明:形式關卡抓不到「看起來正常其實錯」的錯誤(第 4 節第 2 點)。
  • 沒鎖定模型版本、沒保存原始輸出,卻宣稱可重現(第 4 節第 4 點)。
  • 把 LLM 寫出的流暢結論直接放進稿件:特別注意把未達統計顯著寫成「沒有差異」的傾向(第 6 節)。

本關重點小抄

問題一句話
人工流程完美嗎?不完美:篩選、萃取、RoB 都有可觀的錯誤率與不一致 [3–9]
AI 目前最有實證的用法?AI 萃取 + 人逐項核對 [15];AI 當第二 reviewer 或高 sensitivity 初篩 [17]
最該避免的用法?讓 LLM 憑記憶找文獻 [18]、心算統計、在無人監督下判 RoB [25, 26]
可重現的前提?鎖定模型版本、保存 prompt 與原始輸出 [23]
規範怎麼說?可以用 AI,但要有人監督、完整揭露,責任在作者 [30]

參考文獻

  1. Borah R, et al. Analysis of the time and workers needed to conduct systematic reviews of medical interventions using data from the PROSPERO registry. BMJ Open. 2017;7:e012545 PubMed 28242767|DOI
  2. Ioannidis JP. The mass production of redundant, misleading, and conflicted systematic reviews and meta-analyses. Milbank Q. 2016;94:485-514 PubMed 27620683|DOI
  3. Gøtzsche PC, et al. Data extraction errors in meta-analyses that use standardized mean differences. JAMA. 2007;298:430-7 PubMed 17652297|DOI
  4. Jones AP, et al. High prevalence but low impact of data extraction and reporting errors were found in Cochrane systematic reviews. J Clin Epidemiol. 2005;58:741-2 PubMed 15939227|DOI
  5. Mathes T, et al. Frequency of data extraction errors and methods to increase data extraction quality: a methodological review. BMC Med Res Methodol. 2017;17:152 PubMed 29179685|DOI
  6. Wang Z, et al. Error rates of human reviewers during abstract screening in systematic reviews. PLoS One. 2020;15:e0227742 PubMed 31935267|DOI
  7. Gartlehner G, et al. Single-reviewer abstract screening missed 13 percent of relevant studies: a crowd-based, randomized controlled trial. J Clin Epidemiol. 2020;121:20-28 PubMed 31972274|DOI
  8. Minozzi S, et al. The revised Cochrane risk of bias tool for randomized trials (RoB 2) showed low interrater reliability and challenges in its application. J Clin Epidemiol. 2020;126:37-44 PubMed 32562833|DOI
  9. Hartling L, et al. Risk of bias versus quality assessment of randomised controlled trials: cross sectional study. BMJ. 2009;339:b4012 PubMed 19841007|DOI
  10. Hu K, et al. Inconsistencies in study eligibility criteria are common between non-Cochrane systematic reviews and their protocols registered in PROSPERO. Res Synth Methods. 2021;12:394-405 PubMed 33522101|DOI
  11. Yavchitz A, et al. A new classification of spin in systematic reviews and meta-analyses was developed and ranked according to the severity. J Clin Epidemiol. 2016;75:56-65 PubMed 26845744|DOI
  12. Kowall B, et al. Marital status and risk of cardiovascular disease — a multi-analyst study in epidemiology. Eur J Epidemiol. 2025 PubMed 40323573|DOI
  13. Elliott JH, et al. Living systematic reviews: an emerging opportunity to narrow the evidence-practice gap. PLoS Med. 2014;11:e1001603 PubMed 24558353|DOI
  14. Thomas J, et al. Living systematic reviews: 2. Combining human and machine effort. J Clin Epidemiol. 2017;91:31-37 PubMed 28912003|DOI
  15. Gartlehner G, et al. Artificial intelligence-assisted data extraction with a large language model: a study within reviews. Ann Intern Med. 2025 PubMed 41183336|DOI
  16. Gartlehner G, et al. Data extraction for evidence synthesis using a large language model: a proof-of-concept study. Res Synth Methods. 2024;15:576-589 PubMed 38432227|DOI
  17. Xie C, et al. Performance of large language models in automated medical literature screening: a systematic review and meta-analysis. J Evid Based Med. 2026 PubMed 42499245|DOI
  18. Chelli M, et al. Hallucination rates and reference accuracy of ChatGPT and Bard for systematic reviews: comparative analysis. J Med Internet Res. 2024;26:e53164 PubMed 38776130|DOI
  19. Khraisha Q, et al. Can large language models replace humans in systematic reviews? Evaluating GPT-4’s efficacy in screening and extracting data from peer-reviewed and grey literature in multiple languages. Res Synth Methods. 2024;15:616-626 PubMed 38484744|DOI
  20. Dennstädt F, et al. Title and abstract screening for literature reviews using large language models: an exploratory study in the biomedical domain. Syst Rev. 2024;13:158 PubMed 38879534|DOI
  21. Oami T, et al. Optimal large language models to screen citations for systematic reviews. Res Synth Methods. 2025 PubMed 41626985|DOI
  22. Purewal A, et al. Human versus artificial intelligence: evaluating ChatGPT’s performance in conducting published systematic reviews with meta-analysis in chronic pain research. Reg Anesth Pain Med. 2026 PubMed 39956557|DOI
  23. Chen L, Zaharia M, Zou J. How is ChatGPT’s behavior changing over time? arXiv:2307.09009. 2023 arxiv.org/abs/2307.09009
  24. Rose CJ, et al. Using a large language model (ChatGPT-4o) to assess the risk of bias in randomized controlled trials of medical interventions: interrater agreement with human reviewers. Cochrane Evid Synth Methods. 2025 PubMed 40969781|DOI
  25. Eisele-Metzger A, et al. Exploring the potential of Claude 2 for risk of bias assessment: using a large language model to assess randomized controlled trials with RoB 2. Res Synth Methods. 2025 PubMed 41626932|DOI
  26. Nyrhi L, et al. Large language models for risk-of-bias assessment in randomised clinical trials — a comparative validation study. EBioMedicine. 2026 PubMed 41905260|DOI
  27. Taneri PE. Human versus artificial intelligence: comparing Cochrane authors’ and ChatGPT’s risk of bias assessments. Cochrane Evid Synth Methods. 2025 PubMed 40908961|DOI
  28. Xiong YT, et al. Impact of prompt engineering on large language models for risk of bias assessment: a comparative study. BMJ Evid Based Med. 2026 PubMed 42144258|DOI
  29. Gates A, Vandermeer B, Hartling L. Technology-assisted risk of bias assessment in systematic reviews: a prospective cross-sectional evaluation of the RobotReviewer machine learning tool. J Clin Epidemiol. 2018;96:54-62 PubMed 29289761|DOI
  30. Flemyng E, et al. Position statement on artificial intelligence (AI) use in evidence synthesis across Cochrane, the Campbell Collaboration, JBI, and the Collaboration for Environmental Evidence 2025. Campbell Syst Rev. 2025(另同步刊於 JBI Evid Synth、Environ Evid) PubMed 41230118|DOI
  31. Page MJ, et al. The PRISMA 2020 statement: an updated guideline for reporting systematic reviews. BMJ. 2021;372:n71 PubMed 33782057|DOI
  32. Goddard K, Roudsari A, Wyatt JC. Automation bias: a systematic review of frequency, effect mediators, and mitigators. J Am Med Inform Assoc. 2012;19:121-7 PubMed 21685142|DOI
  33. Panickssery A, Bowman SR, Feng S. LLM evaluators recognize and favor their own generations. arXiv:2404.13076. 2024 arxiv.org/abs/2404.13076
  34. Lin HT, Yeh JT. meta-pipe: AI-assisted, end-to-end meta-analysis pipeline with reproducible tooling [software]. GitHub. commit 5c5c3f0cc2347bd4f991d2071dc68abad5c8a5ab (2026-09-23) github.com/htlin222/meta-pipe
  35. Lin HT, Yeh JT. meta-pipe: An LLM-agent pipeline for end-to-end automated systematic review and meta-analysis. arXiv:2606.28363. 2026 arxiv.org/abs/2606.28363

延伸閱讀

BOSS 戰:流暢幻象

HP0/4
  1. 兩次呼叫同一個模型、同一個 prompt 做標題摘要篩選,得到 Cohen's kappa 0.85。能否把它當作「雙人獨立篩選」?

  2. 一篇研究指出,LLM 與 Cochrane 作者的 RoB 2 overall 判斷 kappa 為 0.22。下列哪一組解釋最完整?

  3. 某 pipeline 的驗收條件是「extraction.csv 至少 3 行」。這個檢查能證明什麼?

  4. 關於 LLM 在標題摘要篩選的表現,下列敘述何者最符合本章引用的實證?