跳到主要內容

LV.01

為什麼要做 Systematic Review

narrative vs systematic、證據金字塔、SR 家族(scoping / rapid / umbrella / living)

BOSS
「我覺得有效」軼事巨人
時間
約 25 分鐘

本關目標

新手勇者,歡迎來到 SR 王國。這一關的 Boss 是「我覺得有效」軼事巨人——它的武器是一個病人的故事、一位權威的經驗、一篇剛好讀到的論文。打完本關,你應該能:

  1. 說清楚 systematic review(SR,系統性回顧) 與 narrative review(敘述性回顧) 的差別,以及 SR 為什麼存在。
  2. 用比較新的眼光看 evidence pyramid(證據金字塔):SR 不只是金字塔頂端的一層。
  3. 分辨 SR 家族成員——scoping review、rapid review、umbrella review、living systematic review——各自適合什麼情境。
  4. 知道「研究浪費」的論點與數字該怎麼引用,也知道 SR 本身會被濫產。

全站用同一個迷你 SR 當主線:「全身性類固醇能不能讓急性喉嚨痛比較快好?」從這一關開始,每一關都會拿它當例子。


一、軼事巨人為什麼難打

想像晨會上學長說:「喉嚨痛打一針 dexamethasone 就好了,我用很多年了。」你去翻文獻,找到一篇 RCT 說有效,另一篇的結果未達統計顯著。你該相信哪一篇?

人腦天生會被三件事帶著走:

  • 記得的病例:效果好的病人印象深刻,沒改善的病人默默消失在追蹤之外。
  • 剛好讀到的論文:你讀到哪篇,取決於哪篇被引用得多、哪篇刊在大期刊,而這些和「結果是否正向」有關(第 4 關會談 publication bias)。
  • 想要的答案:已經相信某個治療有效的人,比較容易注意到支持的證據。

只讀一兩篇研究、或請一位專家「整理一下文獻」,都擋不住這三件事。這就是 SR 存在的理由。

Narrative review vs systematic review

Narrative review(敘述性回顧)Systematic review(系統性回顧)
問題常很廣,例如「喉嚨痛的處置」聚焦、事先定義,例如 PICO(第 2 關)
找文獻作者熟悉的文獻,搜尋方法通常不寫多個資料庫、完整檢索式、可重現(第 4 關)
選文獻標準不明事先寫好的納入與排除條件,雙人獨立篩選(第 6 關)
評品質常不評或不一致逐篇評 risk of bias(第 8 關)
整合作者主觀敘述結構化整合,能量化就做 meta-analysis(第 9 關)
可重現別人很難重做別人照 protocol 應能得到相近結果

Mulrow 1994 在 BMJ 說明了 SR 的理由:資訊量太大,需要有效率地整合;需要檢驗研究發現能否推廣到不同族群與情境;而明確、事先寫好的方法可以限制偏誤。Cochrane Handbook 第 1 章(Lasserson 2019)也從「依事先訂好的方法回答特定問題」來定義 SR。

一個常見誤會:SR 不等於 meta-analysis。SR 是一整套流程;meta-analysis 是流程中「用統計合併效果量」的選配步驟。研究太不相同時,SR 可以只做敘述性整合(第 9 關)。量化合併的細節在姊妹站 MA 王國第 1 關。

SR 的流程地圖

本站 12 關就是一份 SR 的完整流程:

問題形成(第 2 關)→ 寫 protocol 並註冊(第 3 關)→ 搜尋(第 4 關)→ 去重(第 5 關)→ 兩階段篩選(第 6 關)→ 資料萃取(第 7 關)→ risk of bias(第 8 關)→ 合併(第 9 關)→ GRADE 證據確定性(第 10 關)→ 依 PRISMA 2020 報告(第 11 關)→ AI 在每一步能做什麼(第 12 關)。


二、為什麼需要 SR:證據爆炸與過時速度

文獻多到讀不完

Bastian 2010 的標題就是答案:每天約 75 篇試驗報告、11 篇 SR,而多數文獻整合仍是非系統性的敘述性回顧。十年後情況更誇張:Hoffmann 2021 估計被索引的 SR 從 2000 年的約 1,432 篇(95% CI 547–2,317)、2010 年約 5,013 篇,增加到 2019 年約 29,073 篇(95% CI 25,445–32,702),相當於每天將近 80 篇 SR。

沒有人能靠「自己讀」跟上,所以需要有人用可信的方法把證據整合起來。

SR 也會過時

Shojania 2007 追蹤 100 篇高品質 SR,看它們多久出現「需要更新」的訊號(例如新的大型試驗改變了結論):

  • 57%(95% CI 47–67%)在追蹤期間出現更新訊號;
  • 無訊號存活的中位數為 5.5 年(95% CI 4.6–7.6);
  • 但 23% 在 2 年內、15% 在 1 年內就出現訊號,7% 在發表當下就已經有訊號。

所以讀 SR 時要看搜尋日期,不是只看發表日期。這也是後面要介紹的 living SR 出現的原因。


三、證據金字塔:新舊兩種看法

傳統證據金字塔由下而上是:專家意見 → 病例報告 → 觀察性研究 → RCT → SR/MA。這張圖有用,但容易讓人以為「只要是 SR,就是最高等級證據」。

Murad 2016 提出「新證據金字塔」,有兩個重點:

  1. 分隔研究設計的線條變成波浪狀:研究的確定性不只由設計決定,還要看偏誤風險、一致性、精確度等(也就是 GRADE 的想法,第 10 關)。做得好的觀察性研究,可能比偏誤嚴重的 RCT 更可信。
  2. SR/MA 被拿出金字塔,變成「看證據的放大鏡」:SR 是消化證據(評讀、綜合、應用)的工具,而不是位階最高的一種研究設計。合併 10 個高偏誤風險的小試驗,得到的仍是低確定性的證據。

一句話記住:SR 的可信度取決於它納入了什麼、怎麼做的,而不是它叫做 SR。


四、SR 家族:四個常見親戚

標準的 SR(例如 Cochrane intervention review)回答「某介入對某結果的效果」。但不是每個問題都該用它。Munn 2018 提出 SR 類型學,說明不同類型的問題與納入條件該對應到哪種回顧。下面是本關要認識的四個親戚。

1. Scoping review(範圍回顧)

用途:描繪某領域有哪些研究、用了哪些定義與方法、知識缺口在哪;釐清概念;或作為正式 SR 的前置探勘。它通常不以合併效果為目的。

  • 方法框架最早由 Arksey & O’Malley 2005 提出,分五個階段:確立研究問題、找出相關研究、選擇研究、整理資料(charting)、彙整摘要與報告,另有選擇性的第六階段「諮詢利害關係人」;JBI 的更新指引見 Peters 2020。
  • 報告規範是 PRISMA-ScR(Tricco 2018):20 個必要項目與 2 個選擇項目,由 24 位專家組成的小組依 EQUATOR 指引發展。
  • Munn 2018 的提醒:scoping review 適合找知識缺口、界定範圍、釐清概念或探討研究怎麼做,不應拿來回答本該用 SR 回答的效果問題。

例:「醫學教育中的 AI 應用研究,目前做了哪些、用什麼 outcome?」→ scoping review。

2. Rapid review(快速回顧)

用途:決策者在時間或資源受限下需要證據,例如疫情初期的政策決定。做法是有意識地簡化 SR 的某些步驟。

但「快速」沒有統一定義,實證也還不足:

  • Tricco 2015 納入 82 篇 rapid review,找出 50 種不同的方法,只有 16 種出現超過一次。常見簡化包括限制日期(68%)、限制語言(49%)、只搜已發表文獻(24%)、以敘述方式呈現結果(78%);比較 rapid review 與 SR 的 4 個案例研究中,3 個結論一致。
  • Haby 2016 回顧後發現,沒有任何一篇 SR 的品質足以對「最佳 rapid review 方法」下確切結論。
  • Hamel 2021 分析 216 篇 rapid review 與 90 篇方法學文章的定義,歸納出 8 個主題,顯示定義仍很分歧。
  • Cochrane Rapid Reviews Methods Group(Garritty 2021)提出 26 項建議,並註明部分捷徑缺乏實證、指引需持續更新。
  • JBI 立場(Tricco 2022):尚未背書特定 rapid review 方法,但要求維持嚴謹,並清楚報告簡化了哪些步驟。

幾個常見捷徑已有 meta-research 可參考,例如單人篩選會漏掉多少研究(第 6 關)、排除非英文文獻的影響(第 4 關)。

3. Umbrella review(傘狀回顧,overview of reviews)

用途:同一主題已經有多篇 SR,想整合起來看全貌,或比較不同介入。分析單位是 SR,不是原始研究。

  • Aromataris 2015 提出 JBI 的 umbrella review 方法,包括 PICO 式問題與一份 10 題的 SR 評讀工具。
  • Fusar-Poli 2018 歸納 10 條實務規則,例如預先註冊 protocol、報告異質性與偏誤、證據分層、做敏感度分析。
  • 特有的陷阱是重疊(overlap):同一個原始試驗被好幾篇 SR 納入,整合時會被重複計算。Pieper 2014 檢視 60 篇 overview,只有 32 篇提到重疊;重疊可用 corrected covered area(CCA)衡量。
  • 入門說明也可參考 Ioannidis 2009 在 CMAJ 的 umbrella review 導論。

4. Living systematic review(活的系統性回顧)

用途:證據快速出現、現有結論不確定、新研究可能改變實務或政策時,讓 SR 持續更新,有新研究就納入。

  • 概念由 Elliott 2014 提出;Elliott 2017(系列第 1 篇)說明了上述適用情境。
  • 系列第 2 篇(Thomas 2017)談人與機器如何分工、持續監測新文獻。
  • 系列第 3 篇(Simmonds 2017)提醒統計問題:反覆更新 meta-analysis 時,Type I error 會隨更新次數上升,並比較了幾種校正方法(如 trial sequential analysis,細節在 MA 王國)。

一張表選類型

你的情境選誰
想知道某介入的效果,時間足夠標準 SR(± meta-analysis)
想知道某領域有哪些研究、缺口在哪Scoping review
決策期限很短Rapid review(寫清楚簡化了什麼)
已經有很多篇 SR,想整合Umbrella review(處理重疊)
證據一直出來、結論還不穩Living SR

五、研究浪費:為什麼「先做 SR」是倫理問題

Chalmers & Glasziou 2009 的四階段架構

Chalmers & Glasziou 2009 在 Lancet 的觀點文,把研究浪費分成四個接續階段:

  1. 選錯問題:例如膝關節骨關節炎,只有 9% 的病人想要更多藥物研究,但超過 80% 的 RCT 在評估藥物。
  2. 設計與方法不佳:例如回覆的 24 位試驗作者中,只有 11 位在設計新試驗時知道相關 SR;234 篇試驗中,分派隱匿不足者 18%、不清楚者 26%。
  3. 沒有發表:一份涵蓋 79 個追蹤研究的 SR 估計,摘要發表後 9 年內成為全文的只有約 53%。
  4. 報告不完整、無法使用:介入描述足夠者約 60%。

作者接著推估:若第 2、3、4 階段各損失約 50%,而且圖中估計的損失可以推廣,累積起來可能超過 85%。這是有條件的粗估,主要根據臨床試驗的證據推論到其他研究。引用時請寫「作者估計累積損失可能超過 85%」,不要寫成「研究證實 85% 的研究被浪費」。

Macleod 2014 是 Lancet「increasing value, reducing waste」系列的導論 Comment,沿用了這個估計並換算成金額,再把浪費的成因拆給研究者、經費方、藥廠、監管者與機構。它不是新的原始研究。

從「浪費」到 evidence based research

Lund 2016 在 BMJ 主張:沒有對既有證據做系統性回顧、確認真的還有不確定性,就不應啟動新研究;對涉及人與動物的研究,這更是倫理問題。這一派稱為 evidence based research,作者們成立 EBRNetwork,並提到英國 NIHR 已要求經費申請者以現有 SR 說明提案的必要性。這篇文章沒有量化浪費的數字。

換句話說:做一個新的 RCT 之前,應該先有(或先做)一份 SR。SR 不只是讀文獻的方法,也是決定「還需不需要做新研究」的根據。

但 SR 本身也會被濫產

勇者要小心,SR 也有暗黑面:

  • 重複做同一題:Siontis 2013 抽樣 20 個主題,較新的 meta-analysis 有 13 篇沒有納入任何新的 outcome;光是 statin 預防心臟手術後心房顫動,就有 11 篇納入條件相似的 meta-analysis,結果相似或相同。
  • 數量暴增:Ioannidis 2016 指出,1991–2014 年間 SR 的年發表量增加 2,728%,同期所有 PubMed 收錄項目只增加 153%;作者認為現在每年發表的試驗 SR 可能比新的 RCT 還多。他的結論用的是保留語氣:大部分產出的 SR/MA 可能是不必要、誤導或有利益衝突的,既不誤導又有用的只是少數。
  • 品質參差:Moher 2007 分析 300 篇 SR,只有 23.1%(68/294)報告了 publication bias 評估,沒有一篇有註冊編號;Page 2016 的橫斷研究發現,至少三分之一的 SR 沒有報告 protocol、完整的布林檢索邏輯或資料萃取方法等關鍵資訊。

本站的立場是:SR 是對付軼事巨人的好武器,但武器也要保養。後面每一關教的,就是怎麼做出一份不屬於「濫產」那一類的 SR。


六、主線任務預告:喉嚨痛與類固醇

全站的迷你 SR 是真的做過一遍的:2026-10-06 搜尋 PubMed 得到 231 筆,篩選後納入 9 篇 RCT,每個步驟的檔案都保留下來。它刻意只搜 PubMed、單人執行、沒有註冊 protocol——這些都是正式 SR 不該省的步驟,也正好讓我們在後面的關卡看到「省了會怎樣」。

為什麼選這題?因為已經有兩份做得很完整的 SR 可以當標準答案:Cochrane review(de Cassan 2020)與 BMJ Rapid Recommendation 的 SR(Sadeghirad 2017;10 篇試驗、1,426 人)。我們可以逐篇對照自己漏了什麼。先劇透:只搜 PubMed,真的漏掉了一篇——第 4 關會揭曉是哪一篇、為什麼漏。

本範例僅供方法學教學,不可作為臨床決策依據。


常見錯誤與誤讀

誤讀比較精確的說法
「SR 就是 meta-analysis」SR 是流程;MA 是其中選配的統計步驟
「SR 永遠是最高等級證據」確定性取決於納入研究的品質與一致性;SR 是看證據的工具(Murad 2016)
「narrative review 沒有價值」它適合介紹背景、提出觀點;只是不適合回答需要限制偏誤的效果問題
「scoping review 是簡化版 SR」兩者回答的問題不同;scoping review 不是回答效果問題的捷徑
「rapid review 就是隨便做快一點」要有意識地選擇簡化步驟,並清楚報告簡化了什麼
「研究已證實 85% 的研究被浪費」Chalmers & Glasziou 2009 的 85% 是有條件的累積粗估
「SR 越多越好」重複、冗餘的 SR 本身就是浪費(Siontis 2013;Ioannidis 2016)

本關重點小抄

  • SR = 事先定義、可重現的「找、選、評、整合」流程,目的是限制偏誤(Mulrow 1994)。
  • SR ≠ MA:MA 是選配的統計步驟。
  • 證據量:每天約 75 篇試驗、11 篇 SR(Bastian 2010);2019 年每天約 80 篇 SR(Hoffmann 2021)。
  • SR 會過時:中位數 5.5 年出現更新訊號,但 23% 在 2 年內(Shojania 2007)。
  • 新證據金字塔:SR 是放大鏡,不是最高層(Murad 2016)。
  • Scoping → 找範圍與缺口;Rapid → 時間緊、報告簡化步驟;Umbrella → 整合 SR、小心重疊;Living → 持續更新、注意重複檢定。
  • 研究浪費:四階段架構;85% 是有條件的推估(Chalmers & Glasziou 2009)。
  • 新研究之前先看 SR(Lund 2016);但 SR 本身也會被濫產(Ioannidis 2016)。

延伸閱讀

  • Mulrow CD. Rationale for systematic reviews. BMJ. 1994. DOI: 10.1136/bmj.309.6954.597
  • Lasserson TJ, Thomas J, Higgins JPT. Chapter 1: Starting a review. Cochrane Handbook for Systematic Reviews of Interventions v6. 2019. DOI: 10.1002/9781119536604.ch1
  • Murad MH, Asi N, Alsawas M, et al. New evidence pyramid. Evid Based Med. 2016. DOI: 10.1136/ebmed-2016-110401
  • Bastian H, Glasziou P, Chalmers I. Seventy-five trials and eleven systematic reviews a day: how will we ever keep up? PLoS Med. 2010. DOI: 10.1371/journal.pmed.1000326
  • Hoffmann F, Allers K, Rombey T, et al. Nearly 80 systematic reviews were published each day. J Clin Epidemiol. 2021. DOI: 10.1016/j.jclinepi.2021.05.022
  • Shojania KG, Sampson M, Ansari MT, et al. How quickly do systematic reviews go out of date? A survival analysis. Ann Intern Med. 2007. DOI: 10.7326/0003-4819-147-4-200708210-00179
  • Munn Z, Stern C, Aromataris E, et al. What kind of systematic review should I conduct? A proposed typology and guidance. BMC Med Res Methodol. 2018. DOI: 10.1186/s12874-017-0468-4
  • Munn Z, Peters MDJ, Stern C, et al. Systematic review or scoping review? BMC Med Res Methodol. 2018. DOI: 10.1186/s12874-018-0611-x
  • Arksey H, O’Malley L. Scoping studies: towards a methodological framework. Int J Soc Res Methodol. 2005. DOI: 10.1080/1364557032000119616
  • Peters MDJ, Marnie C, Tricco AC, et al. Updated methodological guidance for the conduct of scoping reviews. JBI Evid Synth. 2020. DOI: 10.11124/JBIES-20-00167
  • Tricco AC, Lillie E, Zarin W, et al. PRISMA Extension for Scoping Reviews (PRISMA-ScR): checklist and explanation. Ann Intern Med. 2018. DOI: 10.7326/M18-0850
  • Tricco AC, Antony J, Zarin W, et al. A scoping review of rapid review methods. BMC Med. 2015. DOI: 10.1186/s12916-015-0465-6
  • Haby MM, Chapman E, Clark R, et al. What are the best methodologies for rapid reviews of the research evidence for evidence-informed decision making in health policy and practice? Health Res Policy Syst. 2016. DOI: 10.1186/s12961-016-0155-7
  • Hamel C, Michaud A, Thuku M, et al. Defining rapid reviews: a systematic scoping review and thematic analysis of definitions and defining characteristics. J Clin Epidemiol. 2021. DOI: 10.1016/j.jclinepi.2020.09.041
  • Garritty C, Gartlehner G, Nussbaumer-Streit B, et al. Cochrane Rapid Reviews Methods Group offers evidence-informed guidance to conduct rapid reviews. J Clin Epidemiol. 2021. DOI: 10.1016/j.jclinepi.2020.10.007
  • Tricco AC, Khalil H, Holly C, et al. Rapid reviews and the methodological rigor of evidence synthesis: a JBI position statement. JBI Evid Synth. 2022. DOI: 10.11124/JBIES-21-00371
  • Aromataris E, Fernandez R, Godfrey CM, et al. Summarizing systematic reviews: methodological development, conduct and reporting of an umbrella review approach. Int J Evid Based Healthc. 2015. DOI: 10.1097/XEB.0000000000000055
  • Fusar-Poli P, Radua J. Ten simple rules for conducting umbrella reviews. Evid Based Ment Health. 2018. DOI: 10.1136/ebmental-2018-300014
  • Pieper D, Antoine SL, Mathes T, et al. Systematic review finds overlapping reviews were not mentioned in every other overview. J Clin Epidemiol. 2014. DOI: 10.1016/j.jclinepi.2013.11.007
  • Ioannidis JP. Integration of evidence from multiple meta-analyses: a primer on umbrella reviews, treatment networks and multiple treatments meta-analyses. CMAJ. 2009. DOI: 10.1503/cmaj.081086
  • Elliott JH, Turner T, Clavisi O, et al. Living systematic reviews: an emerging opportunity to narrow the evidence-practice gap. PLoS Med. 2014. DOI: 10.1371/journal.pmed.1001603
  • Elliott JH, Synnot A, Turner T, et al. Living systematic review: 1. Introduction—the why, what, when, and how. J Clin Epidemiol. 2017. DOI: 10.1016/j.jclinepi.2017.08.010
  • Thomas J, Noel-Storr A, Marshall I, et al. Living systematic reviews: 2. Combining human and machine effort. J Clin Epidemiol. 2017. DOI: 10.1016/j.jclinepi.2017.08.011
  • Simmonds M, Salanti G, McKenzie J, et al. Living systematic reviews: 3. Statistical methods for updating meta-analyses. J Clin Epidemiol. 2017. DOI: 10.1016/j.jclinepi.2017.08.008
  • Chalmers I, Glasziou P. Avoidable waste in the production and reporting of research evidence. Lancet. 2009. DOI: 10.1016/S0140-6736(09)60329-9
  • Macleod MR, Michie S, Roberts I, et al. Biomedical research: increasing value, reducing waste. Lancet. 2014. DOI: 10.1016/S0140-6736(13)62329-6
  • Lund H, Brunnhuber K, Juhl C, et al. Towards evidence based research. BMJ. 2016. DOI: 10.1136/bmj.i5440
  • Siontis KC, Hernandez-Boussard T, Ioannidis JP. Overlapping meta-analyses on the same topic: survey of published studies. BMJ. 2013. DOI: 10.1136/bmj.f4501
  • Ioannidis JP. The mass production of redundant, misleading, and conflicted systematic reviews and meta-analyses. Milbank Q. 2016. DOI: 10.1111/1468-0009.12210
  • Moher D, Tetzlaff J, Tricco AC, et al. Epidemiology and reporting characteristics of systematic reviews. PLoS Med. 2007. DOI: 10.1371/journal.pmed.0040078
  • Page MJ, Shamseer L, Altman DG, et al. Epidemiology and reporting characteristics of systematic reviews of biomedical research: a cross-sectional study. PLoS Med. 2016. DOI: 10.1371/journal.pmed.1002028
  • Sadeghirad B, Siemieniuk RAC, Brignardello-Petersen R, et al. Corticosteroids for treatment of sore throat: systematic review and meta-analysis of randomised trials. BMJ. 2017. DOI: 10.1136/bmj.j3887
  • de Cassan S, Thompson MJ, Perera R, et al. Corticosteroids as standalone or add-on treatment for sore throat. Cochrane Database Syst Rev. 2020. DOI: 10.1002/14651858.CD008268.pub3

下一關:第 2 關 問題形成——打倒軼事巨人的第一步,是把問題問清楚。

BOSS 戰:「我覺得有效」軼事巨人

HP0/4
  1. 下列哪一項最能區分 systematic review 與 narrative review?

  2. 衛生局要在 3 週內決定是否把某疫苗納入公費,需要一份證據整合。最合適的選擇是?

  3. 你想知道「醫學教育中的模擬訓練」目前有哪些研究類型、用了哪些 outcome、哪裡還是空白,而不是算出一個合併效果。最合適的是?

  4. 關於 Chalmers & Glasziou 2009 對研究浪費的估計,下列敘述何者最精確?