跳到主要內容

LV.01

新手村:統合分析是什麼

Meta-analysis 的定義、它能做與不能做的事,以及何時不該合併

BOSS
蘋果橘子合體獸
時間
約 30 分鐘

還沒走過 systematic review 流程?建議先完成 SR 王國(特別是 LV.02 問題形成、LV.06 篩選、LV.08 Risk of bias)。

本關目標

歡迎來到新手村。這一關不急著算公式,先把地圖看清楚。打完本關,你應該能:

  1. 說清楚 systematic review(SR,系統性回顧) 與 meta-analysis(MA,統合分析) 的差別與關係。
  2. 看懂一張 forest plot(森林圖) 的基本構造,知道 MA 最後交出的「成果」包含哪些東西。
  3. 判斷什麼情況不該把研究合併成一個數字——也就是本關 Boss「蘋果橘子合體獸」的弱點。
  4. 知道 MA 能減少什麼誤差、不能減少什麼誤差。

建議先修:SR 站。 本站專講「量化合併」。如果你還沒走過「問題形成 → 搜尋 → 篩選 → 萃取 → 偏誤風險評估」這條流程,建議先到姊妹站 Systematic Review 冒險 的第 1 關〈為什麼要做 SR〉打底,再回來會順很多。


一、Meta-analysis 到底在做什麼

想像你在晨會上被學長問到:「BCG 疫苗到底能不能預防結核病?」你翻到 13 個試驗,有的說保護效果很強,有的說幾乎看不出效果,還有一個效果方向相反。你會怎麼回答?

  • 挑一篇你最喜歡的?→ 這叫 cherry-picking。
  • 數數看「有效」和「沒效」(口語的 vote counting 說法)各幾篇?→ 這叫 vote counting,它忽略了每個研究的大小與精確度,是公認不建議的做法(SR 站第 9 關會深入講)。
  • 把每個試驗的**效果量(effect size)**算出來,依照各自的精確度給權重,算出一個加權平均,同時評估研究之間的差異有多大 → 這就是 meta-analysis。

用一句話定義:Meta-analysis 是用統計方法,把多個回答同一個問題的研究所估計的效果量,加權合併成一個整體估計,並量化這個估計的不確定性與研究間的差異。(Cochrane Handbook 第 10 章;Borenstein 2010)

SR 與 MA 的關係

這兩個名詞常被混用,但它們不是同一件事:

Systematic reviewMeta-analysis
本質一整套事先定義、可重現的流程流程中的一個統計步驟
一定要有嗎是 MA 可信的前提選配;研究不夠相似時可以不做
產出回答問題的證據整合(敘述或量化)合併效果量 + CI + 異質性指標

沒有 MA 的 SR 完全成立;但沒有 SR 流程的 MA,只是把一批隨手撿來的研究算平均,選了哪些研究本身就可能決定了答案(Cochrane Handbook 第 1、10 章)。所以本站假設你的研究是經過系統性搜尋與篩選得來的。

為什麼要合併:四個理由

  1. 提高精確度(precision):單一小試驗的 CI 很寬,合併多個試驗後,整體估計的 CI 會變窄。
  2. 回答單一研究回答不了的問題:例如效果在不同族群、不同劑量下是否一致。
  3. 把「研究結果不一致」變成可以分析的對象:MA 不只給平均值,還會量化研究之間的差異(異質性,heterogeneity;第 6 關),甚至嘗試解釋它(第 7 關)。
  4. 更早看清證據:Lau 1992 用 **cumulative meta-analysis(累積統合分析)**回頭檢視心肌梗塞治療的試驗,示範依時間逐一加入試驗的做法,可以看出合併證據在何時開始穩定;Antman 1992 比較了 MA 結果與同時期教科書和綜論文章的建議,指出專家建議常與累積證據不同步。第 8 關會實際操作 cumulative MA。

二、先看一張 forest plot

下面是本站主線範例 ex1:BCG 疫苗與結核病(metafor 套件內建的 dat.bcg,13 個試驗,原始資料整理自 Colditz 1994 的 meta-analysis)。這張圖的細節會在第 4 關一步步拆解,現在先認識它的長相:

BCG 疫苗 13 個試驗的 forest plot,每列一個試驗的 risk ratio 與 95% CI,底部菱形為 random-effects 合併結果
Figure 1-1 ex1 BCG forest plot(random-effects,REML)。橫軸是 risk ratio(log 尺度),1 代表兩組風險相同;左邊代表疫苗組風險較低。

看 forest plot 的順序建議如下:

  1. 每一列 = 一個研究。 方塊是該研究的點估計,橫線是它的 95% confidence interval(CI,信賴區間)。
  2. 方塊大小 = 權重。 越精確(通常越大)的研究方塊越大、對合併結果影響越大。
  3. 垂直參考線 = 無效線(line of no effect)。 Ratio 類效果量(RR、OR、HR)是 1;差值類(MD、RD)是 0。
  4. 底部菱形 = 合併結果。 菱形中心是合併估計值,左右兩端是 95% CI。
  5. 最後才看各研究彼此是否一致。 橫線大多重疊嗎?有沒有方向完全相反的研究?

在這個例子中,random-effects 合併的 RR 為 0.489(95% CI 0.344–0.696),整體偏向保護效果;但 13 個試驗的估計值散得很開,Q 檢定 Q = 152.23(df = 12,p < 0.0001),I² 約 92%。也就是說,「平均有保護效果」和「每個地方效果都一樣」是兩回事——這是之後第 5、6、7 關的主題。

MA 的完整「成果」不只一個數字

一份合格的 meta-analysis 結果,至少應包含:

  • 合併效果量與 95% CI(第 4 關)
  • 使用的模型與估計方法(fixed vs random effects、τ² 估計式;第 4、5 關)
  • 異質性:Q、I²、τ²,最好再加 prediction interval(預測區間)(第 5、6 關;IntHout 2016 主張常規報告)
  • 偏誤相關評估:各研究 RoB、可能的 publication bias(第 9 關)
  • 證據確定性:GRADE(第 10 關)

只報一個「合併 OR 與 p 值」的 MA,資訊是不完整的。


三、SR 流程 300 字速覽(深入請看 SR 站)

SR 流程摘要。 一份 SR 從明確的問題開始,通常用 PICO(Population、Intervention、Comparator、Outcome)定義納入條件;接著寫好 protocol 並在 PROSPERO 或 OSF 註冊,事先鎖定問題與分析計畫,限制「看過資料才改問題」的空間(PRISMA-P;Shamseer 2015)。搜尋要跨多個資料庫並記錄完整檢索式(PRISMA-S;Rethlefsen 2021)。篩選分 title/abstract 與 full text 兩階段,建議兩人獨立進行。資料萃取用事先試填過的表格,單人萃取的錯誤比雙人多(Buscemi 2006)。每個研究要用 RoB 2、ROBINS-I 等工具評偏誤風險。最後才是合併:能量化就做 meta-analysis,不能就用結構化的敘述整合;整個過程依 PRISMA 2020 報告(Page 2021),並以 GRADE 評估證據確定性。

深入請看 → SR 站 第 2 關 問題形成、第 4 關 搜尋策略、第 8 關 Risk of bias、第 6 關 篩選、第 9 關 合併策略、第 10 關 GRADE、第 11 關 PRISMA 報告。

本站從「研究已經篩好、資料已經萃取好」這一步接手。


四、MA 能減少什麼、不能減少什麼

這是新手最容易誤會的一點。

MA 能減少的是隨機誤差(random error)。 每個研究都是從母群抽樣,結果有抽樣變異;把多個研究合併,抽樣誤差會互相抵銷一部分,所以合併估計的 CI 變窄。

MA 不能減少系統性誤差(bias)。 如果每個試驗都沒做好 allocation concealment、outcome assessor 都沒有 blind,它們可能都往「高估療效」的方向偏。把 10 個同方向偏掉的研究合併,只會得到一個精確但偏掉的答案。這就是常說的 garbage in, garbage out。整合多個 meta-epidemiological 資料集的研究顯示,random sequence generation 或 allocation concealment 不足、缺乏 double-blinding 的試驗,平均而言效果估計偏大,而且這個現象主要出現在主觀評估的 outcome(Savović 2012),所以 RoB 評估不是形式,而是會改變結論的步驟。

另外兩個 MA 本身處理不了的問題:

  • Publication bias / reporting bias:沒被發表的研究根本不在你的資料裡,模型再好也算不到(第 9 關)。
  • 研究問的不是同一個問題:見下一節。

歷史教訓:MA 也會錯

MA 並非自動等於「證據金字塔頂端、不會錯」。幾個值得記住的例子:

  • 靜脈鎂離子用於急性心肌梗塞:早期小型試驗的 meta-analysis(Teo 1991)顯示有利效果,但其後的大型試驗 ISIS-4(1995)並未支持這個結論。第 8 關會用 ex3 的資料重現這段歷史,練習 cumulative MA 與 sensitivity analysis。
  • MA 與後續大型 RCT 的不一致:LeLorier 1997 比較了 meta-analysis 與之後同主題的大型 RCT,發現兩者結論不一致的情況並不少見。
  • MA 的「量產」問題:Ioannidis 2016 指出 SR 與 MA 的數量急速成長,其中有相當比例是重複、誤導或有利益衝突的。

這些例子不是要你不信 MA,而是提醒:MA 的可信度取決於納入研究的品質、合併是否合理、以及報告是否誠實。


五、Boss 戰重點:什麼時候不該合併

統計軟體不會阻止你。只要給它一串效果量和標準誤,它一定吐得出一個菱形。真正的判斷在你身上。下列情況要特別警覺:

1. Apples and oranges:研究問的不是同一個問題

這個比喻是 MA 被批評最久的一點:把蘋果和橘子混在一起算平均,得到的「水果平均」沒有意義。判斷方式是回到 PICO 逐項比較:

  • Population:兒童 vs 老人、輕症 vs 重症、門診 vs ICU
  • Intervention:劑量差十倍、給藥途徑不同、合併治療不同
  • Comparator:安慰劑 vs 標準治療 vs 另一種藥——「A vs 安慰劑」和「A vs B」不能直接放進同一個合併
  • Outcome:定義不同(全死因 vs 心血管死亡)、追蹤時間不同(30 天 vs 5 年)

Cochrane Handbook 把這類差異稱為 clinical diversity(臨床多樣性) 與 methodological diversity(方法學多樣性),它們是 statistical heterogeneity(統計異質性) 的來源。關鍵是:要不要合併,先由臨床與方法學判斷決定,而不是由 I² 決定。I² 很低也可能是不同問題剛好數字相近;I² 很高則需要回頭找原因,而不是自動放棄或自動改用 random-effects。

但也不要走極端。如果把納入條件定得太窄,每個研究都「不一樣」,就永遠無法合併。合理的做法是在 protocol 階段就定好「多相似才合併」的規則,並把預期的差異來源列為 subgroup 或 meta-regression 的事前假設(第 7 關)。

2. Garbage in:研究本身偏誤風險太高

如果大多數研究是 high risk of bias,可以考慮只合併 low risk 研究作為主分析,或至少做 sensitivity analysis(第 8 關)。RoB 評估本身見 SR 站 LV.08 Risk of bias。混合 RCT 與觀察性研究時尤其要小心:兩者的偏誤結構不同,通常建議分開分析(Cochrane Handbook 第 10、24 章)。

3. 資料單位不對:非獨立的資料列

同一個試驗拆成多列(例如依嚴重度分層、多臂試驗共用同一個對照組)卻當成獨立研究合併,會讓同一批病人被重複計算、精確度被高估。這是第 3 關的主題,ex4 會示範一次。

4. 效果量不可比

有的研究只報 median、有的報 HR、有的報二分類結果,能不能轉換到同一尺度?轉換的假設合理嗎?這是第 2、3 關的主題。

5. 研究太少或太異質,合併數字會誤導讀者

只有兩三個研究、且方向互相矛盾時,一個合併數字可能給人「已有結論」的錯覺。此時可改用結構化的敘述整合(Synthesis Without Meta-analysis, SWiM;見 SR 站第 9 關),或至少同時呈現 prediction interval。

6. 不要把原始人數直接相加

一個常見的直覺錯誤是:「把所有試驗的事件數和人數加總,就當成一個大試驗。」這會破壞每個試驗內部的隨機分派比較。Altman & Deeks 2002 用 NNT 的例子說明,各試驗兩組人數比例不同時,「當成一個試驗加總」會受 Simpson’s paradox(辛普森悖論) 影響而偏誤。MA 的做法永遠是先在每個研究內部算效果量,再跨研究合併。


常見錯誤與誤讀

誤讀比較精確的說法
「有 MA 就是最高等級證據」證據確定性要看納入研究品質、一致性、精確度、間接性、發表偏誤(GRADE;第 10 關,完整流程見 SR 站 LV.10)
「研究越多,答案越接近真相」研究越多,隨機誤差越小;系統性偏誤不會因此消失
「I² 低就可以合併,I² 高就不能」是否合併先由臨床與方法學判斷;I² 是描述,不是開關
「合併結果未達統計顯著,代表治療無效」只代表本次合併未偵測到統計顯著差異;CI 若很寬,可能仍無法排除有意義的效果
「Random-effects 可以解決異質性」Random-effects 只是承認異質性存在並反映在 CI 上,並沒有解釋它
「把事件數加總就是 MA」必須先在研究內算效果量再合併,否則會受 Simpson’s paradox 影響

本關重點小抄

  • MA = 加權合併多個研究的效果量,並量化不確定性與研究間差異。
  • SR 是流程,MA 是其中的選配統計步驟;沒有系統性搜尋的 MA 容易被選擇偏差影響。
  • Forest plot 看法:每列一研究 → 方塊大小是權重 → 無效線(1 或 0)→ 菱形是合併結果 → 再看一致性。
  • MA 減少隨機誤差,不減少偏誤:garbage in, garbage out。
  • 不該合併的情境:PICO 差太多(apples and oranges)、偏誤風險太高、資料不獨立、效果量不可比、研究太少又互相矛盾。
  • 要不要合併由臨床與方法學判斷決定,不是由 I² 決定。
  • 完整成果 = 合併效果量 + CI + 模型 + 異質性(含 PI)+ 偏誤評估 + GRADE。

延伸閱讀

  • Higgins JPT, Thomas J, Chandler J, et al., eds. Cochrane Handbook for Systematic Reviews of Interventions, version 6(2019;線上持續更新版)。第 10 章〈Analysing data and undertaking meta-analyses〉。DOI: 10.1002/9781119536604;免費線上版:https://training.cochrane.org/handbook
  • Borenstein M, Hedges LV, Higgins JPT, Rothstein HR. A basic introduction to fixed-effect and random-effects models for meta-analysis. Res Synth Methods. 2010;1(2):97-111. DOI: 10.1002/jrsm.12
  • Colditz GA, Brewer TF, Berkey CS, et al. Efficacy of BCG vaccine in the prevention of tuberculosis: meta-analysis of the published literature. JAMA. 1994;271(9):698-702. PMID: 8309034
  • Lau J, Antman EM, Jimenez-Silva J, et al. Cumulative meta-analysis of therapeutic trials for myocardial infarction. N Engl J Med. 1992;327(4):248-254. DOI: 10.1056/NEJM199207233270406
  • Antman EM, Lau J, Kupelnick B, et al. A comparison of results of meta-analyses of randomized control trials and recommendations of clinical experts. JAMA. 1992;268(2):240-248. PMID: 1535110
  • Teo KK, Yusuf S, Collins R, et al. Effects of intravenous magnesium in suspected acute myocardial infarction: overview of randomised trials. BMJ. 1991;303(6816):1499-1503. DOI: 10.1136/bmj.303.6816.1499
  • ISIS-4 Collaborative Group. ISIS-4: a randomised factorial trial assessing early oral captopril, oral mononitrate, and intravenous magnesium sulphate in 58,050 patients with suspected acute myocardial infarction. Lancet. 1995;345(8951):669-685. PMID: 7661937
  • LeLorier J, Grégoire G, Benhaddad A, et al. Discrepancies between meta-analyses and subsequent large randomized, controlled trials. N Engl J Med. 1997;337(8):536-542. DOI: 10.1056/NEJM199708213370806
  • Ioannidis JPA. The mass production of redundant, misleading, and conflicted systematic reviews and meta-analyses. Milbank Q. 2016;94(3):485-514. DOI: 10.1111/1468-0009.12210
  • Savović J, Jones HE, Altman DG, et al. Influence of reported study design characteristics on intervention effect estimates from randomized, controlled trials. Ann Intern Med. 2012;157(6):429-438. DOI: 10.7326/0003-4819-157-6-201209180-00537
  • Altman DG, Deeks JJ. Meta-analysis, Simpson’s paradox, and the number needed to treat. BMC Med Res Methodol. 2002;2:3. DOI: 10.1186/1471-2288-2-3
  • IntHout J, Ioannidis JPA, Rovers MM, Goeman JJ. Plea for routinely presenting prediction intervals in meta-analysis. BMJ Open. 2016;6(7):e010247. DOI: 10.1136/bmjopen-2015-010247
  • Page MJ, McKenzie JE, Bossuyt PM, et al. The PRISMA 2020 statement. BMJ. 2021;372:n71. DOI: 10.1136/bmj.n71
  • Shamseer L, Moher D, Clarke M, et al. PRISMA-P 2015: elaboration and explanation. BMJ. 2015;349:g7647. DOI: 10.1136/bmj.g7647
  • Rethlefsen ML, Kirtley S, Waffenschmidt S, et al. PRISMA-S. Syst Rev. 2021;10:39. DOI: 10.1186/s13643-020-01542-z
  • Buscemi N, Hartling L, Vandermeer B, et al. Single data extraction generated more errors than double data extraction in systematic reviews. J Clin Epidemiol. 2006;59(7):697-703. DOI: 10.1016/j.jclinepi.2005.11.010

下一關:第 2 關 效果量——在合併之前,先學會把每個研究翻譯成同一種語言。

BOSS 戰:蘋果橘子合體獸

HP0/4
  1. 下列關於 systematic review(系統性回顧)與 meta-analysis(統合分析)的關係,何者正確?

  2. 三個 RCT 分別比較「藥物 A vs 安慰劑」用在兒童氣喘、成人 COPD、老年心衰竭,outcome 分別是住院、FEV1 與死亡。最合理的處理是?

  3. 某 meta-analysis 合併了 10 個 high risk of bias 的小型試驗,得到窄窄的 95% CI 且 p < 0.001。下列敘述何者最恰當?

  4. 想用多個試驗算 NNT(number needed to treat),下列哪個做法較不容易出錯?