跳到主要內容

LV.08

鎂之幽靈:敏感度分析的考驗

Sensitivity analysis、leave-one-out、influence diagnostics 與 cumulative meta-analysis

BOSS
鎂之幽靈
時間
約 40 分鐘
建議先過
LV.06

本關目標

前幾關你學會了合併、估計 τ²、量化與探索異質性。這一關要問一個更不舒服的問題:如果我的分析決定換一個,結論還站得住嗎?

這就是 sensitivity analysis(敏感度分析)。本關用一個真實的歷史案例當教材:靜脈注射鎂劑(intravenous magnesium)治療急性心肌梗塞(acute myocardial infarction)。1990 年代初,多個小型試驗與合併分析顯示鎂劑可能降低死亡率;1995 年,超大型試驗 ISIS-4 卻未顯示這樣的效果。這段歷史常被方法學教科書拿來討論,本關 Boss「鎂之幽靈」就是它。

完成本關後你應該能:

  1. 說出 sensitivity analysis 要檢驗哪些決策。
  2. 讀懂 leave-one-out 與 influence diagnostics 的輸出。
  3. 用 cumulative meta-analysis 看出「證據如何隨時間演變」,並理解它的限制。
  4. 解釋為什麼同一批資料,fixed-effect 與 random-effects 可能給出分歧的結論。

一、故事背景:從「便宜有效」到大型試驗

依時間順序整理(以下皆為已查證的文獻摘要或本站 R 輸出):

  1. 1991 年,Teo 等人的合併分析:7 個隨機試驗、1,301 人。鎂劑組死亡 25/657(3.8%),對照組 53/644(8.2%),死亡 odds 降低約 55%(p < 0.001)。作者的結論相當謹慎:鎂劑「可能」降低死亡率,並明確呼籲需要大型試驗來證實或推翻(Teo 1991)。
  2. 1992 年,LIMIT-2(Woods 1992):英國 Leicester 的隨機試驗,結果支持鎂劑降低死亡率(Woods 1992)。
  3. 1993 年,Yusuf 等人的文章以「有效、安全、簡單且便宜的介入」為標題討論靜脈鎂劑(Yusuf 1993)。
  4. 1995 年,ISIS-4:58,050 名疑似急性心肌梗塞病人的 2×2×2 factorial 隨機試驗,其中一個比較是 24 小時靜脈硫酸鎂 vs 開放對照(ISIS-4 1995)。

本關資料是 metafor 內建的 dat.li2007,來自 Li 等人 2007 年的 Cochrane review,共 22 個隨機試驗、72,476 人,結果是全因死亡,OR < 1 代表鎂劑組死亡較少。在這份資料中:

  • ISIS-4:鎂劑組死亡 2,216/29,011,對照組 2,103/29,039;單獨的 OR = 1.059(95% CI 0.996–1.127,p = 0.069),未達統計顯著,點估計略偏向不利於鎂劑的方向。
  • ISIS-4 一個試驗就佔了全部病人的 80.1%。
鎂劑 22 個試驗的 forest plot,多數小型試驗的 OR 點估計在 1 的左側且 CI 很寬,ISIS-4 與 MAGIC 的 CI 很窄且緊貼 1
Figure 8-1 鎂劑 22 個試驗的 forest plot(random-effects,REML)。注意小型試驗多在左側(偏向有益),兩個超大型試驗緊貼 1。資料:metafor::dat.li2007;本站 ex3 R 輸出。

二、第一個敏感度問題:模型選擇

同一批 22 個試驗:

模型合併 OR95% CIp異質性
Random-effects(REML)0.5790.431–0.7780.0003τ² = 0.177,I² = 82.2%
Fixed-effect(Mantel-Haenszel)0.9870.936–1.0410.63Q = 57.77,df = 21

兩種模型給出分歧的結論:random-effects 顯示統計顯著的死亡率降低;fixed-effect 則無統計顯著差異,點估計幾乎在 1。

為什麼?回想 LV.04 與 LV.05 的權重公式:

  • Fixed-effect 權重 = 1 / v_i。ISIS-4 與 MAGIC 的抽樣變異極小,兩者幾乎決定了一切。
  • Random-effects 權重 = 1 / (v_i + τ²)。τ² = 0.177 加進每個研究的分母後,大小試驗的權重差距被大幅壓縮。在本例的 influence 輸出中,ISIS-4 的 random-effects 權重只有 12.7%、MAGIC 為 12.5%,儘管 ISIS-4 一個試驗就有 80.1% 的病人。

所以這不是「哪個軟體算錯」,而是兩個模型在回答不同問題、並以不同方式對待小型試驗。當小型試驗與大型試驗的結果系統性不同時,random-effects 會讓小型試驗的聲音變大。 本例的 small-study effect 檢定(Egger-type)p = 6.5 × 10⁻⁵,顯示小型試驗的效果明顯比大型試驗更偏向有益(funnel plot 與這類檢定的解讀,見 LV.09)。在這種情況下,只報 random-effects 的 0.579 而不提 fixed-effect 與 small-study effect,會讓讀者誤以為證據很一致。

三、Cumulative meta-analysis:證據如何隨時間演變

把試驗依發表年份排序,每加入一個就重新合併一次,這就是 cumulative meta-analysis(累積統合分析)。Lau 等人在 1992 年用這個方法分析了心肌梗塞的 15 種治療(Lau 1992)。

鎂劑 cumulative forest plot,每一列是加入該試驗後的累積合併 OR,早期 CI 很寬,逐漸收窄
Figure 8-2 依年份累積的 random-effects 合併 OR。每一列代表「加入這個試驗之後」的合併結果。資料:metafor::dat.li2007;本站 ex3 R 輸出。

挑幾個關鍵時間點(random-effects,REML):

加入的試驗k累積 OR(95% CI)pI²
Morton 198410.436(0.038–5.022)0.510%
Rasmussen 198620.347(0.121–0.999)0.04980%
Shechter 199060.297(0.142–0.622)0.00130%
Woods 1992(LIMIT-2)100.602(0.411–0.882)0.009114.7%
Shechter 1995(ISIS-4 前最後一個)130.479(0.323–0.712)0.0002730.9%
ISIS-4 1995140.538(0.361–0.800)0.002269.7%
Nakashima 2004(全部)220.579(0.431–0.778)0.0002882.2%

同樣的累積過程,換成 fixed-effect(Mantel-Haenszel):

時間點累積 OR_MH(95% CI)
ISIS-4 之前(Shechter 1995)0.588(0.469–0.738)
加入 ISIS-41.015(0.957–1.078)
全部 22 個試驗0.987(0.936–1.041)
累積合併 OR 隨年份變化的折線圖,random-effects 曲線維持在 0.5 左右,fixed-effect 曲線在 1995 年跳到接近 1
Figure 8-3 累積合併 OR 的軌跡。fixed-effect 在 ISIS-4 加入後跳到 1 附近,random-effects 只小幅移動,但 I² 大增。資料:本站 ex3 R 輸出。

怎麼讀?

  1. ISIS-4 之前(13 個試驗、4,115 人):random-effects OR = 0.479(95% CI 0.323–0.712),看起來證據相當強。
  2. 加入 ISIS-4 後:fixed-effect 立刻從 0.588 跳到 1.015;random-effects 只從 0.479 移到 0.538,但 I² 從 30.9% 跳到 69.7%。random-effects 把「一個巨大試驗與一群小型試驗不一致」的事實,吸收成了「異質性變大」。
  3. 第 2 個試驗就「剛好顯著」(p = 0.0498):只有兩個小型試驗時,CI 上限 0.999 剛好擦過 1。這提醒我們,早期少量資料就可能出現顯著結果。

Cumulative MA 的另一面:鏈激酶的故事

Cumulative meta-analysis 也不是只會揭穿錯誤。Lau 1992 的同一篇論文顯示,靜脈 streptokinase(鏈激酶)治療急性心肌梗塞,在 1973 年、僅 8 個試驗共 2,432 人時,累積結果已出現一致且統計顯著的總死亡率降低(OR 0.74,95% CI 0.59–0.92);之後 25 個試驗、34,542 人,基本上只是讓 CI 變窄,沒有改變結論(Lau 1992)。

兩個故事放在一起看,教訓是:cumulative MA 展示證據的演變,但它本身無法告訴你哪個時間點的結論是對的。 鎂劑的早期證據後來沒有被大型試驗支持;鏈激酶的早期證據則被後來的大型試驗確認。

重複檢定的問題

每加入一個試驗就檢定一次,等於對同一個問題做了很多次檢定,type I error 會膨脹。Trial sequential analysis(TSA)借用臨床試驗期中分析的概念,估算所需資訊量並調整顯著邊界(Wetterslev 2008);Brok 2009 以新生兒醫學的 meta-analysis 為例,說明看似定論的結果在調整後可能仍屬證據不足(Brok 2009)。TSA 並非所有方法學者都同意的標準做法,細節見 LV.11。

四、Leave-one-out:一次拿掉一個

Leave-one-out 每次拿掉一個研究重新合併,看結論是否依賴單一研究。

Leave-one-out forest plot,22 列分別是拿掉某一試驗後的合併 OR,全部落在約 0.54 到 0.63 之間且都在 1 的左側
Figure 8-4 每次拿掉一個試驗後的 random-effects 合併 OR。垂直參考線為全部試驗的合併值。資料:本站 ex3 R 輸出。

鎂劑資料的結果(random-effects):

  • 合併 OR 範圍:0.538(拿掉 MAGIC)到 0.628(拿掉 Shechter 1995),所有 CI 都不含 1。
  • 拿掉 ISIS-4:OR 0.539(0.399–0.730),I² 從 82.2% 降到 60.1%。
  • 拿掉 MAGIC:OR 0.538(0.394–0.735),I² 降到 67.8%。
  • 同時拿掉 ISIS-4 與 MAGIC(k = 20):OR 0.507(0.380–0.676),I² 只剩 29.5%。

看起來「非常穩定」對吧?這正是陷阱。Leave-one-out 只能告訴你:沒有任何單一試驗能翻轉 random-effects 的結論。 它無法偵測「一群研究共同的系統性問題」。本例中偏向有益的是一整群小型試驗,一次拿掉一個,其他十幾個仍在。

另外,「拿掉兩個大型試驗後 I² 只剩 29.5%」也不代表剩下的小型試驗比較可信:那 20 個試驗合起來的病人數遠少於 ISIS-4 一個試驗。I² 降低反映的是研究精確度的變化(LV.06)。

五、Influence diagnostics:誰的影響力最大

Viechtbauer 與 Cheung 2010 年把迴歸診斷的工具搬到 meta-analysis(Viechtbauer 2010),metafor 的 influence() 一次算出:

  • Studentized residual(rstudent):這個研究離「其他研究預測的位置」有多遠,可用來找 outlier。
  • DFFITS:拿掉它,合併值會移動多少(以標準誤為單位)。
  • Cook’s distance:拿掉它,整體模型改變多少。
  • Hat value:它在模型中的槓桿(leverage),與權重有關。
metafor influence 圖,多個小面板分別顯示 22 個試驗的 rstudent、DFFITS、Cook's distance、hat value 與權重
Figure 8-5 鎂劑資料的 influence diagnostics。資料:本站 ex3 R 輸出。

本例中數值較突出的幾個試驗:

試驗rstudentDFFITSCook’s D權重
Shechter 1995−1.59−0.5600.2884.4%
MAGIC 20001.390.5020.24412.5%
ISIS-4 19951.610.5110.22512.7%

依 metafor 預設的判定標準,沒有任何試驗被標記為 influential。但 ISIS-4、MAGIC 與 Shechter 1995 的 Cook’s distance 與 DFFITS 絕對值相對較大:兩個大型試驗把結果往 1 拉,Shechter 1995 則把結果往有益的方向拉。

讀 influence 輸出時要記得:「沒被標記」只表示沒有單一研究超過預設門檻,不等於分析沒有問題。這些工具是用來找出值得細看的研究,然後回頭去讀那篇研究的設計、族群、RoB,而不是自動刪除。

六、其他常見的敏感度分析

除了模型與單一研究,敏感度分析通常還會檢驗這些決策(Cochrane Handbook 第 10 章):

決策敏感度分析的做法
Risk of bias只納入低 RoB 研究重跑(RoB 評估見 SR 站 LV.08)
τ² 估計法與 CI 方法REML ↔ DL ↔ PM;Wald ↔ HKSJ(LV.05)
效果量OR ↔ RR;MD ↔ SMD
零事件處理不同 continuity correction,或改用不需校正的方法
資料插補缺少 SD、用 median/IQR 換算的研究,排除或改用其他換算法(LV.03)
非獨立資料ex4 中把同一試驗的三列 Orpington 合併成一列:g 由 −0.537 變成 −0.227(95% CI −0.619 至 0.164,p = 0.255),幅度明顯縮小,仍未達統計顯著
研究設計只納入 RCT,排除 quasi-randomized

兩個原則:

  1. 事先規劃:在 protocol 寫明要做哪些敏感度分析。看完結果才決定刪哪篇,就變成選擇性報告。
  2. 全部報告:結論有變的、沒變的都要寫。

注意區分:sensitivity analysis 問的是「我的分析決策會不會改變結論」,subgroup analysis 問的是「效果在不同族群是否不同」(LV.07)。前者不需要做子群間差異檢定,而是比較結論是否一致。

七、大型試驗 vs 先前的 meta-analysis:一般性的證據

大型試驗與先前 meta-analysis 結論分歧的情況並不少見。LeLorier 等人 1997 年比較了 12 個大型 RCT(每個至少 1,000 人)與先前同主題的 19 個 meta-analysis,共 40 個結局:兩者的一致性只有 fair(κ = 0.35,95% CI 0.06–0.64),大型試驗的結果有 35% 未被先前的 meta-analysis 準確預測(LeLorier 1997)。

文中一個具體例子是低劑量 aspirin 預防子癇前症孕婦的胎兒生長遲滯:先前的 meta-analysis 只納入 394 人且結果達統計顯著,後續 9,364 人的大型 RCT 則未達統計顯著。值得一提的是,LeLorier 的分析以「整體死亡率」這個結局、依其分類標準,把 magnesium 歸在兩者一致的主題之一;上一節 ex3 呈現的落差,是另一種切入角度(早期小型試驗的合併結果 vs ISIS-4),兩者並不矛盾,但也提醒我們「一致或不一致」取決於比較的定義。

但同一篇研究也顯示,兩者點估計的差異只在 40 個結局中的 5 個(12%)達統計顯著,而且不一致的案例都是「一方顯著、另一方未達顯著」,而非方向完全相反。比較公允的讀法是:由少量小型試驗組成的 meta-analysis,不宜被當成定論;需要報告異質性、small-study effect 與敏感度分析,並在 GRADE 中反映 imprecision 與 publication bias 的疑慮(LV.10)。

八、R 程式碼(metafor)

library(metafor)
dat <- dat.li2007
dat <- dat[order(dat$year, dat$id), ]            # chronological order for cumulative MA
dat$bi <- dat$n1i - dat$ai; dat$di <- dat$n2i - dat$ci
dat <- escalc(measure = "OR", ai = ai, bi = bi, ci = ci, di = di, data = dat)
dat$label <- paste(dat$study, dat$year)

res_re <- rma(yi, vi, data = dat, method = "REML", slab = label)
res_mh <- rma.mh(ai = ai, bi = bi, ci = ci, di = di, data = dat, slab = label)

cum_re <- cumul(res_re, order = seq_len(nrow(dat)))   # cumulative MA
forest(cum_re, atransf = exp)

loo <- leave1out(res_re)                               # leave-one-out
inf <- influence(res_re); plot(inf)                    # influence diagnostics

# Sensitivity: drop both mega-trials
rma(yi, vi, data = dat[!dat$study %in% c("ISIS-4", "MAGIC"), ], method = "REML")

完整可執行版本請見本站範例 ex3 的 analysis.R。

常見錯誤 / 誤讀

  1. 「Leave-one-out 很穩定,所以結論可信」:它只排除了單一研究的影響,抓不到一群研究的共同偏誤。
  2. 「Influence 沒有標紅,所以沒問題」:預設門檻只是篩檢工具,數值相對突出的研究仍值得回頭細讀。
  3. 「Random-effects 考慮了異質性,所以比較正確」:在 small-study effect 存在時,random-effects 會放大小型試驗的影響。兩種模型結論分歧時,要並報並解釋。
  4. 「Fixed-effect NS,證明鎂無效」:未達統計顯著不等於證明無效。ISIS-4 單獨的 OR 1.059(95% CI 0.996–1.127)是「未顯示益處」,它的 CI 本身就有範圍。
  5. 「Cumulative MA 某一年已經顯著,之後的試驗都是浪費」:鎂劑的例子說明早期顯著可能不被後來的大型試驗支持;重複檢定也會膨脹 type I error。
  6. 「看完結果再決定刪掉哪篇」:這不是敏感度分析,是選擇性報告。

本關重點小抄

  • 鎂劑資料:22 個試驗、72,476 人;ISIS-4 佔 80.1% 的病人。
  • 模型分歧:random-effects OR 0.579(0.431–0.778)vs MH fixed-effect 0.987(0.936–1.041,未達統計顯著)。
  • ISIS-4 前(k = 13,4,115 人):OR 0.479(0.323–0.712);ISIS-4 單獨:OR 1.059(0.996–1.127),p = 0.069,未達統計顯著。
  • Cumulative MA:fixed-effect 加入 ISIS-4 後 0.588 → 1.015;random-effects 0.479 → 0.538,I² 30.9% → 69.7%。
  • Leave-one-out:0.538–0.628,全部 CI 不含 1;穩定不等於正確。
  • Influence:rstudent、DFFITS、Cook’s D、hat;用來找值得細看的研究,不是用來自動刪除。
  • 敏感度分析要事先規劃、全部報告。

延伸閱讀

  • Lau J, Antman EM, Jimenez-Silva J, et al. Cumulative meta-analysis of therapeutic trials for myocardial infarction. N Engl J Med. 1992. doi:10.1056/NEJM199207233270406
  • Teo KK, Yusuf S, Collins R, et al. Effects of intravenous magnesium in suspected acute myocardial infarction: overview of randomised trials. BMJ. 1991. doi:10.1136/bmj.303.6816.1499
  • Woods KL, Fletcher S, Roffe C, et al. Intravenous magnesium sulphate in suspected acute myocardial infarction: results of the second Leicester Intravenous Magnesium Intervention Trial (LIMIT-2). Lancet. 1992. doi:10.1016/0140-6736(92)91828-v
  • Yusuf S, Teo K, Woods K. Intravenous magnesium in acute myocardial infarction. An effective, safe, simple, and inexpensive intervention. Circulation. 1993. doi:10.1161/01.cir.87.6.2043
  • ISIS-4 Collaborative Group. ISIS-4: a randomised factorial trial assessing early oral captopril, oral mononitrate, and intravenous magnesium sulphate in 58,050 patients with suspected acute myocardial infarction. Lancet. 1995. PubMed 7661937
  • LeLorier J, Grégoire G, Benhaddad A, et al. Discrepancies between meta-analyses and subsequent large randomized, controlled trials. N Engl J Med. 1997. doi:10.1056/NEJM199708213370806
  • Viechtbauer W, Cheung MWL. Outlier and influence diagnostics for meta-analysis. Res Synth Methods. 2010. doi:10.1002/jrsm.11
  • Wetterslev J, Thorlund K, Brok J, et al. Trial sequential analysis may establish when firm evidence is reached in cumulative meta-analysis. J Clin Epidemiol. 2008. doi:10.1016/j.jclinepi.2007.03.013
  • Brok J, Thorlund K, Wetterslev J, et al. Apparently conclusive meta-analyses may be inconclusive. Int J Epidemiol. 2009. doi:10.1093/ije/dyn188
  • Higgins JPT, Thomas J, Chandler J, et al., eds. Cochrane Handbook for Systematic Reviews of Interventions, Chapter 10(10.14 Sensitivity analyses). 線上版

BOSS 戰:鎂之幽靈

HP0/4
  1. 鎂劑資料(22 個試驗)中,random-effects 合併 OR = 0.579(95% CI 0.431–0.778),Mantel-Haenszel fixed-effect 合併 OR = 0.987(95% CI 0.936–1.041)。下列敘述何者最恰當?

  2. Leave-one-out 分析中,每次拿掉一個試驗,random-effects 合併 OR 介於 0.538 到 0.628,所有 CI 都不含 1。這最多能說明什麼?

  3. Cumulative meta-analysis 中,加入第 2 個試驗(Rasmussen 1986)時,合併 OR = 0.347(95% CI 0.121–0.999,p = 0.0498)。這個現象主要提醒我們什麼?

  4. 下列哪一項最適合作為「事先規劃」的敏感度分析?