跳到主要內容

LV.10

GRADE 審判庭:把森林圖翻成確定性

MA 結果如何影響 inconsistency、imprecision 與 publication bias 的判斷

BOSS
確定性審判官
時間
約 30 分鐘
建議先過
LV.05 、LV.06 、LV.09

本關目標

前九關你學會了把研究合併、量化異質性、檢查發表偏誤。但臨床讀者真正想問的是:「這個結果我能信幾分?」這一關把 meta-analysis 的統計輸出,翻譯成 GRADE(Grading of Recommendations, Assessment, Development and Evaluation)的證據確定性判斷。

讀完這一關,你應該能:

  1. 說出 GRADE 五個降級 domain 中,哪三個最直接依賴 meta-analysis 的數字。
  2. 用 I²、τ²、prediction interval 判斷 inconsistency(不一致性)。
  3. 用 CI 與 optimal information size(OIS,最適資訊量)判斷 imprecision(不精確性)。
  4. 把第 9 關的 funnel plot 與檢定結果,轉成 publication bias 的判斷。

GRADE 的完整流程、Summary of Findings(SoF)表與其他 domain 在 SR 站深講,本關只聚焦「MA 數字 → GRADE 判斷」這座橋。

1. GRADE 三十秒摘要

GRADE 對每一個重要 outcome分別評估證據確定性(certainty of evidence),分為 high、moderate、low、very low 四級(Guyatt 2008;Balshem 2011)。RCT 的證據起點為 high,觀察性研究起點為 low。之後依五個 domain 考慮降級:risk of bias、inconsistency、indirectness、imprecision、publication bias;觀察性研究另可因效果很大、有劑量反應關係、或殘餘干擾因子只會削弱效果而升級(Guyatt 2011, GRADE 9)。最後把結果與絕對效果一起放進 SoF 表(Guyatt 2011, GRADE 1)。

深入請看 → SR 站第 10 關:GRADE 與 Summary of Findings

2. MA 數字與 GRADE domain 的對應

GRADE domain主要依據本站相關關卡
Risk of bias各研究的 RoB 評估(RoB 2、ROBINS-I)SR 站第 8 關;本站第 8 關的敏感度分析
IndirectnessPICO 與臨床問題的吻合程度SR 站第 2、10 關
Inconsistency森林圖、I²、τ²、prediction interval、subgroup / meta-regression本站第 5–7 關
ImprecisionPooled estimate 的 CI、總樣本數 / 事件數與 OIS本站第 4–5 關
Publication biasFunnel plot、不對稱檢定、搜尋完整度、試驗註冊比對本站第 9 關

後三個 domain 是 meta-analysis 的數字直接派上用場的地方,也是本關的主題。

3. Inconsistency:研究結果彼此一致嗎?

GRADE 怎麼看

GRADE 指引第 7 篇(Guyatt 2011, GRADE 7)列出判斷 inconsistency 時可參考的線索:各研究的點估計差異很大、CI 彼此幾乎不重疊、異質性檢定的 p 值很小、I² 很大。若異質性可由事先規劃的 subgroup 分析合理解釋,則宜分開呈現各子群的估計,而不是對整體降級。

I² 不是一切

第 6 關提過,I² 是「觀察到的變異中,有多少比例來自真實差異」,它不是異質性的絕對大小(Borenstein 2017)。同樣的 τ²,若研究都很大,I² 就會很高。I² 的粗略分級(Higgins 2003)只是參考,不能當成降級門檻。

對臨床判斷更有用的是 prediction interval(預測區間):它估計「在一個新的情境中,真實效果可能落在哪裡」(Riley 2011;IntHout 2016)。

範例:BCG 疫苗(ex1)

指標數值
k13
Random-effects(REML)pooled RR(95% CI)0.49(0.34–0.70)
τ²0.313
I²92.2%
Q 檢定Q = 152.2,df = 12,p < 0.0001
95% prediction interval0.15–1.55

平均效果的 CI 不含 1,看起來 BCG 有保護效果;但 prediction interval 從 0.15 一路延伸到 1.55,跨過 1。意思是:在某些情境下,BCG 的效果可能非常好,在另一些情境下可能沒有保護效果。這是很典型的 inconsistency。

那能不能解釋?第 7 關用緯度做 meta-regression:斜率 −0.029(p < 0.001;改用 Knapp-Hartung 調整後 p = 0.0046),緯度解釋了約 75.6% 的 τ²,但殘餘異質性仍達統計顯著(QE = 30.73,p = 0.0012;殘餘 τ² = 0.076)。

一種合理的 GRADE 寫法是:「各試驗效果差異大(I² = 92%,prediction interval 0.15–1.55),部分可由緯度解釋,但仍有未解釋的異質性,因 inconsistency 降一級。」要注意的是,緯度是研究層級的變數,meta-regression 的結果有生態謬誤(ecological fallacy)的風險(Thompson 2002),而且它不是事先規劃的分析時,可信度更低。

判斷要點

  • 先看森林圖與 prediction interval:效果的方向是否可能改變? 方向改變比「大小不同」嚴重得多。
  • 若所有研究都指向同一方向、只是大小不同,即使 I² 不低,也不一定要降級。
  • 研究數少時,I² 與 τ² 的估計都非常不穩定(von Hippel 2015),不宜只依賴單一數字。

4. Imprecision:結果夠精確嗎?

兩個問題

GRADE 指引第 6 篇(Guyatt 2011, GRADE 6)處理 imprecision 時,可以拆成兩個問題:

  1. CI 是否跨過重要的決策閾值? 如果 CI 同時包含「有臨床意義的好處」與「沒有效果」(或甚至傷害),不同位置會導向不同的臨床決策,就是不精確。
  2. 總資訊量夠不夠?(OIS) 即使 CI 看起來不錯,若合併的總樣本數(或事件數)少於「一個檢定力足夠的單一試驗」所需,也宜考慮降級。

第一點大家比較熟。第二點常被忽略,但它正是用來防範「小試驗合併出看似精確的結果」。

範例一:CI 跨過虛無值

第 7 關的連續型範例 ex4(專科中風照護 vs 一般照護的住院天數,k = 9)以 Hedges’ g 合併:

方法SMD(95% CI)p
REML−0.54(−1.14 至 0.07)0.082
REML + HKSJ−0.54(−1.25 至 0.18)0.121

點估計看起來是中等大小的效果,但 CI 從「大幅縮短住院」延伸到「略為延長」,未達統計顯著。GRADE 的寫法會是「CI 同時包含有意義的好處與無效果,因 imprecision 降級」。注意不要寫成「專科照護無效」:未達統計顯著代表這份資料無法確定效果,而不是證明沒有效果。本例 I² 也高達 95.5%,同時有 inconsistency 的問題;兩個 domain 的理由要分開寫清楚。

範例二:CI 不含 1,但資訊量可能不足(ex3)

第 8 關的 magnesium 範例是 OIS 概念最好的教材:

分析k人數OR(95% CI)p
ISIS-4 之前的 13 個試驗(random-effects)1341150.48(0.32–0.71)0.0003
ISIS-4 單獨1—1.059(0.996–1.127)0.069
全部 22 個試驗,random-effects2272,4760.58(0.43–0.78)0.0003
全部 22 個試驗,fixed-effect(MH)2272,4760.99(0.94–1.04)0.63

ISIS-4 之前的合併結果 CI 不含 1、p 很小,看起來「很精確」。但它來自 13 個小試驗、總共 4115 人;死亡率這種 outcome,要偵測合理大小的效果,單一試驗通常需要更多人。以 OIS 的角度看,即使 CI 不含 1,也宜考慮 imprecision。後來的 ISIS-4 單獨結果為 OR 1.059(95% CI 0.996–1.127),未達統計顯著,與早期合併結果的方向不同。

這也解釋了為什麼最後的 random-effects 與 fixed-effect 結果差這麼多:random-effects 給小試驗相對較多的權重,fixed-effect 幾乎由大型試驗主導。兩種模型結論分歧本身就是一個警訊(第 4–5 關)。OIS 的想法與 trial sequential analysis 的 required information size 很接近,第 11 關會再談。

判斷要點

  • 先決定決策閾值(例如最小臨床重要差異),再看 CI 是否跨過它;只看「CI 是否含 1」不夠。
  • CI 不含 1 時,仍要問:總樣本數或事件數夠不夠?是不是全部來自小試驗?
  • 報告絕對效果(每 1000 人多幾個或少幾個事件),比相對效果更容易判斷臨床意義(Guyatt 2013, GRADE 12)。

5. Publication bias:有沒有研究消失了?

GRADE 怎麼看

GRADE 指引第 5 篇(Guyatt 2011, GRADE 5)把 publication bias 寫成「未偵測到(undetected)」或「強烈懷疑(strongly suspected)」兩種狀態,而不是「有 / 沒有」。可以引起懷疑的線索包括:funnel plot 不對稱、證據主要來自小型且結果正向的早期試驗、研究多由有利益關係的贊助者資助等。

範例:ex2 與 ex3

範例不對稱檢定其他線索一種合理判斷
ex2 被動吸菸(k = 37)Egger p = 0.023;Begg p = 0.22空缺落在不顯著區;trim-and-fill 校正後 OR 1.245 → 1.191,CI 仍不含 1有 small-study effect 跡象;校正後結論方向不變,可考慮是否降級並說明理由
ex3 magnesium(k = 22)Egger t = −5.02,p < 0.001早期小試驗效果大,大型試驗未達顯著強烈懷疑 small-study effect,宜降級

第 9 關強調過:檢定顯著只代表 small-study effect,原因不一定是發表偏誤;但在 GRADE 中,「小研究效果明顯較大」本身就會降低我們對合併結果的信心,所以通常會反映在 publication bias(或與 risk of bias 一併考量)。

研究數少時怎麼辦?

k < 10 時,不對稱檢定的檢定力很低(第 9 關的模擬中,k = 10 時只有約 26%),「檢定不顯著」不能作為「未偵測到 publication bias」的依據。這時判斷要依賴其他資訊:搜尋是否涵蓋試驗註冊庫與灰色文獻、是否找到已註冊但未發表的試驗、研究的贊助來源。這也是為什麼 SR 站的搜尋關卡那麼強調註冊庫。

6. 串起來:避免重複扣分

三個 domain 常常同時出現問題,但理由要分開寫。幾個實務提醒(本站的教學建議):

  • 同一個問題不要扣兩次:例如 CI 很寬的主因就是研究間差異很大,要想清楚這是 inconsistency 還是 imprecision 的問題,並在理由中說明。
  • 每一次降級都寫一句理由,並附上關鍵數字(I²、prediction interval、CI、總人數、Egger p 值)。讀者應能從 SoF 表的註腳重建你的判斷。
  • 敏感度分析結果也是證據:若排除高偏誤風險研究、或 trim-and-fill 後結論不變,可以寫進理由,支持不降級或只降一級。
  • NMA 有專屬框架:網絡統合分析的證據確定性使用 CINeMA 等延伸方法(第 11 關)。

7. 實作練習:替 magnesium 的最終結果寫 GRADE 註腳

假設你在 2005 年左右寫一篇 magnesium 治療急性心肌梗塞的 SR,outcome 為全死因死亡,手上有第 8 關 ex3 的 22 個 RCT(72,476 人)。起點是 high(全部為 RCT)。請先自己試著寫三個 domain 的判斷,再對照下面的參考寫法。

Inconsistency:random-effects 的 I² = 82.2%,τ² = 0.177,Q = 57.72(p < 0.0001)。更關鍵的是,小試驗多半顯示明顯好處,而大型試驗(ISIS-4)的點估計略大於 1。排除 ISIS-4 與 MAGIC 兩個大型試驗後,I² 降為 29.5%,OR 為 0.51(0.38–0.68)。也就是說,異質性主要來自「大試驗 vs 小試驗」的差異,而不是臨床上可解釋的族群差異。參考寫法:「各試驗結果差異大(I² = 82%),且與試驗大小有關,因 inconsistency 降一級。」

Publication bias / small-study effect:Egger 檢定 t = −5.02,p < 0.001;結合上述「效果隨試驗變大而消失」的型態,強烈懷疑 small-study effect。參考寫法:「小型試驗的效果明顯大於大型試驗(Egger p < 0.001),強烈懷疑 small-study effect,降一級。」這裡要注意與 inconsistency 的理由是否重疊:兩者都源自「大小試驗不一致」。有些評估者會選擇只在其中一個 domain 降級,並在另一個 domain 的註腳說明「已於 X 處考慮」,這比默默扣兩次更透明。

Imprecision:random-effects OR 0.58(0.43–0.78),CI 不含 1;fixed-effect(MH)OR 0.99(0.94–1.04),CI 窄且跨 1。兩個模型給出方向不同的答案,此時「哪一個 CI 才算數」本身就是判斷的一部分。總人數 72,476 人已相當龐大,單看資訊量不是問題;問題在於模型選擇。參考寫法:「總資訊量足夠;但 random-effects 與 fixed-effect 結果分歧,主要反映上述 small-study effect,不另因 imprecision 降級。」

結論範例:從 high 起算,因 inconsistency 與 small-study effect 降級後為 low certainty。SoF 表上的敘述可以是:「magnesium 對死亡率的效果不確定;大型試驗未顯示死亡率降低(ISIS-4 OR 1.059,95% CI 0.996–1.127,未達統計顯著),早期小試驗的好處可能被高估。」

這只是一種合理的判斷路徑,不是標準答案。GRADE 的價值不在於所有人給出相同等級,而在於每一次降級都有寫清楚、讀者可以檢查的理由。

常見錯誤 / 誤讀

  • 「I² > 50% 就降一級、> 75% 降兩級」:I² 沒有機械式門檻,要看效果方向是否可能改變、能否被解釋。
  • 只看 CI 是否含 1 判斷 imprecision:忽略了決策閾值與 OIS。
  • 「Egger 不顯著,所以 publication bias 未偵測到」:研究數少時檢定力很低,要用其他資訊判斷。
  • 把未達顯著的 pooled 結果寫成「證明無效」:確定性低或 CI 寬,代表「不確定」,不是「無效」。
  • 對整篇 SR 給一個 GRADE:GRADE 是 outcome-by-outcome。

本關重點小抄

Domain看什麼一句話判斷法
Inconsistency森林圖、prediction interval、I²、τ²、subgroup效果的方向是否可能因情境而改變?能否被事先規劃的分析解釋?
ImprecisionCI 與決策閾值、總樣本數 / 事件數(OIS)CI 兩端會不會導向不同決策?資訊量夠不夠一個像樣的試驗?
Publication biasFunnel plot、檢定(k ≥ 10)、註冊庫、贊助來源有沒有理由懷疑「小而正向」的研究被過度代表?

一句話:GRADE 不是把 p 值換個說法,而是問「這個數字在不同情境、不同資訊量、不同發表機率下還站得住嗎」。

延伸閱讀

BOSS 戰:確定性審判官

HP0/4
  1. BCG 範例(ex1)的 random-effects pooled RR 為 0.49(95% CI 0.34–0.70),但 95% prediction interval 為 0.15–1.55。這組數字最直接影響哪個 GRADE domain 的判斷?

  2. Optimal information size(OIS)的概念是?

  3. Magnesium 範例(ex3)中,ISIS-4 之前的 13 個試驗(4115 人)合併 OR 為 0.48(95% CI 0.32–0.71)。若當時用 GRADE 評估,下列哪個考量最能說明為何不宜直接評為 High certainty?

  4. 關於 GRADE 與 meta-analysis 的關係,下列何者正確?