本關目標
前九關你學會了把研究合併、量化異質性、檢查發表偏誤。但臨床讀者真正想問的是:「這個結果我能信幾分?」這一關把 meta-analysis 的統計輸出,翻譯成 GRADE(Grading of Recommendations, Assessment, Development and Evaluation)的證據確定性判斷。
讀完這一關,你應該能:
- 說出 GRADE 五個降級 domain 中,哪三個最直接依賴 meta-analysis 的數字。
- 用 I²、τ²、prediction interval 判斷 inconsistency(不一致性)。
- 用 CI 與 optimal information size(OIS,最適資訊量)判斷 imprecision(不精確性)。
- 把第 9 關的 funnel plot 與檢定結果,轉成 publication bias 的判斷。
GRADE 的完整流程、Summary of Findings(SoF)表與其他 domain 在 SR 站深講,本關只聚焦「MA 數字 → GRADE 判斷」這座橋。
1. GRADE 三十秒摘要
GRADE 對每一個重要 outcome分別評估證據確定性(certainty of evidence),分為 high、moderate、low、very low 四級(Guyatt 2008;Balshem 2011)。RCT 的證據起點為 high,觀察性研究起點為 low。之後依五個 domain 考慮降級:risk of bias、inconsistency、indirectness、imprecision、publication bias;觀察性研究另可因效果很大、有劑量反應關係、或殘餘干擾因子只會削弱效果而升級(Guyatt 2011, GRADE 9)。最後把結果與絕對效果一起放進 SoF 表(Guyatt 2011, GRADE 1)。
深入請看 → SR 站第 10 關:GRADE 與 Summary of Findings
2. MA 數字與 GRADE domain 的對應
| GRADE domain | 主要依據 | 本站相關關卡 |
|---|---|---|
| Risk of bias | 各研究的 RoB 評估(RoB 2、ROBINS-I) | SR 站第 8 關;本站第 8 關的敏感度分析 |
| Indirectness | PICO 與臨床問題的吻合程度 | SR 站第 2、10 關 |
| Inconsistency | 森林圖、I²、τ²、prediction interval、subgroup / meta-regression | 本站第 5–7 關 |
| Imprecision | Pooled estimate 的 CI、總樣本數 / 事件數與 OIS | 本站第 4–5 關 |
| Publication bias | Funnel plot、不對稱檢定、搜尋完整度、試驗註冊比對 | 本站第 9 關 |
後三個 domain 是 meta-analysis 的數字直接派上用場的地方,也是本關的主題。
3. Inconsistency:研究結果彼此一致嗎?
GRADE 怎麼看
GRADE 指引第 7 篇(Guyatt 2011, GRADE 7)列出判斷 inconsistency 時可參考的線索:各研究的點估計差異很大、CI 彼此幾乎不重疊、異質性檢定的 p 值很小、I² 很大。若異質性可由事先規劃的 subgroup 分析合理解釋,則宜分開呈現各子群的估計,而不是對整體降級。
I² 不是一切
第 6 關提過,I² 是「觀察到的變異中,有多少比例來自真實差異」,它不是異質性的絕對大小(Borenstein 2017)。同樣的 τ²,若研究都很大,I² 就會很高。I² 的粗略分級(Higgins 2003)只是參考,不能當成降級門檻。
對臨床判斷更有用的是 prediction interval(預測區間):它估計「在一個新的情境中,真實效果可能落在哪裡」(Riley 2011;IntHout 2016)。
範例:BCG 疫苗(ex1)
| 指標 | 數值 |
|---|---|
| k | 13 |
| Random-effects(REML)pooled RR(95% CI) | 0.49(0.34–0.70) |
| τ² | 0.313 |
| I² | 92.2% |
| Q 檢定 | Q = 152.2,df = 12,p < 0.0001 |
| 95% prediction interval | 0.15–1.55 |
平均效果的 CI 不含 1,看起來 BCG 有保護效果;但 prediction interval 從 0.15 一路延伸到 1.55,跨過 1。意思是:在某些情境下,BCG 的效果可能非常好,在另一些情境下可能沒有保護效果。這是很典型的 inconsistency。
那能不能解釋?第 7 關用緯度做 meta-regression:斜率 −0.029(p < 0.001;改用 Knapp-Hartung 調整後 p = 0.0046),緯度解釋了約 75.6% 的 τ²,但殘餘異質性仍達統計顯著(QE = 30.73,p = 0.0012;殘餘 τ² = 0.076)。
一種合理的 GRADE 寫法是:「各試驗效果差異大(I² = 92%,prediction interval 0.15–1.55),部分可由緯度解釋,但仍有未解釋的異質性,因 inconsistency 降一級。」要注意的是,緯度是研究層級的變數,meta-regression 的結果有生態謬誤(ecological fallacy)的風險(Thompson 2002),而且它不是事先規劃的分析時,可信度更低。
判斷要點
- 先看森林圖與 prediction interval:效果的方向是否可能改變? 方向改變比「大小不同」嚴重得多。
- 若所有研究都指向同一方向、只是大小不同,即使 I² 不低,也不一定要降級。
- 研究數少時,I² 與 τ² 的估計都非常不穩定(von Hippel 2015),不宜只依賴單一數字。
4. Imprecision:結果夠精確嗎?
兩個問題
GRADE 指引第 6 篇(Guyatt 2011, GRADE 6)處理 imprecision 時,可以拆成兩個問題:
- CI 是否跨過重要的決策閾值? 如果 CI 同時包含「有臨床意義的好處」與「沒有效果」(或甚至傷害),不同位置會導向不同的臨床決策,就是不精確。
- 總資訊量夠不夠?(OIS) 即使 CI 看起來不錯,若合併的總樣本數(或事件數)少於「一個檢定力足夠的單一試驗」所需,也宜考慮降級。
第一點大家比較熟。第二點常被忽略,但它正是用來防範「小試驗合併出看似精確的結果」。
範例一:CI 跨過虛無值
第 7 關的連續型範例 ex4(專科中風照護 vs 一般照護的住院天數,k = 9)以 Hedges’ g 合併:
| 方法 | SMD(95% CI) | p |
|---|---|---|
| REML | −0.54(−1.14 至 0.07) | 0.082 |
| REML + HKSJ | −0.54(−1.25 至 0.18) | 0.121 |
點估計看起來是中等大小的效果,但 CI 從「大幅縮短住院」延伸到「略為延長」,未達統計顯著。GRADE 的寫法會是「CI 同時包含有意義的好處與無效果,因 imprecision 降級」。注意不要寫成「專科照護無效」:未達統計顯著代表這份資料無法確定效果,而不是證明沒有效果。本例 I² 也高達 95.5%,同時有 inconsistency 的問題;兩個 domain 的理由要分開寫清楚。
範例二:CI 不含 1,但資訊量可能不足(ex3)
第 8 關的 magnesium 範例是 OIS 概念最好的教材:
| 分析 | k | 人數 | OR(95% CI) | p |
|---|---|---|---|---|
| ISIS-4 之前的 13 個試驗(random-effects) | 13 | 4115 | 0.48(0.32–0.71) | 0.0003 |
| ISIS-4 單獨 | 1 | — | 1.059(0.996–1.127) | 0.069 |
| 全部 22 個試驗,random-effects | 22 | 72,476 | 0.58(0.43–0.78) | 0.0003 |
| 全部 22 個試驗,fixed-effect(MH) | 22 | 72,476 | 0.99(0.94–1.04) | 0.63 |
ISIS-4 之前的合併結果 CI 不含 1、p 很小,看起來「很精確」。但它來自 13 個小試驗、總共 4115 人;死亡率這種 outcome,要偵測合理大小的效果,單一試驗通常需要更多人。以 OIS 的角度看,即使 CI 不含 1,也宜考慮 imprecision。後來的 ISIS-4 單獨結果為 OR 1.059(95% CI 0.996–1.127),未達統計顯著,與早期合併結果的方向不同。
這也解釋了為什麼最後的 random-effects 與 fixed-effect 結果差這麼多:random-effects 給小試驗相對較多的權重,fixed-effect 幾乎由大型試驗主導。兩種模型結論分歧本身就是一個警訊(第 4–5 關)。OIS 的想法與 trial sequential analysis 的 required information size 很接近,第 11 關會再談。
判斷要點
- 先決定決策閾值(例如最小臨床重要差異),再看 CI 是否跨過它;只看「CI 是否含 1」不夠。
- CI 不含 1 時,仍要問:總樣本數或事件數夠不夠?是不是全部來自小試驗?
- 報告絕對效果(每 1000 人多幾個或少幾個事件),比相對效果更容易判斷臨床意義(Guyatt 2013, GRADE 12)。
5. Publication bias:有沒有研究消失了?
GRADE 怎麼看
GRADE 指引第 5 篇(Guyatt 2011, GRADE 5)把 publication bias 寫成「未偵測到(undetected)」或「強烈懷疑(strongly suspected)」兩種狀態,而不是「有 / 沒有」。可以引起懷疑的線索包括:funnel plot 不對稱、證據主要來自小型且結果正向的早期試驗、研究多由有利益關係的贊助者資助等。
範例:ex2 與 ex3
| 範例 | 不對稱檢定 | 其他線索 | 一種合理判斷 |
|---|---|---|---|
| ex2 被動吸菸(k = 37) | Egger p = 0.023;Begg p = 0.22 | 空缺落在不顯著區;trim-and-fill 校正後 OR 1.245 → 1.191,CI 仍不含 1 | 有 small-study effect 跡象;校正後結論方向不變,可考慮是否降級並說明理由 |
| ex3 magnesium(k = 22) | Egger t = −5.02,p < 0.001 | 早期小試驗效果大,大型試驗未達顯著 | 強烈懷疑 small-study effect,宜降級 |
第 9 關強調過:檢定顯著只代表 small-study effect,原因不一定是發表偏誤;但在 GRADE 中,「小研究效果明顯較大」本身就會降低我們對合併結果的信心,所以通常會反映在 publication bias(或與 risk of bias 一併考量)。
研究數少時怎麼辦?
k < 10 時,不對稱檢定的檢定力很低(第 9 關的模擬中,k = 10 時只有約 26%),「檢定不顯著」不能作為「未偵測到 publication bias」的依據。這時判斷要依賴其他資訊:搜尋是否涵蓋試驗註冊庫與灰色文獻、是否找到已註冊但未發表的試驗、研究的贊助來源。這也是為什麼 SR 站的搜尋關卡那麼強調註冊庫。
6. 串起來:避免重複扣分
三個 domain 常常同時出現問題,但理由要分開寫。幾個實務提醒(本站的教學建議):
- 同一個問題不要扣兩次:例如 CI 很寬的主因就是研究間差異很大,要想清楚這是 inconsistency 還是 imprecision 的問題,並在理由中說明。
- 每一次降級都寫一句理由,並附上關鍵數字(I²、prediction interval、CI、總人數、Egger p 值)。讀者應能從 SoF 表的註腳重建你的判斷。
- 敏感度分析結果也是證據:若排除高偏誤風險研究、或 trim-and-fill 後結論不變,可以寫進理由,支持不降級或只降一級。
- NMA 有專屬框架:網絡統合分析的證據確定性使用 CINeMA 等延伸方法(第 11 關)。
7. 實作練習:替 magnesium 的最終結果寫 GRADE 註腳
假設你在 2005 年左右寫一篇 magnesium 治療急性心肌梗塞的 SR,outcome 為全死因死亡,手上有第 8 關 ex3 的 22 個 RCT(72,476 人)。起點是 high(全部為 RCT)。請先自己試著寫三個 domain 的判斷,再對照下面的參考寫法。
Inconsistency:random-effects 的 I² = 82.2%,τ² = 0.177,Q = 57.72(p < 0.0001)。更關鍵的是,小試驗多半顯示明顯好處,而大型試驗(ISIS-4)的點估計略大於 1。排除 ISIS-4 與 MAGIC 兩個大型試驗後,I² 降為 29.5%,OR 為 0.51(0.38–0.68)。也就是說,異質性主要來自「大試驗 vs 小試驗」的差異,而不是臨床上可解釋的族群差異。參考寫法:「各試驗結果差異大(I² = 82%),且與試驗大小有關,因 inconsistency 降一級。」
Publication bias / small-study effect:Egger 檢定 t = −5.02,p < 0.001;結合上述「效果隨試驗變大而消失」的型態,強烈懷疑 small-study effect。參考寫法:「小型試驗的效果明顯大於大型試驗(Egger p < 0.001),強烈懷疑 small-study effect,降一級。」這裡要注意與 inconsistency 的理由是否重疊:兩者都源自「大小試驗不一致」。有些評估者會選擇只在其中一個 domain 降級,並在另一個 domain 的註腳說明「已於 X 處考慮」,這比默默扣兩次更透明。
Imprecision:random-effects OR 0.58(0.43–0.78),CI 不含 1;fixed-effect(MH)OR 0.99(0.94–1.04),CI 窄且跨 1。兩個模型給出方向不同的答案,此時「哪一個 CI 才算數」本身就是判斷的一部分。總人數 72,476 人已相當龐大,單看資訊量不是問題;問題在於模型選擇。參考寫法:「總資訊量足夠;但 random-effects 與 fixed-effect 結果分歧,主要反映上述 small-study effect,不另因 imprecision 降級。」
結論範例:從 high 起算,因 inconsistency 與 small-study effect 降級後為 low certainty。SoF 表上的敘述可以是:「magnesium 對死亡率的效果不確定;大型試驗未顯示死亡率降低(ISIS-4 OR 1.059,95% CI 0.996–1.127,未達統計顯著),早期小試驗的好處可能被高估。」
這只是一種合理的判斷路徑,不是標準答案。GRADE 的價值不在於所有人給出相同等級,而在於每一次降級都有寫清楚、讀者可以檢查的理由。
常見錯誤 / 誤讀
- 「I² > 50% 就降一級、> 75% 降兩級」:I² 沒有機械式門檻,要看效果方向是否可能改變、能否被解釋。
- 只看 CI 是否含 1 判斷 imprecision:忽略了決策閾值與 OIS。
- 「Egger 不顯著,所以 publication bias 未偵測到」:研究數少時檢定力很低,要用其他資訊判斷。
- 把未達顯著的 pooled 結果寫成「證明無效」:確定性低或 CI 寬,代表「不確定」,不是「無效」。
- 對整篇 SR 給一個 GRADE:GRADE 是 outcome-by-outcome。
本關重點小抄
| Domain | 看什麼 | 一句話判斷法 |
|---|---|---|
| Inconsistency | 森林圖、prediction interval、I²、τ²、subgroup | 效果的方向是否可能因情境而改變?能否被事先規劃的分析解釋? |
| Imprecision | CI 與決策閾值、總樣本數 / 事件數(OIS) | CI 兩端會不會導向不同決策?資訊量夠不夠一個像樣的試驗? |
| Publication bias | Funnel plot、檢定(k ≥ 10)、註冊庫、贊助來源 | 有沒有理由懷疑「小而正向」的研究被過度代表? |
一句話:GRADE 不是把 p 值換個說法,而是問「這個數字在不同情境、不同資訊量、不同發表機率下還站得住嗎」。
延伸閱讀
- Guyatt GH, et al. GRADE guidelines 6. Rating the quality of evidence—imprecision. J Clin Epidemiol. 2011.
- Guyatt GH, et al. GRADE guidelines: 7. Rating the quality of evidence—inconsistency. J Clin Epidemiol. 2011.
- Guyatt GH, et al. GRADE guidelines: 5. Rating the quality of evidence—publication bias. J Clin Epidemiol. 2011.
- Riley RD, et al. Interpretation of random effects meta-analyses. BMJ. 2011.
- Borenstein M, et al. Basics of meta-analysis: I² is not an absolute measure of heterogeneity. Res Synth Methods. 2017.
- SR 站第 10 關:GRADE 與 Summary of Findings
- 本站參考文獻「Certainty of evidence:GRADE」分組