跳到主要內容

LV.10

GRADE 與 Summary of Findings

從 risk of bias 到證據確定性、SoF table

BOSS
降級天秤審判官
時間
約 45 分鐘
建議先過
LV.08 、LV.09

本關目標

上一關你算出了迷你 SR 的合併結果。但醫學生、臨床醫療人員、指引小組真正想知道的是:「這個數字我能信幾分?」這一關的審判官手上有一座天平:一邊放五個降級砝碼,一邊放三個升級砝碼,最後決定每個結果的證據確定性(certainty of evidence)。

讀完本關,你應該能:

  1. 說明 GRADE(Grading of Recommendations, Assessment, Development and Evaluation)的四個等級與起點。
  2. 逐一運用五個降級因子與三個升級因子,並寫出每一次判斷的理由。
  3. 讀懂並親手做出 Summary of Findings(SoF,結果摘要)表,包括絕對效果。
  4. 用迷你 SR 的 grade_sof.md 逐項重建判斷,並與 BMJ 2017、Cochrane 2020 對照。
  5. 知道 SoF 表之後還有 Evidence to Decision(EtD)框架,以及它和 SR 作者的分工。

MA 數字如何轉成 inconsistency、imprecision、publication bias 的判斷,在 MA 王國 LV.10 有更多量化範例;本關深講完整流程與 SoF 表。

1. GRADE 在評什麼

GRADE 把證據確定性分成 high、moderate、low、very low 四級,套用在「某一個結果的整體證據(body of evidence)」,而不是單篇研究。在 SR 的情境裡,確定性代表「我們對效果估計值正確的信心」;在指引的情境裡,則代表「效果估計值足以支持某個建議的信心」(Balshem 2011, GRADE 3)。GRADE 的整體架構最早在 BMJ 系列中介紹(Atkins 2004;Guyatt 2008)。

GRADE 工作小組後來進一步說明,確定性最好理解為「真實效果落在某個門檻某一側(或某個範圍內)」的確定程度;SR 作者應該寫清楚自己用的是什麼門檻(Hultcrantz 2017)。例如「類固醇是否增加 24 h 完全緩解(門檻 = RR 1)」與「是否增加至少每千人 100 人」是兩個不同的確定性問題。

三個基本規則:

  • 起點:RCT 從 high 開始,觀察性研究從 low 開始(Balshem 2011)。若觀察性研究用 ROBINS-I 評 RoB,起點的處理另有指引(Schünemann 2019, GRADE 18)。
  • 逐一結果評:每個結果先分別考慮五個降級 domain;整體確定性只有在需要做建議時才有意義,一般以確定性最低的關鍵結果為準(Guyatt 2013, GRADE 11)。
  • 選結果:先決定哪些結果對病人重要、哪些是關鍵(critical),這一步在框定問題時就要做(Guyatt 2011, GRADE 2)。

2. 五個降級砝碼

Domain問的問題判斷重點
Risk of bias研究本身做得可靠嗎?不要跨研究平均;若部分研究 high RoB,考慮只用低 RoB 研究的結果
Inconsistency研究結果彼此一致嗎?點估計是否相近、CI 是否重疊、I²;方向是否改變比大小不同嚴重
Indirectness證據回答的是我的問題嗎?族群、介入、結果(替代指標)不同;沒有直接比較
Imprecision結果夠精確嗎?CI 兩端是否導向不同決策;總資訊量是否達 OIS
Publication bias有研究消失了嗎?小型、商業贊助研究為主;funnel plot 有限制

Risk of bias。 RCT 常見的限制包括分配隱匿失敗、未盲化、失追蹤、未遵守意圖治療原則,以及較晚才被重視的「因明顯好處提早停止」與「依結果選擇性報告」;RoB 可能因結果而異,而且決定是否降級時不應跨研究平均——若某結果同時有高、低 RoB 的研究,應考慮只納入低 RoB 的研究(Guyatt 2011, GRADE 4)。缺失受試者資料的處理另有指引:先做完整案例分析,再以「合理的最壞情況」做敏感度分析,結果穩健就不必因缺失資料降級(Guyatt 2017, GRADE 17)。LV.08 的 RoB 2 結果就是這個砝碼的輸入。

Inconsistency。 判斷依據包括點估計的相似度、CI 的重疊程度、異質性檢定與 I²。應事先提出少數幾個關於病人、介入、結果、方法學的假說來解釋異質性;當異質性大且無法解釋時降級,特別是有些研究顯示明顯好處、另一些顯示沒有效果或傷害時,而不只是「效果大或小」的差別(Guyatt 2011, GRADE 7)。

Indirectness。 有四種形式:病人不同、介入不同、結果不同(例如以替代指標代替病人重要結果),以及缺乏 head-to-head 直接比較(Guyatt 2011, GRADE 8)。

Imprecision。 主要看 95% CI:如果 CI 上界與下界各自為真時,臨床做法會不同,就要降級。效果看起來很大、但總樣本數不大且事件很少時,可計算「optimal information size(OIS,最適資訊量)」協助判斷。對 SR 而言,若 CI 不含 RR 1 且事件數或人數超過 OIS,精確度足夠;若 CI 包含明顯的好處或傷害(作者建議以 RR < 0.75 或 > 1.25 作為粗略參考),即使達到 OIS 仍可考慮降級(Guyatt 2011, GRADE 6)。

Publication bias。 當證據來自多個小型、多數由商業贊助的研究時,應該懷疑;funnel plot 等方法都有明顯限制(Guyatt 2011, GRADE 5)。研究數少時不對稱檢定的檢定力很低,這部分在 MA 王國 LV.09 有完整討論。

一個重要提醒:避免重複扣分。 同一個問題(例如研究間差異很大)可能同時讓 CI 變寬與 I² 變高。GRADE 用於預後證據的文章就提醒,先因不一致降級、再因 CI 寬降級,有重複計算的風險(Iorio 2015)。每一次降級都要寫一句獨立的理由。

3. 三個升級砝碼

升級主要用於觀察性研究(Guyatt 2011, GRADE 9):

  1. 大效果:方法嚴謹的觀察性研究顯示風險至少減少或增加 2 倍,可考慮升一級;至少 5 倍可考慮升兩級。
  2. 劑量反應關係(dose-response gradient)。
  3. 所有合理的干擾或偏誤只會削弱觀察到的效果(或在結果顯示無效果時,只會製造出虛假的效果)。

升級的前提是研究本身沒有嚴重的降級問題;不要用升級來「抵銷」RoB。迷你 SR 全部是 RCT,從 high 開始,不使用升級因子。

4. 迷你 SR 逐項評等

起點:9 篇皆為 RCT,從 High 開始。以下全部依 07_synthesis_grade/grade_sof.md 第三節,RoB 依 06_rob/rob2.csv(Low 1、Some concerns 6、High 2)。

結果研究數(人數)RoB不一致間接不精確發表偏誤 / 缺漏證據確定性
24 h 完全緩解4 RCT(833)不降降 1不降降 1未降,需注意⊕⊕◯◯ Low
48 h 完全緩解3 RCT(717)不降不降不降降 1同上⊕⊕⊕◯ Moderate
完全緩解時間4 RCT(316)降 1不降降 1不降n 有假設值⊕⊕◯◯ Low
開始緩解時間多篇,未合併降 1降 1不降—量尺不一⊕⊕◯◯ Low(敘述性)
不良事件9 RCT,定義不一降 1——降 1報告不完整⊕⊕◯◯ Low(敘述性)

逐項看判斷怎麼來的。

24 h 完全緩解(Low)。

  • RoB 不降:4 篇中沒有 overall High;Wei、Kiderman、Tasar 為 Some concerns,權重最大的 Hayward 2017 為 Low。
  • Inconsistency 降 1:I² 72%,Hayward(RR 1.28)與其他三篇(2.81–8.81)效果大小差很多;拿掉 Hayward 後 I² 0%。異質性可以用情境(基層、不給立即抗生素 vs 急診)部分解釋,但這不是事先規劃的子群分析,只能列為可能原因。
  • Indirectness 不降:同時涵蓋基層與急診,符合 PICO。
  • Imprecision 降 1:主要分析 REML + HKSJ 的 95% CI 0.80–10.19 跨 1,PI 0.23–34.92。
  • 發表偏誤:k = 4 無法做有意義的不對稱檢定,未降級;但 9 篇中 5 篇沒有可用數據,且已知漏掉一篇未被 PubMed 收錄的試驗(Ahn 2003),在註腳寫明。
  • 寫理由時要說清楚:inconsistency 與 imprecision 都和 Hayward 的差異有關,兩次降級各自的依據(效果差異 vs CI 跨 1)必須分開寫。

48 h 完全緩解(Moderate)。 I² 35%,不降 inconsistency;HKSJ 95% CI 0.97–2.43 下界跨 1,降 imprecision 一級。Tasar 的 48 h 人數是全文 Table 3 兩列相加而得,標為 derived_from_reported。

完全緩解時間(Low)。 HKSJ 區間 −29.27 到 −11.68 小時,PI −33.61 到 −7.34,都不含 0,所以 imprecision 不降。但 O’Brien 1993、Olympia 2005 的 overall RoB 為 High;排除這兩篇後只剩 k = 2,MD −22.55(−78.51 到 33.40),未達統計顯著——結論的穩健度取決於品質較差的試驗,因此 RoB 降 1。另外 4 篇都是急診、全員給抗生素,沒有基層試驗,indirectness 降 1。這就是 GRADE 4「不要跨研究平均、考慮只看低 RoB 研究」在實作中的樣子。

完全緩解時間的 forest plot:四篇試驗的平均差都在 0 的左側,Marvez-Valls 1998 的區間跨過 0,合併菱形整體在 0 的左側
Figure 10-1 迷你 SR:完全緩解時間(MD,小時;負值 = 類固醇較快)。資料:example/07_synthesis_grade/results.json。教學示範,不可作為臨床決策依據。

5. Summary of Findings 表

SoF 表為最重要的(至多七個)結果呈現:研究數與人數、確定性、相對效果與絕對效果的最佳估計。二元結果建議以 RR 作為相對效果,套用到基準(對照組)風險得到絕對風險;基準風險最好來自具代表性的觀察性研究,沒有時可用相關 RCT。當相對效果的 CI 包含虛無值(RR 1)時,可在絕對風險欄註明未達統計顯著、只報 CI,或加註強調點估計的不確定性(Guyatt 2013, GRADE 12)。連續結果的 SoF 表另有指引(Guyatt 2013, GRADE 13)。

迷你 SR 的 SoF 表(族群:門診或急診的急性喉嚨痛;介入:單劑或短期 oral/IM 類固醇;對照:placebo):

結果對照組類固醇組相對效果(95% CI)研究數(人數)確定性白話結論
24 h 疼痛完全緩解107/1000305/1000(85 to 1000*)RR 2.85(0.80–10.19),HKSJ4(833)Low類固醇可能增加 24 h 完全緩解,但未達統計顯著,且各試驗效果差異大
48 h 疼痛完全緩解333/1000513/1000(325 to 810)RR 1.54(0.97–2.43),HKSJ3(717)Moderate類固醇很可能增加 48 h 完全緩解;HKSJ 區間下界跨 1,未達統計顯著
完全緩解時間—平均早 20.5 小時(11.7 to 29.3 小時)MD −20.47 h,HKSJ4(316)Low類固醇可能縮短疼痛時間,但證據來自急診、加抗生素、品質參差的小試驗
開始緩解時間—5 篇報告類固醇組較早;Bulloch 整體與 Hayward 未達統計顯著未合併7Low類固醇可能讓疼痛較早開始緩解,但各試驗結果不一
不良事件Hayward 嚴重不良事件 3 例Hayward 2 例;其餘多寫未觀察到相關副作用未合併9Low可能不增加短期不良事件,但收集與報告不完整

註:基準風險 = 納入試驗對照組風險的中位數(24 h:0.107;48 h:0.333),類固醇組 = 1000 × 基準風險 × RR 的 HKSJ CI 上下界。*24 h 上界計算值超過 1000,截在 1000。

幾個值得學的細節:

  • 絕對效果的區間會暴露不確定性:24 h 的每千人差異是 +198,區間 −22 到 +893;這比「RR 2.85」更直接告訴讀者「證據不足以確定」。
  • 白話措辭跟著確定性走:GRADE 26 建議 high 用「results in」、moderate 用「likely results in」、low 用「may result in」,工作坊與調查中這類句子被多數人接受(Santesso 2020)。上表的「可能 / 很可能」就是照這個規則寫的。
  • SoF 表真的有用:小型隨機試驗顯示,有 SoF 表的讀者答對關鍵問題的比例較高、找到關鍵結果的時間較短(Rosenbaum 2010);另一個 290 人的隨機試驗中,新格式提高了對風險差與證據品質的理解(Carrasco-Labra 2016)。

沒有單一合併估計的結果(開始緩解時間、不良事件)也能評 GRADE,做法見 LV.09 與 Murad 2017。

6. 對照標準答案:BMJ 2017 與 Cochrane 2020

迷你 SR 刻意選了一個已有高品質 SR 的題目,讓我們能對答案(grade_sof.md 第五節):

迷你 SR(PubMed only,單人,全文萃取)BMJ 2017(Sadeghirad 2017)Cochrane 2020(de Cassan 2020)
搜尋PubMed多資料庫 + 試驗登錄 + 參考文獻多資料庫 + 試驗登錄
納入9 RCT10 RCT(1426 人)9 RCT(1319 人)
24 h 完全緩解4 篇:RR 2.85;REML 1.27–6.41;HKSJ 0.80–10.19(未達統計顯著);Low5 篇:RR 2.24(1.17–4.29),I² 69%,ModerateRR 2.4(1.29–4.47),I² 67%,High
48 h 完全緩解3 篇:RR 1.54;REML 1.22–1.95;HKSJ 0.97–2.43(未達統計顯著);Moderate4 篇:RR 1.48(1.26–1.75),I² 3%,HighRR 1.50(1.27–1.76),I² 0%,High
完全緩解時間4 篇:MD −20.5 h(HKSJ −29.3 to −11.7);Low6 篇:−11.1 h(−21.8 to −0.4),Low平均縮短 11.6 h(摘要未給 CI),Moderate

為什麼點估計相近、區間較寬?

  1. 點估計已經接近:24 h RR 2.85 vs 2.24/2.4;48 h 1.54 vs 1.48/1.50;I²(72% vs 67–69%)也相近。初版只靠 Hayward 一篇全文時得到的 RR 1.28 明顯偏低——那是資料可得性造成的偏差;補回全文後,點估計已接近既有 SR。
  2. 區間較寬,主要是方法選擇:迷你 SR 主要分析用 REML + HKSJ。改看 REML 的 Wald 型區間(24 h 1.27–6.41;48 h 1.22–1.95),與兩篇 SR 一樣達統計顯著。k = 3–4 時 HKSJ 明顯放寬區間,這是方法學取捨,不代表結論互相矛盾。
  3. 24 h 少一篇:BMJ 有 5 篇、迷你 SR 4 篇;最可能的差異是 Ahn 2003(未被 PubMed 收錄)——只搜一個資料庫的代價(回想 LV.04)。
  4. 完全緩解時間仍較大:迷你 SR 的 4 篇全是急診、全員給抗生素、3 篇 IM;−20.5 h 接近 BMJ 的 IM 次群(−22.4 h),而非整體估計(−11.1 h)。
  5. 確定性不同的原因:點估計相近的資料,迷你 SR 的區間較寬,所以 imprecision 被扣分;各團隊對 inconsistency 的判斷也不同(Cochrane 24 h 評 High)。GRADE 的價值不是所有人給出同一個等級,而是每一次判斷都有寫清楚、可以被檢查的理由。

7. 從證據到決策:EtD 框架

SoF 表告訴你「效果多大、多確定」,但「該不該建議」還需要更多資訊。GRADE 指引把建議分成 strong 與 weak(亦稱 conditional),決定方向與強度的因素包括效果估計、對估計的信心、價值觀與偏好,以及資源使用(Andrews 2013, GRADE 14;Andrews 2013, GRADE 15)。

Evidence to Decision(EtD)框架把這個過程結構化(Alonso-Coello 2016):

  1. 形成問題:PICO、採取的觀點、次族群、背景。
  2. 逐準則評估:問題是否優先、期望與不期望效果的大小、證據確定性、病人對結果的重視程度、利弊平衡、資源使用、可接受性、可行性;採族群觀點的框架另加公平性。各準則都要寫下判斷與依據。
  3. 下結論:建議的類型與強度、理由、次族群考量、實施、監測評估與研究優先順序。

該文列出五種決策類型(個別病人觀點的臨床建議、族群觀點的臨床建議、納保決策、檢驗相關建議、健康系統/公共衛生建議),各有不同的準則集合;納保決策甚至沒有強/弱之分,而是不納保、限研究、價格協商、限制性納保、完全納保等類型。文中的 WHO bedaquiline 範例是改寫版,作者註明不代表 WHO 的實際建議。

要注意分工:EtD 是給指引小組與決策者用的,不是 SR 作者的規則。SR 作者的產出——SoF 表與每個結果的確定性——是 EtD 的輸入。迷你 SR 只做到 SoF 表,而且明確標示「教學示範,不可作為臨床決策依據」。

常見錯誤 / 誤讀

  • 對單篇研究評 GRADE:GRADE 評的是某個結果的整體證據。
  • RoB 用「平均」判斷:GRADE 4 明確反對跨研究平均;應看高 RoB 研究對結果的影響。
  • 同一個問題扣兩次分:inconsistency 與 imprecision 都源自同一批研究差異時,理由要分開寫清楚。
  • 只看相對效果:沒有絕對效果,讀者無法判斷臨床意義;基準風險要寫明來源。
  • 把 Low certainty 寫成「無效」:Low 代表「可能」,不確定性高;未達統計顯著的結果更不能寫成「沒有效果」。
  • 看到 RCT 就給 High:RCT 只是起點。
  • 用升級抵銷降級:升級主要用於觀察性研究,而且前提是沒有嚴重的降級問題。

本關重點小抄

項目一句話
四個等級high / moderate / low / very low,評「某結果的整體證據」
起點RCT high,觀察性 low
五降RoB、inconsistency、indirectness、imprecision、publication bias
三升大效果(≥2 倍升 1、≥5 倍升 2)、劑量反應、干擾只會削弱效果
SoF 表≤ 7 個重要結果;人數、確定性、相對 + 絕對效果、白話結論
措辭high「會」、moderate「很可能」、low「可能」
EtD指引小組用;SoF 表是它的輸入

迷你 SR 的三個等級記起來:24 h Low、48 h Moderate、完全緩解時間 Low。

延伸閱讀

BOSS 戰:降級天秤審判官

HP0/5
  1. 下列關於 GRADE 的敘述,何者正確?

  2. 迷你 SR 的 24 h 疼痛完全緩解被評為 Low。下列哪一組降級理由與 grade_sof.md 一致?

  3. GRADE 指引第 9 篇建議,方法嚴謹的觀察性研究若顯示相對風險至少減少或增加幾倍時,可考慮升一級?

  4. 迷你 SR 的 24 h RR(2.85)與 BMJ 2017(2.24)、Cochrane 2020(2.4)點估計相近,但區間寬很多。最主要的原因是?

  5. SoF 表中,24 h 結果的確定性為 Low。依 GRADE 指引第 26 篇的措辭建議,白話結論最適合寫成?