本關目標
上一關你算出了迷你 SR 的合併結果。但醫學生、臨床醫療人員、指引小組真正想知道的是:「這個數字我能信幾分?」這一關的審判官手上有一座天平:一邊放五個降級砝碼,一邊放三個升級砝碼,最後決定每個結果的證據確定性(certainty of evidence)。
讀完本關,你應該能:
- 說明 GRADE(Grading of Recommendations, Assessment, Development and Evaluation)的四個等級與起點。
- 逐一運用五個降級因子與三個升級因子,並寫出每一次判斷的理由。
- 讀懂並親手做出 Summary of Findings(SoF,結果摘要)表,包括絕對效果。
- 用迷你 SR 的
grade_sof.md逐項重建判斷,並與 BMJ 2017、Cochrane 2020 對照。 - 知道 SoF 表之後還有 Evidence to Decision(EtD)框架,以及它和 SR 作者的分工。
MA 數字如何轉成 inconsistency、imprecision、publication bias 的判斷,在 MA 王國 LV.10 有更多量化範例;本關深講完整流程與 SoF 表。
1. GRADE 在評什麼
GRADE 把證據確定性分成 high、moderate、low、very low 四級,套用在「某一個結果的整體證據(body of evidence)」,而不是單篇研究。在 SR 的情境裡,確定性代表「我們對效果估計值正確的信心」;在指引的情境裡,則代表「效果估計值足以支持某個建議的信心」(Balshem 2011, GRADE 3)。GRADE 的整體架構最早在 BMJ 系列中介紹(Atkins 2004;Guyatt 2008)。
GRADE 工作小組後來進一步說明,確定性最好理解為「真實效果落在某個門檻某一側(或某個範圍內)」的確定程度;SR 作者應該寫清楚自己用的是什麼門檻(Hultcrantz 2017)。例如「類固醇是否增加 24 h 完全緩解(門檻 = RR 1)」與「是否增加至少每千人 100 人」是兩個不同的確定性問題。
三個基本規則:
- 起點:RCT 從 high 開始,觀察性研究從 low 開始(Balshem 2011)。若觀察性研究用 ROBINS-I 評 RoB,起點的處理另有指引(Schünemann 2019, GRADE 18)。
- 逐一結果評:每個結果先分別考慮五個降級 domain;整體確定性只有在需要做建議時才有意義,一般以確定性最低的關鍵結果為準(Guyatt 2013, GRADE 11)。
- 選結果:先決定哪些結果對病人重要、哪些是關鍵(critical),這一步在框定問題時就要做(Guyatt 2011, GRADE 2)。
2. 五個降級砝碼
| Domain | 問的問題 | 判斷重點 |
|---|---|---|
| Risk of bias | 研究本身做得可靠嗎? | 不要跨研究平均;若部分研究 high RoB,考慮只用低 RoB 研究的結果 |
| Inconsistency | 研究結果彼此一致嗎? | 點估計是否相近、CI 是否重疊、I²;方向是否改變比大小不同嚴重 |
| Indirectness | 證據回答的是我的問題嗎? | 族群、介入、結果(替代指標)不同;沒有直接比較 |
| Imprecision | 結果夠精確嗎? | CI 兩端是否導向不同決策;總資訊量是否達 OIS |
| Publication bias | 有研究消失了嗎? | 小型、商業贊助研究為主;funnel plot 有限制 |
Risk of bias。 RCT 常見的限制包括分配隱匿失敗、未盲化、失追蹤、未遵守意圖治療原則,以及較晚才被重視的「因明顯好處提早停止」與「依結果選擇性報告」;RoB 可能因結果而異,而且決定是否降級時不應跨研究平均——若某結果同時有高、低 RoB 的研究,應考慮只納入低 RoB 的研究(Guyatt 2011, GRADE 4)。缺失受試者資料的處理另有指引:先做完整案例分析,再以「合理的最壞情況」做敏感度分析,結果穩健就不必因缺失資料降級(Guyatt 2017, GRADE 17)。LV.08 的 RoB 2 結果就是這個砝碼的輸入。
Inconsistency。 判斷依據包括點估計的相似度、CI 的重疊程度、異質性檢定與 I²。應事先提出少數幾個關於病人、介入、結果、方法學的假說來解釋異質性;當異質性大且無法解釋時降級,特別是有些研究顯示明顯好處、另一些顯示沒有效果或傷害時,而不只是「效果大或小」的差別(Guyatt 2011, GRADE 7)。
Indirectness。 有四種形式:病人不同、介入不同、結果不同(例如以替代指標代替病人重要結果),以及缺乏 head-to-head 直接比較(Guyatt 2011, GRADE 8)。
Imprecision。 主要看 95% CI:如果 CI 上界與下界各自為真時,臨床做法會不同,就要降級。效果看起來很大、但總樣本數不大且事件很少時,可計算「optimal information size(OIS,最適資訊量)」協助判斷。對 SR 而言,若 CI 不含 RR 1 且事件數或人數超過 OIS,精確度足夠;若 CI 包含明顯的好處或傷害(作者建議以 RR < 0.75 或 > 1.25 作為粗略參考),即使達到 OIS 仍可考慮降級(Guyatt 2011, GRADE 6)。
Publication bias。 當證據來自多個小型、多數由商業贊助的研究時,應該懷疑;funnel plot 等方法都有明顯限制(Guyatt 2011, GRADE 5)。研究數少時不對稱檢定的檢定力很低,這部分在 MA 王國 LV.09 有完整討論。
一個重要提醒:避免重複扣分。 同一個問題(例如研究間差異很大)可能同時讓 CI 變寬與 I² 變高。GRADE 用於預後證據的文章就提醒,先因不一致降級、再因 CI 寬降級,有重複計算的風險(Iorio 2015)。每一次降級都要寫一句獨立的理由。
3. 三個升級砝碼
升級主要用於觀察性研究(Guyatt 2011, GRADE 9):
- 大效果:方法嚴謹的觀察性研究顯示風險至少減少或增加 2 倍,可考慮升一級;至少 5 倍可考慮升兩級。
- 劑量反應關係(dose-response gradient)。
- 所有合理的干擾或偏誤只會削弱觀察到的效果(或在結果顯示無效果時,只會製造出虛假的效果)。
升級的前提是研究本身沒有嚴重的降級問題;不要用升級來「抵銷」RoB。迷你 SR 全部是 RCT,從 high 開始,不使用升級因子。
4. 迷你 SR 逐項評等
起點:9 篇皆為 RCT,從 High 開始。以下全部依 07_synthesis_grade/grade_sof.md 第三節,RoB 依 06_rob/rob2.csv(Low 1、Some concerns 6、High 2)。
| 結果 | 研究數(人數) | RoB | 不一致 | 間接 | 不精確 | 發表偏誤 / 缺漏證據 | 確定性 |
|---|---|---|---|---|---|---|---|
| 24 h 完全緩解 | 4 RCT(833) | 不降 | 降 1 | 不降 | 降 1 | 未降,需注意 | ⊕⊕◯◯ Low |
| 48 h 完全緩解 | 3 RCT(717) | 不降 | 不降 | 不降 | 降 1 | 同上 | ⊕⊕⊕◯ Moderate |
| 完全緩解時間 | 4 RCT(316) | 降 1 | 不降 | 降 1 | 不降 | n 有假設值 | ⊕⊕◯◯ Low |
| 開始緩解時間 | 多篇,未合併 | 降 1 | 降 1 | 不降 | — | 量尺不一 | ⊕⊕◯◯ Low(敘述性) |
| 不良事件 | 9 RCT,定義不一 | 降 1 | — | — | 降 1 | 報告不完整 | ⊕⊕◯◯ Low(敘述性) |
逐項看判斷怎麼來的。
24 h 完全緩解(Low)。
- RoB 不降:4 篇中沒有 overall High;Wei、Kiderman、Tasar 為 Some concerns,權重最大的 Hayward 2017 為 Low。
- Inconsistency 降 1:I² 72%,Hayward(RR 1.28)與其他三篇(2.81–8.81)效果大小差很多;拿掉 Hayward 後 I² 0%。異質性可以用情境(基層、不給立即抗生素 vs 急診)部分解釋,但這不是事先規劃的子群分析,只能列為可能原因。
- Indirectness 不降:同時涵蓋基層與急診,符合 PICO。
- Imprecision 降 1:主要分析 REML + HKSJ 的 95% CI 0.80–10.19 跨 1,PI 0.23–34.92。
- 發表偏誤:k = 4 無法做有意義的不對稱檢定,未降級;但 9 篇中 5 篇沒有可用數據,且已知漏掉一篇未被 PubMed 收錄的試驗(Ahn 2003),在註腳寫明。
- 寫理由時要說清楚:inconsistency 與 imprecision 都和 Hayward 的差異有關,兩次降級各自的依據(效果差異 vs CI 跨 1)必須分開寫。
48 h 完全緩解(Moderate)。 I² 35%,不降 inconsistency;HKSJ 95% CI 0.97–2.43 下界跨 1,降 imprecision 一級。Tasar 的 48 h 人數是全文 Table 3 兩列相加而得,標為 derived_from_reported。
完全緩解時間(Low)。 HKSJ 區間 −29.27 到 −11.68 小時,PI −33.61 到 −7.34,都不含 0,所以 imprecision 不降。但 O’Brien 1993、Olympia 2005 的 overall RoB 為 High;排除這兩篇後只剩 k = 2,MD −22.55(−78.51 到 33.40),未達統計顯著——結論的穩健度取決於品質較差的試驗,因此 RoB 降 1。另外 4 篇都是急診、全員給抗生素,沒有基層試驗,indirectness 降 1。這就是 GRADE 4「不要跨研究平均、考慮只看低 RoB 研究」在實作中的樣子。
5. Summary of Findings 表
SoF 表為最重要的(至多七個)結果呈現:研究數與人數、確定性、相對效果與絕對效果的最佳估計。二元結果建議以 RR 作為相對效果,套用到基準(對照組)風險得到絕對風險;基準風險最好來自具代表性的觀察性研究,沒有時可用相關 RCT。當相對效果的 CI 包含虛無值(RR 1)時,可在絕對風險欄註明未達統計顯著、只報 CI,或加註強調點估計的不確定性(Guyatt 2013, GRADE 12)。連續結果的 SoF 表另有指引(Guyatt 2013, GRADE 13)。
迷你 SR 的 SoF 表(族群:門診或急診的急性喉嚨痛;介入:單劑或短期 oral/IM 類固醇;對照:placebo):
| 結果 | 對照組 | 類固醇組 | 相對效果(95% CI) | 研究數(人數) | 確定性 | 白話結論 |
|---|---|---|---|---|---|---|
| 24 h 疼痛完全緩解 | 107/1000 | 305/1000(85 to 1000*) | RR 2.85(0.80–10.19),HKSJ | 4(833) | Low | 類固醇可能增加 24 h 完全緩解,但未達統計顯著,且各試驗效果差異大 |
| 48 h 疼痛完全緩解 | 333/1000 | 513/1000(325 to 810) | RR 1.54(0.97–2.43),HKSJ | 3(717) | Moderate | 類固醇很可能增加 48 h 完全緩解;HKSJ 區間下界跨 1,未達統計顯著 |
| 完全緩解時間 | — | 平均早 20.5 小時(11.7 to 29.3 小時) | MD −20.47 h,HKSJ | 4(316) | Low | 類固醇可能縮短疼痛時間,但證據來自急診、加抗生素、品質參差的小試驗 |
| 開始緩解時間 | — | 5 篇報告類固醇組較早;Bulloch 整體與 Hayward 未達統計顯著 | 未合併 | 7 | Low | 類固醇可能讓疼痛較早開始緩解,但各試驗結果不一 |
| 不良事件 | Hayward 嚴重不良事件 3 例 | Hayward 2 例;其餘多寫未觀察到相關副作用 | 未合併 | 9 | Low | 可能不增加短期不良事件,但收集與報告不完整 |
註:基準風險 = 納入試驗對照組風險的中位數(24 h:0.107;48 h:0.333),類固醇組 = 1000 × 基準風險 × RR 的 HKSJ CI 上下界。*24 h 上界計算值超過 1000,截在 1000。
幾個值得學的細節:
- 絕對效果的區間會暴露不確定性:24 h 的每千人差異是 +198,區間 −22 到 +893;這比「RR 2.85」更直接告訴讀者「證據不足以確定」。
- 白話措辭跟著確定性走:GRADE 26 建議 high 用「results in」、moderate 用「likely results in」、low 用「may result in」,工作坊與調查中這類句子被多數人接受(Santesso 2020)。上表的「可能 / 很可能」就是照這個規則寫的。
- SoF 表真的有用:小型隨機試驗顯示,有 SoF 表的讀者答對關鍵問題的比例較高、找到關鍵結果的時間較短(Rosenbaum 2010);另一個 290 人的隨機試驗中,新格式提高了對風險差與證據品質的理解(Carrasco-Labra 2016)。
沒有單一合併估計的結果(開始緩解時間、不良事件)也能評 GRADE,做法見 LV.09 與 Murad 2017。
6. 對照標準答案:BMJ 2017 與 Cochrane 2020
迷你 SR 刻意選了一個已有高品質 SR 的題目,讓我們能對答案(grade_sof.md 第五節):
| 迷你 SR(PubMed only,單人,全文萃取) | BMJ 2017(Sadeghirad 2017) | Cochrane 2020(de Cassan 2020) | |
|---|---|---|---|
| 搜尋 | PubMed | 多資料庫 + 試驗登錄 + 參考文獻 | 多資料庫 + 試驗登錄 |
| 納入 | 9 RCT | 10 RCT(1426 人) | 9 RCT(1319 人) |
| 24 h 完全緩解 | 4 篇:RR 2.85;REML 1.27–6.41;HKSJ 0.80–10.19(未達統計顯著);Low | 5 篇:RR 2.24(1.17–4.29),I² 69%,Moderate | RR 2.4(1.29–4.47),I² 67%,High |
| 48 h 完全緩解 | 3 篇:RR 1.54;REML 1.22–1.95;HKSJ 0.97–2.43(未達統計顯著);Moderate | 4 篇:RR 1.48(1.26–1.75),I² 3%,High | RR 1.50(1.27–1.76),I² 0%,High |
| 完全緩解時間 | 4 篇:MD −20.5 h(HKSJ −29.3 to −11.7);Low | 6 篇:−11.1 h(−21.8 to −0.4),Low | 平均縮短 11.6 h(摘要未給 CI),Moderate |
為什麼點估計相近、區間較寬?
- 點估計已經接近:24 h RR 2.85 vs 2.24/2.4;48 h 1.54 vs 1.48/1.50;I²(72% vs 67–69%)也相近。初版只靠 Hayward 一篇全文時得到的 RR 1.28 明顯偏低——那是資料可得性造成的偏差;補回全文後,點估計已接近既有 SR。
- 區間較寬,主要是方法選擇:迷你 SR 主要分析用 REML + HKSJ。改看 REML 的 Wald 型區間(24 h 1.27–6.41;48 h 1.22–1.95),與兩篇 SR 一樣達統計顯著。k = 3–4 時 HKSJ 明顯放寬區間,這是方法學取捨,不代表結論互相矛盾。
- 24 h 少一篇:BMJ 有 5 篇、迷你 SR 4 篇;最可能的差異是 Ahn 2003(未被 PubMed 收錄)——只搜一個資料庫的代價(回想 LV.04)。
- 完全緩解時間仍較大:迷你 SR 的 4 篇全是急診、全員給抗生素、3 篇 IM;−20.5 h 接近 BMJ 的 IM 次群(−22.4 h),而非整體估計(−11.1 h)。
- 確定性不同的原因:點估計相近的資料,迷你 SR 的區間較寬,所以 imprecision 被扣分;各團隊對 inconsistency 的判斷也不同(Cochrane 24 h 評 High)。GRADE 的價值不是所有人給出同一個等級,而是每一次判斷都有寫清楚、可以被檢查的理由。
7. 從證據到決策:EtD 框架
SoF 表告訴你「效果多大、多確定」,但「該不該建議」還需要更多資訊。GRADE 指引把建議分成 strong 與 weak(亦稱 conditional),決定方向與強度的因素包括效果估計、對估計的信心、價值觀與偏好,以及資源使用(Andrews 2013, GRADE 14;Andrews 2013, GRADE 15)。
Evidence to Decision(EtD)框架把這個過程結構化(Alonso-Coello 2016):
- 形成問題:PICO、採取的觀點、次族群、背景。
- 逐準則評估:問題是否優先、期望與不期望效果的大小、證據確定性、病人對結果的重視程度、利弊平衡、資源使用、可接受性、可行性;採族群觀點的框架另加公平性。各準則都要寫下判斷與依據。
- 下結論:建議的類型與強度、理由、次族群考量、實施、監測評估與研究優先順序。
該文列出五種決策類型(個別病人觀點的臨床建議、族群觀點的臨床建議、納保決策、檢驗相關建議、健康系統/公共衛生建議),各有不同的準則集合;納保決策甚至沒有強/弱之分,而是不納保、限研究、價格協商、限制性納保、完全納保等類型。文中的 WHO bedaquiline 範例是改寫版,作者註明不代表 WHO 的實際建議。
要注意分工:EtD 是給指引小組與決策者用的,不是 SR 作者的規則。SR 作者的產出——SoF 表與每個結果的確定性——是 EtD 的輸入。迷你 SR 只做到 SoF 表,而且明確標示「教學示範,不可作為臨床決策依據」。
常見錯誤 / 誤讀
- 對單篇研究評 GRADE:GRADE 評的是某個結果的整體證據。
- RoB 用「平均」判斷:GRADE 4 明確反對跨研究平均;應看高 RoB 研究對結果的影響。
- 同一個問題扣兩次分:inconsistency 與 imprecision 都源自同一批研究差異時,理由要分開寫清楚。
- 只看相對效果:沒有絕對效果,讀者無法判斷臨床意義;基準風險要寫明來源。
- 把 Low certainty 寫成「無效」:Low 代表「可能」,不確定性高;未達統計顯著的結果更不能寫成「沒有效果」。
- 看到 RCT 就給 High:RCT 只是起點。
- 用升級抵銷降級:升級主要用於觀察性研究,而且前提是沒有嚴重的降級問題。
本關重點小抄
| 項目 | 一句話 |
|---|---|
| 四個等級 | high / moderate / low / very low,評「某結果的整體證據」 |
| 起點 | RCT high,觀察性 low |
| 五降 | RoB、inconsistency、indirectness、imprecision、publication bias |
| 三升 | 大效果(≥2 倍升 1、≥5 倍升 2)、劑量反應、干擾只會削弱效果 |
| SoF 表 | ≤ 7 個重要結果;人數、確定性、相對 + 絕對效果、白話結論 |
| 措辭 | high「會」、moderate「很可能」、low「可能」 |
| EtD | 指引小組用;SoF 表是它的輸入 |
迷你 SR 的三個等級記起來:24 h Low、48 h Moderate、完全緩解時間 Low。
延伸閱讀
- Guyatt GH, et al. GRADE guidelines: 1. Introduction—GRADE evidence profiles and summary of findings tables. J Clin Epidemiol. 2011.
- Balshem H, et al. GRADE guidelines: 3. Rating the quality of evidence. J Clin Epidemiol. 2011.
- Guyatt GH, et al. GRADE guidelines: 12. Preparing summary of findings tables—binary outcomes. J Clin Epidemiol. 2013.
- Santesso N, et al. GRADE guidelines 26: informative statements to communicate the findings of systematic reviews of interventions. J Clin Epidemiol. 2020.
- Alonso-Coello P, et al. GRADE Evidence to Decision (EtD) frameworks. BMJ. 2016.
- MA 王國 LV.10:從 MA 結果判 GRADE