跳到主要內容

LV.11

PRISMA 2020 報告

PRISMA 2020 checklist、flow diagram、AMSTAR 2 自我檢查

BOSS
流程圖加總對不上幽靈
時間
約 40 分鐘
建議先過
LV.06 、LV.10

本關目標

你已經走完搜尋、篩選、萃取、RoB、合併與 GRADE。最後一步是把整個過程寫出來,讓別人看得懂、查得到、能重做。這一關的幽靈最喜歡躲在 flow diagram 裡:某一層的數字加總對不上、某篇研究不知道從哪裡冒出來、排除理由少了幾篇。

讀完本關,你應該能:

  1. 說明 PRISMA 2020 的定位(報告指引,不是品質評分),以及 27 項 checklist 的七個區段。
  2. 畫出一張每一層都加得回來的 PRISMA 2020 flow diagram。
  3. 區分「報告完整度」(PRISMA)與「方法學品質」(AMSTAR 2、ROBIS)。
  4. 用 AMSTAR 2 替迷你 SR 做一次誠實的自我檢查。

1. PRISMA 2020 是什麼

PRISMA(Preferred Reporting Items for Systematic reviews and Meta-Analyses)2009 版的設計目的,是幫助 SR 作者透明地報告為什麼做這篇回顧、做了什麼、發現了什麼。PRISMA 2020 取代了 2009 版,反映這十年在找研究、選研究、評讀與合併方法上的進展,內容包括 27 項 checklist、逐項詳述的擴充 checklist、摘要 checklist,以及原始回顧與更新回顧的 flow diagram(Page 2021, PRISMA 2020)。每一項的理由與範例在配套的 explanation and elaboration 文件中(Page 2021, E&E)。

PRISMA 2020 的發展過程本身就是一次小型的證據整合:整理 60 份 SR 報告指引文件、對方法學家與期刊編輯做線上調查(220 人受邀、110 人回覆)、21 人的面對面會議,之後再經多輪草稿修訂(Page 2021, 發展過程;前置的條目整理見 Page 2020)。舊版的 checklist 與四階段流程圖見 Liberati 2009 與 Moher 2009。

PRISMA 2020 主要為評估健康介入效果的 SR 設計,但多數項目也適用於其他類型的回顧;不論有沒有做 meta-analysis 都適用。其他回顧類型有延伸版:PRISMA-P(protocol,LV.03)、PRISMA-S(搜尋,Rethlefsen 2021,LV.04)、PRISMA-ScR(scoping review,Tricco 2018)、PRISMA-DTA(McInnes 2018)、PRISMA-NMA(Hutton 2015)、PRISMA-IPD(Stewart 2015)。

2. 27 項 checklist:七個區段

PRISMA 2020 checklist 分成七個區段、27 項(部分有子項目)。下表用自己的話摘要每一項,並對照迷你 SR 的檔案位置——寫報告時,每一項都應該能指到一個實際的產物。

區段項目要報告什麼(摘要)迷你 SR 的對應
Title1標明是 systematic review標題寫明
Abstract2依 PRISMA 2020 for Abstracts—
Introduction3 理由、4 目的既有知識下的理由;明確的問題01_pico_eligibility.md
Methods5 資格條件納入排除條件、合併時怎麼分組同上
6 資訊來源所有資料庫、註冊平台、其他來源與最後搜尋日期PubMed,2026-10-06
7 搜尋策略所有資料庫與網站的完整搜尋式(含 filter)02_search/search_strategy.md
8 篩選流程幾人篩、是否獨立、有無自動化工具單人(限制)
9 資料收集幾人萃取、是否獨立、有無聯絡作者單人(限制)
10a / 10b 資料項目結果的定義與蒐集範圍;其他變項與缺失資訊的假設extraction.csv(標註 derived_from_reported 與假設)
11 RoB 評估工具、幾人評、是否獨立RoB 2,06_rob/
12 效果量每個結果用的效果量RR、MD
13a–13f 合併方法哪些研究進哪個合併、資料準備、呈現方式、合併方法與模型、異質性探索、敏感度分析analysis.R(REML + HKSJ、leave-one-out、排除 High RoB)
14 報告偏誤評估合併中缺漏結果的方法k < 10,僅敘述
15 確定性評估證據確定性的方法GRADE
Results16a / 16b 篩選結果flow diagram;看似符合卻被排除的研究與理由prisma_flow.png
17 研究特徵、18 各研究 RoB每篇研究的特徵與 RoBextraction.csv、rob2_traffic_light.png
19 各研究結果每組摘要統計量與效果量 + 區間forest plot
20a–20d 合併結果貢獻研究的特徵與 RoB、所有合併結果與異質性、異質性探索、敏感度分析results.json、output.txt
21 報告偏誤、22 確定性每個合併的評估結果grade_sof.md
Discussion23a–23d解讀、證據的限制、回顧流程的限制、對實務與研究的意涵README「限制」
Other information24a–24c 註冊與 protocol註冊資訊、protocol 在哪、修改與理由未註冊(限制)
25 經費、26 利益衝突經費來源與角色;作者利益衝突—
27 資料與程式萃取表、分析資料、程式碼是否公開、在哪全部檔案 + 重現指令

相較 2009 版,幾個值得注意的變動(PRISMA 2020 Box 2):要求所有資料庫的完整搜尋式(不再是「至少一個」);篩選與萃取要寫幾個人、是否獨立、有無自動化工具;合併方法拆成 13a–13f;新增證據確定性(15、22)、利益衝突(26)與資料/程式公開(27);protocol 與註冊移到最後的 Other information,並要求說明修改。

PRISMA 2020 也明確把 SWiM 列為 item 13d 的相關指引、把 PRISMA-S 列為 item 6、7 的相關指引——所以 LV.04 與 LV.09 的報告,最後都會匯流到這張 checklist。

3. Flow diagram:讓每一層都加得回來

迷你 SR 的 PRISMA 2020 flow diagram:PubMed 231 筆,去重 0,標題摘要篩選 231 筆排除 221 筆,送全文 10 篇、未取得 1 篇,評估資格 9 篇、排除 0 篇,最後納入 9 篇研究、9 份報告
Figure 11-1 迷你 SR 的 PRISMA 2020 flow diagram,所有數字由 screening_log.csv 程式計數(example/04_prisma/make_prisma.py)。單人篩選、只搜 PubMed,教學示範。

迷你 SR 的數字(04_prisma/prisma_counts.json):

  • Identification:PubMed 231 筆(2026-10-06),註冊平台 0;去重 0、自動化排除 0、其他原因移除 0。
  • Screening:標題摘要篩選 231 筆,排除 221 筆。排除理由依「設計 → 族群 → 介入/途徑 → 對照」的順序只記第一個不符的條件,避免重複計數:設計不符 86、術後或插管相關喉嚨痛 70、其他疾病 53、非類固醇 9、吸入/霧化/局部途徑 2、類固醇互比 1。
  • Retrieval:送全文 10 篇,1 篇未取得(Hansen 2017:無摘要、無 OA 全文)。
  • Eligibility:評估 9 篇,排除 0。
  • Included:9 篇研究、9 份報告。

程式裡寫死了一條一致性檢查:231 − 0 − 221 − 1 − 0 = 9。手畫流程圖時,最常見的錯誤就是某一層加總對不上;讓程式從篩選紀錄計數,而不是手填,是打倒幽靈最可靠的方法。若要用現成工具,PRISMA2020 R 套件與 Shiny 網頁可以產生符合 2020 版的流程圖(Haddaway 2022)。

誠實的細節:圖中 eligibility 那一格寫「full text: 1;PubMed abstract only: 8」。當初做資格判斷時只有 Hayward 2017 有全文,其餘依摘要判斷;後來透過機構訂閱讀完其餘 8 篇全文,逐篇重新核對後納入決定不變,所以 PRISMA 數字沒有改,篩選紀錄也保留原始狀態、沒有回頭改寫。這類「流程中途的變動」正是 item 23c(回顧流程的限制)與 item 24c(protocol 的修改)該寫的內容。

另外兩點值得學:

  • 「研究」與「報告」分開計數:一個試驗可能有多份報告(主報告、次分析、會議摘要),PRISMA 2020 的最後一格兩者都要寫(LV.05 去重關的內容)。
  • 全文排除要附理由:迷你 SR 全文階段排除 0 篇;若有排除,每一個理由都要有數字,總和要等於排除篇數(item 16b 還要求列出「看似符合卻被排除」的研究)。

4. 互動練習:自己畫一次

下面的產生器預設是空白的。請把上一節迷你 SR 的數字填進去(PubMed 231、去重 0、篩選 231、排除 221、送全文 10、未取得 1、評估 9、全文排除 0、納入 9 篇研究 / 9 份報告),看看工具的一致性檢查會不會報錯(填完可以按「載入迷你 SR 數字」對答案;另一個按鈕「載入虛構示範數字」是有全文排除理由的虛構例子);再故意把「排除 221」改成 220,看看幽靈從哪裡冒出來。

Identification(資料庫與註冊平台)
Screening
Reports excluded:排除理由
Included

✓ 各階段加總一致。

IdentificationScreeningIncludedIdentification of studies via databases and registersRecords identified from:Databases (n = –)Registers (n = –)Records removed before screening:Duplicate records removed (n = –)Records marked as ineligible byautomation tools (n = –)Records removed for other reasons(n = –)Records screened(n = –)Records excluded(n = –)Reports sought for retrieval(n = –)Reports not retrieved(n = –)Reports assessed for eligibility(n = –)Reports excluded:Reason 1 (n = –)Studies included in review (n = –)Reports of included studies(n = –)

框架依 PRISMA 2020 flow diagram(Page et al., BMJ 2021)新版 systematic review 模板;範例數字為虛構。紅框表示該格與上游加總不一致。

5. 報告寫得完整,不代表做得好

PRISMA 被廣泛採用,但報告品質的實況仍不理想。一篇整合 56 項研究、涵蓋 5,371 篇 SR 的方法學回顧發現:在用 PRISMA 評估的 SR 中,提供 protocol 資訊的不到 6%(102/1,741);用 QUOROM 評估者中只有 9% 有流程圖;用 AMSTAR 評估者中,30% 做了重複篩選與重複萃取(Pussegoda 2017)。期刊背書 PRISMA 與較完整的報告相關:一項觀察性研究中,背書後 PRISMA 遵循度由 83.1% 升到 90.1%、AMSTAR 遵循度由 74.6% 升到 85.0%(Panic 2013);這是觀察性證據,不能直接推論為因果。

更根本的問題是:PRISMA 檢查的是「有沒有寫」,不是「有沒有做好」。AMSTAR 2 的作者也指出,SR 的報告品質可能更反映作者把事情寫清楚的能力,而不是他們實際怎麼做回顧(Shea 2017)。要評估方法學品質,需要另一類工具。Kolaski 等人的整理把這些工具分成四類:報告、偏誤風險、方法學品質、整體證據確定性,並提醒不要只是表面套用工具(Kolaski 2023)。

6. AMSTAR 2:評 SR 本身的品質

AMSTAR(A MeaSurement Tool to Assess systematic Reviews)最早在 2007 年發表,原本 11 項(Shea 2007),信度與可用性的評估見 Shea 2009。AMSTAR 2 更新為 16 項,可評估納入 RCT、非隨機研究或兩者的 SR(Shea 2017)。重點設計:

  • 回答「Yes / Partial yes / No」;沒寫就當成 No,不給作者「無罪推定」。
  • 不加總成分數。作者明確建議不要把各項評分合成總分,而是看每個弱點的影響。
  • 原文建議 7 個關鍵領域,並以它們決定整體信心(評估者可依情境調整):
關鍵領域AMSTAR 2 item
Protocol 在回顧開始前註冊2
文獻搜尋是否充分4
排除個別研究的理由7
納入研究的偏誤風險評估9
Meta-analysis 方法是否適當11
解讀結果時是否考慮偏誤風險13
發表偏誤的存在與可能影響15

整體信心分四級(原文 Box 2):High(無或一個非關鍵弱點)、Moderate(超過一個非關鍵弱點)、Low(一個關鍵缺陷)、Critically low(超過一個關鍵缺陷)。原文的信度測試中,三組評估者對 54 篇 SR 評分,50 個 κ 值中有 46 個達 moderate 以上;完成一篇評估約 15–32 分鐘(不含閱讀時間)。另一個常用工具是評 SR 偏誤風險的 ROBIS(Whiting 2016)。

7. 迷你 SR 的 AMSTAR 2 自我檢查

把迷你 SR 當成一篇投稿來評,結果並不好看——這正是教學重點:

Item判斷理由
1 PICOYes01_pico_eligibility.md
2 ProtocolNo條件在搜尋前寫定,但 Partial yes 要求 protocol 至少寫到研究問題、搜尋策略、納入/排除條件與 RoB 評估方法;01_pico_eligibility.md 缺搜尋策略與 RoB 方法(Yes 還要再加合併計畫與異質性探討計畫,也都沒寫)。另外沒有註冊、沒有外部時間戳記 → 關鍵缺陷
3 研究設計的選擇理由Yes限 RCT,有說明
4 搜尋No只搜 PubMed,無註冊平台、灰色文獻、引用追蹤;已知漏掉 1 篇試驗 → 關鍵缺陷
5 雙人篩選No單人(非關鍵弱點)
6 雙人萃取No單人(非關鍵弱點)
7 排除研究清單Partial yes全文階段 0 篇排除、1 篇未取得有說明;標題摘要排除有理由計數
8 研究描述Yesextraction.csv
9 RoBYesRoB 2,逐 domain 附全文位置
10 納入研究的經費No萃取表沒有收集各試驗經費來源(非關鍵弱點)
11 MA 方法Yes本項只有 Yes/No,判準是方法本身:說明哪些結果能合併、為什麼(資料可得性、多臂合併規則);用適當的加權方法並處理異質性(REML + HKSJ);探討異質性來源(Hayward 的臨床差異)。要提醒的是:模型與 HKSJ 是在分析階段才定、沒有事先寫進 protocol——這個缺陷不在本項扣,而是讓 item 2 無法拿到 Yes
12 RoB 對 MA 的影響Yes排除 High RoB 的敏感度分析
13 解讀時考慮 RoBYesGRADE 理由中有寫
14 異質性YesHayward 的臨床差異
15 發表偏誤Partial yesk < 10 無法檢定,有敘述限制
16 利益衝突需補寫—

兩個關鍵缺陷(item 2、4)→ 整體信心 Critically low。同一篇回顧,PRISMA 報告可以寫得很完整(每一項都指得到檔案、限制全部列出),AMSTAR 2 卻是最低等級。兩者並不矛盾:PRISMA 讓你看得見缺陷,AMSTAR 2 告訴你缺陷有多嚴重。這也是為什麼迷你 SR 每一頁都標示「教學示範,不可作為臨床決策依據」。

常見錯誤 / 誤讀

  • 把 PRISMA 當品質評分:PRISMA 27 項全寫,不代表方法做得好。
  • 只附一個資料庫的搜尋式:PRISMA 2020 要求所有資料庫、註冊平台與網站。
  • flow diagram 手填、加總對不上:讓程式從篩選紀錄計數。
  • 只寫「兩位作者篩選」:要寫是否獨立、如何處理不一致、有無自動化工具。
  • 把 AMSTAR 2 加總成分數:原作者明確不建議;看關鍵領域。
  • 事後修改 protocol 卻不說明:item 24c 要求寫出修改與理由。

本關重點小抄

工具回答的問題單位
PRISMA 2020報告寫清楚了嗎?(27 項、7 區段 + flow diagram)報告
AMSTAR 2SR 做得好嗎?(16 項、7 關鍵領域、4 級信心)一篇 SR
ROBISSR 的偏誤風險?一篇 SR
GRADE某個結果的證據多確定?一個結果

Flow diagram 口訣:辨識 − 移除 = 篩選;篩選 − 排除 = 送全文;送全文 − 未取得 = 評估;評估 − 排除 = 納入。每一層都要加得回來。

延伸閱讀

BOSS 戰:流程圖加總對不上幽靈

HP0/5
  1. PRISMA 2020 是什麼性質的工具?

  2. 迷你 SR 的 flow diagram:PubMed 231 筆、去重 0、標題摘要排除 221、送全文 10、未取得 1、全文排除 0。納入幾篇?

  3. 下列哪一項不是 AMSTAR 2 原文列出的 7 個關鍵領域(critical domains)之一?

  4. 以 AMSTAR 2 嚴格自評迷你 SR(未註冊 protocol、只搜 PubMed),整體信心最可能是?

  5. PRISMA 2020 相較 2009 版的變動,下列何者正確?