跳到主要內容

LV.06

篩選:從標題到全文

title/abstract → full text、雙人獨立篩選、kappa、爭議處理

BOSS
看標題就判死刑急躁騎士
時間
約 40 分鐘
建議先過
LV.02 、LV.05

本關目標

本關 Boss「看標題就判死刑急躁騎士」的口頭禪是:「標題寫 children?我們做成人,砍。」「標題說 1 天 vs 3 天?類固醇互比,砍。」它砍得很快,但也砍掉了合格的研究。打完本關,你應該能:

  1. 說出篩選的兩個階段(title/abstract → full text)各自的目標與判斷原則。
  2. 引用實證說明為什麼要雙人獨立篩選,以及單人篩選大約會漏掉多少。
  3. 計算 Cohen’s kappa,並說明 Landis & Koch 分級的爭議與 kappa 的悖論。
  4. 設計爭議處理流程,並把排除理由整理成 PRISMA flow diagram 的數字。
  5. 親手篩 20 筆迷你 SR 的真實紀錄,看自己與參考答案的 kappa。

一、兩個階段,兩種心態

Title/abstract 篩選Full-text 篩選
看什麼標題、摘要、出版類型全文(方法、結果、附錄)
心態寬鬆:資訊不足就送全文嚴格:逐條核對 eligibility criteria
決定include/exclude/maybeinclude/exclude(並記錄理由)
要記錄的排除筆數(可分理由)每一篇的排除理由(PRISMA 必填)

標題摘要階段追求的是 sensitivity:寧可多送幾篇全文,也不要把合格研究砍掉。因為一旦在這一步被排除,之後沒有任何步驟會再看它一眼。全文階段才追求精準,並且每一篇排除都要寫出具體理由(例如「對照組也給類固醇」),而不是「不符合」三個字(Cochrane Handbook 第 4 章,Lefebvre 2019)。

開始前先校準(calibration)

正式篩選前,兩位審查者先用同一小批紀錄(例如 20–50 筆)各自篩選,比對不一致的地方,討論後把 eligibility criteria 寫得更清楚。很多不一致不是誰看錯,而是條件本身有模糊地帶,例如「住院病人算不算?」「扁桃腺周圍膿瘍算不算咽喉炎?」。這些討論的結果要寫回 protocol 或篩選指引,並註明修改日期(第 3 關)。


二、為什麼要兩個人?實證怎麼說

研究設計主要結果
Edwards 200222,571 筆紀錄,四位審查者兩兩配對單人平均漏掉 8% 的合格報告(範圍 0–24%);兩人一組平均沒有漏掉(0–1%);雙人篩選平均多找到 9% 的 RCT
Gartlehner 2020隨機試驗,280 位參與者、2,000 篇摘要單人 sensitivity 86.6%(95% CI 80.6–91.2),漏掉 13%;雙人 97.5%(95% CI 95.1–98.8),漏掉 3%;specificity 79.2% vs 68.7%
Stoll 2019單一大型 SR第二位審查者在 title/abstract 階段多找到 6.6–9.1% 的合格研究,full text 階段多找到 6.6–11.9%
Wang 2020139,467 筆引文、86 位審查者摘要篩選階段總錯誤率(誤納入 + 誤排除)10.76%(95% CI 7.43–14.09%)
Waffenschmidt 2019方法學 SR單人篩選會漏掉較多研究,不等同雙人篩選;由有經驗者執行時,可考慮作為 rapid review 的捷徑

幾個重點:

  1. 人會錯,而且錯得不少。 Wang 2020 的 10.76% 是「每個決定」的平均錯誤率;篩上千筆時,錯誤是必然的。
  2. 雙人篩選是用 specificity 換 sensitivity。 Gartlehner 2020 中雙人的 specificity 比較低,意思是有更多不相關的文章被送到全文階段。多看幾篇全文的成本,遠小於漏掉一篇合格試驗。
  3. 單人篩選不是不能做,而是要誠實標示。 Gartlehner 2020 與 Waffenschmidt 2019 都認為,它可以是 rapid review 刻意降低標準時的選項,但不符合一般 SR 的期待。
  4. 省力的折衷方案:Shemilt 2016 以成本效果模型比較不同策略,「單人篩選加 text mining」可使 title/abstract 的工作量減少超過 60%(模型推估)。機器輔助的細節在第 12 關。

「獨立」是關鍵字

兩個人一起看螢幕討論著篩,不算雙人獨立篩選。獨立的意思是:各自篩選、看不到對方的決定,篩完才比對。篩選平台的盲化模式(第 5 關)就是為了這件事。


三、Cohen’s kappa:一致到底有多一致?

兩個人篩完,第一個問題是:「我們有多一致?」最直覺的是一致比例(percent agreement,p_o)。但 Cohen 1960 指出,兩個人就算亂猜也會有一部分剛好一致,所以提出 kappa,扣掉機遇造成的一致:

κ = (p_o − p_e) / (1 − p_e)

p_o = 兩人判斷相同的比例(對角線加總 ÷ 總數)
p_e = 機遇一致比例 = Σ(A 判某類的比例 × B 判同一類的比例)

κ = 1 代表完全一致;κ = 0 代表一致程度與機遇相同;κ 小於 0 代表比機遇還不一致。

算一次:一位同學 vs 參考答案

假設一位同學做完下方的 20 題練習,與參考答案的對照如下(這是教學用的假設作答,題目是真的):他把 Niland 2006 判成 exclude(中了陷阱)、把霧化類固醇的 Al Atbi 2025 判成 include(也中了陷阱)、把沒有摘要的 Hansen 2017 判成 exclude,其餘全對。

同學 \ 參考答案includeexcludemaybe合計
include8109
exclude19111
maybe0000
合計910120
p_o = (8 + 9 + 0) / 20 = 0.85
p_e = (9/20 × 9/20) + (11/20 × 10/20) + (0/20 × 1/20) = 0.2025 + 0.275 + 0 = 0.478
κ   = (0.85 − 0.478) / (1 − 0.478) ≈ 0.71

17 題答對,κ 約 0.71。但只有 20 筆,κ 的 95% CI 會很寬——下方練習的結果頁會一併顯示 CI,你會看到它往往跨好幾個分級。

Landis & Koch 分級與它的爭議

文獻中最常引用的判讀表出自 Landis & Koch 1977(以下為常見的引用版本):

κ標籤
小於 0poor
0.00–0.20slight
0.21–0.40fair
0.41–0.60moderate
0.61–0.80substantial
0.81–1.00almost perfect

這張表好用,但爭議不少:

  1. 切點是慣例,不是實證門檻。 為什麼 0.61 算 substantial、0.60 就只有 moderate?沒有資料支持這條線。
  2. 對健康研究可能太寬鬆。 McHugh 2012 指出,常用的判讀標準讓 0.41 看起來就「可以接受」;她提出更嚴格的解讀,認為 κ 低於 0.60 就表示一致性不足,對研究結果的信心應該打折。
  3. kappa 本身會被資料分布扭曲(下一節),同一個標籤在不同情境下意義不同。
  4. 小樣本時 CI 很寬。 20 筆算出的 0.71,可能落在 moderate 到 almost perfect 之間的任何地方。

所以實務建議是:同時報告一致比例、kappa(含 CI)、各審查者的納入數,不要只丟一個「substantial」的標籤(Sim & Wright 2005;McHugh 2012)。

Kappa 的悖論:一致比例更高,kappa 反而更低

Feinstein & Cicchetti 1990 描述了「高一致、低 kappa」的兩個悖論;Byrt 1993 則指出 kappa 同時受**審查者之間的偏差(bias)與類別的盛行率(prevalence)**影響,建議一併報告這兩個指標。看兩個假設情境(教學用數字):

情境兩人都納入只有一人納入兩人都排除p_op_eκ
A:納入很少55 + 51850.950.9050.47
B:納入較多4515 + 151250.850.580.64

情境 A 的一致比例比 B 高,kappa 卻比 B 低。原因是 A 裡面「排除」占壓倒性多數,兩個人就算不太用心,也很容易在「排除」上剛好一致,p_e 被推到 0.905,留給 kappa 的空間就很小。

SR 的篩選剛好就是情境 A:迷你 SR 231 筆裡最後只納入 9 篇。這是 kappa 的數學性質,不代表審查者很差(這段是由 Feinstein、Byrt 的論點推論到 SR 篩選情境)。這也是為什麼下方的 kappa 計算器會一併顯示 κ_max——在觀察到的邊際分布下,kappa 最多能到多少。

文獻中 kappa 通常多少?

Hanegraaf 2024 彙整 45 篇報告審查者間一致性的文章:abstract 篩選的平均 Cohen’s kappa 為 0.82(SD 0.11,n = 12)、full-text 篩選 0.77(SD 0.18,n = 14)、資料萃取 0.88;kappa 與團隊人數、篩選量、SR 品質之間沒有觀察到相關。該研究也發現多數 SR 根本沒有報告審查者間一致性。


四、爭議處理:不一致怎麼辦?

  1. 先討論:兩人回到原文與 eligibility criteria,說明各自的理由。多數不一致在這一步解決。
  2. 第三人裁決:仍無共識時,由事先指定的第三位審查者(通常是資深成員或臨床專家)決定。
  3. 記錄:記下不一致的筆數、怎麼解決的。若反覆出現同一類爭議,代表條件需要釐清,回頭更新篩選指引。
  4. 全文階段的排除理由要有階層。 一篇文章可能同時「設計不符」又「族群不符」。若每個理由都記,加總會超過排除篇數。常見做法是依固定順序只記第一個不符的條件,例如迷你 SR 用的「設計 → 族群 → 介入/途徑 → 對照」。

標題摘要階段的「maybe」不是逃避,而是一個正式的決定:資訊不足,需要全文。不要讓急躁騎士逼你在資訊不足時硬選 include 或 exclude。


五、迷你 SR 的篩選流程

本站的迷你 SR 在 2026-10-06 從 PubMed 找到 231 筆,篩選結果如下(數字來自 04_prisma/prisma_counts.json,由 screening_log.csv 程式計數):

步驟筆數
PubMed 找到231
去重刪除0(只搜一個資料庫,見第 5 關)
標題摘要篩選231
標題摘要排除221
送全文10
取不到全文1(Hansen 2017)
全文評估9
全文排除0
納入研究9 篇 RCT(9 份報告)

標題摘要階段 221 筆的排除理由:

排除理由筆數
研究設計不符(review、SR、指引、評論、protocol、經濟評估、觀察性研究)86
族群不符:術後/插管相關喉嚨痛70
族群不符:其他疾病53
介入不是類固醇9
途徑不符:吸入/霧化/局部2
對照不符:類固醇 vs 類固醇1

一致性檢查:231 − 0 − 221 − 1 − 0 = 9。

迷你 SR 的 PRISMA 2020 流程圖:PubMed 231 筆,去重 0,標題摘要排除 221,送全文 10,取不到 1,全文評估 9,納入 9 篇 RCT
Figure 6-1 迷你 SR 的 PRISMA 2020 flow diagram(由 screening_log.csv 程式計數產生)。教學示範,單人篩選、只搜 PubMed。

幾個值得注意的地方:

  • 70 筆術後喉嚨痛:搜尋式裡的 sore throat 和 dexamethasone 會大量抓到麻醉插管後喉嚨痛的 RCT。這類研究族群、設計都像,但病因是機械性傷害,不是感染性咽喉炎。這是篩選者最常需要「看懂摘要」的地方。
  • 全文階段的照實記錄:當初 9 篇裡只有 Hayward 2017 有開放全文,其餘 8 篇先依摘要判斷資格(prisma_counts.json 中 assessed_using_abstract_only = 8)。之後透過機構訂閱讀完全文,逐篇重新核對,8 篇仍全部符合納入條件,納入決定與 PRISMA 數字不變;篩選紀錄保留原始判斷,沒有回頭改寫。
  • 最大的限制:單人篩選。 本範例由一人完成,沒有第二人獨立篩選,也沒有 kappa。依 Gartlehner 2020 的數字,單人 abstract 篩選平均會漏掉約 13% 的相關研究;我們有 BMJ 2017 與 Cochrane 2020 兩篇既有 SR 可以對照,部分彌補這個缺口,但正式 SR 不能這樣做。

六、任務:你來當第二位審查者

迷你 SR 缺一位第二審查者,現在由你補上。下方的 20 筆是從 231 筆中挑出的真實紀錄(include 9、exclude 10、maybe 1),摘要是自行改寫的中文重點。

任務步驟:

  1. 先讀上方的納入/排除條件(練習元件頂端也有)。
  2. 一筆一筆判 include/exclude/maybe。先不要看解析,全部做完再看。
  3. 做完後看結果頁:一致比例、Cohen’s kappa 與 95% CI、Landis & Koch 分級,以及你「判 exclude 但參考答案是 include」的題目——這是 SR 裡代價最高的錯誤。
  4. 把你的結果(3×3 表)輸入下方的 kappa 計算器,對照 κ_max,想想你的 kappa 是被「判斷差異」拉低,還是被「類別分布」拉低。
  5. 回頭看你錯的題目,問自己:是條件沒讀清楚、摘要沒讀完,還是條件本身有模糊地帶?

這 20 筆裡藏了 4 個陷阱:一篇標題看起來是類固醇互比、一篇只有標題沒有摘要、一篇族群與設計都完美但給藥途徑不對、一篇看起來是兒童咽喉炎但族群其實是另一種疾病。看你能不能全部避開。

1 / 20
納入/排除條件(eligibility criteria)
研究問題
急性喉嚨痛(咽喉炎)病人,給一劑或短期全身性類固醇,相較於 placebo 或常規照護,能否較快緩解疼痛?
P(族群)
因急性喉嚨痛/咽喉炎/扁桃腺炎就醫的門診或急診病人,年齡 >3 歲
I(介入)
全身性 corticosteroid(oral、IM、IV),任何劑量與療程,可合併抗生素或止痛藥
C(對照)
placebo 或常規照護(兩組其他處置相同)
O(結果)
主要:24 小時與 48 小時疼痛完全緩解;次要:疼痛開始緩解時間、完全緩解時間、24 小時疼痛分數、復發、缺課缺工、不良事件
S(研究設計)
隨機對照試驗(RCT),平行或多臂設計
納入條件
符合上述 P、I、C、S;O 至少報告一項疼痛相關結果
排除條件
  • 非 RCT(review、SR、指引、評論、protocol、經濟評估、觀察性研究)
  • 術後、插管或麻醉相關喉嚨痛;扁桃腺切除術後疼痛
  • 傳染性單核球增多症、扁桃腺周圍膿瘍、PFAPA、慢性或反覆性咽喉炎、住院病人
  • 吸入、霧化、局部或鼻用類固醇
  • 類固醇 vs 類固醇(沒有 placebo 或常規照護組)
判斷標準
  • 納入 include:符合所有條件
  • 排除 exclude:至少一項條件不符
  • 待議 maybe:標題摘要資訊不足,需看全文才能決定

PMID 284184822017RCT,雙盲

Effect of Oral Dexamethasone Without Immediate Antibiotics vs Placebo on Acute Sore Throat in Adults: A Randomized Clinical Trial.

英國基層成人喉嚨痛試驗,約五百多人隨機分到單劑口服類固醇(dexamethasone)或安慰劑;24 小時完全緩解比例未達統計顯著,48 小時則較高。

P
英國 42 家基層診所的成人急性喉嚨痛,不需立即抗生素
I
口服 dexamethasone 10 mg 一次
C
外觀相同的 placebo
O
24 與 48 小時完全緩解比例

Kappa 計算器

把練習結果或你自己專題的兩人篩選結果填進來。可切換 2×2(include/exclude)或 3×3(加上 maybe)。

列 = Rater A(例:你),欄 = Rater B(例:另一位篩選者)
A \ BIncludeExcludeMaybe合計
23
67
10
合計236512100

對角線(底色格)是兩人判斷一致的件數。

po 觀察一致
0.830
pe 機率一致
0.500
Cohen's κ
0.660
SE
0.070
95% CI
0.52 to 0.80

Landis & Koch 分級:高度(substantial)

  1. < 0.00 差(poor)
  2. 0.00–0.20 輕微(slight)
  3. 0.21–0.40 尚可(fair)
  4. 0.41–0.60 中等(moderate)
  5. 0.61–0.80 高度(substantial)
  6. 0.81–1.00 幾乎完全一致(almost perfect)

要提醒的是:這套切點有爭議。Landis & Koch(1977)原文就說明這些分界是任意訂的,只是方便溝通的參考值; McHugh(2012)等作者主張在臨床與健康研究中應採更嚴格的標準。κ 也受盛行率(prevalence)與兩人邊際分布差異影響, 宜同時報告 po、κ 與 95% CI,而不是只報分級標籤。 在目前的邊際分布下,κ 最大只能到 0.96。

SE 採 Fleiss, Cohen & Everitt(1969)大樣本公式,95% CI = κ ± 1.96 × SE(Wald 法,樣本小時僅供參考)。

怎麼解讀你的結果? 20 筆的 kappa 只是練習,重點不是分數,而是你錯在哪裡。如果你在 Niland 2006 錯了,代表你用標題判生死;如果你在霧化類固醇那題錯了,代表你沒有逐條核對 I(介入)。這正是急躁騎士的兩種招式。


常見錯誤

錯誤正確做法
標題摘要階段太嚴格,看到一點不符就排除資訊不足就送全文,用 maybe
兩人一起討論著篩各自獨立篩選,篩完才比對
因為結果「未達統計顯著」而排除篩選看設計與 PICO,不看結果好壞(練習題 S03)
全文排除只寫「不符合」每篇寫具體理由,依固定階層記第一個不符的條件
只報 kappa 與一個分級標籤一併報一致比例、CI、各自的納入數
看到 kappa 偏低就認定審查者很差先看類別分布,納入比例很低時 kappa 會被壓低
單人篩選卻不在限制中說明誠實標示,並說明可能的漏抓

本關重點小抄

  • 兩階段兩種心態:title/abstract 寬鬆(寧可多送),full text 嚴格(每篇記理由)。
  • 雙人獨立篩選:單人漏掉約 8%(Edwards 2002)到 13%(Gartlehner 2020);雙人約 0–3%。
  • 人會錯:摘要篩選每個決定的錯誤率約 10.76%(Wang 2020)。
  • κ = (p_o − p_e) / (1 − p_e);Landis & Koch 分級是慣例,McHugh 2012 認為對健康研究過寬(0.60 以下視為不足)。
  • Kappa 悖論:納入比例很低時,一致比例高、kappa 卻可能偏低(Feinstein & Cicchetti 1990;Byrt 1993)。
  • 迷你 SR:231 → 排除 221 → 送全文 10 → 取不到 1 → 納入 9;單人篩選是最大限制。

延伸閱讀

  • Lefebvre C, Glanville J, Briscoe S, et al. Chapter 4: Searching for and selecting studies. In: Cochrane Handbook for Systematic Reviews of Interventions v6. 2019. DOI: 10.1002/9781119536604.ch4
  • Edwards P, Clarke M, DiGuiseppi C, et al. Identification of randomized controlled trials in systematic reviews: accuracy and reliability of screening records. Stat Med. 2002;21(11):1635-1640. DOI: 10.1002/sim.1190
  • Gartlehner G, Affengruber L, Titscher V, et al. Single-reviewer abstract screening missed 13 percent of relevant studies: a crowd-based, randomized controlled trial. J Clin Epidemiol. 2020;121:20-28. DOI: 10.1016/j.jclinepi.2020.01.005
  • Stoll CRT, Izadi S, Fowler S, et al. The value of a second reviewer for study selection in systematic reviews. Res Synth Methods. 2019. DOI: 10.1002/jrsm.1369
  • Waffenschmidt S, Knelangen M, Sieben W, et al. Single screening versus conventional double screening for study selection in systematic reviews: a methodological systematic review. BMC Med Res Methodol. 2019. DOI: 10.1186/s12874-019-0782-0
  • Wang Z, Nayfeh T, Tetzlaff J, et al. Error rates of human reviewers during abstract screening in systematic reviews. PLoS One. 2020. DOI: 10.1371/journal.pone.0227742
  • Shemilt I, Khan N, Park S, et al. Use of cost-effectiveness analysis to compare the efficiency of study identification methods in systematic reviews. Syst Rev. 2016. DOI: 10.1186/s13643-016-0315-4
  • Cohen J. A coefficient of agreement for nominal scales. Educ Psychol Meas. 1960;20(1):37-46. DOI: 10.1177/001316446002000104
  • Landis JR, Koch GG. The measurement of observer agreement for categorical data. Biometrics. 1977;33(1):159-174. PubMed 843571
  • McHugh ML. Interrater reliability: the kappa statistic. Biochem Med (Zagreb). 2012;22(3):276-282. PubMed 23092060
  • Feinstein AR, Cicchetti DV. High agreement but low kappa: I. The problems of two paradoxes. J Clin Epidemiol. 1990. DOI: 10.1016/0895-4356(90)90158-l
  • Byrt T, Bishop J, Carlin JB. Bias, prevalence and kappa. J Clin Epidemiol. 1993. DOI: 10.1016/0895-4356(93)90018-v
  • Sim J, Wright CC. The kappa statistic in reliability studies: use, interpretation, and sample size requirements. Phys Ther. 2005. PubMed 15733050
  • Hanegraaf P, Wondimu A, Mosselman JJ, et al. Inter-reviewer reliability of human literature reviewing and implications for the introduction of machine-assisted systematic reviews. BMJ Open. 2024. DOI: 10.1136/bmjopen-2023-076912

下一關:第 7 關 資料萃取——9 篇都進門了,接下來要把數字一個一個搬出來。

BOSS 戰:看標題就判死刑急躁騎士

HP0/5
  1. Gartlehner 2020 的隨機試驗中,單人與雙人 abstract 篩選的 sensitivity 分別約為多少?

  2. 兩位審查者篩 200 筆,觀察一致比例 0.95,但 kappa 只有 0.47。最可能的原因是什麼?

  3. 下列關於 Landis & Koch 分級(例如 0.61–0.80 substantial)的敘述,何者最恰當?

  4. 標題摘要階段遇到一篇「PubMed 標為 RCT、但沒有摘要」的文章(如練習題 S10),最恰當的處理是?

  5. 迷你 SR 的 PRISMA 數字中,標題摘要階段排除 221 筆。最大的排除理由是?