跳到主要內容

LV.07

資料萃取

萃取表設計、pilot、雙人萃取、聯絡作者

BOSS
「這是 SD 還是 SE?」混沌史萊姆
時間
約 40 分鐘
建議先過
LV.06

本關目標

9 篇 RCT 進門了,現在要把它們的數字搬進你的資料表。本關 Boss「『這是 SD 還是 SE?』混沌史萊姆」最擅長的是讓數字變形:百分比沒有分母、三臂試驗少一臂、表頭寫 n = 46 但內文說有人失聯、表格寫 Mean 數值卻是中位數。打完本關,你應該能:

  1. 設計一份萃取表(data extraction form),知道該萃取哪些欄位、為什麼要記來源位置。
  2. 說明 pilot 與雙人萃取的做法,並引用萃取錯誤率的實證。
  3. 知道何時、如何聯絡作者。
  4. 用迷你 SR 的 extraction.csv,處理三種「萃取灰色地帶」:百分比換算人數、多臂試驗合併、分析人數的假設。

萃取完的數字怎麼變成效果量(CI → SE、median/IQR → mean/SD、cluster 與 crossover)是 MA 站的主題,深入請看 → MA 站第 3 關 從萃取到效果量。本關專注在「把正確的數字、連同它的出處,搬進表格」。


一、萃取什麼?

Cochrane Handbook 第 5 章(Li 2019)把要收集的資料分成幾大類。對照迷你 SR 的 extraction.csv,domain 欄就是這樣分的:

類別例子迷你 SR 的 domain
研究來源與設計期刊、場域、隨機方法、盲法、註冊design
受試者年齡範圍、診斷條件、Centor 分數population
介入與對照藥名、劑量、途徑、療程、合併用藥intervention
樣本數隨機人數、各時間點分析人數、失聯人數sample
結果outcome 定義、時間點、事件數、mean、SDoutcome
安全性不良事件、回診、復發safety
RoB 相關資訊分配隱匿、失聯原因、事先指定的結果另存於 rob2.csv(第 8 關)

一個數字一列:長格式

迷你 SR 的萃取表是長格式(long format),每一個數字一列,共 265 列:

study_id, pmid, domain, variable, arm, value, unit, source, location, value_status, note
Kiderman2005, 15808038, outcome, complete_resolution_24h_events, steroid, 17, participants,
  fulltext PMC1463093 HTML, Table 2 (pain free at 24 h), derived_from_reported, 42.5% x 40 = 17

這種設計的好處是每個數字都帶著三樣東西:

  1. source 與 location:從哪個版本(全文、摘要)、哪個表、第幾段取得。第二位萃取者或審稿人可以直接翻到那個位置核對。
  2. value_status:這個數字是原文報告(reported,219 個)、由報告值簡單計算(derived_from_reported,14 個),還是原文沒寫(not_reported_in_available_source,32 格)。
  3. note:計算式或特殊情況,例如「42.5% x 40 = 17」。

「原文沒寫」也是一筆資料。迷你 SR 的原則是不補值:全文沒寫的 SD、人數一律留空,不從圖或 p 值反推(範例 README 限制第 4 點)。例如 Olympia 2005 的 Table 2 分母暗示了 24 小時緩解人數,但原文沒有明寫,就不萃取。


二、萃取表的設計與工具

萃取表要在 protocol 階段就規劃好,至少包含:

  • Outcome 的定義與優先順序:例如「疼痛完全緩解」的定義、要哪些時間點;同一概念有多個量表時用哪個。
  • 時間點的選擇規則:例如「最接近 24 小時的追蹤」。
  • 效果量需要的原始數字:二元結果要事件數與分母;連續結果要 mean、SD、n。
  • 多臂、cluster、crossover 等特殊設計的處理方式。

為什麼要事先規定?Mayo-Wilson 2017 以 gabapentin 疼痛與 quetiapine 憂鬱的 RCT 示範:單一試驗就有 68 與 98 種可用於 meta-analysis 的結果;刻意挑選可以把 pain intensity 的合併 SMD 從 −0.45(95% CI −0.63 至 −0.27)變成 −0.06(95% CI −0.24 至 0.12,未達統計顯著)。這是示範性分析,不代表常態,但說明了萃取時的選擇空間有多大。沒有事先規則,萃取者就可能(即使無意間)挑到結論想要的那個數字。

用什麼工具?

Elamin 2009 比較紙本、試算表、網路問卷、資料庫與專用網站,各有利弊;專用軟體在多數面向表現最好,但建置成本較高。Li 2015 以 SRDR(Systematic Review Data Repository)示範資料收集表的建構、萃取、管理與封存;Saldanha 2019 統計 SRDR 上 735 個專案中有 152 個(21%)公開資料。

學生專題用試算表就夠了,但要做到三件事:欄位固定(下拉選單)、每個數字附出處、保留修改紀錄。


三、Pilot:先試萃 2–3 篇

萃取表寫好後,先讓所有萃取者各自試萃 2–3 篇不同類型的研究,比對結果。常見發現:

  • 欄位定義不清(「n」是隨機人數還是分析人數?)
  • 漏了欄位(某篇有兩種給藥途徑,表格沒有地方填)
  • 單位不一致(小時 vs 天、VAS 0–10 vs 0–100)

迷你 SR 就在 Wei 2002 遇到這種情況:它有 IM 與口服兩個類固醇臂,arm 欄位因此要多出 steroid_IM、steroid_oral,而不是只有 steroid 與 control。這類設計在 pilot 時發現,修改成本最低。


四、雙人萃取:錯誤率的實證

研究發現
Buscemi 2006單人萃取比雙人萃取產生較多錯誤(相對差異 21.7%,P = .019);多數 outcome 的效果估計沒有觀察到明顯差異;單人萃取平均省 36.1% 時間
Mathes 2017方法學回顧(6 項研究):萃取錯誤率最高可達 50%,錯誤常影響效果估計;不同萃取方式與訓練的比較證據薄弱
Jones 2005重做某 Cochrane 小組所有 SR 的萃取:34 篇中 20 篇有錯誤(含轉換計算錯誤 2 篇、誤解資料 7 篇);資料處理錯誤都改變了摘要結果,但沒有改變 review 結論
Gøtzsche 200727 篇使用 SMD 的 meta-analysis,63%(17 篇)在抽查的兩個試驗中至少有一個錯誤;7 篇確認有錯,其中 1 篇其後撤稿
Tendal 200910 位觀察者重複 SMD 萃取:試驗層級一致率 53%,meta-analysis 層級 31%;原因包括選擇不同時間點、量表、對照組與計算方式
Xu 2022288 個不良事件 meta-analysis:萃取錯誤使 3.5%(10/288)改變效果方向、6.6%(19/288)改變 P 值的統計顯著性

結論很清楚:萃取錯誤很常見,而且有時會改變結果。Cochrane Handbook 第 5 章(Li 2019)也把雙人獨立萃取列為降低錯誤的做法;人力有限時,常見的折衷是一人萃取、另一人逐項核對原文。Tendal 2009 也提醒,很多「錯誤」其實是「選擇不同」——兩個人選了不同時間點或量表,這要靠事先規定的萃取規則解決,而不是靠多一個人。

混沌史萊姆的招式:SD 還是 SE?

本關 Boss 的名字不是開玩笑。表格寫「mean ± 2.4」,這個 2.4 是 SD 還是 SE?要看表格註腳或方法段。若某篇的 SD 比其他研究小很多,很可能是 SE。迷你 SR 也遇到類似的陷阱:Bulloch 2003 的 Table 2 標「Mean」,但數值與摘要寫的是中位數(記錄在 rob2.csv 的 D5 理由中)。萃取時多看一眼表頭、註腳、摘要是否一致,是最便宜的品管。


五、聯絡作者

全文沒寫的資料,最可靠的來源是作者本人。Young & Hopewell 2011(Cochrane 方法學回顧)整理取得未發表資料的方法:

  • 電子郵件聯絡的回覆率最高,所需嘗試次數最少。
  • 用同一種方式重複寄送,不會提高回覆率。
  • 詢問方法學問題(例如隨機方法)比索取遺漏的數據得到更多回應。

這些結論來自少量研究,但實務上很有用。寫信時:具體列出需要的數字(「Table 2 中各組的分析人數」)、附上你的萃取表、給一個合理的期限、記錄寄送與回覆日期。在方法段報告聯絡了幾位作者、幾位回覆、拿到什麼。

迷你 SR 是教學示範,沒有聯絡作者。所以下一節的三個灰色地帶,都是在「不聯絡作者」的條件下處理的;正式 SR 的第一步應該是寫信。


六、迷你 SR 的三個灰色地帶

9 篇全部依全文萃取後,有幾個數字無法直接從原文抄下來。以下三種處理,都記錄在 extraction.csv 的 value_status 與 note,以及 analysis.R 的註解中。

灰色地帶 1:百分比換算人數(Kiderman 2005)

Kiderman 2005 的 Table 2 只報告「不痛的比例」,沒有人數。全文寫明兩組追蹤完整(類固醇 40 人、安慰劑 39 人),所以可以還原:

時間點類固醇組安慰劑組
24 小時42.5% × 40 = 1710.3% × 39 = 4
48 小時57.5% × 40 = 2333.3% × 39 = 13

驗算:4/39 = 10.26%,四捨五入後就是原文的 10.3%;13/39 = 33.3%。數字對得上,代表換算可信。這四個值標為 derived_from_reported,note 寫出算式。

這種換算的前提是分母明確。如果原文只說「42.5% 的病人」卻沒說是 40 人中的 42.5%,還是追蹤到的某個子集,就不能直接乘。

灰色地帶 2:多臂試驗合併(Wei 2002)

Wei 2002 有三臂:IM dexamethasone、口服 dexamethasone、placebo。我們的問題是「類固醇 vs placebo」,不在乎途徑。24 小時完全緩解(Table III):

臂事件 / 分析人數
IM dexamethasone13 / 39
口服 dexamethasone12 / 41
placebo4 / 36

如果把「IM vs placebo」與「口服 vs placebo」當兩個研究,placebo 的 36 人就會被計算兩次——這是 unit-of-analysis error。迷你 SR 依 Cochrane Handbook 第 23 章的建議,把兩個類固醇臂合併成一組:25/80 vs 4/36,單篇 RR 2.81(95% CI 1.06–7.49)。二元資料的合併很簡單,直接加總事件數與人數;連續資料要用合併 mean 與 SD 的公式(MA 站第 3 關)。

注意兩件事:

  1. 分母用的是該時間點的分析人數(n_analysed_24h:39、41、36),不是隨機人數(共 120 人)。萃取表要分開記錄不同時間點的分析人數。
  2. 合併規則寫在 analysis.R 開頭,依據是 Cochrane Handbook 23.3.4,而不是看哪種合併方式結果比較好。但要提醒的是:analysis.R 是萃取完才寫的,無法證明規則是事先定的;正式 SR 應該把多臂試驗的處理方式寫進 protocol。若問題改成「IM 與口服哪個好」,就不能合併。

灰色地帶 3:以隨機分派人數作為分析人數(Marvez-Valls 1998 與 Tasar 2008)

連續結果(完全緩解時間)的 SE 需要每組的 n。這兩篇看起來都「用隨機人數」,但性質完全不同:

Marvez-Valls 1998——這是一個假設。 全文報告隨機分派 46/46 人,摘要寫「8 人失聯被排除」,但沒有說各在哪一組;Table 2 的標題仍寫 n = 46。各組真正的分析人數無法得知,所以萃取表把 n_analysed 記為 not_reported_in_available_source,analysis.R 改用隨機人數 46/46,並在輸出中明確標記為假設:

MarvezValls1998: n_randomised - ASSUMPTION: randomised n (per-arm analysed n not reported)

用 46 而不是實際較小的人數,會讓這篇的 SE 稍微偏小、權重稍微偏大。它的單篇 MD 為 −13.8 h(95% CI −31.62 至 4.02,未達統計顯著)。這個假設的影響怎麼檢查?看 leave-one-out:拿掉 Marvez-Valls 後,合併 MD 為 −21.32 h(HKSJ −34.79 至 −7.85),與主分析 −20.47 h(HKSJ −29.27 至 −11.68)方向與量級相近,代表結論不依賴這個假設(results.json)。同一件事在第 8 關會以 RoB 的 D3(missing outcome data)再出現一次:失聯 8.7%、分組未報,判為 Some concerns。

Tasar 2008——有原文依據,不是假設。 Tasar 分派 31/42 人,全文寫明「追蹤期間沒有病人被排除」,所以分析人數 = 隨機人數是原文報告的(value_status = reported)。兩篇數字的長相一樣,差別在於有沒有原文支撐。萃取時要問的不是「用了什麼數字」,而是「這個數字從哪裡來」。

Tasar 也有自己的小灰色地帶:48 小時完全緩解人數由 Table 3 的「24 小時內」與「25–48 小時」兩列相加(類固醇 13 + 16 = 29;安慰劑 2 + 20 = 22),標為 derived_from_reported。另外兩組人數 31 vs 42 不均且原文未解釋,這不是萃取問題,而是第 8 關 D1(隨機過程)的疑慮。

三種處理的共同原則

原則在迷你 SR 怎麼做
能從報告值簡單算出的,就算,並寫出算式Kiderman 的百分比、Tasar 的兩列相加、Wei 的臂合併
算不出來的,就留空或明確標示假設Marvez-Valls 的分析人數
不從圖讀數、不從 p 值反推(本範例的選擇)5 篇沒報 24/48 小時完全緩解人數,Wei 2002 另外沒有 48 小時追蹤,因此 24 小時 k = 4、48 小時 k = 3
假設要有敏感度分析leave-one-out、排除高 RoB 研究

範例 README 的限制第 3 點也承認:這些處理都未經第二人核對。O’Brien 1993 只有 PDF,靠瀏覽器逐頁閱讀,也有誤讀風險。這些就是單人萃取的代價。


常見錯誤

錯誤正確做法
萃取表只記數字,不記出處每個數字附來源版本與位置(表號、段落)
原文沒寫的欄位自己猜一個留空並標示「未報告」;需要時聯絡作者
換算或假設不留紀錄標 derived_from_reported 或假設,note 寫算式
多臂試驗的共用對照組重複計算合併相關的臂,或拆分對照組
分母一律用隨機人數優先用該時間點的分析人數,並記錄用了哪一種
把 SE 當 SD、把中位數當平均數核對表頭、註腳、摘要是否一致
時間點、量表事後才挑Protocol 事先規定選擇規則
單人萃取不說明雙人萃取或一人萃取一人核對;做不到就在限制中寫明

本關重點小抄

  • 萃取表:設計、樣本、介入、結果、安全性、RoB 資訊;每個數字附 source、location、value_status。
  • 事先規定:outcome 定義、時間點、量表優先順序、特殊設計的處理(Mayo-Wilson 2017:挑選可把 SMD −0.45 變成 −0.06)。
  • Pilot:先試萃 2–3 篇,修正欄位。
  • 錯誤很常見:Buscemi 2006(單人錯誤多 21.7%)、Jones 2005(34 篇中 20 篇有錯)、Xu 2022(6.6% 改變顯著性)。
  • 聯絡作者:電子郵件、具體列出所需數字(Young & Hopewell 2011)。
  • 迷你 SR 灰色地帶:Kiderman 百分比 → 17/40、4/39;Wei 兩臂合併 → 25/80 vs 4/36;Marvez-Valls 46/46 是標明的假設,Tasar 31/42 有原文依據。

延伸閱讀

  • Li T, Higgins JPT, Deeks JJ. Chapter 5: Collecting data. In: Cochrane Handbook for Systematic Reviews of Interventions v6. 2019. DOI: 10.1002/9781119536604.ch5
  • Higgins JPT, Eldridge S, Li T. Chapter 23: Including variants on randomized trials. In: Cochrane Handbook for Systematic Reviews of Interventions v6. 2019. DOI: 10.1002/9781119536604.ch23
  • Buscemi N, Hartling L, Vandermeer B, et al. Single data extraction generated more errors than double data extraction in systematic reviews. J Clin Epidemiol. 2006;59(7):697-703. DOI: 10.1016/j.jclinepi.2005.11.010
  • Mathes T, Klaßen P, Pieper D. Frequency of data extraction errors and methods to increase data extraction quality: a methodological review. BMC Med Res Methodol. 2017. DOI: 10.1186/s12874-017-0431-4
  • Jones AP, Remmington T, Williamson PR, et al. High prevalence but low impact of data extraction and reporting errors were found in Cochrane systematic reviews. J Clin Epidemiol. 2005. DOI: 10.1016/j.jclinepi.2004.11.024
  • Gøtzsche PC, Hróbjartsson A, Maric K, et al. Data extraction errors in meta-analyses that use standardized mean differences. JAMA. 2007. DOI: 10.1001/jama.298.4.430
  • Tendal B, Higgins JP, Jüni P, et al. Disagreements in meta-analyses using outcomes measured on continuous or rating scales: observer agreement study. BMJ. 2009. DOI: 10.1136/bmj.b3128
  • Xu C, Yu T, Furuya-Kanamori L, et al. Validity of data extraction in evidence synthesis practice of adverse events: reproducibility study. BMJ. 2022. DOI: 10.1136/bmj-2021-069155
  • Mayo-Wilson E, Li T, Fusco N, et al. Cherry-picking by trialists and meta-analysts can drive conclusions about intervention efficacy. J Clin Epidemiol. 2017. DOI: 10.1016/j.jclinepi.2017.07.014
  • Young T, Hopewell S. Methods for obtaining unpublished data. Cochrane Database Syst Rev. 2011. DOI: 10.1002/14651858.MR000027.pub2
  • Elamin MB, Flynn DN, Bassler D, et al. Choice of data extraction tools for systematic reviews depends on resources and review complexity. J Clin Epidemiol. 2009. DOI: 10.1016/j.jclinepi.2008.10.016
  • Li T, Vedula SS, Hadar N, et al. Innovations in data collection, management, and archiving for systematic reviews. Ann Intern Med. 2015. DOI: 10.7326/M14-1603
  • Saldanha IJ, Smith BT, Ntzani E, et al. The Systematic Review Data Repository (SRDR): descriptive characteristics of publicly available data and opportunities for research. Syst Rev. 2019. DOI: 10.1186/s13643-019-1250-y

迷你 SR 納入的 9 篇 RCT

下一關:第 8 關 Risk of bias——數字搬好了,接下來要問:這些數字可信嗎?

BOSS 戰:「這是 SD 還是 SE?」混沌史萊姆

HP0/4
  1. Kiderman 2005 只報告「24 小時不痛的比例:類固醇組 42.5%(n = 40)、安慰劑組 10.3%(n = 39)」。迷你 SR 怎麼處理?

  2. Wei 2002 是三臂試驗(IM dexamethasone、口服 dexamethasone、placebo)。若把「IM vs placebo」與「口服 vs placebo」當成兩個研究放進同一個 meta-analysis,會發生什麼事?

  3. Marvez-Valls 1998 隨機分派 46/46 人,全文寫「8 人失聯被排除」但沒說各在哪一組,Table 2 標題仍寫 n = 46。迷你 SR 用 46/46 計算 MD 的 SE。這個處理應如何描述?

  4. Buscemi 2006 比較單人萃取與雙人萃取,主要發現是?