本關目標
9 篇 RCT 進門了,現在要把它們的數字搬進你的資料表。本關 Boss「『這是 SD 還是 SE?』混沌史萊姆」最擅長的是讓數字變形:百分比沒有分母、三臂試驗少一臂、表頭寫 n = 46 但內文說有人失聯、表格寫 Mean 數值卻是中位數。打完本關,你應該能:
- 設計一份萃取表(data extraction form),知道該萃取哪些欄位、為什麼要記來源位置。
- 說明 pilot 與雙人萃取的做法,並引用萃取錯誤率的實證。
- 知道何時、如何聯絡作者。
- 用迷你 SR 的
extraction.csv,處理三種「萃取灰色地帶」:百分比換算人數、多臂試驗合併、分析人數的假設。
萃取完的數字怎麼變成效果量(CI → SE、median/IQR → mean/SD、cluster 與 crossover)是 MA 站的主題,深入請看 → MA 站第 3 關 從萃取到效果量。本關專注在「把正確的數字、連同它的出處,搬進表格」。
一、萃取什麼?
Cochrane Handbook 第 5 章(Li 2019)把要收集的資料分成幾大類。對照迷你 SR 的 extraction.csv,domain 欄就是這樣分的:
| 類別 | 例子 | 迷你 SR 的 domain |
|---|---|---|
| 研究來源與設計 | 期刊、場域、隨機方法、盲法、註冊 | design |
| 受試者 | 年齡範圍、診斷條件、Centor 分數 | population |
| 介入與對照 | 藥名、劑量、途徑、療程、合併用藥 | intervention |
| 樣本數 | 隨機人數、各時間點分析人數、失聯人數 | sample |
| 結果 | outcome 定義、時間點、事件數、mean、SD | outcome |
| 安全性 | 不良事件、回診、復發 | safety |
| RoB 相關資訊 | 分配隱匿、失聯原因、事先指定的結果 | 另存於 rob2.csv(第 8 關) |
一個數字一列:長格式
迷你 SR 的萃取表是長格式(long format),每一個數字一列,共 265 列:
study_id, pmid, domain, variable, arm, value, unit, source, location, value_status, note
Kiderman2005, 15808038, outcome, complete_resolution_24h_events, steroid, 17, participants,
fulltext PMC1463093 HTML, Table 2 (pain free at 24 h), derived_from_reported, 42.5% x 40 = 17
這種設計的好處是每個數字都帶著三樣東西:
source與location:從哪個版本(全文、摘要)、哪個表、第幾段取得。第二位萃取者或審稿人可以直接翻到那個位置核對。value_status:這個數字是原文報告(reported,219 個)、由報告值簡單計算(derived_from_reported,14 個),還是原文沒寫(not_reported_in_available_source,32 格)。note:計算式或特殊情況,例如「42.5% x 40 = 17」。
「原文沒寫」也是一筆資料。迷你 SR 的原則是不補值:全文沒寫的 SD、人數一律留空,不從圖或 p 值反推(範例 README 限制第 4 點)。例如 Olympia 2005 的 Table 2 分母暗示了 24 小時緩解人數,但原文沒有明寫,就不萃取。
二、萃取表的設計與工具
萃取表要在 protocol 階段就規劃好,至少包含:
- Outcome 的定義與優先順序:例如「疼痛完全緩解」的定義、要哪些時間點;同一概念有多個量表時用哪個。
- 時間點的選擇規則:例如「最接近 24 小時的追蹤」。
- 效果量需要的原始數字:二元結果要事件數與分母;連續結果要 mean、SD、n。
- 多臂、cluster、crossover 等特殊設計的處理方式。
為什麼要事先規定?Mayo-Wilson 2017 以 gabapentin 疼痛與 quetiapine 憂鬱的 RCT 示範:單一試驗就有 68 與 98 種可用於 meta-analysis 的結果;刻意挑選可以把 pain intensity 的合併 SMD 從 −0.45(95% CI −0.63 至 −0.27)變成 −0.06(95% CI −0.24 至 0.12,未達統計顯著)。這是示範性分析,不代表常態,但說明了萃取時的選擇空間有多大。沒有事先規則,萃取者就可能(即使無意間)挑到結論想要的那個數字。
用什麼工具?
Elamin 2009 比較紙本、試算表、網路問卷、資料庫與專用網站,各有利弊;專用軟體在多數面向表現最好,但建置成本較高。Li 2015 以 SRDR(Systematic Review Data Repository)示範資料收集表的建構、萃取、管理與封存;Saldanha 2019 統計 SRDR 上 735 個專案中有 152 個(21%)公開資料。
學生專題用試算表就夠了,但要做到三件事:欄位固定(下拉選單)、每個數字附出處、保留修改紀錄。
三、Pilot:先試萃 2–3 篇
萃取表寫好後,先讓所有萃取者各自試萃 2–3 篇不同類型的研究,比對結果。常見發現:
- 欄位定義不清(「n」是隨機人數還是分析人數?)
- 漏了欄位(某篇有兩種給藥途徑,表格沒有地方填)
- 單位不一致(小時 vs 天、VAS 0–10 vs 0–100)
迷你 SR 就在 Wei 2002 遇到這種情況:它有 IM 與口服兩個類固醇臂,arm 欄位因此要多出 steroid_IM、steroid_oral,而不是只有 steroid 與 control。這類設計在 pilot 時發現,修改成本最低。
四、雙人萃取:錯誤率的實證
| 研究 | 發現 |
|---|---|
| Buscemi 2006 | 單人萃取比雙人萃取產生較多錯誤(相對差異 21.7%,P = .019);多數 outcome 的效果估計沒有觀察到明顯差異;單人萃取平均省 36.1% 時間 |
| Mathes 2017 | 方法學回顧(6 項研究):萃取錯誤率最高可達 50%,錯誤常影響效果估計;不同萃取方式與訓練的比較證據薄弱 |
| Jones 2005 | 重做某 Cochrane 小組所有 SR 的萃取:34 篇中 20 篇有錯誤(含轉換計算錯誤 2 篇、誤解資料 7 篇);資料處理錯誤都改變了摘要結果,但沒有改變 review 結論 |
| Gøtzsche 2007 | 27 篇使用 SMD 的 meta-analysis,63%(17 篇)在抽查的兩個試驗中至少有一個錯誤;7 篇確認有錯,其中 1 篇其後撤稿 |
| Tendal 2009 | 10 位觀察者重複 SMD 萃取:試驗層級一致率 53%,meta-analysis 層級 31%;原因包括選擇不同時間點、量表、對照組與計算方式 |
| Xu 2022 | 288 個不良事件 meta-analysis:萃取錯誤使 3.5%(10/288)改變效果方向、6.6%(19/288)改變 P 值的統計顯著性 |
結論很清楚:萃取錯誤很常見,而且有時會改變結果。Cochrane Handbook 第 5 章(Li 2019)也把雙人獨立萃取列為降低錯誤的做法;人力有限時,常見的折衷是一人萃取、另一人逐項核對原文。Tendal 2009 也提醒,很多「錯誤」其實是「選擇不同」——兩個人選了不同時間點或量表,這要靠事先規定的萃取規則解決,而不是靠多一個人。
混沌史萊姆的招式:SD 還是 SE?
本關 Boss 的名字不是開玩笑。表格寫「mean ± 2.4」,這個 2.4 是 SD 還是 SE?要看表格註腳或方法段。若某篇的 SD 比其他研究小很多,很可能是 SE。迷你 SR 也遇到類似的陷阱:Bulloch 2003 的 Table 2 標「Mean」,但數值與摘要寫的是中位數(記錄在 rob2.csv 的 D5 理由中)。萃取時多看一眼表頭、註腳、摘要是否一致,是最便宜的品管。
五、聯絡作者
全文沒寫的資料,最可靠的來源是作者本人。Young & Hopewell 2011(Cochrane 方法學回顧)整理取得未發表資料的方法:
- 電子郵件聯絡的回覆率最高,所需嘗試次數最少。
- 用同一種方式重複寄送,不會提高回覆率。
- 詢問方法學問題(例如隨機方法)比索取遺漏的數據得到更多回應。
這些結論來自少量研究,但實務上很有用。寫信時:具體列出需要的數字(「Table 2 中各組的分析人數」)、附上你的萃取表、給一個合理的期限、記錄寄送與回覆日期。在方法段報告聯絡了幾位作者、幾位回覆、拿到什麼。
迷你 SR 是教學示範,沒有聯絡作者。所以下一節的三個灰色地帶,都是在「不聯絡作者」的條件下處理的;正式 SR 的第一步應該是寫信。
六、迷你 SR 的三個灰色地帶
9 篇全部依全文萃取後,有幾個數字無法直接從原文抄下來。以下三種處理,都記錄在 extraction.csv 的 value_status 與 note,以及 analysis.R 的註解中。
灰色地帶 1:百分比換算人數(Kiderman 2005)
Kiderman 2005 的 Table 2 只報告「不痛的比例」,沒有人數。全文寫明兩組追蹤完整(類固醇 40 人、安慰劑 39 人),所以可以還原:
| 時間點 | 類固醇組 | 安慰劑組 |
|---|---|---|
| 24 小時 | 42.5% × 40 = 17 | 10.3% × 39 = 4 |
| 48 小時 | 57.5% × 40 = 23 | 33.3% × 39 = 13 |
驗算:4/39 = 10.26%,四捨五入後就是原文的 10.3%;13/39 = 33.3%。數字對得上,代表換算可信。這四個值標為 derived_from_reported,note 寫出算式。
這種換算的前提是分母明確。如果原文只說「42.5% 的病人」卻沒說是 40 人中的 42.5%,還是追蹤到的某個子集,就不能直接乘。
灰色地帶 2:多臂試驗合併(Wei 2002)
Wei 2002 有三臂:IM dexamethasone、口服 dexamethasone、placebo。我們的問題是「類固醇 vs placebo」,不在乎途徑。24 小時完全緩解(Table III):
| 臂 | 事件 / 分析人數 |
|---|---|
| IM dexamethasone | 13 / 39 |
| 口服 dexamethasone | 12 / 41 |
| placebo | 4 / 36 |
如果把「IM vs placebo」與「口服 vs placebo」當兩個研究,placebo 的 36 人就會被計算兩次——這是 unit-of-analysis error。迷你 SR 依 Cochrane Handbook 第 23 章的建議,把兩個類固醇臂合併成一組:25/80 vs 4/36,單篇 RR 2.81(95% CI 1.06–7.49)。二元資料的合併很簡單,直接加總事件數與人數;連續資料要用合併 mean 與 SD 的公式(MA 站第 3 關)。
注意兩件事:
- 分母用的是該時間點的分析人數(
n_analysed_24h:39、41、36),不是隨機人數(共 120 人)。萃取表要分開記錄不同時間點的分析人數。 - 合併規則寫在
analysis.R開頭,依據是 Cochrane Handbook 23.3.4,而不是看哪種合併方式結果比較好。但要提醒的是:analysis.R是萃取完才寫的,無法證明規則是事先定的;正式 SR 應該把多臂試驗的處理方式寫進 protocol。若問題改成「IM 與口服哪個好」,就不能合併。
灰色地帶 3:以隨機分派人數作為分析人數(Marvez-Valls 1998 與 Tasar 2008)
連續結果(完全緩解時間)的 SE 需要每組的 n。這兩篇看起來都「用隨機人數」,但性質完全不同:
Marvez-Valls 1998——這是一個假設。 全文報告隨機分派 46/46 人,摘要寫「8 人失聯被排除」,但沒有說各在哪一組;Table 2 的標題仍寫 n = 46。各組真正的分析人數無法得知,所以萃取表把 n_analysed 記為 not_reported_in_available_source,analysis.R 改用隨機人數 46/46,並在輸出中明確標記為假設:
MarvezValls1998: n_randomised - ASSUMPTION: randomised n (per-arm analysed n not reported)
用 46 而不是實際較小的人數,會讓這篇的 SE 稍微偏小、權重稍微偏大。它的單篇 MD 為 −13.8 h(95% CI −31.62 至 4.02,未達統計顯著)。這個假設的影響怎麼檢查?看 leave-one-out:拿掉 Marvez-Valls 後,合併 MD 為 −21.32 h(HKSJ −34.79 至 −7.85),與主分析 −20.47 h(HKSJ −29.27 至 −11.68)方向與量級相近,代表結論不依賴這個假設(results.json)。同一件事在第 8 關會以 RoB 的 D3(missing outcome data)再出現一次:失聯 8.7%、分組未報,判為 Some concerns。
Tasar 2008——有原文依據,不是假設。 Tasar 分派 31/42 人,全文寫明「追蹤期間沒有病人被排除」,所以分析人數 = 隨機人數是原文報告的(value_status = reported)。兩篇數字的長相一樣,差別在於有沒有原文支撐。萃取時要問的不是「用了什麼數字」,而是「這個數字從哪裡來」。
Tasar 也有自己的小灰色地帶:48 小時完全緩解人數由 Table 3 的「24 小時內」與「25–48 小時」兩列相加(類固醇 13 + 16 = 29;安慰劑 2 + 20 = 22),標為 derived_from_reported。另外兩組人數 31 vs 42 不均且原文未解釋,這不是萃取問題,而是第 8 關 D1(隨機過程)的疑慮。
三種處理的共同原則
| 原則 | 在迷你 SR 怎麼做 |
|---|---|
| 能從報告值簡單算出的,就算,並寫出算式 | Kiderman 的百分比、Tasar 的兩列相加、Wei 的臂合併 |
| 算不出來的,就留空或明確標示假設 | Marvez-Valls 的分析人數 |
| 不從圖讀數、不從 p 值反推(本範例的選擇) | 5 篇沒報 24/48 小時完全緩解人數,Wei 2002 另外沒有 48 小時追蹤,因此 24 小時 k = 4、48 小時 k = 3 |
| 假設要有敏感度分析 | leave-one-out、排除高 RoB 研究 |
範例 README 的限制第 3 點也承認:這些處理都未經第二人核對。O’Brien 1993 只有 PDF,靠瀏覽器逐頁閱讀,也有誤讀風險。這些就是單人萃取的代價。
常見錯誤
| 錯誤 | 正確做法 |
|---|---|
| 萃取表只記數字,不記出處 | 每個數字附來源版本與位置(表號、段落) |
| 原文沒寫的欄位自己猜一個 | 留空並標示「未報告」;需要時聯絡作者 |
| 換算或假設不留紀錄 | 標 derived_from_reported 或假設,note 寫算式 |
| 多臂試驗的共用對照組重複計算 | 合併相關的臂,或拆分對照組 |
| 分母一律用隨機人數 | 優先用該時間點的分析人數,並記錄用了哪一種 |
| 把 SE 當 SD、把中位數當平均數 | 核對表頭、註腳、摘要是否一致 |
| 時間點、量表事後才挑 | Protocol 事先規定選擇規則 |
| 單人萃取不說明 | 雙人萃取或一人萃取一人核對;做不到就在限制中寫明 |
本關重點小抄
- 萃取表:設計、樣本、介入、結果、安全性、RoB 資訊;每個數字附
source、location、value_status。 - 事先規定:outcome 定義、時間點、量表優先順序、特殊設計的處理(Mayo-Wilson 2017:挑選可把 SMD −0.45 變成 −0.06)。
- Pilot:先試萃 2–3 篇,修正欄位。
- 錯誤很常見:Buscemi 2006(單人錯誤多 21.7%)、Jones 2005(34 篇中 20 篇有錯)、Xu 2022(6.6% 改變顯著性)。
- 聯絡作者:電子郵件、具體列出所需數字(Young & Hopewell 2011)。
- 迷你 SR 灰色地帶:Kiderman 百分比 → 17/40、4/39;Wei 兩臂合併 → 25/80 vs 4/36;Marvez-Valls 46/46 是標明的假設,Tasar 31/42 有原文依據。
延伸閱讀
- Li T, Higgins JPT, Deeks JJ. Chapter 5: Collecting data. In: Cochrane Handbook for Systematic Reviews of Interventions v6. 2019. DOI: 10.1002/9781119536604.ch5
- Higgins JPT, Eldridge S, Li T. Chapter 23: Including variants on randomized trials. In: Cochrane Handbook for Systematic Reviews of Interventions v6. 2019. DOI: 10.1002/9781119536604.ch23
- Buscemi N, Hartling L, Vandermeer B, et al. Single data extraction generated more errors than double data extraction in systematic reviews. J Clin Epidemiol. 2006;59(7):697-703. DOI: 10.1016/j.jclinepi.2005.11.010
- Mathes T, Klaßen P, Pieper D. Frequency of data extraction errors and methods to increase data extraction quality: a methodological review. BMC Med Res Methodol. 2017. DOI: 10.1186/s12874-017-0431-4
- Jones AP, Remmington T, Williamson PR, et al. High prevalence but low impact of data extraction and reporting errors were found in Cochrane systematic reviews. J Clin Epidemiol. 2005. DOI: 10.1016/j.jclinepi.2004.11.024
- Gøtzsche PC, Hróbjartsson A, Maric K, et al. Data extraction errors in meta-analyses that use standardized mean differences. JAMA. 2007. DOI: 10.1001/jama.298.4.430
- Tendal B, Higgins JP, Jüni P, et al. Disagreements in meta-analyses using outcomes measured on continuous or rating scales: observer agreement study. BMJ. 2009. DOI: 10.1136/bmj.b3128
- Xu C, Yu T, Furuya-Kanamori L, et al. Validity of data extraction in evidence synthesis practice of adverse events: reproducibility study. BMJ. 2022. DOI: 10.1136/bmj-2021-069155
- Mayo-Wilson E, Li T, Fusco N, et al. Cherry-picking by trialists and meta-analysts can drive conclusions about intervention efficacy. J Clin Epidemiol. 2017. DOI: 10.1016/j.jclinepi.2017.07.014
- Young T, Hopewell S. Methods for obtaining unpublished data. Cochrane Database Syst Rev. 2011. DOI: 10.1002/14651858.MR000027.pub2
- Elamin MB, Flynn DN, Bassler D, et al. Choice of data extraction tools for systematic reviews depends on resources and review complexity. J Clin Epidemiol. 2009. DOI: 10.1016/j.jclinepi.2008.10.016
- Li T, Vedula SS, Hadar N, et al. Innovations in data collection, management, and archiving for systematic reviews. Ann Intern Med. 2015. DOI: 10.7326/M14-1603
- Saldanha IJ, Smith BT, Ntzani E, et al. The Systematic Review Data Repository (SRDR): descriptive characteristics of publicly available data and opportunities for research. Syst Rev. 2019. DOI: 10.1186/s13643-019-1250-y
迷你 SR 納入的 9 篇 RCT
- O’Brien 1993. Ann Emerg Med. PubMed 8427434
- Marvez-Valls 1998. Acad Emerg Med. PubMed 9660281
- Wei 2002. Laryngoscope. PubMed 11802044
- Bulloch 2003. Ann Emerg Med. PubMed 12712025
- Kiderman 2005. Br J Gen Pract. PubMed 15808038
- Olympia 2005. Arch Pediatr Adolesc Med. PubMed 15753273
- Niland 2006. Pediatr Infect Dis J. PubMed 16732143
- Tasar 2008. J Emerg Med. PubMed 18468831
- Hayward 2017. JAMA. PubMed 28418482
下一關:第 8 關 Risk of bias——數字搬好了,接下來要問:這些數字可信嗎?