怎麼讀一篇臨床研究論文
論文不是從頭讀到尾的。這一章給一個閱讀順序、每一站該問的問題,以及一張「看到什麼就去讀哪一頁」的對照表。
論文不是從頭讀到尾的
摘要是作者對自己研究最有利的敘述。從摘要開始讀,你會先拿到結論,再去找支持它的證據—— 那個順序讓人很難不同意。
比較有用的順序是:
- 標題與作者 → 這是什麼設計?誰做的?
- Methods 的設計段落 → 這個設計能回答那個問題嗎?
- 流程圖(CONSORT / STROBE / PRISMA / STARD) → 誰進了分析,誰沒有
- Table 1 → 兩組像不像?該用什麼判斷?
- 主要結果 → 效果多大?區間多寬?
- 敏感度分析與亞組 → 結論穩不穩?
- 最後才回頭看摘要 → 它說的跟你剛才看到的一樣嗎?
先認出設計
設計決定了這篇論文能回答什麼,這比它宣稱回答了什麼重要。
| 讀到這些字 | 設計是 | 能算 | 不能算 |
|---|---|---|---|
| 「隨機分配」「安慰劑對照」 | 隨機對照試驗 | 因果效應、ARR、NNT | — |
| 「追蹤了 N 年」「基線時無此疾病」 | 世代研究 | 發生率、RR、HR | 因果(只能逼近) |
| 「病例組」「對照組」「回溯暴露史」 | 病例對照 | OR | 發生率、RR |
| 「敏感度」「特異度」「參考標準」 | 診斷準確度 | 準確度指標 | 病人會不會因此受益 |
| 「模型」「C-index」「驗證世代」 | 預測模型 | 個人風險 | 介入的效果 |
| 「檢索策略」「PRISMA」「合併」 | 系統性回顧 | 綜合證據 | 比原始研究更強的因果宣稱 |
每一站該問的問題
流程圖
誰進了分析,誰沒有,為什麼。 這一格是整篇論文最有資訊量、也最常被跳過的地方。
- RCT:被排除的人數與原因分布合理嗎?失聯率多高?
- 世代:完整個案分析掉了幾人?(D1 的例子掉了 17 人, 頁面把它列出來,因為缺失通常與預後有關)
- 診斷研究:有多少人真的接受了參考標準? 這個數字遠小於納入人數時,要警覺驗證性偏誤
- 系統性回顧:讀全文後排除的理由分布,會透露納入條件有沒有被事後調整
流程圖經常只以圖片存在。 本站的 RCT 章用的那個試驗(Elmunzer 2012),篩選與排除人數在 Methods 與 Results 全文裡一次都沒出現,Figure 1 的圖說也只有五個字:「Enrollment and Outcomes.」。 這代表全文檢索、grep、語言模型讀摘要都抓不到它——你只能自己去看那張圖。所以我們照做了一次, 把數字抄下來重畫一份:
figures/scripts/D3-consort-subgroup.R抄回來之後才看得到第二件事,而且比第一件更麻煩:那張圖的最上格是「簽了同意書的人」,不是「被評估 合格性的人」。 多少人被看過一眼、其中多少人根本沒被問到要不要參加,這篇論文任何地方都沒有記載—— 正文沒有,那張圖也沒有。上面那個紅色虛線空框畫的就是這一格。所以「去看那張圖」是必要的,但它不保證 補得齊:流程圖能告訴你的,止於作者決定畫進去的那一格。
Table 1
問「兩組像不像」,但不要看 p 值:
- RCT:虛無假設在隨機化下依定義為真,檢定它得不到資訊
- 觀察性研究:兩組確實來自不同母體,p 值只反映樣本數
兩種情況都該看標準化平均差(SMD),慣例 |SMD| < 0.1 算平衡。
主要結果
四個問題,順序有意義:
- 效果量多大? 不是 p 值多小
- 信賴區間多寬? 區間跨過無效值就是未達顯著;區間很寬代表這份資料排除不了中等效應
- 絕對還是相對? 只報 RRR 不報 ARR / NNT 是誇大獲益的標準手法
- 這個 outcome 是事先指定的嗎?
敏感度分析與亞組
- 亞組的檢定力永遠不足,看不到差異是常態
- 要看的是交互作用檢定,不是各亞組各自的 p 值
- 事先指定與事後分析要分開看
- 敏感度分析結論一致,比主分析單獨顯著更有說服力
三個這個站實際遇到的誤讀
這些不是教科書上的假想例子,是寫這個站的過程中真的差點寫錯或發現的:
| 情境 | 直覺的讀法 | 實際上 |
|---|---|---|
| 配對病例對照,比較「忽略配對」與「完整模型」 | 忽略配對讓你錯過真實關聯 | 尊重配對只讓 OR 從 1.07 動到 1.09。 翻轉結論的是控制干擾因子(4.15)。 兩個模型同時差兩件事,歸因給其中一件就是錯的。 看這一章 |
| 預測模型移到外部世代,C-index 只掉一點 | 鑑別力維持良好,模型可用 | C 從 0.666 到 0.642, 但校準系統性偏低:最低風險組預測 28.7%、實際 36.4%。C-index 對整條風險刻度的平移完全免疫。 看這一章 |
| 診斷研究只對檢驗陽性者做參考標準 | 省成本,影響應該不大 | 只驗一半的陰性者,表面敏感度從 0.63 升到 0.78、特異度從 0.81 掉到 0.67。 看這一章 |
看到什麼就去讀哪一頁
| 論文裡出現 | 去讀 |
|---|---|
| Table 1、SMD | Table 1 與標準化平均差 |
| 存活曲線、log-rank | Kaplan-Meier 與 log-rank |
| HR、比例風險 | Cox 迴歸、PH 假設 |
| 累積發生率、競爭事件 | 競爭風險 |
| OR、勝算比 | 邏輯迴歸 |
| 發生率、人年、offset | Poisson 迴歸 |
| ROC、AUC | ROC 與 AUC |
| PPV、NPV、盛行率 | 預測值與盛行率 |
| Forest plot、I²、漏斗圖 | Forest 與 funnel plot |
| 傾向分數、配對、加權 | 傾向分數配對、IPTW |
| DAG、collider | 干擾與 DAG |
不確定某個詞的中英對照,用術語表。
最後一件事
讀論文最有用的一個習慣,不是記住哪個檢定該用在哪裡,而是每看到一個數字就問它的分母是誰。
多數統計上的誤讀,追到底都是分母的問題:Table 1 的 p 值分母是樣本數不是差異、 病例對照的分母是研究者選的、驗證性偏誤動的是分母、預測模型的校準壞掉是因為新族群的分母結構不同。
讀讀看這張圖
答案取自產生本頁圖表的同一份統計輸出,不是另外打上去的。
本章建議讀主要結果時先問效果量與信賴區間,而不是先看 p 值。以世代研究那一章的未校正結果為例,這個順序買到什麼?
看答案與解析
正確答案: 買到「這份資料排除不了什麼」。區間上界到 1.932,將近翻倍的風險並沒有被排除
p 值回答的是「離無效值有多遠」,它把區間的兩端壓成一個數字,於是「資料太少所以什麼都排除不了」與「資料很多而效果確實很小」在 p 值上長得一樣。0.805 就是前者。先看區間就看得到後面那件事:上界 1.932 代表將近翻倍的風險仍在資料容得下的範圍內。至於點估計 1.077 本身不足以宣告方向——區間橫跨無效值時方向是未定的,把它讀成「有害」與把它讀成「有保護」一樣沒有根據。
本章列的三個實際誤讀,其中一個是「預測模型移到外部世代,鑑別力只掉一點,所以模型可用」。它錯在哪?
看答案與解析
正確答案: 錯在只看排序。最低風險那組的預測是 0.287、實際發生的是 0.364,而 C-index 對整條風險刻度的平移完全免疫
C-index 只問模型有沒有把高風險的人排在低風險的人前面,把每個人的預測值同時平移或縮放,排序不變,它也不變。所以 0.642 與 0.666 之間的差距對「預測值準不準」什麼都沒說。真正的問題在校準:最低風險那組預測 0.287、實際 0.364,而臨床上的門檻式決策用的正是預測值。第二個說法提到的樂觀偏誤在這個例子上幾乎為零——開發世代的事件數相對於參數非常充足,沒有什麼可以過度配適的空間,所以那不是這裡的解釋。至於第一個說法所訴諸的門檻:C-index 沒有一條通用的及格線。可接受的範圍取決於結果本身有多可預測,也取決於模型要拿來做什麼——用來排候補名單與用來決定要不要加做輔助治療,需要的鑑別力並不一樣。而且就算判定 0.642 已經足夠,這一頁的失敗仍然在校準而不是鑑別力上;把它講成門檻問題,等於換一個鑑別力指標繼續只看鑑別力。只報 C-index 不報校準的預測模型論文,等於只報了一半。
本章列的另一個誤讀是「配對病例對照裡,忽略配對讓你錯過真實關聯」。實際跑出來的數字說了什麼?
看答案與解析
正確答案: 尊重配對之後勝算比只從 1.07 動到 1.09,翻轉結論的是另一件事——控制干擾因子
只差一件事的比較才有辦法歸因。同樣的變項、只多還原配對結構,勝算比從 1.07 移到 1.09,幾乎沒有動;4.15 是再加入自發性流產次數之後的結果,那一步同時改了兩件事。把整個差異記在配對頭上,就是把功勞算在錯的原因上。這不代表忽略配對無所謂——它讓標準誤與信賴區間失準,而且偏誤方向要看配對變項與暴露、與結果各自的關聯方向,並不必然指向虛無。0.76 那個說法則把 p 值的微小變化當成證據;兩個都離顯著很遠的估計之間比 p 值,不會得到任何資訊。
本章第三個誤讀是「診斷研究只對檢驗陽性者做參考標準,省成本、影響應該不大」。用同一份資料模擬只驗一半的陰性者,會看到什麼?
看答案與解析
正確答案: 表面敏感度爬到 0.776,同時表面特異度掉下來——被略過驗證的人裡真陰性遠多於偽陰性
表面敏感度從 0.634 爬到 0.776,表面特異度則往下掉,兩者方向相反。機制是被略過驗證的那群陰性者裡真陰性遠多於偽陰性:把他們排除,特異度的分母流失大量真陰性,敏感度的分母也少了偽陰性。所以「省成本、影響不大」正好說反了——它同時讓檢驗看起來更敏感、更不特異,而且幅度不小;只驗一成陰性者時特異度低到 0.293。這個偏誤不會在論文裡標示自己,只能從「有多少人接受了參考標準」這個數字去推,那正是流程圖存在的理由。
本章結尾說,讀論文最有用的習慣是每看到一個數字就問它的分母是誰。以世代研究那一章的完整個案分析為例,這個習慣會問出什麼?
看答案與解析
正確答案: 會問出後面每一個估計的分母其實是 299,而不是資料集的總人數
後面所有的估計都跑在 299 人身上,不是 316 人。差額是因變項缺失而被排除的人,而完整個案分析要成立,缺失必須夠良性;缺值的人如果本來就追蹤得比較鬆散,那個條件就未必成立。48 個事件確實決定精確度,但精確度回答不了「這個估計代表誰」。多數統計上的誤讀追到底都是分母的問題:基線表的 p 值反映的是樣本數不是差異、病例對照的分母是研究者選的、驗證性偏誤動的是分母、預測模型的校準壞掉是因為新族群的分母結構不同。
本章「先認出設計」那張表列出每種設計能算什麼、不能算什麼。病例對照那一列為什麼只寫得出勝算比?
看答案與解析
正確答案: 因為那 165 位對照是研究者挑進來的,分母不對應任何母體
能不能算發生率,取決於分母是不是一個定義好的母體與追蹤時間,而不是取決於樣本大小。這份研究的 165 位對照是依配對條件挑出來的,他們被選進來的機率不是由自然發生率決定的,所以任何以他們為分母的比例都不對應真實世界的任何一個量。83 位病例的多寡只影響精確度;248 這個總數同樣是被拼出來的,而且「沒有記錄追蹤時間」也不是理由——巢式病例對照一樣是病例對照,但因為對照是從一個已定義的世代裡抽的,它反而估得出發生率。決定的是對照怎麼來的,不是資料量。
本章用到的統計方法
延伸觀看
Types of Study Designs in Clinical Research Explained & Made Easy
Principles of Epidemiology 03. Disease Occurrence and Prototype of Study Designs素材來源與授權
- Elmunzer BJ, et al. A Randomized Trial of Rectal Indomethacin to Prevent Post-ERCP Pancreatitis. N Engl J Med 2012;366:1414-22original本頁的 CONSORT 流程圖數字抄自該文 Figure 1;圖為本站重繪,非複製原圖。引用為事實陳述,非文字改作。