基礎已經雙重審閱,尚未人工抽查

怎麼讀一篇臨床研究論文

論文不是從頭讀到尾的。這一章給一個閱讀順序、每一站該問的問題,以及一張「看到什麼就去讀哪一頁」的對照表。

論文不是從頭讀到尾的

摘要是作者對自己研究最有利的敘述。從摘要開始讀,你會先拿到結論,再去找支持它的證據—— 那個順序讓人很難不同意。

比較有用的順序是:

  1. 標題與作者 → 這是什麼設計?誰做的?
  2. Methods 的設計段落 → 這個設計能回答那個問題嗎?
  3. 流程圖(CONSORT / STROBE / PRISMA / STARD) → 誰進了分析,誰沒有
  4. Table 1 → 兩組像不像?該用什麼判斷?
  5. 主要結果 → 效果多大?區間多寬?
  6. 敏感度分析與亞組 → 結論穩不穩?
  7. 最後才回頭看摘要 → 它說的跟你剛才看到的一樣嗎?

先認出設計

設計決定了這篇論文回答什麼,這比它宣稱回答了什麼重要。

讀到這些字設計是能算不能算
「隨機分配」「安慰劑對照」隨機對照試驗因果效應、ARR、NNT
「追蹤了 N 年」「基線時無此疾病」世代研究發生率、RR、HR因果(只能逼近)
「病例組」「對照組」「回溯暴露史」病例對照OR發生率、RR
「敏感度」「特異度」「參考標準」診斷準確度準確度指標病人會不會因此受益
「模型」「C-index」「驗證世代」預測模型個人風險介入的效果
「檢索策略」「PRISMA」「合併」系統性回顧綜合證據比原始研究更強的因果宣稱

每一站該問的問題

流程圖

誰進了分析,誰沒有,為什麼。 這一格是整篇論文最有資訊量、也最常被跳過的地方。

  • RCT:被排除的人數與原因分布合理嗎?失聯率多高?
  • 世代:完整個案分析掉了幾人?(D1 的例子掉了 17 人, 頁面把它列出來,因為缺失通常與預後有關)
  • 診斷研究:有多少人真的接受了參考標準? 這個數字遠小於納入人數時,要警覺驗證性偏誤
  • 系統性回顧:讀全文後排除的理由分布,會透露納入條件有沒有被事後調整

流程圖經常只以圖片存在。 本站的 RCT 章用的那個試驗(Elmunzer 2012),篩選與排除人數在 Methods 與 Results 全文裡一次都沒出現,Figure 1 的圖說也只有五個字:「Enrollment and Outcomes.」。 這代表全文檢索、grep、語言模型讀摘要都抓不到它——你只能自己去看那張圖。所以我們照做了一次, 把數字抄下來重畫一份:

重畫的 CONSORT 流程圖,三個階段由上而下,每個階段一條淺色橫帶,左緣有直排的階段名稱。最上方是一個紅色虛線的空框,寫著「評估合格性(人數未報告)」與「不在正文裡,也不在圖裡」,一條虛線箭頭往下接到下一格。Enrolment:「簽署知情同意書」799 人;主幹往下的途中向右分出一格「排除」共 197 人,底下列出三項理由與人數(不符合納入條件 169、符合排除條件 11、沒有接受 ERCP 17);主幹繼續往下進入「接受隨機分配」602 人。Allocation:分成左右兩支,左支分到 indomethacin 295 人、右支分到安慰劑 307 人,兩支都註明全部實際接受了分配到的處置。Analysis:兩支各一格,寫納入分析的人數(左 295、右 307),並註明都完成了五天的主要結果追蹤;左支途中向右分出一個小框,寫有 1 位病人無法保留栓劑,仍依分派組別分析。圖的最下方有一行紅字,說明數字抄自原文 Figure 1、此圖為重繪而非複製。
本章那個 RCT 的流程圖,數字抄自原文 Figure 1、以本站畫法重繪(原圖著作權屬 Massachusetts Medical Society,不轉載)。兩組加起來 602 人,與公開的個案層級資料完全對得起來——這是整張圖唯一能用圖以外的東西查核的部分。產圖腳本 figures/scripts/D3-consort-subgroup.R

抄回來之後才看得到第二件事,而且比第一件更麻煩:那張圖的最上格是「簽了同意書的人」,不是「被評估 合格性的人」。 多少人被看過一眼、其中多少人根本沒被問到要不要參加,這篇論文任何地方都沒有記載—— 正文沒有,那張圖也沒有。上面那個紅色虛線空框畫的就是這一格。所以「去看那張圖」是必要的,但它不保證 補得齊:流程圖能告訴你的,止於作者決定畫進去的那一格。

Table 1

問「兩組像不像」,但不要看 p 值

  • RCT:虛無假設在隨機化下依定義為真,檢定它得不到資訊
  • 觀察性研究:兩組確實來自不同母體,p 值只反映樣本數

兩種情況都該看標準化平均差(SMD),慣例 |SMD| < 0.1 算平衡。

主要結果

四個問題,順序有意義:

  1. 效果量多大? 不是 p 值多小
  2. 信賴區間多寬? 區間跨過無效值就是未達顯著;區間很寬代表這份資料排除不了中等效應
  3. 絕對還是相對? 只報 RRR 不報 ARR / NNT 是誇大獲益的標準手法
  4. 這個 outcome 是事先指定的嗎?

敏感度分析與亞組

  • 亞組的檢定力永遠不足,看不到差異是常態
  • 要看的是交互作用檢定,不是各亞組各自的 p 值
  • 事先指定與事後分析要分開看
  • 敏感度分析結論一致,比主分析單獨顯著更有說服力

三個這個站實際遇到的誤讀

這些不是教科書上的假想例子,是寫這個站的過程中真的差點寫錯或發現的:

情境直覺的讀法實際上
配對病例對照,比較「忽略配對」與「完整模型」忽略配對讓你錯過真實關聯尊重配對只讓 OR 從 1.07 動到 1.09。 翻轉結論的是控制干擾因子(4.15)。 兩個模型同時差兩件事,歸因給其中一件就是錯的。 看這一章
預測模型移到外部世代,C-index 只掉一點鑑別力維持良好,模型可用C 從 0.666 到 0.642, 但校準系統性偏低:最低風險組預測 28.7%、實際 36.4%。C-index 對整條風險刻度的平移完全免疫。 看這一章
診斷研究只對檢驗陽性者做參考標準省成本,影響應該不大只驗一半的陰性者,表面敏感度從 0.63 升到 0.78、特異度從 0.81 掉到 0.67。 看這一章

看到什麼就去讀哪一頁

論文裡出現去讀
Table 1、SMDTable 1 與標準化平均差
存活曲線、log-rankKaplan-Meier 與 log-rank
HR、比例風險Cox 迴歸PH 假設
累積發生率、競爭事件競爭風險
OR、勝算比邏輯迴歸
發生率、人年、offsetPoisson 迴歸
ROC、AUCROC 與 AUC
PPV、NPV、盛行率預測值與盛行率
Forest plot、I²、漏斗圖Forest 與 funnel plot
傾向分數、配對、加權傾向分數配對IPTW
DAG、collider干擾與 DAG

不確定某個詞的中英對照,用術語表

最後一件事

讀論文最有用的一個習慣,不是記住哪個檢定該用在哪裡,而是每看到一個數字就問它的分母是誰

多數統計上的誤讀,追到底都是分母的問題:Table 1 的 p 值分母是樣本數不是差異、 病例對照的分母是研究者選的、驗證性偏誤動的是分母、預測模型的校準壞掉是因為新族群的分母結構不同。

讀讀看這張圖

答案取自產生本頁圖表的同一份統計輸出,不是另外打上去的。

本章建議讀主要結果時先問效果量與信賴區間,而不是先看 p 值。以世代研究那一章的未校正結果為例,這個順序買到什麼?

看答案與解析

正確答案: 買到「這份資料排除不了什麼」。區間上界到 1.932,將近翻倍的風險並沒有被排除

p 值回答的是「離無效值有多遠」,它把區間的兩端壓成一個數字,於是「資料太少所以什麼都排除不了」與「資料很多而效果確實很小」在 p 值上長得一樣。0.805 就是前者。先看區間就看得到後面那件事:上界 1.932 代表將近翻倍的風險仍在資料容得下的範圍內。至於點估計 1.077 本身不足以宣告方向——區間橫跨無效值時方向是未定的,把它讀成「有害」與把它讀成「有保護」一樣沒有根據。

本章列的三個實際誤讀,其中一個是「預測模型移到外部世代,鑑別力只掉一點,所以模型可用」。它錯在哪?

看答案與解析

正確答案: 錯在只看排序。最低風險那組的預測是 0.287、實際發生的是 0.364,而 C-index 對整條風險刻度的平移完全免疫

C-index 只問模型有沒有把高風險的人排在低風險的人前面,把每個人的預測值同時平移或縮放,排序不變,它也不變。所以 0.642 與 0.666 之間的差距對「預測值準不準」什麼都沒說。真正的問題在校準:最低風險那組預測 0.287、實際 0.364,而臨床上的門檻式決策用的正是預測值。第二個說法提到的樂觀偏誤在這個例子上幾乎為零——開發世代的事件數相對於參數非常充足,沒有什麼可以過度配適的空間,所以那不是這裡的解釋。至於第一個說法所訴諸的門檻:C-index 沒有一條通用的及格線。可接受的範圍取決於結果本身有多可預測,也取決於模型要拿來做什麼——用來排候補名單與用來決定要不要加做輔助治療,需要的鑑別力並不一樣。而且就算判定 0.642 已經足夠,這一頁的失敗仍然在校準而不是鑑別力上;把它講成門檻問題,等於換一個鑑別力指標繼續只看鑑別力。只報 C-index 不報校準的預測模型論文,等於只報了一半。

本章列的另一個誤讀是「配對病例對照裡,忽略配對讓你錯過真實關聯」。實際跑出來的數字說了什麼?

看答案與解析

正確答案: 尊重配對之後勝算比只從 1.07 動到 1.09,翻轉結論的是另一件事——控制干擾因子

只差一件事的比較才有辦法歸因。同樣的變項、只多還原配對結構,勝算比從 1.07 移到 1.09,幾乎沒有動;4.15 是再加入自發性流產次數之後的結果,那一步同時改了兩件事。把整個差異記在配對頭上,就是把功勞算在錯的原因上。這不代表忽略配對無所謂——它讓標準誤與信賴區間失準,而且偏誤方向要看配對變項與暴露、與結果各自的關聯方向,並不必然指向虛無。0.76 那個說法則把 p 值的微小變化當成證據;兩個都離顯著很遠的估計之間比 p 值,不會得到任何資訊。

本章第三個誤讀是「診斷研究只對檢驗陽性者做參考標準,省成本、影響應該不大」。用同一份資料模擬只驗一半的陰性者,會看到什麼?

看答案與解析

正確答案: 表面敏感度爬到 0.776,同時表面特異度掉下來——被略過驗證的人裡真陰性遠多於偽陰性

表面敏感度從 0.634 爬到 0.776,表面特異度則往下掉,兩者方向相反。機制是被略過驗證的那群陰性者裡真陰性遠多於偽陰性:把他們排除,特異度的分母流失大量真陰性,敏感度的分母也少了偽陰性。所以「省成本、影響不大」正好說反了——它同時讓檢驗看起來更敏感、更不特異,而且幅度不小;只驗一成陰性者時特異度低到 0.293。這個偏誤不會在論文裡標示自己,只能從「有多少人接受了參考標準」這個數字去推,那正是流程圖存在的理由。

本章結尾說,讀論文最有用的習慣是每看到一個數字就問它的分母是誰。以世代研究那一章的完整個案分析為例,這個習慣會問出什麼?

看答案與解析

正確答案: 會問出後面每一個估計的分母其實是 299,而不是資料集的總人數

後面所有的估計都跑在 299 人身上,不是 316 人。差額是因變項缺失而被排除的人,而完整個案分析要成立,缺失必須夠良性;缺值的人如果本來就追蹤得比較鬆散,那個條件就未必成立。48 個事件確實決定精確度,但精確度回答不了「這個估計代表誰」。多數統計上的誤讀追到底都是分母的問題:基線表的 p 值反映的是樣本數不是差異、病例對照的分母是研究者選的、驗證性偏誤動的是分母、預測模型的校準壞掉是因為新族群的分母結構不同。

本章「先認出設計」那張表列出每種設計能算什麼、不能算什麼。病例對照那一列為什麼只寫得出勝算比?

看答案與解析

正確答案: 因為那 165 位對照是研究者挑進來的,分母不對應任何母體

能不能算發生率,取決於分母是不是一個定義好的母體與追蹤時間,而不是取決於樣本大小。這份研究的 165 位對照是依配對條件挑出來的,他們被選進來的機率不是由自然發生率決定的,所以任何以他們為分母的比例都不對應真實世界的任何一個量。83 位病例的多寡只影響精確度;248 這個總數同樣是被拼出來的,而且「沒有記錄追蹤時間」也不是理由——巢式病例對照一樣是病例對照,但因為對照是從一個已定義的世代裡抽的,它反而估得出發生率。決定的是對照怎麼來的,不是資料量。

延伸觀看

Types of Study Designs in Clinical Research Explained & Made Easy
ENThis Is Why with Dr. Busti· 51 min想先把各種設計的地圖建起來的話,這支一次講完。趕時間就跳過,本章第二節有濃縮版。
Principles of Epidemiology 03. Disease Occurrence and Prototype of Study Designs
繁中臺大開放式課程 NTU OCW· 92 min繁中,把設計的原型講得最完整。

素材來源與授權

回報內容問題

這個站的統計內容由 AI 撰寫、AI 互審,人工只做抽查。你看得出來的錯,我們不一定看得出來。

寫得越具體越修得動,例如哪一句話跟哪本教科書/哪篇論文的說法不一致。

留了才回得了信;不留也會看。

一併送出的資訊

這些是自動帶上的,每一項都可以取消。