進階已經雙重審閱,尚未人工抽查

Bland-Altman 分析與一致性界限

兩個測量方法「高度相關」是一句幾乎不含資訊的話。這一頁用 Bland 與 Altman 自己那份血壓資料,先讓相關係數把你說服,再用同一批人的差值圖把界限有多寬攤開來;接著講重複測量該怎麼算(垮掉的是精確度,不是界限)、比例性偏誤怎麼檢查,以及一個 mmHg 尺度的界限該怎麼翻譯成臨床決策。

這一頁要回答的問題

論文的 Results 常常這樣寫:「新方法與參考方法呈高度相關,顯示兩者具有良好的一致性。」前半句是統計,後半句是願望,而且兩句之間沒有任何推論關係。這一頁用的資料會讓那個相關係數看起來完全站得住腳,然後把同一批人的差值攤開來給你看。

一致性(agreement)問的是一件很具體的事:如果我把這個病人的測量方式從 A 換成 B,我拿到的數字會差多少,而那個差值大到會讓我改變處置嗎。 相關係數回答不了它,因為相關係數量的是「兩個方法把病人排出來的順序有多接近」,不是「同一個病人身上兩個讀數差幾個單位」。

讀完這一頁之後,看到一篇方法比較的論文,你應該問得出四個問題:

  1. 偏差有多大、往哪個方向——新方法平均而言比參考方法高還是低,高多少。
  2. 一致性界限有多寬——而且要換算成臨床單位:這個寬度等於幾個「臨床上有意義的差」。
  3. 界限本身有多不確定——界限是估計出來的,它有自己的信賴區間,而重複測量處理錯了,垮的通常是這一項。
  4. 差值會不會隨測量值大小而變——如果會,一組固定的界限就不能套用在整個量程上。

資料:Bland 與 Altman 自己那份血壓資料

本頁用 MethComp::sbp:765 筆讀數,來自 85 位受試者,每位受試者由 3 個方法各測 3 次,單位是 mmHg。這是 Bland 與 Altman 用來示範這套方法的原始教學資料,三個方法的意義如下:

方法代碼是什麼在本站的角色
J人工觀察者 J,水銀血壓計本頁的參照方法
R人工觀察者 R,水銀血壓計留給觀察者間信度那一頁
S半自動血壓機本頁的待測方法

這一頁比的是人工觀察者 J 與半自動機器 S,差值一律定義成 S − J:正值代表機器讀得比人高。可以配成 255 個單次配對,或 85 個「每人三次平均」的配對。

誘導:先看散點圖,再看同一批人的差值

兩個並排的面板,都用同樣 85 位受試者、每人三次讀數的平均值。左邊的面板標題是 A. Correlation -- looks like agreement,橫軸是觀察者 J 的平均收縮壓(mmHg),縱軸是機器 S 的平均收縮壓(mmHg),兩軸尺度相同;資料點散成一條明顯上升的雲,一條虛線畫出等值線(y 等於 x);左上角的圖例印著 r = 0.82、95% 信賴區間 0.73 到 0.88、p < 0.0001、n = 85 subjects,右下角的圖例標示那條虛線是 line of equality。多數資料點落在等值線的上方,也就是機器讀得比人高,但在這個尺度下不明顯。右邊的面板標題是 B. Bland-Altman -- the same 85 subjects,橫軸改成兩個方法的平均值(mmHg),縱軸改成機器 S 減去觀察者 J 的差值(mmHg);一條粗實線畫在偏差 15.6 的位置並標註 bias,兩條虛線畫在 56.7 與 -25.4,分別標註 +1.96 SD 與 -1.96 SD;灰色細線標出零。資料點在兩條虛線之間鋪得很開,上下跨越數十 mmHg,個別受試者的差值最大到 105 mmHg;面板左下角一行字寫著 limits span 82 mmHg。
左:同一批 85 位受試者的散點圖與相關係數,看起來像一致。右:完全相同的資料換成差值對平均值作圖,一致性界限的跨距是 82.1 mmHg。兩張圖沒有任何一個數字不同,只是問了不同的問題。產圖腳本 figures/scripts/B9-03-bland-altman.R

左邊那張圖給出的相關係數是 r = 0.817(95% CI 0.732 到 0.878,p < 0.0001),決定係數 r² = 0.668。用全部 255 個單次配對算則是 0.796。

這個數字沒有任何一篇臨床論文會拒絕稱它為「高度相關」——它的 p 值小到不成問題,區間下界還在 0.73 以上。而它對「這台機器能不能拿來取代人工測量」這個問題,貢獻是零。

這張圖為什麼橫軸放兩者的平均

右邊那張圖的橫軸是兩個方法的平均,不是參考方法。這不是美觀問題:差值與參考方法之間本來就會有人為的負相關(參考方法那一次剛好量偏高時,差值就會被拉低),把差值對參考方法作圖,會憑空生出一條向下的斜率,讓你以為有比例性偏誤。兩者的平均是目前對「真值」最好的近似,它把這個人為關聯攤平掉。

差值圖上的三條線是這樣算的:中間那條是差值的平均,也就是偏差 +15.62 mmHg(95% CI +11.54 到 +19.70);上下兩條是偏差加上與減去 1.96 倍的差值標準差 20.95 mmHg,得到 -25.4 與 +56.7。跨距 82.1 mmHg。

意思是:這台機器換上去之後,個別病人的讀數可能比人工測量低 25 mmHg,也可能高 57 mmHg,而這還是「95% 的人落在裡面」的範圍。

界限有多寬才算寬:三條把它翻譯成臨床的路

界限是一個統計量,「夠不夠好」不是統計問題。要把它變成可以判斷的東西,有三條路,這份資料三條都走得通。

第一條,換算成臨床上有意義的差。 收縮壓上,10 mmHg 是一般認為足以影響處置的量級。界限跨距等於 8.2 個這樣的差。實際看單次配對的分布也是同一個結論:62.7% 的配對差超過 10 mmHg,23.5% 超過兩倍,而單一配對最大差到 109 mmHg。

第二條,看它會不會翻轉決策。 把 140 mmHg 當成分界,用 J 判定為高的有 24 人,用 S 判定為高的有 36 人。逐人比對,共有 14 位(16.5%)僅僅因為換一個量測方法就跨過這條線——其中 13 位是機器判高而人工判不高,1 位反向。切點怎麼決定、切點附近的誤分類要怎麼看,見切點的選擇

第三條,找一個外部的法規錨點。 ISO 81060-2 criterion 1 對非侵入式血壓計的要求是:與參考方法的平均差不超過 5 mmHg,差值標準差不超過 8 mmHg。這份資料的觀測值是平均差 15.62 與標準差 20.95 mmHg,兩項都大幅未達

對照組:同一批人、同一個場合,兩位人工觀察者

這份資料還有第三個方法:另一位人工觀察者 R。把 J 與 R 拿來配對,樣本、場合、統計方法全部不變,只換掉「另一方是誰」:

這一對偏差(mmHg)差值 SD(mmHg)界限(mmHg)界限跨距(mmHg)
機器 S 對觀察者 J(本頁)+15.6220.95-25.4 到 +56.782.1
觀察者 J 對觀察者 R+0.092.26-4.3 到 +4.58.9

兩位人工觀察者之間的絕對一致性 ICC 是 0.997,界限跨距 8.9 mmHg——大約是人與機器那一組的 11%,換句話說機器那一組寬了大約 9 倍。

這個對照排除掉一整類辯解。界限之所以寬,不是因為血壓本來就會跳、不是因為受試者不合作、不是因為 85 個人太少、也不是因為 Bland-Altman 這個方法對誰都嚴苛。同一批人、同一個下午、同一組公式,兩個人拿同一台水銀血壓計互相對照,差值標準差只有 2.26 mmHg。寬的是這台機器。

重複測量:垮掉的是精確度,不是界限

兩個並排的差值對平均值面板,共用同一組座標軸,橫軸都是兩個方法的平均值(mmHg),縱軸都是機器 S 減去觀察者 J 的差值(mmHg)。左邊面板的標題是 A. All 255 pairs treated as independent,標題下兩行小字寫著 SD 20.4、界限 -24.3 到 55.5、span 80 mmHg,以及陰影代表每條界限的 95% 信賴區間、上下各 4.3 mmHg(樣本數被當成 255);面板裡畫出全部 255 個單次配對的點、一條粗實的偏差線、兩條虛線的界限,界限外圍各有一條淺色的水平陰影帶表示信賴區間。右邊面板的標題是 B. Bland and Altman (1999) for replicates,兩行小字寫著 SD 20.9、界限 -25.4 到 56.7、span 82 mmHg,以及陰影是每條界限的 95% 信賴區間、上下各 6.6 mmHg(n = 85 位受試者);畫的是 85 個每人平均的點。兩張圖的虛線界限位置幾乎重疊,肉眼幾乎分不出高低;差別在陰影帶:右邊那兩條陰影帶明顯比左邊厚。右邊面板另外用點狀線畫出第三組界限(只用每人平均的差、不做修正),它們明顯落在虛線界限的內側,左上角圖例標明那組界限窄了 10%。
同一份資料的三組一致性界限。左右兩張的虛線位置幾乎相同(跨距差 2.8%),差別在陰影帶的厚度——把 85 位受試者當成 255 個獨立觀測,界限的信賴區間會窄 35%。右圖的點狀線是只用每人平均的差、不做修正的版本,那一組才是真的偏窄。產圖腳本 figures/scripts/B9-03-bland-altman.R

每位受試者被各測了 3 次,所以「有幾個觀測值」這個問題有三種答法,而三種答法給出三組不同的界限:

做法n差值 SD界限跨距界限的 95% CI 半寬
A. 255 個配對全部當成獨立觀測25520.37-24.3 到 +55.579.84.30
B. 只用每人平均的差,不做修正8518.93-21.5 到 +52.774.27.01
C. Bland 與 Altman 1999 的重複測量修正8520.95-25.4 到 +56.782.16.60

單位都是 mmHg。C 是本頁採用的做法。三橫列擺在一起,結論與多數人的直覺不一樣:

把 255 個配對全部當成獨立觀測,界限本身幾乎沒有動。 跨距 79.84 對上正確的 82.12,只窄了 2.77%,換算成絕對值是 2.28 mmHg。畫出來的圖,兩條虛線的位置肉眼分不出來。

垮掉的是界限的精確度。 界限的 95% 信賴區間從正確的上下各 6.60 mmHg,縮成上下各 4.30 mmHg,窄了 34.9%。原因很直接:有效樣本數被灌水 3 倍——資料裡只有 85 個獨立的人,卻按 255 個獨立觀測去算標準誤。

真正嚴重偏窄的是第三種做法。 只用每人 3 次的平均去算差值、然後不做任何修正,跨距是 74.22 mmHg,窄了 9.62%,少掉 7.90 mmHg。這才是 Bland 與 Altman 1999 那篇的第 5.2 節在警告的東西:平均會把每個方法自己的測量誤差壓小,於是你報出來的界限描述的是「三次平均對三次平均」,而臨床上每個病人只會被量一次。

為什麼界限沒有跟著垮

因為 J 與 S 是同時讀同一位受試者的。那一瞬間血壓真正的高低,兩個方法共享,於是它在同一次的差值裡被減掉了。差值的變異因此已經幾乎不含「這個人這一刻血壓在哪裡」的成分,重複三次也不會憑空多出來——把它們當成獨立觀測,估到的 SD 自然與正確答案接近。

正確的做法是把差值的變異拆開再組回去。以 mm 表示每人的重複次數、dˉ\bar d 表示每人的平均差值、sw2s_w^2 表示各方法自己的組內變異:

sd2  =  var(dˉ)  +  (11m)sw,ref2  +  (11m)sw,test2s_d^2 \;=\; \operatorname{var}(\bar d) \;+\; \left(1 - \frac{1}{m}\right) s_{w,\text{ref}}^2 \;+\; \left(1 - \frac{1}{m}\right) s_{w,\text{test}}^2

代進這份資料:mm 是 3,修正係數 0.667;每人平均差值的標準差 18.93 mmHg;觀察者 J 自己重複三次的組內標準差 6.12 mmHg,機器 S 是 9.12 mmHg(各自 170 個自由度)。組回去得到 20.95 mmHg,就是上表 C 那一橫列。

順帶注意兩個組內標準差的大小關係:機器自己重複三次的變異比人工還大(9.12 對 6.12 mmHg)。一台號稱能消除觀察者誤差的裝置,在自身再現性上並沒有比人穩。

比例性偏誤:檢查過,未偵測到

兩個並排的散點面板,各附一條迴歸線與其信賴帶。左邊面板的標題是 A. Difference against magnitude,橫軸是兩個方法的平均值(mmHg),縱軸是機器 S 減去觀察者 J 的差值(mmHg),標題下方一行小字寫著斜率 +0.036 mmHg per mmHg、95% 信賴區間 −0.103 到 +0.174、p = 0.610;圖上有 85 個資料點、一條灰色的零線、一條粗的擬合線與淺色信賴帶,擬合線幾乎水平;面板左上角一行字寫著 the fitted line is flat: no proportional bias detected。右邊面板的標題是 B. Same check on the log scale,橫軸是兩個方法對數測量值的平均(log mmHg),縱軸是 log(機器 S) 減 log(觀察者 J),小字寫著斜率 −0.064、95% 信賴區間 −0.196 到 +0.068、p = 0.338;同樣有資料點、零線、幾乎水平的擬合線與信賴帶,另外兩條虛線畫出對數尺度的一致性界限並標註 +1.96 SD 等於比值 1.49、-1.96 SD 等於比值 0.85;面板左上角一行字寫著機器平均讀高 12.6%。
把差值對平均值迴歸,看差值會不會隨測量值大小而變。左:原尺度,斜率 +0.036 mmHg per mmHg,p = 0.610。右:同一個檢查放到對數尺度,界限改以比值呈現。兩邊都未偵測到比例性偏誤。產圖腳本 figures/scripts/B9-03-bland-altman.R

一組固定的界限有一個隱含前提:差值的大小與測量值的大小無關。血壓高的人差得比較多,就不成立——這時候一條界限套整個量程,會在低端過寬、在高端過窄。

檢查方式是把差值對平均值做線性迴歸,看斜率。這份資料上,以每人平均計算的斜率是 +0.0356 mmHg/mmHg(95% CI −0.1028 到 +0.1739,p = 0.610);換成全部 255 個單次配對是 +0.0514(p = 0.226)。點估計的意思是測量值每上升 10 mmHg,差值變動 +0.36 mmHg——與 10 mmHg 這個量級相比可以忽略。

所以本頁的結論是:在這份資料裡未偵測到比例性偏誤,界限就用一組固定的數字報。

右邊那個面板示範另一種常見做法:兩邊取對數再做同樣的事。這在差值隨測量值成比例放大時是標準處理,好處是界限會以比值而不是絕對量回來。這份資料上取完對數斜率是 −0.0640(p = 0.338),一樣未偵測到趨勢;對數尺度的結果換算回來是:機器平均讀高 12.6%,界限為比值 0.851 到 1.491,也就是 -14.9% 到 +49.1%。

動手跑一次

data(sbp, package = "MethComp")

# 資料是長格式:meth(J/R/S)、item(受試者)、repl(第幾次)、y(mmHg)。
# 先確認每個 (meth, item, repl) 只有一列,否則下面的 reshape 會靜默地取到
# 第一筆而不報錯——這一行是承重的,不是裝飾。
stopifnot(!anyDuplicated(sbp[c("meth", "item", "repl")]))

w <- reshape(sbp[sbp$meth %in% c("J", "S"), ],
             direction = "wide", idvar = c("item", "repl"),
             timevar = "meth")
w$diff <- w$y.S - w$y.J          # 差值定義:機器減人工
w$avg  <- (w$y.S + w$y.J) / 2

# 每人的平均(85 位受試者)
m <- aggregate(cbind(diff, avg, y.J, y.S) ~ item, data = w, FUN = mean)

# 1. 誘導:相關係數。高,而且與一致性無關。
cor.test(m$y.J, m$y.S)

# 2. 一致性界限,Bland & Altman (1999) 的重複測量修正。
#    直接對 255 個配對算 sd(w$diff) 會把 85 個人當成 255 個獨立觀測:
#    界限本身只窄百分之幾,但界限的信賴區間會窄三分之一。
mm <- 3
within_var <- function(v) {
  # 每個方法自己的組內變異:各受試者的變異數,用自由度加權平均
  a <- aggregate(v ~ item, data = w, FUN = function(x) c(var(x), length(x) - 1))
  sum(a$v[, 1] * a$v[, 2]) / sum(a$v[, 2])
}
n      <- nrow(m)
df_w   <- n * (mm - 1)
k      <- 1 - 1 / mm
vJ     <- within_var(w$y.J)
vS     <- within_var(w$y.S)
v_dbar <- var(m$diff)
s2     <- v_dbar + k * (vJ + vS)
bias   <- mean(m$diff)
z      <- qnorm(0.975)
loa    <- bias + c(-1, 1) * z * sqrt(s2)

# 3. 界限的信賴區間。s2 是三個獨立成分加起來的,它的變異數也就是三份
#    Var(s2) = 2 s2^2 / df 加起來;界限的變異數再由
#    Var(LoA) = Var(bias) + z^2 * Var(s) 組出來,其中 Var(s) = Var(s2) / (4 s2)。
#    課本上那條 sqrt(s2 * (1/n + z^2 / (2(n-1)))) 只在「所有觀測獨立」時成立,
#    這裡不成立:套下去界限的區間會比上表寬大約一個 mmHg。分母是受試者數,
#    不是配對數。
var_s2 <- 2 * v_dbar^2 / (n - 1) + k^2 * 2 * vJ^2 / df_w + k^2 * 2 * vS^2 / df_w
se     <- sqrt(v_dbar / n + z^2 * var_s2 / (4 * s2))
tq     <- qt(0.975, n - 1)
rbind(lower = loa[1] + c(-1, 1) * tq * se,
      upper = loa[2] + c(-1, 1) * tq * se)

# 4. 比例性偏誤:差值對平均值迴歸。橫軸必須是兩者的平均,
#    對參考方法作圖會憑空生出一條向下的斜率。
summary(lm(diff ~ avg, data = m))

# 5. 對數尺度版:界限回來時是比值,不是 mmHg。跟第 4 步一樣跑在每人平均上——
#    跑在 255 個單次配對會得到另一個斜率,那不是上表報的那個數字。
lm(log(y.S) - log(y.J) ~ I((log(y.S) + log(y.J)) / 2), data = m)

# 匯出給下面的 Python 用
write.csv(sbp, "sbp.csv", row.names = FALSE)

驗證環境:R 4.6.0 + MethComp 1.30.2。MethComp 只用來取資料,所有計算都是 base R——這一頁的重點是公式看得見。

怎麼讀報表

一篇方法比較的論文,Results 通常給你一張 Bland-Altman 圖加一段文字。六個位置值得逐一確認:

  1. 差值的方向寫清楚了嗎。 「A 減 B」與「B 減 A」的偏差正負號相反。圖的縱軸標籤應該寫得出是誰減誰;只寫 “difference” 的圖沒辦法被引用。
  2. 界限有沒有附信賴區間。 界限是估計值。本頁的上界是 +56.7,它的 95% CI 一路到 +63.3——若作者要主張「界限落在可接受範圍」,要看的是區間的外緣,不是點估計。
  3. 重複測量怎麼處理的。 有重複而 n 報成配對數(本頁的話是 255 而不是 85),那篇的界限信賴區間偏窄;只用每人平均而不修正的,界限本身就偏窄。Methods 沒交代的,兩種都有可能。
  4. 比例性偏誤檢查了嗎,怎麼檢查的。 應該看得到「差值對兩者平均」的迴歸斜率。若是對參考方法迴歸的,那條斜率不能信。
  5. 有沒有給臨床上可接受的差,而且是事先給的。 沒有這個數字,「界限可接受」就只是作者的感想。最好的版本是引用外部標準,像本頁的 ISO 81060-2 criterion 1。
  6. 樣本涵蓋的量程夠不夠。 界限只能外推到有資料的範圍。血壓集中在正常區間的一群人,說不出這台機器在 140 mmHg 以上準不準。

常見誤用

誤用為什麼錯
用相關係數或 R² 論證一致性它量的是排序關聯,而且會隨受試者的離散程度上升;整體偏移 16 mmHg 也完全不影響它
用配對 t 檢定「證明兩法無差異」檢定的是平均差是不是零,對個別病人的差值分散度隻字未提;不顯著更常見的原因是樣本不足
把差值對參考方法作圖參考方法的測量誤差同時進到橫軸與縱軸,會憑空生出一條向下的斜率
有重複測量,卻把配對全當獨立本頁的界限只窄 2.8%,但界限的信賴區間窄 35%,而「界限可接受」這個主張靠的正是區間
只用每人平均的差、不做修正平均壓小了各方法自己的測量誤差,本頁因此少報 7.9 mmHg 的跨距,而臨床上每個病人只量一次
報了界限,但沒有事先訂可接受的差界限是統計量,「夠不夠好」要靠外部標準或臨床閾值才能判斷
比例性偏誤不顯著就寫成「差值與測量值無關」未偵測到不等於不存在;本頁斜率的區間仍容納量程兩端 10 到 17 mmHg 的傾斜
把界限外推到資料沒涵蓋的量程界限描述的是被測到的那個範圍,換一群人要重估
界限很寬,卻結論「可互換,建議臨床採用」本頁跨距 82 mmHg,等於 8.2 個臨床有意義的差,且 16.5% 的人會跨過 140 mmHg
拿 ICC 當一致性的證據ICC 是比值,分母含受試者之間的變異;同一台裝置在離散度大的族群會拿到漂亮的 ICC

這一頁與其他頁的關係

  • 同一份資料的信度那一面——見組內相關係數(ICC)。那一頁用的是本頁刻意避開的 J 對 R,兩頁合起來就是「一致性」與「信度」是同一批數字上的兩個不同問題。
  • 類別變項的一致性——見Kappa 與加權 Kappa。結果是類別而不是連續量時,差值沒有意義,換一套工具。
  • 測量誤差的下游後果——見測量誤差。本頁量到的差值分散度,就是那一頁在講的東西進到迴歸之前的樣子。
  • 差值對平均值的那條迴歸——見線性迴歸。比例性偏誤的檢查只是把它用在一個特別的 xy 上。
  • 重複測量的相依結構——見叢集資料。本頁的修正公式是那一頁變異數分解的一個特例。
  • 切點與決策翻轉——見切點的選擇。本頁第二條翻譯路徑用的就是那一頁的框架。
  • 臨床脈絡——見設計章 診斷準確度研究

重跑本頁的所有數字

/opt/homebrew/bin/Rscript figures/scripts/B9-03-bland-altman.R

讀讀看這張圖

答案取自產生本頁圖表的同一份統計輸出,不是另外打上去的。

機器 S 與觀察者 J 量同一批人的收縮壓,相關係數是 0.817(95% CI 0.732 到 0.878)。這個數字能不能支持「機器可以取代人工測量」?

看答案與解析

正確答案: 不能。同一批人的差值攤開之後,一致性界限跨了 82.1 mmHg

相關係數量的是兩組數字有沒有一起上下起伏,不是有沒有量出同一個數字:把機器整體加上一個常數,相關係數完全不動,一致性卻整個變了。同一批人的差值攤開之後,界限跨了 82.1 mmHg,換上這台機器,個別病人的讀數可能比人工低二十幾、也可能高五十幾 mmHg。15.6 mmHg 是平均差,它只說系統性偏高多少,說不出個別病人可以差多遠;6.1 mmHg 是觀察者 J 自己重複三次的組內標準差,那是方法內部的再現性。何況一個沒有單位的相關係數,本來就不能拿去跟 mmHg 比大小。

差值圖上,中間那條線畫在差值的平均 15.62 mmHg,而差值標準差是 20.95 mmHg。上面那條線在哪裡,它的意思是什麼?

看答案與解析

正確答案: 在 56.68,它與下面那條線之間涵蓋 95% 的個別差值

上面那條線是平均差加上約兩個差值標準差,也就是 56.68,個別差值有 95% 落在上下兩條線之間。19.70 是平均差本身的信賴區間上界——那是「平均偏高多少」這個估計有多準,樣本一大就會縮得很窄,把它當界限報等於宣稱機器與人工幾乎沒有差別。63.28 是界限自己的信賴區間上界,它回答的是「這條界限的位置有多不確定」,該一起附上,但界限本身仍然是 56.68。三個數字都印在同一張圖上,混起來的後果是拿一個描述平均值的區間,去回答一個關於個別病人的問題。

每位受試者被各測了三次。把 255 個配對全部當成獨立觀測,界限跨距是 79.84 mmHg;用針對重複測量的正確做法則是 82.12 mmHg。把重複當獨立,真正付出的代價是什麼?

看答案與解析

正確答案: 界限的 95% 信賴區間半寬被算成 4.30 mmHg,比正確值窄,因為有效樣本數被灌水

界限本身幾乎沒動——79.84 對 82.12——因為兩個方法是同時測同一個人的,那一瞬間血壓的高低在差值裡被減掉了。垮掉的是界限的精確度:信賴區間半寬從正確的 6.60 mmHg 縮成 4.30 mmHg,因為資料裡只有八十五個獨立的人,卻按 255 個獨立觀測去算標準誤。74.22 mmHg 才是真正嚴重偏窄的那一組,但它來自另一種做法——只用每人三次的平均算差值又不做修正,那描述的是「三次平均對三次平均」,而臨床上每個病人只會被量一次。把信賴區間算窄的方向是假裝比較確定,等於把一個沒過關的裝置往過關的方向推。

把差值對兩者平均做迴歸,以每人平均計算的斜率是 0.0356 mmHg/mmHg,95% CI -0.1028 到 0.1739,p = 0.610。可以寫什麼?

看答案與解析

正確答案: 區間上界 0.1739 乘上這份資料一百多 mmHg 的量程仍然不小,所以只能寫未偵測到趨勢

檢定不顯著最常見的原因是樣本不夠,不是效應是零。斜率的區間上界 0.1739 mmHg/mmHg 乘上這份資料一百多 mmHg 的量程,等於「界限在量程兩端相差十幾 mmHg」也與資料相容——那不是一個小到可以宣告不存在的範圍。所以正確的句子是「未偵測到差值隨測量值變化的趨勢」,不是「差值與測量值無關」;後者要主張,得先設定等值界限。0.6104 是 p 值,未偵測到不等於不存在;0.0514 是換成全部單次配對的斜率,兩個估計都很平、方向一致,那是互相佐證,不是失效。

以 140 mmHg 當分界,85 個人裡用觀察者 J 判定為高的有 24 人,用機器 S 判定為高的有 36 人。這對「機器能不能取代人工」說了什麼?

看答案與解析

正確答案: 逐人比對有 14 位僅僅因為換一個量測方法就跨過那條線

比總數看不出問題,逐人比對才發現有 14 位僅僅因為換一個量測方法就跨過 140 mmHg,其中 13 位是機器判高而人工判不高、1 位反向。13 是那個單向的人數,不是兩種方法判為高的人數差;24 是人工判為高的人數,而機器多判出來的人是不是真的高血壓,這份資料沒有第三方參考標準可以回答——它只能告訴你換方法會讓誰跨線。所以要把界限翻譯成臨床,就問它會不會翻轉決策,而不是只看平均差。

同一批人、同一個下午,換掉的只有「另一方是誰」:兩位人工觀察者互相對照,單次讀數的差值標準差只有 2.26 mmHg。這個對照排除了什麼?

看答案與解析

正確答案: 兩位觀察者的界限跨距是 8.86 mmHg,所以機器那一組的寬界限不能推給血壓本來就會跳,也不能推給人數太少或方法太嚴苛

同一批人、同一個下午、同一組公式,換掉的只有另一方是誰。兩位人工觀察者的單次讀數界限跨距是 8.86 mmHg,所以機器那一組的寬界限不是血壓會跳、不是受試者不合作、也不是這個方法對誰都嚴苛——寬的是那台機器。30.63 mmHg 是受試者平均值的標準差,描述的是被量的這群人彼此差多少,不是任何一組界限。5.24 mmHg 是用每人三次平均算出來的界限,平均會把每個方法自己的測量誤差壓小,而臨床上每個病人只會被量一次,所以要引的是單次讀數那一組。

素材來源與授權

本頁為原創內容

回報內容問題

這個站的統計內容由 AI 撰寫、AI 互審,人工只做抽查。你看得出來的錯,我們不一定看得出來。

寫得越具體越修得動,例如哪一句話跟哪本教科書/哪篇論文的說法不一致。

留了才回得了信;不留也會看。

一併送出的資訊

這些是自動帶上的,每一項都可以取消。