Lemma

第4章区間推定と仮説検定

目安 8〜11 時間定理など 9演習 7 問
ここまでの道

この章の目標

  • 正規平均・母比率・母分散の信頼区間を構成し、「95% 信頼区間」の意味を正しく説明できる
  • 検定の枠組み(帰無仮説・対立仮説・2 種類の過誤・有意水準・検出力)を理解し、pp 値が帰無仮説のもとで一様分布に従うことを証明できる
  • ネイマン–ピアソンの補題を証明し、尤度比検定とウィルクスの定理の意味を説明できる
  • tt 検定(1 標本・対応のある場合・2 標本)を等分散の仮定の扱いも含めて使い分け、χ2\chi^2 検定を使える
  • 検定と信頼区間の双対性を証明し、効果量と信頼区間で結果を報告できる
  • pp 値と有意性についての典型的な誤解を指摘できる

前提:第2章、第3章。4.7 節では第1章の多変量正規分布と多次元の中心極限定理を使う。

第1章の冒頭の A/B テスト(1 万人ずつの訪問者のうち、購入者は A が 210 人、B が 240 人)では、真の購入率が等しくても 0.3 ポイント程度の差は珍しくないことを見た。では、このデータから何がどこまで言えるのか。本章では、未知のパラメータがありそうな範囲を示す区間推定と、仮説がデータと両立するかを判定する仮説検定を学ぶ。

どちらも実務で日常的に使われるが、「p<0.05p < 0.05 なら効果あり、そうでなければ効果なし」という誤った使い方も多い。本章では、定理の仮定と、結論として言えることの範囲を正確に押さえる。上側 α\alpha 点 zαz_\alpha, tα(k)t_\alpha(k), χα2(k)\chi^2_\alpha(k) は第1章・第2章のとおりとする(z0.025=1.960z_{0.025} = 1.960 など)。

4.1 信頼区間

定義 4.1(信頼区間, confidence interval)0<α<10 < \alpha < 1 とする。統計量 L(X)≤U(X)L(X) \leq U(X) が、すべての θ∈Θ\theta \in \Theta について

Pθ(L(X)≤g(θ)≤U(X))≥1−αP_\theta\bigl(L(X) \leq g(\theta) \leq U(X)\bigr) \geq 1 - \alpha

を満たすとき、[L(X),U(X)][L(X), U(X)] を g(θ)g(\theta) の信頼係数 1−α1 - \alpha の信頼区間という。左辺を被覆確率 (coverage probability) という。被覆確率が各 θ\theta で n→∞n \to \infty のとき 1−α1 - \alpha に収束するものを漸近的な信頼区間という。

信頼区間は、分布が θ\theta によらない θ\theta とデータの関数(枢軸量, pivot)から作るのが基本である。

定理 4.2(正規母集団の信頼区間)X1,…,XnX_1, \dots, X_n(n≥2n \geq 2)を N(μ,σ2)N(\mu, \sigma^2) からの i.i.d. とする。次の区間の被覆確率はちょうど 1−α1 - \alpha である。

  1. σ\sigma が既知のとき、μ\mu について Xˉ±zα/2σ/n\bar{X} \pm z_{\alpha/2}\sigma/\sqrt{n}。
  2. μ\mu について Xˉ±tα/2(n−1)S/n\bar{X} \pm t_{\alpha/2}(n-1)S/\sqrt{n}。
  3. σ2\sigma^2 について [(n−1)S2/χα/22(n−1), (n−1)S2/χ1−α/22(n−1)]\bigl[(n-1)S^2/\chi^2_{\alpha/2}(n-1),\ (n-1)S^2/\chi^2_{1-\alpha/2}(n-1)\bigr]。

証明. 第2章の正規標本の基本定理(定理 2.8)と tt 統計量の分布(系 2.12)より、Z=n(Xˉ−μ)/σ∼N(0,1)Z = \sqrt{n}(\bar{X} - \mu)/\sigma \sim N(0, 1)、T=n(Xˉ−μ)/S∼t(n−1)T = \sqrt{n}(\bar{X} - \mu)/S \sim t(n-1)、V=(n−1)S2/σ2∼χ2(n−1)V = (n-1)S^2/\sigma^2 \sim \chi^2(n-1) で、どの分布も (μ,σ2)(\mu, \sigma^2) によらない。2 の区間が μ\mu を含むことは ∣T∣≤tα/2(n−1)\lvert T \rvert \leq t_{\alpha/2}(n-1) と同値で、tt 分布は 00 について対称な連続分布だから、その確率は 1−α1 - \alpha。1 も同様である。3 の区間が σ2\sigma^2 を含むことは χ1−α/22(n−1)≤V≤χα/22(n−1)\chi^2_{1-\alpha/2}(n-1) \leq V \leq \chi^2_{\alpha/2}(n-1) と同値で、その確率は 1−α1 - \alpha。□\square

例 4.3(配送時間)新しい配送ルートで所要時間(分)を 10 回測り、52, 47, 55, 61, 49, 58, 53, 50, 57, 54 を得た。xˉ=53.6\bar{x} = 53.6、∑i(xi−xˉ)2=168.4\sum_i (x_i - \bar{x})^2 = 168.4、s=4.326s = 4.326、標準誤差 s/10=1.368s/\sqrt{10} = 1.368 で、t0.025(9)=2.262t_{0.025}(9) = 2.262 より平均所要時間 μ\mu の 95% 信頼区間は 53.6±3.09=[50.51,56.69]53.6 \pm 3.09 = [50.51, 56.69]。σ2\sigma^2 の 95% 信頼区間は [168.4/19.023,168.4/2.700]=[8.85,62.36][168.4/19.023, 168.4/2.700] = [8.85, 62.36]、平方根をとって σ\sigma については [2.98,7.90][2.98, 7.90] である。10 個のデータでは、ばらつきの大きさはほとんど絞り込めない。

注意

「μ\mu が [50.51,56.69][50.51, 56.69] に入る確率は 95%」は誤りである。μ\mu は定数なので、計算済みの区間は μ\mu を含むか含まないかのどちらかである。95% は区間を作る手続きの性質であり、データを取り直して区間を作ることを繰り返せば、そのうち約 95% が μ\mu を含む、という意味である。データを見た後の μ\mu についての確率を語りたいなら、μ\mu を確率変数とみるベイズ統計の信用区間(第7章)を使う。

例 4.4(正規性が崩れると)定理 4.2 は正規母集団を仮定している。正規でない母集団で名目 95% の区間の被覆確率を各 20 万回のシミュレーションで調べると、次のようになった。

母集団と区間 n=10n = 10 n=30n = 30 n=100n = 100
正規分布・μ\mu の tt 区間 0.950 0.950 0.949
指数分布・μ\mu の tt 区間 0.900 0.928 0.942
対数正規分布 eN(0,1)e^{N(0, 1)}・μ\mu の tt 区間 0.839 0.884 0.916
指数分布・σ2\sigma^2 の区間 0.766 0.716 0.690

tt 区間は中心極限定理により nn とともに 95% に近づくが、歪んだ分布では遅い。分散の区間は nn を増やしても良くならない。n(S2−σ2)\sqrt{n}(S^2 - \sigma^2) の漸近分散は 4 次の中心モーメント μ4\mu_4 を使って μ4−σ4\mu_4 - \sigma^4 であり、正規分布では 2σ42\sigma^4 だが、指数分布では 8σ48\sigma^4 になる。区間は正規分布を前提に半分の標準偏差で作られているので、被覆確率は P(∣Z∣≤1.96/2)=0.673P(\lvert Z \rvert \leq 1.96/2) = 0.673 に近づく。

命題 4.5(母比率の信頼区間)X1,…,XnX_1, \dots, X_n を B(1,p)B(1, p)(0<p<10 < p < 1)からの i.i.d.、p^=Xˉ\hat{p} = \bar{X}、z=zα/2z = z_{\alpha/2} とする。次はいずれも pp の漸近的な信頼係数 1−α1 - \alpha の信頼区間である。

  1. (ワルド区間)p^±zp^(1−p^)/n\hat{p} \pm z\sqrt{\hat{p}(1 - \hat{p})/n}
  2. (ウィルソン区間){p′∈[0,1]∣∣p^−p′∣≤zp′(1−p′)/n}\lbrace p' \in [0, 1] \mid \lvert \hat{p} - p' \rvert \leq z\sqrt{p'(1 - p')/n} \rbrace。これは中心 p^+z2/(2n)1+z2/n\frac{\hat{p} + z^2/(2n)}{1 + z^2/n}、半幅 z1+z2/np^(1−p^)n+z24n2\frac{z}{1 + z^2/n}\sqrt{\frac{\hat{p}(1 - \hat{p})}{n} + \frac{z^2}{4n^2}} の区間である。

証明. 中心極限定理より Zn=n(p^−p)/p(1−p)→dN(0,1)Z_n = \sqrt{n}(\hat{p} - p)/\sqrt{p(1-p)} \xrightarrow{d} N(0, 1)。2 の集合が pp を含むことは ∣Zn∣≤z\lvert Z_n \rvert \leq z と同値なので、被覆確率は P(∣Z∣≤z)=1−αP(\lvert Z \rvert \leq z) = 1 - \alpha に収束する。1 では、大数の法則より p^→Pp\hat{p} \xrightarrow{P} p なので p(1−p)/(p^(1−p^))→P1\sqrt{p(1-p)/(\hat{p}(1 - \hat{p}))} \xrightarrow{P} 1(p^∈{0,1}\hat{p} \in \lbrace 0, 1 \rbrace となる確率は 00 に近づく)で、スルツキーの定理より n(p^−p)/p^(1−p^)→dN(0,1)\sqrt{n}(\hat{p} - p)/\sqrt{\hat{p}(1 - \hat{p})} \xrightarrow{d} N(0, 1)。2 の区間の形は、不等式を 2 乗した (1+z2/n)p′2−(2p^+z2/n)p′+p^2≤0(1 + z^2/n)p'^2 - (2\hat{p} + z^2/n)p' + \hat{p}^2 \leq 0 を解けば得られる(判別式の 4 分の 1 は z2p^(1−p^)/n+z4/(4n2)z^2\hat{p}(1 - \hat{p})/n + z^4/(4n^2))。□\square

例 4.6(不良品が少ないとき)50 個中 2 個が不良(p^=0.04\hat{p} = 0.04)なら、ワルド区間は [−0.014,0.094][-0.014, 0.094] と負の値を含み、ウィルソン区間は [0.011,0.135][0.011, 0.135] である。真の不良率が p=0.04p = 0.04、n=50n = 50 のとき、二項分布で正確に計算した被覆確率は、ワルド区間が 0.8670.867、ウィルソン区間が 0.9510.951 である。npnp が小さいとき、ワルド区間は信頼係数を大きく下回る。極端なのは不良が 0 個のときで、ワルド区間は 1 点 {0}\lbrace 0 \rbrace につぶれ、p>0p > 0 を決して含まない(ウィルソン区間は [0,z2/(n+z2)][0, z^2/(n + z^2)] で、n=50n = 50 なら [0,0.071][0, 0.071] である)。したがって nn を固定して p→0p \to 0 とすると、ワルド区間の被覆確率は 1−P(p^=0)=1−(1−p)n1 - P(\hat{p} = 0) = 1 - (1 - p)^n 以下なので 00 に近づく。命題 4.5 の「漸近的」は各 pp ごとの収束であって、pp について一様ではない。

4.2 仮説検定の枠組み

検定では、パラメータ空間を Θ0\Theta_0 と Θ1\Theta_1 に分け、帰無仮説 (null hypothesis) H0 ⁣:θ∈Θ0H_0\colon \theta \in \Theta_0 と対立仮説 (alternative hypothesis) H1 ⁣:θ∈Θ1H_1\colon \theta \in \Theta_1 を立てる。データ xx を見て H0H_0 を棄却するかどうかを決める規則を検定といい、理論のためには、xx を見たときに H0H_0 を棄却する確率 ϕ(x)∈[0,1]\phi(x) \in [0, 1] で検定を表す(ϕ\phi が 00 か 11 だけをとるとき、ϕ=1\phi = 1 となる集合を棄却域という)。

定義 4.7 検定 ϕ\phi について、πϕ(θ)=Eθ[ϕ(X)]\pi_\phi(\theta) = E_\theta[\phi(X)] を検出力関数 (power function) という。

  1. H0H_0 が正しい(θ∈Θ0\theta \in \Theta_0)のに棄却する誤りを第 1 種の過誤 (type I error)、H1H_1 が正しい(θ∈Θ1\theta \in \Theta_1)のに棄却しない誤りを第 2 種の過誤 (type II error) という。その確率は πϕ(θ)\pi_\phi(\theta) と 1−πϕ(θ)1 - \pi_\phi(\theta) である。
  2. sup⁡θ∈Θ0πϕ(θ)≤α\sup_{\theta \in \Theta_0}\pi_\phi(\theta) \leq \alpha のとき、ϕ\phi を有意水準 (significance level) α\alpha の検定という。θ∈Θ1\theta \in \Theta_1 での πϕ(θ)\pi_\phi(\theta) を検出力 (power) という。

2 種類の過誤は同時には小さくできないので、第 1 種の過誤の確率を α\alpha 以下に抑えたうえで検出力を大きくする。H0H_0 と H1H_1 は対称ではなく、「棄却しない」ことは「H0H_0 が正しいと示された」ことを意味しない。

例 4.8(片側 zz 検定と検出力)σ\sigma が既知の N(μ,σ2)N(\mu, \sigma^2) からの標本で、H0 ⁣:μ≤μ0H_0\colon \mu \leq \mu_0、H1 ⁣:μ>μ0H_1\colon \mu > \mu_0 とし、Z=n(Xˉ−μ0)/σ>zαZ = \sqrt{n}(\bar{X} - \mu_0)/\sigma > z_\alpha のとき棄却する。n(Xˉ−μ)/σ∼N(0,1)\sqrt{n}(\bar{X} - \mu)/\sigma \sim N(0, 1) より

π(μ)=Pμ(Z>zα)=1−Φ(zα−n(μ−μ0)σ)\pi(\mu) = P_\mu(Z > z_\alpha) = 1 - \Phi\Bigl(z_\alpha - \frac{\sqrt{n}(\mu - \mu_0)}{\sigma}\Bigr)

は μ\mu について増加で π(μ0)=α\pi(\mu_0) = \alpha だから、有意水準 α\alpha の検定である。μ=μ0+δ\mu = \mu_0 + \delta での検出力を 1−β1 - \beta 以上にするには nδ/σ≥zα+zβ\sqrt{n}\delta/\sigma \geq z_\alpha + z_\beta、すなわち n≥((zα+zβ)σ/δ)2n \geq ((z_\alpha + z_\beta)\sigma/\delta)^2 が必要である(δ=0.2σ\delta = 0.2\sigma、α=0.05\alpha = 0.05、検出力 0.80.8 なら n≥155n \geq 155)。標本の大きさの設計は第8章で扱う。

4.3 pp 値

定義 4.9(pp 値, p-value)値が大きいほど H0H_0 に不利な検定統計量 TT を考える。単純な帰無仮説 H0 ⁣:θ=θ0H_0\colon \theta = \theta_0 について、観測値 t=T(x)t = T(x) に対する p(x)=Pθ0(T(X)≥t)p(x) = P_{\theta_0}(T(X) \geq t) を pp 値という。複合仮説では sup⁡θ∈Θ0Pθ(T(X)≥t)\sup_{\theta \in \Theta_0}P_\theta(T(X) \geq t) とする。

pp 値は「H0H_0 が正しいとしたとき、観測されたものと同じかそれ以上に極端な値が出る確率」である。両側検定では T=∣Z∣T = \lvert Z \rvert などとすればよい。

定理 4.10(pp 値の分布)H0 ⁣:θ=θ0H_0\colon \theta = \theta_0 のもとで次が成り立つ。

  1. TT の分布関数 FF が連続ならば、p(X)p(X) は一様分布 U(0,1)U(0, 1) に従う。
  2. 一般に、すべての u∈[0,1]u \in [0, 1] について Pθ0(p(X)≤u)≤uP_{\theta_0}(p(X) \leq u) \leq u。

したがって「p(X)≤αp(X) \leq \alpha なら棄却する」検定は有意水準 α\alpha の検定である。

証明. G(t)=Pθ0(T≥t)G(t) = P_{\theta_0}(T \geq t) とおくと p(X)=G(T)p(X) = G(T) で、GG は単調非増加である。1. FF が連続なら P(T=t)=0P(T = t) = 0 なので G(t)=1−F(t)G(t) = 1 - F(t)、p(X)=1−F(T)p(X) = 1 - F(T)。第2章の確率積分変換(命題 2.19 の 3)より F(T)∼U(0,1)F(T) \sim U(0, 1) なので、1−F(T)∼U(0,1)1 - F(T) \sim U(0, 1)。2. A={t∣G(t)≤u}A = \lbrace t \mid G(t) \leq u \rbrace とおくと、GG が非増加なので、t∈At \in A かつ t′>tt' > t なら t′∈At' \in A である。A=∅A = \emptyset なら P(G(T)≤u)=0P(G(T) \leq u) = 0。A=RA = \mathbb{R} なら t→−∞t \to -\infty で G(t)→1G(t) \to 1 より u=1u = 1 で、主張は自明である。それ以外では s=inf⁡As = \inf A は実数で、s∈As \in A なら {G(T)≤u}={T≥s}\lbrace G(T) \leq u \rbrace = \lbrace T \geq s \rbrace の確率は G(s)≤uG(s) \leq u。s∉As \notin A なら {G(T)≤u}={T>s}\lbrace G(T) \leq u \rbrace = \lbrace T > s \rbrace の確率は lim⁡t→s+0G(t)≤u\lim_{t \to s + 0}G(t) \leq u である。□\square

次のコードは、N(μ,1)N(\mu, 1) からの n=20n = 20 の標本で H0 ⁣:μ=0H_0\colon \mu = 0 を両側 zz 検定することを 10 万回繰り返し、pp 値を 0.10.1 刻みの区間に分けた割合を表示する。

import math
import numpy as np

rng = np.random.default_rng(0)
n, reps = 20, 100_000

def p_values(mu):
    # N(mu, 1) の標本で H0: mu = 0 を両側 z 検定する(sigma = 1 は既知とする)
    z = rng.normal(mu, 1, size=(reps, n)).mean(axis=1) * math.sqrt(n)
    return np.array([math.erfc(abs(v) / math.sqrt(2)) for v in z])  # = 2(1 - Phi(|z|))

for mu in [0.0, 0.5]:
    counts, _ = np.histogram(p_values(mu), bins=10, range=(0, 1))
    print(f"mu={mu}:", " ".join(f"{c / reps:.3f}" for c in counts))
mu=0.0: 0.100 0.100 0.102 0.100 0.099 0.101 0.100 0.099 0.099 0.099
mu=0.5: 0.721 0.107 0.057 0.035 0.023 0.017 0.013 0.010 0.009 0.008

H0H_0 のもとでは各区間にほぼ 10% ずつ入る(定理 4.10)。μ=0.5\mu = 0.5 では 72% が 0.10.1 未満に集まるが、p>0.5p > 0.5 となる標本も約 6% ある。効果があっても、pp 値は実験ごとに大きく揺れる。

注意

pp 値についてのよくある誤解

  • pp 値は「H0H_0 が正しい確率」ではない。H0H_0 を仮定したときに、観測されたものと同じかそれ以上に極端なデータが得られる確率であり、H0H_0 の確率を語るには事前の確率が要る(第7章)。検討する施策のうち本当に効果があるものが 10% しかなく、検出力 0.80.8、α=0.05\alpha = 0.05 で検定すると、有意になった施策のうち割合 0.9×0.050.9×0.05+0.1×0.8=0.36\frac{0.9 \times 0.05}{0.9 \times 0.05 + 0.1 \times 0.8} = 0.36 が実は効果のないものである。
  • 「有意でない」は「差がない」ではない。検出力が低ければ、本当に差があっても有意にならないことが多い(例 4.26)。
  • 「有意」は「重要」ではない。標本が大きければ、実務上無視できる差も有意になる(例 4.26)。
  • p=0.049p = 0.049 と p=0.051p = 0.051 に本質的な違いはない。
  • 多数の検定をして有意なものだけを選んで報告すると、報告された pp 値には定理 4.10 の保証が当てはまらない(多重比較と pp ハッキング。第8章)。

4.4 ネイマン–ピアソンの補題

どんな検定が最も検出力が高いか。単純仮説どうしの場合には完全な答えがある。

定理 4.11(ネイマン–ピアソンの補題, Neyman–Pearson lemma)XX の同時確率関数または同時密度について、H0 ⁣:f=f0H_0\colon f = f_0 と H1 ⁣:f=f1H_1\colon f = f_1 を考える。

  1. 定数 k≥0k \geq 0 について、f1(x)>kf0(x)f_1(x) > kf_0(x) なら ϕ∗(x)=1\phi^{\ast}(x) = 1、f1(x)<kf0(x)f_1(x) < kf_0(x) なら ϕ∗(x)=0\phi^{\ast}(x) = 0 となる検定 ϕ∗\phi^{\ast}(等号の点での値は任意)をとり、α=E0[ϕ∗]\alpha = E_0[\phi^{\ast}] とする。このとき E0[ϕ]≤αE_0[\phi] \leq \alpha を満たす任意の検定 ϕ\phi について E1[ϕ]≤E1[ϕ∗]E_1[\phi] \leq E_1[\phi^{\ast}]。すなわち ϕ∗\phi^{\ast} は有意水準 α\alpha の最強力検定 (most powerful test) である。
  2. 任意の α∈(0,1)\alpha \in (0, 1) について、1 の形の検定で、等号の点では定数 γ∈[0,1]\gamma \in [0, 1] をとり、E0[ϕ∗]=αE_0[\phi^{\ast}] = \alpha となるものがある。

証明. 1. すべての xx で (ϕ∗(x)−ϕ(x))(f1(x)−kf0(x))≥0(\phi^{\ast}(x) - \phi(x))(f_1(x) - kf_0(x)) \geq 0 である(f1>kf0f_1 > kf_0 なら ϕ∗=1≥ϕ\phi^{\ast} = 1 \geq \phi、f1<kf0f_1 < kf_0 なら ϕ∗=0≤ϕ\phi^{\ast} = 0 \leq \phi)。これを xx について積分(離散なら和を)すると

E1[ϕ∗]−E1[ϕ]≥k(E0[ϕ∗]−E0[ϕ])≥0E_1[\phi^{\ast}] - E_1[\phi] \geq k\bigl(E_0[\phi^{\ast}] - E_0[\phi]\bigr) \geq 0
  1. H0H_0 のもとで確率 11 で f0(X)>0f_0(X) > 0 なので、Λ=f1(X)/f0(X)\Lambda = f_1(X)/f_0(X) が定まる。G(k)=P0(Λ>k)G(k) = P_0(\Lambda > k) は非増加かつ右連続で、k→∞k \to \infty で 00 に近づく。k0=inf⁡{k≥0∣G(k)≤α}k_0 = \inf\lbrace k \geq 0 \mid G(k) \leq \alpha \rbrace とおくと、右連続性より G(k0)≤αG(k_0) \leq \alpha であり、P0(Λ≥k0)≥αP_0(\Lambda \geq k_0) \geq \alpha である(k0>0k_0 > 0 なら k<k0k < k_0 で G(k)>αG(k) > \alpha だから、k→k0−0k \to k_0 - 0 の極限から。k0=0k_0 = 0 なら P0(Λ≥0)=1P_0(\Lambda \geq 0) = 1)。P0(Λ=k0)>0P_0(\Lambda = k_0) > 0 なら γ=(α−G(k0))/P0(Λ=k0)∈[0,1]\gamma = (\alpha - G(k_0))/P_0(\Lambda = k_0) \in [0, 1]、そうでなければ γ=0\gamma = 0 とおくと、E0[ϕ∗]=G(k0)+γP0(Λ=k0)=αE_0[\phi^{\ast}] = G(k_0) + \gamma P_0(\Lambda = k_0) = \alpha となる(後者の場合は G(k0)=P0(Λ≥k0)≥αG(k_0) = P_0(\Lambda \geq k_0) \geq \alpha より G(k0)=αG(k_0) = \alpha)。□\square

2 の γ\gamma による乱択は、離散分布でちょうど水準 α\alpha にするための理論上の工夫である。たとえば B(10,p)B(10, p) で H0 ⁣:p=0.5H_0\colon p = 0.5 を大きい値で棄却するとき、P0(X≥9)=0.011P_0(X \geq 9) = 0.011、P0(X≥8)=0.055P_0(X \geq 8) = 0.055 で、ちょうど 0.050.05 の棄却域はない。実務では保守的な棄却域を使うか、pp 値を報告する。

例 4.12(正規平均の片側検定は一様最強力)σ\sigma が既知の正規標本で H0 ⁣:μ=μ0H_0\colon \mu = \mu_0、H1 ⁣:μ=μ1H_1\colon \mu = \mu_1(μ1>μ0\mu_1 > \mu_0)とすると

f1(x)f0(x)=exp⁡(n(μ1−μ0)σ2xˉ−n(μ12−μ02)2σ2)\frac{f_1(x)}{f_0(x)} = \exp\Bigl(\frac{n(\mu_1 - \mu_0)}{\sigma^2}\bar{x} - \frac{n(\mu_1^2 - \mu_0^2)}{2\sigma^2}\Bigr)

は xˉ\bar{x} の増加関数なので、最強力検定は「xˉ\bar{x} が大きいとき棄却」、すなわち例 4.8 の zz 検定である。この検定は μ1\mu_1 によらないので、すべての μ1>μ0\mu_1 > \mu_0 に対して同時に最強力である。例 4.8 より H0 ⁣:μ≤μ0H_0\colon \mu \leq \mu_0 に対しても水準 α\alpha なので、これは H0 ⁣:μ≤μ0H_0\colon \mu \leq \mu_0、H1 ⁣:μ>μ0H_1\colon \mu > \mu_0 の一様最強力検定 (uniformly most powerful test) である。一方、両側の対立仮説 μ≠μ0\mu \neq \mu_0 では、μ1>μ0\mu_1 > \mu_0 と μ1<μ0\mu_1 < \mu_0 で最強力検定が異なるので、一様最強力検定は存在しない。

4.5 尤度比検定とウィルクスの定理

定義 4.13(尤度比検定, likelihood ratio test)尤度 L(θ)L(\theta) について Λn=sup⁡θ∈Θ0L(θ)/sup⁡θ∈ΘL(θ)\Lambda_n = \sup_{\theta \in \Theta_0}L(\theta)\big/\sup_{\theta \in \Theta}L(\theta) とし、−2log⁡Λn-2\log\Lambda_n が大きいとき H0H_0 を棄却する検定を尤度比検定という。

0≤Λn≤10 \leq \Lambda_n \leq 1 である。単純仮説どうしのネイマン–ピアソンの検定も、尤度の比 f1/f0f_1/f_0 が大きいときに棄却する検定であり、尤度比検定はその考え方を複合仮説に広げたものである。一般には −2log⁡Λn-2\log\Lambda_n の分布は複雑だが、標本が大きいときは次が成り立つ。

定理 4.14(ウィルクスの定理, Wilks' theorem)Θ⊂Rk\Theta \subset \mathbb{R}^k を開集合とし、H0H_0 は θ\theta の kk 個の成分のうち k−rk - r 個を既知の値に固定するもの(Θ0={θ∈Θ∣θr+1=cr+1,…,θk=ck}\Theta_0 = \lbrace \theta \in \Theta \mid \theta_{r+1} = c_{r+1}, \dots, \theta_k = c_k \rbrace)とする。第3章の最尤推定量の漸近正規性(定理 3.32)の多次元版が成り立つ正則条件のもとで、真の値が Θ0\Theta_0 に属するならば −2log⁡Λn→dχ2(k−r)-2\log\Lambda_n \xrightarrow{d} \chi^2(k - r)。

主張のみとする(Casella–Berger、竹村『現代数理統計学』を参照)。k=1k = 1, Θ0={θ0}\Theta_0 = \lbrace \theta_0 \rbrace の場合の考え方は次のとおりである。ℓn\ell_n を最尤推定量 θ^\hat{\theta} のまわりで展開すると、ℓn′(θ^)=0\ell_n'(\hat{\theta}) = 0 と −ℓn′′/n≈I1(θ0)-\ell_n''/n \approx I_1(\theta_0) より ℓn(θ0)≈ℓn(θ^)−12nI1(θ0)(θ^−θ0)2\ell_n(\theta_0) \approx \ell_n(\hat{\theta}) - \frac{1}{2}nI_1(\theta_0)(\hat{\theta} - \theta_0)^2。よって −2log⁡Λn≈(nI1(θ0)(θ^−θ0))2-2\log\Lambda_n \approx \bigl(\sqrt{nI_1(\theta_0)}(\hat{\theta} - \theta_0)\bigr)^2 で、漸近正規性からこれは χ2(1)\chi^2(1) に近い。自由度は H0H_0 で固定したパラメータの個数である。ロジスティック回帰などの入れ子のモデルの比較(第6章)は、この定理に基づく。

例 4.15(ポアソン平均の検定)1 日の問い合わせ件数 Xi∼Po⁡(λ)X_i \sim \operatorname{Po}(\lambda) について H0 ⁣:λ=λ0H_0\colon \lambda = \lambda_0 とすると、λ^=Xˉ\hat{\lambda} = \bar{X} より

−2log⁡Λn=2n(Xˉlog⁡Xˉλ0−(Xˉ−λ0))-2\log\Lambda_n = 2n\Bigl(\bar{X}\log\frac{\bar{X}}{\lambda_0} - (\bar{X} - \lambda_0)\Bigr)

30 日の平均が 4.64.6、λ0=4\lambda_0 = 4 ならこれは 2.572.57 で、χ2(1)\chi^2(1) による pp 値は 0.1090.109 である。

注意 4.16(境界では χ2\chi^2 にならない)ウィルクスの定理は、真の値がパラメータ空間の内部にあることを仮定する。Xi∼N(θ,1)X_i \sim N(\theta, 1)、θ≥0\theta \geq 0 で H0 ⁣:θ=0H_0\colon \theta = 0 を検定すると、最尤推定量は max⁡(Xˉ,0)\max(\bar{X}, 0)、−2log⁡Λn=nmax⁡(Xˉ,0)2-2\log\Lambda_n = n\max(\bar{X}, 0)^2 である。H0H_0 のもとで nXˉ∼N(0,1)\sqrt{n}\bar{X} \sim N(0, 1) なので、これは確率 1/21/2 で 00、確率 1/21/2 で χ2(1)\chi^2(1) に従う値をとり、χ2(1)\chi^2(1) の棄却点を使うと実際の有意水準は α/2\alpha/2 になる。分散成分が 00 かどうかの検定などで現れる状況である。

4.6 tt 検定

定理 4.17(tt 検定)

  1. (1 標本)N(μ,σ2)N(\mu, \sigma^2) からの大きさ nn の標本について、H0 ⁣:μ=μ0H_0\colon \mu = \mu_0 のもとで T=n(Xˉ−μ0)/S∼t(n−1)T = \sqrt{n}(\bar{X} - \mu_0)/S \sim t(n-1)。両側検定は ∣T∣>tα/2(n−1)\lvert T \rvert > t_{\alpha/2}(n-1) で棄却し、pp 値は T′∼t(n−1)T' \sim t(n-1) として 2P(T′≥∣t∣)2P(T' \geq \lvert t \rvert) である。
  2. (対応のある場合)組 (Xi,Yi)(X_i, Y_i) の差 Di=Xi−YiD_i = X_i - Y_i が i.i.d. で N(δ,σD2)N(\delta, \sigma_D^2) に従うなら、DiD_i に 1 を適用する。
  3. (2 標本・等分散)X1,…,Xm∼N(μX,σ2)X_1, \dots, X_m \sim N(\mu_X, \sigma^2) と Y1,…,Yn∼N(μY,σ2)Y_1, \dots, Y_n \sim N(\mu_Y, \sigma^2) がすべて独立なら、Sp2=(m−1)SX2+(n−1)SY2m+n−2S_p^2 = \frac{(m-1)S_X^2 + (n-1)S_Y^2}{m+n-2} として
T=Xˉ−Yˉ−(μX−μY)Sp1/m+1/n∼t(m+n−2)T = \frac{\bar{X} - \bar{Y} - (\mu_X - \mu_Y)}{S_p\sqrt{1/m + 1/n}} \sim t(m + n - 2)

証明. 1 は第2章の tt 統計量の分布そのもので、2 は 1 の言い換えである。3:Z=Xˉ−Yˉ−(μX−μY)σ1/m+1/n∼N(0,1)Z = \frac{\bar{X} - \bar{Y} - (\mu_X - \mu_Y)}{\sigma\sqrt{1/m + 1/n}} \sim N(0, 1) である。第2章の正規標本の基本定理(定理 2.8)と 2 つの標本の独立性から、Xˉ\bar{X}, SX2S_X^2, Yˉ\bar{Y}, SY2S_Y^2 は互いに独立で、(m−1)SX2/σ2∼χ2(m−1)(m-1)S_X^2/\sigma^2 \sim \chi^2(m-1)、(n−1)SY2/σ2∼χ2(n−1)(n-1)S_Y^2/\sigma^2 \sim \chi^2(n-1)。 独立な χ2\chi^2 分布の和は χ2\chi^2 分布なので(第2章 定理 2.6)、V=(m+n−2)Sp2/σ2∼χ2(m+n−2)V = (m+n-2)S_p^2/\sigma^2 \sim \chi^2(m+n-2) で、ZZ と VV は独立だから、tt 分布の定義より T=Z/V/(m+n−2)∼t(m+n−2)T = Z/\sqrt{V/(m+n-2)} \sim t(m+n-2)。□\square

例 4.18 (1)(配送時間)例 4.3 で、従来ルートの平均 50 分と比べて H0 ⁣:μ=50H_0\colon \mu = 50 を検定すると、t=(53.6−50)/1.368=2.63t = (53.6 - 50)/1.368 = 2.63、自由度 9、p=0.027p = 0.027 で、有意水準 5% で棄却される。95% 信頼区間 [50.51,56.69][50.51, 56.69] が 50 を含まないことに対応している(4.8 節)。

(2)(対応のある比較)8 人の作業者が同じ作業を旧ツールと新ツールで行った所要時間(分)は、旧が 25, 31, 22, 35, 28, 40, 27, 33、新が 23, 30, 19, 33, 28, 38, 26, 30 だった。差(旧 − 新)は 2, 1, 3, 2, 0, 2, 1, 3 で、dˉ=1.75\bar{d} = 1.75、sd=1.035s_d = 1.035、t=4.78t = 4.78、自由度 7、p=0.002p = 0.002、差の 95% 信頼区間は [0.88,2.62][0.88, 2.62] 分である。同じデータを誤って独立な 2 標本とみて 3 を使うと、t=0.60t = 0.60、p=0.56p = 0.56 となる。作業者による違い(標準偏差は約 5.8 分)が大きく、対にしてそれを打ち消すことで小さな改善が見えるのである。

3 は 2 群の分散が等しいことを仮定している。仮定しないときは次の近似を使う。

定義 4.19(ウェルチの tt 検定, Welch's t-test)TW=Xˉ−Yˉ−(μX−μY)SX2/m+SY2/nT_W = \frac{\bar{X} - \bar{Y} - (\mu_X - \mu_Y)}{\sqrt{S_X^2/m + S_Y^2/n}} を、自由度

ν^=(SX2/m+SY2/n)2(SX2/m)2m−1+(SY2/n)2n−1\hat{\nu} = \frac{(S_X^2/m + S_Y^2/n)^2}{\frac{(S_X^2/m)^2}{m-1} + \frac{(S_Y^2/n)^2}{n-1}}

の tt 分布で近似する検定をウェルチの tt 検定という。

TWT_W の正確な分布は未知の比 σX2/σY2\sigma_X^2/\sigma_Y^2 に依存し、tt 分布にはならない(ベーレンス–フィッシャー問題)。ν^\hat{\nu} は次のように決める。W=SX2/m+SY2/nW = S_X^2/m + S_Y^2/n とおくと、TWT_W は N(0,1)N(0, 1) に従う変数と、それと独立な W/E[W]\sqrt{W/E[W]} の比である。そこで W/E[W]W/E[W] を χ2(ν)/ν\chi^2(\nu)/\nu(平均 11、分散 2/ν2/\nu)で近似し、分散を合わせる。Var⁡(SX2)=2σX4/(m−1)\operatorname{Var}(S_X^2) = 2\sigma_X^4/(m-1) などから

Var⁡(WE[W])=2(σX2/m+σY2/n)2(σX4m2(m−1)+σY4n2(n−1))=2ν\operatorname{Var}\Bigl(\frac{W}{E[W]}\Bigr) = \frac{2}{(\sigma_X^2/m + \sigma_Y^2/n)^2}\Bigl(\frac{\sigma_X^4}{m^2(m-1)} + \frac{\sigma_Y^4}{n^2(n-1)}\Bigr) = \frac{2}{\nu}

を ν\nu について解き、σ2\sigma^2 を S2S^2 で置き換えたものが ν^\hat{\nu} である。

例 4.20(等分散を仮定すると誤る)2 つの倉庫で 1 件あたりのピッキング時間(秒)を測った。倉庫 A(m=12m = 12)は 31, 33, 30, 32, 34, 32, 33, 32, 30, 34, 32, 31(xˉ=32\bar{x} = 32, sX2=20/11s_X^2 = 20/11)、新設の倉庫 B(n=6n = 6)は 37, 28, 42, 31, 45, 39(yˉ=37\bar{y} = 37, sY2=42s_Y^2 = 42)だった。

検定 標準誤差 tt 値 自由度 pp 値 差の 95% 信頼区間
等分散の tt 検定 1.90 2.64 16 0.018 [0.98,9.02][0.98, 9.02]
ウェルチの tt 検定 2.67 1.87 5.22 0.118 [−1.79,11.79][-1.79, 11.79]

等分散を仮定すると、ばらつきの小さい A がプールした分散を引き下げ、B の平均の不確かさを過小評価する。どちらが正しく働くかを、平均が等しいという H0H_0 のもとで 100 万回のシミュレーションで調べると、名目 5% の検定の実際の第 1 種の過誤の確率は次のとおりだった。

群 1(大きさ、標準偏差) 群 2(大きさ、標準偏差) 等分散の tt 検定 ウェルチの tt 検定
12, 1 6, 5 18.3% 5.2%
6, 1 12, 5 1.2% 5.0%
10, 1 10, 3 5.9% 5.1%
12, 1 6, 1 5.0% 5.1%

小さい群の分散が大きいと等分散の検定は有意を出しすぎ、逆なら保守的になって検出力を失う。ウェルチの検定は分散が本当に等しいときの損失も小さい(群の大きさ 12 と 6、平均の差が σ\sigma のとき、検出力は 0.470.47 対 0.440.44)。

ヒント

実務では 2 群の平均の比較では、ウェルチの検定を既定にするのがよい。「まず等分散の検定をして、その結果で使う検定を選ぶ」二段階の手順は、全体としての有意水準が保証されないので勧められない。ソフトウェアの既定値も違い、R の t.test はウェルチ、SciPy の scipy.stats.ttest_ind は等分散(equal_var=True)が既定である。また、同じ対象を 2 回測ったデータは対応のある tt 検定で分析する(例 4.18 (2))。いずれの tt 検定も、歪んだ分布で標本が小さいと例 4.4 のように精度が落ちる。

4.7 χ2\chi^2 検定

定理 4.21(ピアソンの χ2\chi^2 適合度検定)独立な nn 回の試行で、各回は確率 pj>0p_j > 0 でカテゴリ jj(j=1,…,kj = 1, \dots, k)になるとし、カテゴリ jj の度数を NjN_j とする。n→∞n \to \infty のとき

X2=∑j=1k(Nj−npj)2npj→dχ2(k−1)X^2 = \sum_{j=1}^k \frac{(N_j - np_j)^2}{np_j} \xrightarrow{d} \chi^2(k - 1)

証明. ii 回目の試行がカテゴリ jj のとき第 jj 成分だけが 11 のベクトルを Yi∈RkY_i \in \mathbb{R}^k とすると、N=(N1,…,Nk)⊤=∑iYiN = (N_1, \dots, N_k)^{\top} = \sum_i Y_i で、YiY_i は i.i.d.、E[Yi]=pE[Y_i] = p、E[YijYil]=δjlpjE[Y_{ij}Y_{il}] = \delta_{jl}p_j より Cov⁡(Yi)=diag⁡(p)−pp⊤\operatorname{Cov}(Y_i) = \operatorname{diag}(p) - pp^{\top} である(A⊤A^{\top} は転置で、02 線形代数の tA{}^tA と同じ)。D=diag⁡(p1,…,pk)D = \operatorname{diag}(\sqrt{p_1}, \dots, \sqrt{p_k})、q=(p1,…,pk)⊤q = (\sqrt{p_1}, \dots, \sqrt{p_k})^{\top} とおくと ∥q∥=1\lVert q \rVert = 1 で、Zn=D−1(N−np)/nZ_n = D^{-1}(N - np)/\sqrt{n} は、多次元の中心極限定理(第1章 定理 1.28)より

Zn→dNk(0,D−1(diag⁡(p)−pp⊤)D−1)=Nk(0,I−qq⊤)Z_n \xrightarrow{d} N_k\bigl(0, D^{-1}(\operatorname{diag}(p) - pp^{\top})D^{-1}\bigr) = N_k(0, I - qq^{\top})

を満たす。P=I−qq⊤P = I - qq^{\top} は qq の直交補空間(k−1k - 1 次元)への直交射影である。W∼Nk(0,I)W \sim N_k(0, I) とすると PW∼Nk(0,PP⊤)=Nk(0,P)PW \sim N_k(0, PP^{\top}) = N_k(0, P) なので、極限は PWPW と同じ分布であり、第2章の正規ベクトルの直交分解(定理 2.7)より ∥PW∥2∼χ2(k−1)\lVert PW \rVert^2 \sim \chi^2(k-1)。X2=∥Zn∥2X^2 = \lVert Z_n \rVert^2 で x↦∥x∥2x \mapsto \lVert x \rVert^2 は連続なので、連続写像定理(第1章 定理 1.29)より X2→dχ2(k−1)X^2 \xrightarrow{d} \chi^2(k-1)。□\square

期待度数 npjnp_j がおおむね 5 以上なら近似がよい、というのは経験則であり、度数の小さいカテゴリがあるときは正確な検定を使う。また、pjp_j が ss 個の未知パラメータで決まるモデルを検定するとき、そのパラメータを度数 N1,…,NkN_1, \dots, N_k から最尤法で推定して npjnp_j を置き換えると、極限は χ2(k−1−s)\chi^2(k - 1 - s) になる(主張のみ)。分類する前の元のデータから推定した値(たとえば連続データの標本平均と標本分散)を使った場合は、極限は χ2(k−1−s)\chi^2(k - 1 - s) と χ2(k−1)\chi^2(k - 1) の間にある分布になり、χ2(k−1−s)\chi^2(k - 1 - s) の棄却点を使うと有意を出しすぎる(チャーノフ–レーマンの結果)。

例 4.22(サンプル比率の不一致)A/B/C の 3 案に訪問者を 1:1:1 で無作為に振り分けたはずが、人数は 5,060、4,980、4,760 だった。H0 ⁣:p=(1/3,1/3,1/3)H_0\colon p = (1/3, 1/3, 1/3) で X2=9.78X^2 = 9.78、自由度 2、p=0.0075p = 0.0075 である。振り分けやログの記録の不具合が疑われ、このまま 3 案の成果を比べるのは危険である。オンライン実験では、この検査を毎回行うことが勧められている(Kohavi–Tang–Xu)。

定理 4.23(独立性の χ2\chi^2 検定)nn 個の対象を 2 つの属性(rr 通りと cc 通り)で分類した度数を NijN_{ij} とし、Ni⋅=∑jNijN_{i\cdot} = \sum_j N_{ij}、N⋅j=∑iNijN_{\cdot j} = \sum_i N_{ij}、E^ij=Ni⋅N⋅j/n\hat{E}_{ij} = N_{i\cdot}N_{\cdot j}/n とする。各対象が独立に同じ分布に従い、2 つの属性が独立(H0H_0)で、周辺確率がすべて正ならば

X2=∑i=1r∑j=1c(Nij−E^ij)2E^ij→dχ2((r−1)(c−1))X^2 = \sum_{i=1}^r\sum_{j=1}^c \frac{(N_{ij} - \hat{E}_{ij})^2}{\hat{E}_{ij}} \xrightarrow{d} \chi^2\bigl((r-1)(c-1)\bigr)

主張のみとする。自由度は、全体の rc−1rc - 1 個の自由なパラメータから、H0H_0 のもとで推定する (r−1)+(c−1)(r - 1) + (c - 1) 個を引いたものである。行ごとの人数を実験者が決める場合(群ごとの比率が等しいかの検定)も、同じ統計量と自由度を使う。

例 4.24(第1章の A/B テスト) 2 × 2 の分割表(A は購入 210・非購入 9,790、B は購入 240・非購入 9,760)で X2=2.05X^2 = 2.05、自由度 1、p=0.153p = 0.153 である。2 × 2 表の X2X^2 は、2 群を合わせた比率 pˉ\bar{p} を使った比率の差の zz 統計量 z=(p^B−p^A)/pˉ(1−pˉ)(1/m+1/n)z = (\hat{p}_B - \hat{p}_A)/\sqrt{\bar{p}(1 - \bar{p})(1/m + 1/n)} の 2 乗に等しい(問題 4.4。ここでは z=1.43z = 1.43)。なお、R の chisq.test と SciPy の chi2_contingency は、2 × 2 表では既定でイェーツの連続修正をかける(この例では X2=1.91X^2 = 1.91、p=0.167p = 0.167)。ツールによって数値が違うときは、こうした既定値を確かめる。

4.8 検定と信頼区間の双対性

定理 4.25(検定と信頼区間の双対性)

  1. 各 θ0∈Θ\theta_0 \in \Theta について H0 ⁣:θ=θ0H_0\colon \theta = \theta_0 の有意水準 α\alpha の検定があり、その受容域(棄却しない xx の集合)を A(θ0)A(\theta_0) とする。このとき C(x)={θ0∈Θ∣x∈A(θ0)}C(x) = \lbrace \theta_0 \in \Theta \mid x \in A(\theta_0) \rbrace は、すべての θ\theta で Pθ(θ∈C(X))≥1−αP_\theta(\theta \in C(X)) \geq 1 - \alpha を満たす(信頼係数 1−α1 - \alpha の信頼集合)。
  2. 逆に C(X)C(X) が信頼係数 1−α1 - \alpha の信頼集合なら、A(θ0)={x∣θ0∈C(x)}A(\theta_0) = \lbrace x \mid \theta_0 \in C(x) \rbrace を受容域とする検定は、H0 ⁣:θ=θ0H_0\colon \theta = \theta_0 の有意水準 α\alpha の検定である。

証明. どちらの場合も θ0∈C(x)  ⟺  x∈A(θ0)\theta_0 \in C(x) \iff x \in A(\theta_0) なので、Pθ0(θ0∈C(X))=Pθ0(X∈A(θ0))P_{\theta_0}(\theta_0 \in C(X)) = P_{\theta_0}(X \in A(\theta_0)) である。この値が 1−α1 - \alpha 以上であることと、θ0\theta_0 で棄却する確率が α\alpha 以下であることは同値である。□\square

tt 区間と両側 tt 検定(例 4.18 (1))、ウィルソン区間と「∣p^−p0∣/p0(1−p0)/n>zα/2\lvert \hat{p} - p_0 \rvert/\sqrt{p_0(1-p_0)/n} > z_{\alpha/2} なら棄却する」スコア検定(命題 4.5 の 2)は、この意味で対応している。ワルド区間とスコア検定のように作り方の違う区間と検定は、境目で結論が食い違うことがあるので、同じ方法のものを組にして報告する。pp 値は「θ0\theta_0 からどれだけ離れているか」しか示さないが、信頼区間はパラメータのありうる範囲を示し、すべての θ0\theta_0 についての検定の結果を含んでいる。

4.9 効果量

有意かどうかは、効果の大きさと標本の大きさの両方で決まる。効果の大きさそのものを表す量を効果量 (effect size) という。元の単位での差(平均の差、比率の差)、比(相対的な改善率 p^B/p^A−1\hat{p}_B/\hat{p}_A - 1)、標準偏差を単位にした差 d=(xˉ−yˉ)/spd = (\bar{x} - \bar{y})/s_p(コーエンの dd)などがある。dd について 0.2・0.5・0.8 を小・中・大とする目安は行動科学の慣習であり、実務上の重要さは文脈で決まる。等分散の tt 統計量は t=dmn/(m+n)t = d\sqrt{mn/(m+n)} と書けるので、dd が一定でも tt は n\sqrt{n} に比例して大きくなる。

例 4.26 (1)(有意だが重要でない)m=n=10000m = n = 10000 で d=0.05d = 0.05 なら t=3.54t = 3.54、p=0.0004p = 0.0004 で「高度に有意」だが、平均の差は標準偏差の 5% にすぎず、2 群の分布はほとんど重なっている。

(2)(有意でないが、差がないとは言えない)第1章の A/B テストでは p=0.153p = 0.153 で有意でないが、購入率の差の 95% 信頼区間(ワルド型)は [−0.11,0.71][-0.11, 0.71] ポイントで、A の購入率 2.1% で割って概算すると、相対的には −5-5% から +34+34% の改善に当たる。データは「効果なし」とも「3 割以上の改善」とも両立しており、「B は効果がない」とは結論できない。仮に真の差が 0.3 ポイント(相対 14% の改善)あったとしても、この標本の大きさでの検出力は約 0.300.30 しかない。ただし、検出力は本来、実験の前に「実務上意味のある最小の差」について計算するものである(次の TIP)。観測された差をそのまま真の差とみなして事後的に計算した検出力は pp 値の言い換えにすぎず(両側 zz 検定なら、p>0.05p > 0.05 のときおよそ 0.50.5 以下になる)、pp 値以上の情報をもたない。

ヒント

実務では 結果は「推定値と信頼区間(と効果量)」で報告し、pp 値はその補足にとどめる。事前に「実務上意味のある最小の差」を決め、それを検出できる標本の大きさを確保する(第8章)。「差がない」ことを示したいときは、許容できる幅 ±Δ\pm\Delta を前もって決め、差の 1−2α1 - 2\alpha 信頼区間が (−Δ,Δ)(-\Delta, \Delta) に収まるかを確かめる(同等性検定)。

まとめ

  • 信頼区間は枢軸量から作る。「95%」は区間を作る手続きの被覆確率であり、計算済みの区間が θ\theta を含む確率ではない。
  • 正規平均の tt 区間は非正規性に比較的強いが、分散の χ2\chi^2 区間は正規性が崩れると nn を増やしても正しくならない。母比率では、npnp が小さいときワルド区間よりウィルソン区間がよい。
  • 検定は第 1 種の過誤の確率を α\alpha 以下に抑え、検出力を大きくする。棄却しないことは H0H_0 の証明ではない。
  • 連続な検定統計量の pp 値は H0H_0 のもとで一様分布に従い、一般にも P(p≤u)≤uP(p \leq u) \leq u である。pp 値は H0H_0 が正しい確率ではない。
  • 単純仮説どうしでは尤度比で棄却する検定が最強力である(ネイマン–ピアソンの補題)。尤度比検定の統計量 −2log⁡Λn-2\log\Lambda_n は、正則条件と内点の仮定のもとで χ2\chi^2 分布に近づく(ウィルクスの定理)。
  • 平均の比較には tt 検定を使う。対応のあるデータは差をとり、2 群の比較はウェルチの検定を既定にする。
  • χ2\chi^2 検定は度数の適合度と独立性を調べる。2 × 2 表では比率の差の zz 検定と同じである。
  • 検定と信頼区間は表裏一体であり(双対性)、結果は効果量と信頼区間で報告する。「有意でない」は「差がない」ではなく、「有意」は「重要」ではない。

演習問題

問題 4.1 ★ 例 4.3 の 95% 信頼区間 [50.51,56.69][50.51, 56.69] について、次の解釈の正誤を答えよ。(a) μ\mu がこの区間に入る確率は 95% である。(b) 同じ方法で区間を何度も作れば、約 95% の区間が μ\mu を含む。(c) 今後の配送の約 95% は、この範囲の時間で終わる。(d) 有意水準 5% の両側 tt 検定で、H0 ⁣:μ=55H_0\colon \mu = 55 は棄却されない。

解答

(a) 誤り。μ\mu は定数で、確率 95% は区間を作る手続きの性質である。(b) 正しい。これが信頼係数の意味である。(c) 誤り。信頼区間は平均 μ\mu の範囲であり、個々の配送時間は標準偏差 4.34.3 分程度でばらつく。次の 1 回の値 Xn+1X_{n+1} について (Xn+1−Xˉ)/(S1+1/n)∼t(n−1)(X_{n+1} - \bar{X})/(S\sqrt{1 + 1/n}) \sim t(n-1) なので、その 95% の範囲(予測区間)は 53.6±2.262×4.326×1.1=[43.3,63.9]53.6 \pm 2.262 \times 4.326 \times \sqrt{1.1} = [43.3, 63.9] とずっと広い。(d) 正しい。55 は区間に含まれるので、双対性(定理 4.25)より棄却されない(実際 p=0.33p = 0.33)。

問題 4.2 ★ 大きさ 16 の標本で xˉ=102.5\bar{x} = 102.5、s=6.0s = 6.0 だった。正規母集団を仮定して、H0 ⁣:μ=100H_0\colon \mu = 100 の両側 tt 検定(有意水準 5%)を行い、μ\mu の 95% 信頼区間を求めよ(t0.025(15)=2.131t_{0.025}(15) = 2.131)。結果が有意でなかったことから「μ=100\mu = 100 である」と結論してよいか。

解答

標準誤差は 6/4=1.56/4 = 1.5、t=2.5/1.5=1.67<2.131t = 2.5/1.5 = 1.67 < 2.131 なので棄却されない(p=0.116p = 0.116)。信頼区間は 102.5±2.131×1.5=[99.30,105.70]102.5 \pm 2.131 \times 1.5 = [99.30, 105.70]。区間は 100 を含むが、105 付近までの値も含んでいる。データは μ=100\mu = 100 とも μ=105\mu = 105 とも両立しており、「μ=100\mu = 100 である」とは結論できない。言えるのは「μ=100\mu = 100 を否定する十分な証拠はない」ことだけである。

問題 4.3 ★★ 部品の寿命 X1,…,XnX_1, \dots, X_n が i.i.d. で Exp⁡(λ)\operatorname{Exp}(\lambda) に従う。H0 ⁣:λ=λ0H_0\colon \lambda = \lambda_0、H1 ⁣:λ=λ1H_1\colon \lambda = \lambda_1(λ1<λ0\lambda_1 < \lambda_0。平均寿命が長い)について、(1) 最強力検定が「∑iXi\sum_i X_i が大きいとき棄却」であることを示し、2λ0∑iXi∼χ2(2n)2\lambda_0\sum_i X_i \sim \chi^2(2n) を使って棄却点を求めよ。(2) これが H1 ⁣:λ<λ0H_1\colon \lambda < \lambda_0 の一様最強力検定であることを示せ。(3) H0H_0 の平均寿命が 1000 時間、n=10n = 10、有意水準 5% のとき、xˉ\bar{x} がいくつを超えたら棄却するか(χ0.052(20)=31.41\chi^2_{0.05}(20) = 31.41)。

解答

(1) f1(x)f0(x)=(λ1λ0)nexp⁡((λ0−λ1)∑ixi)\frac{f_1(x)}{f_0(x)} = \bigl(\frac{\lambda_1}{\lambda_0}\bigr)^n\exp\bigl((\lambda_0 - \lambda_1)\sum_i x_i\bigr) は λ0>λ1\lambda_0 > \lambda_1 より ∑ixi\sum_i x_i の増加関数なので、定理 4.11 より最強力検定は ∑iXi>c\sum_i X_i > c で棄却する。H0H_0 のもとで ∑iXi∼Gamma⁡(n,λ0)\sum_i X_i \sim \operatorname{Gamma}(n, \lambda_0) で、密度の変数変換より 2λ0∑iXi∼Gamma⁡(n,1/2)=χ2(2n)2\lambda_0\sum_i X_i \sim \operatorname{Gamma}(n, 1/2) = \chi^2(2n)(第2章 定理 2.6)。よって c=χα2(2n)/(2λ0)c = \chi^2_\alpha(2n)/(2\lambda_0)。(2) この検定は λ1\lambda_1 によらないので、すべての λ1<λ0\lambda_1 < \lambda_0 に対して最強力である。(3) c=31.41×1000/2=15705c = 31.41 \times 1000/2 = 15705 時間、すなわち xˉ>1570.5\bar{x} > 1570.5 時間で棄却する。真の平均寿命が 2000 時間でも、検出力は P(χ2(20)>15.705)≈0.73P(\chi^2(20) > 15.705) \approx 0.73 にとどまる。

問題 4.4 ★★ 2 × 2 表で、群 A の成功・失敗の度数を a,ba, b、群 B の成功・失敗の度数を c,dc, d とし、m=a+bm = a + b、n=c+dn = c + d、N=m+nN = m + n、s=a+cs = a + c、f=b+df = b + d とする。独立性の χ2\chi^2 統計量が X2=N(ad−bc)2mnsfX^2 = \frac{N(ad - bc)^2}{mnsf} に等しく、比率の差の zz 統計量(例 4.24)の 2 乗に一致することを示せ。

解答

E^11=ms/N\hat{E}_{11} = ms/N なので a−E^11=a(a+b+c+d)−(a+b)(a+c)N=ad−bcNa - \hat{E}_{11} = \frac{a(a + b + c + d) - (a + b)(a + c)}{N} = \frac{ad - bc}{N}。他のセルも符号を除いて同じ値である(行和・列和が一致するから)。よって

X2=(ad−bc)2N2(Nms+Nmf+Nns+Nnf)=(ad−bc)2N⋅(m+n)(s+f)mnsf=N(ad−bc)2mnsfX^2 = \frac{(ad - bc)^2}{N^2}\Bigl(\frac{N}{ms} + \frac{N}{mf} + \frac{N}{ns} + \frac{N}{nf}\Bigr) = \frac{(ad - bc)^2}{N}\cdot\frac{(m + n)(s + f)}{mnsf} = \frac{N(ad - bc)^2}{mnsf}

一方 p^A−p^B=am−cn=an−cmmn\hat{p}_A - \hat{p}_B = \frac{a}{m} - \frac{c}{n} = \frac{an - cm}{mn} で、an−cm=a(c+d)−c(a+b)=ad−bcan - cm = a(c + d) - c(a + b) = ad - bc。pˉ=s/N\bar{p} = s/N より pˉ(1−pˉ)(1m+1n)=sfN2⋅Nmn=sfNmn\bar{p}(1 - \bar{p})(\frac{1}{m} + \frac{1}{n}) = \frac{sf}{N^2}\cdot\frac{N}{mn} = \frac{sf}{Nmn}。よって z2=(ad−bc)2m2n2⋅Nmnsf=N(ad−bc)2mnsf=X2z^2 = \frac{(ad - bc)^2}{m^2n^2}\cdot\frac{Nmn}{sf} = \frac{N(ad - bc)^2}{mnsf} = X^2。

問題 4.5 ★★ 例 4.15 の統計量について、H0H_0 のもとで −2log⁡Λn−n(Xˉ−λ0)2/λ0→P0-2\log\Lambda_n - n(\bar{X} - \lambda_0)^2/\lambda_0 \xrightarrow{P} 0 を示し、ウィルクスの定理の結論 −2log⁡Λn→dχ2(1)-2\log\Lambda_n \xrightarrow{d} \chi^2(1) を直接確かめよ。例 4.15 の数値で n(xˉ−λ0)2/λ0n(\bar{x} - \lambda_0)^2/\lambda_0 を計算せよ。

解答

g(x)=xlog⁡(x/λ0)−(x−λ0)g(x) = x\log(x/\lambda_0) - (x - \lambda_0) とおくと g(λ0)=0g(\lambda_0) = 0、g′(x)=log⁡(x/λ0)g'(x) = \log(x/\lambda_0)、g′′(x)=1/xg''(x) = 1/x、g′′′(x)=−1/x2g'''(x) = -1/x^2。h=Xˉ−λ0h = \bar{X} - \lambda_0、∣h∣≤λ0/2\lvert h \rvert \leq \lambda_0/2 のとき、テイラーの定理より g(Xˉ)=h22λ0+Rg(\bar{X}) = \frac{h^2}{2\lambda_0} + R、∣R∣≤46λ02∣h∣3\lvert R \rvert \leq \frac{4}{6\lambda_0^2}\lvert h \rvert^3。よって −2log⁡Λn=2ng(Xˉ)=nh2λ0+2nR-2\log\Lambda_n = 2ng(\bar{X}) = \frac{nh^2}{\lambda_0} + 2nR。中心極限定理より nh→dN(0,λ0)\sqrt{n}h \xrightarrow{d} N(0, \lambda_0) なので、P(∣h∣>λ0/2)→0P(\lvert h \rvert > \lambda_0/2) \to 0 で、n∣h∣3=(n∣h∣)3/n→P0n\lvert h \rvert^3 = (\sqrt{n}\lvert h \rvert)^3/\sqrt{n} \xrightarrow{P} 0。したがって 2nR→P02nR \xrightarrow{P} 0 で、スルツキーの定理より −2log⁡Λn-2\log\Lambda_n は nh2/λ0=(nh/λ0)2nh^2/\lambda_0 = (\sqrt{n}h/\sqrt{\lambda_0})^2 と同じ極限 χ2(1)\chi^2(1) をもつ(連続写像定理)。数値は 30×0.62/4=2.7030 \times 0.6^2/4 = 2.70(p=0.100p = 0.100)で、−2log⁡Λn=2.57-2\log\Lambda_n = 2.57(p=0.109p = 0.109)に近い。これはスコア検定の統計量である。

問題 4.6 ★★ 【この結論は正しいか】メールの件名を変えるテストで、各 2,000 通を送り、開封率は旧件名 20.0%、新件名 21.0% だった。比率の差の検定で p=0.43p = 0.43 となり、担当者は「新しい件名には効果がなかった」と報告した。この結論の問題点を指摘し、何を報告すべきか述べよ。

解答

「有意でない」ことは「効果がない」ことを示さない。差の 95% 信頼区間(ワルド型)は 0.01±1.960.2×0.8/2000+0.21×0.79/2000=[−1.5,3.5]0.01 \pm 1.96\sqrt{0.2 \times 0.8/2000 + 0.21 \times 0.79/2000} = [-1.5, 3.5] ポイントで、データは悪化 1.5 ポイントとも改善 3.5 ポイントとも両立する。この標本の大きさで、真の改善が 2 ポイント(20% → 22%)あったとしても、有意水準 5% の両側検定の検出力は約 0.340.34 しかない。報告すべきは「差の推定値 +1.0 ポイント、95% 信頼区間 [−1.5,3.5][-1.5, 3.5] ポイント、この実験では判断できない」であり、実務上意味のある差を決めて必要な標本の大きさを計算し直すべきである。効果がないことを主張したいなら、許容幅を決めて同等性検定を行う。

問題 4.7 ★★ 【この分析のどこが危ないか】ある A/B テストで、クリック率・滞在時間・購入率など 20 個の指標を比べたところ、1 個だけで p=0.03p = 0.03 となったので、「新デザインはその指標を改善した」と報告した。何が問題か。すべての指標で真の差がなく、20 個の検定が独立だとして、少なくとも 1 個が p<0.05p < 0.05 となる確率を求めよ。

解答

各検定は単独では有意水準 5% だが、20 個の中から有意なものを選んで報告すると、すべての指標で真の差がなくても、どれかが「有意」になる確率(ファミリーワイズの誤り率)は 5% よりはるかに大きい。独立なら少なくとも 1 個が有意になる確率は 1−0.9520≈0.641 - 0.95^{20} \approx 0.64 である(実際の指標は互いに相関するので値は変わるが、問題は残る)。したがって p=0.03p = 0.03 の指標が 1 個見つかったことは、新デザインの効果の証拠としてはきわめて弱い。主要な指標を事前に 1 つ決めておく、複数の指標を同時に評価するならボンフェローニ法(各検定を 0.05/20=0.00250.05/20 = 0.0025 で行う)やホルム法などの多重比較の補正を使う(第8章)、その他の指標の結果は探索的なものとして扱い、別の実験で確かめる、などが必要である。

この章を読み終えたら

「読了」にすると、学習記録と地図に反映されます。

この章の誤りを報告GitHub で見る