この 章の 目標
正規平均・母比率・母分散の 信頼区間を 構成し、「95% 信頼区間」の 意味を 正しく 説明できる
検定の 枠組み(帰無仮説・対立仮説・2 種類の 過誤・ 有意水準・検出力)を 理解し、 p p p 値が 帰無仮説のもとで 一様分布に 従う ことを 証明できる
ネイマン–ピアソンの 補題を 証明し、尤度比検定と ウィルクスの 定理の 意味を 説明できる
t t t 検定(1 標本・ 対応の ある 場合・2 標本)を 等分散の 仮定の 扱いも 含めて 使い分け、 χ 2 \chi^2 χ 2 検定を 使える
検定と 信頼区間の 双対性を 証明し、効果量と 信頼区間で 結果を 報告できる
p p p 値と 有意性に ついての 典型的な 誤解を 指摘できる
前提 :第2章 、第3章 。4.7 節では 第1章の 多変量正規分布と 多次元の 中心極限定理を 使う。
第1章 の 冒頭の A/B テスト(1 万 人ずつの 訪問者の うち、購入者は A が 210 人、B が 240 人)では、真の 購入率が 等しくても 0.3 ポイント程度の 差は 珍しくない ことを 見た。では、この データから 何が どこまで 言えるのか。本章では、未知の パラメータが ありそうな 範囲を 示す 区間推定 と、仮説が データと 両立するかを 判定する 仮説検定を 学ぶ。
どちらも 実務で 日常的に 使われるが、「 p < 0.05 p < 0.05 p < 0.05 なら 効果 あり、そうでなければ 効果なし」と いう 誤った 使い方も 多い。本章では、定理の 仮定と、結論と して 言える ことの 範囲を 正確に 押さえる。上側 α \alpha α 点 z α z_\alpha z α , t α ( k ) t_\alpha(k) t α ( k ) , χ α 2 ( k ) \chi^2_\alpha(k) χ α 2 ( k ) は 第1章 ・第2章 の とおりと する( z 0.025 = 1.960 z_{0.025} = 1.960 z 0.025 = 1.960 など)。
4.1 信頼区間
定義 4.1 (信頼区間, confidence interval)0 < α < 1 0 < \alpha < 1 0 < α < 1 と する。統計量 L ( X ) ≤ U ( X ) L(X) \leq U(X) L ( X ) ≤ U ( X ) が、すべての θ ∈ Θ \theta \in \Theta θ ∈ Θ に ついて
P θ ( L ( X ) ≤ g ( θ ) ≤ U ( X ) ) ≥ 1 − α P_\theta\bigl(L(X) \leq g(\theta) \leq U(X)\bigr) \geq 1 - \alpha P θ ( L ( X ) ≤ g ( θ ) ≤ U ( X ) ) ≥ 1 − α
を 満たすとき、 [ L ( X ) , U ( X ) ] [L(X), U(X)] [ L ( X ) , U ( X )] を g ( θ ) g(\theta) g ( θ ) の 信頼係数 1 − α 1 - \alpha 1 − α の 信頼区間と いう。左辺を 被覆確率 (coverage probability) と いう。被覆確率が 各 θ \theta θ で n → ∞ n \to \infty n → ∞ の とき 1 − α 1 - \alpha 1 − α に 収束する ものを 漸近的な 信頼区間と いう。
信頼区間は、分布が θ \theta θ に よらない θ \theta θ と データの 関数( 枢軸量 , pivot)から 作るのが 基本である。
定理 4.2 (正規母集団の 信頼区間) X 1 , … , X n X_1, \dots, X_n X 1 , … , X n (n ≥ 2 n \geq 2 n ≥ 2 )を N ( μ , σ 2 ) N(\mu, \sigma^2) N ( μ , σ 2 ) からの i.i.d. と する。次の 区間の 被覆確率は ちょうど 1 − α 1 - \alpha 1 − α である。
σ \sigma σ が 既知の とき、 μ \mu μ に ついて X ˉ ± z α / 2 σ / n \bar{X} \pm z_{\alpha/2}\sigma/\sqrt{n} X ˉ ± z α /2 σ / n 。
μ \mu μ に ついて X ˉ ± t α / 2 ( n − 1 ) S / n \bar{X} \pm t_{\alpha/2}(n-1)S/\sqrt{n} X ˉ ± t α /2 ( n − 1 ) S / n 。
σ 2 \sigma^2 σ 2 に ついて [ ( n − 1 ) S 2 / χ α / 2 2 ( n − 1 ) , ( n − 1 ) S 2 / χ 1 − α / 2 2 ( n − 1 ) ] \bigl[(n-1)S^2/\chi^2_{\alpha/2}(n-1),\ (n-1)S^2/\chi^2_{1-\alpha/2}(n-1)\bigr] [ ( n − 1 ) S 2 / χ α /2 2 ( n − 1 ) , ( n − 1 ) S 2 / χ 1 − α /2 2 ( n − 1 ) ] 。
証明. 第2章 の 正規標本の 基本定理(定理 2.8)と t t t 統計量の 分布(系 2.12)より、 Z = n ( X ˉ − μ ) / σ ∼ N ( 0 , 1 ) Z = \sqrt{n}(\bar{X} - \mu)/\sigma \sim N(0, 1) Z = n ( X ˉ − μ ) / σ ∼ N ( 0 , 1 ) 、T = n ( X ˉ − μ ) / S ∼ t ( n − 1 ) T = \sqrt{n}(\bar{X} - \mu)/S \sim t(n-1) T = n ( X ˉ − μ ) / S ∼ t ( n − 1 ) 、V = ( n − 1 ) S 2 / σ 2 ∼ χ 2 ( n − 1 ) V = (n-1)S^2/\sigma^2 \sim \chi^2(n-1) V = ( n − 1 ) S 2 / σ 2 ∼ χ 2 ( n − 1 ) で、どの 分布も ( μ , σ 2 ) (\mu, \sigma^2) ( μ , σ 2 ) に よらない。2 の 区間が μ \mu μ を 含むことは ∣ T ∣ ≤ t α / 2 ( n − 1 ) \lvert T \rvert \leq t_{\alpha/2}(n-1) ∣ T ∣ ≤ t α /2 ( n − 1 ) と 同値で、 t t t 分布は 0 0 0 に ついて 対称な 連続分布だから、その 確率は 1 − α 1 - \alpha 1 − α 。1 も 同様である。3 の 区間が σ 2 \sigma^2 σ 2 を 含むことは χ 1 − α / 2 2 ( n − 1 ) ≤ V ≤ χ α / 2 2 ( n − 1 ) \chi^2_{1-\alpha/2}(n-1) \leq V \leq \chi^2_{\alpha/2}(n-1) χ 1 − α /2 2 ( n − 1 ) ≤ V ≤ χ α /2 2 ( n − 1 ) と 同値で、その 確率は 1 − α 1 - \alpha 1 − α 。□ \square □
例 4.3 (配送時間)新しい 配送ルートで 所要時間(分)を 10 回測り、52, 47, 55, 61, 49, 58, 53, 50, 57, 54 を 得た。 x ˉ = 53.6 \bar{x} = 53.6 x ˉ = 53.6 、∑ i ( x i − x ˉ ) 2 = 168.4 \sum_i (x_i - \bar{x})^2 = 168.4 ∑ i ( x i − x ˉ ) 2 = 168.4 、s = 4.326 s = 4.326 s = 4.326 、標準誤差 s / 10 = 1.368 s/\sqrt{10} = 1.368 s / 10 = 1.368 で、t 0.025 ( 9 ) = 2.262 t_{0.025}(9) = 2.262 t 0.025 ( 9 ) = 2.262 より 平均所要時間 μ \mu μ の 95% 信頼区間は 53.6 ± 3.09 = [ 50.51 , 56.69 ] 53.6 \pm 3.09 = [50.51, 56.69] 53.6 ± 3.09 = [ 50.51 , 56.69 ] 。σ 2 \sigma^2 σ 2 の 95% 信頼区間は [ 168.4 / 19.023 , 168.4 / 2.700 ] = [ 8.85 , 62.36 ] [168.4/19.023, 168.4/2.700] = [8.85, 62.36] [ 168.4/19.023 , 168.4/2.700 ] = [ 8.85 , 62.36 ] 、平方根を とって σ \sigma σ に ついては [ 2.98 , 7.90 ] [2.98, 7.90] [ 2.98 , 7.90 ] である。10 個の データでは、ばら つきの 大きさは ほとんど 絞り 込めない。
注意
「μ \mu μ が [ 50.51 , 56.69 ] [50.51, 56.69] [ 50.51 , 56.69 ] に 入る 確率は 95%」は 誤りである。 μ \mu μ は 定数なので、計算済みの 区間は μ \mu μ を 含むか 含まないかの どちらかである。95% は 区間を 作る 手続きの 性質であり、データを 取り直して 区間を 作る ことを 繰り返せば、そのうち約 95% が μ \mu μ を 含む、と いう 意味である。データを 見た後の μ \mu μ に ついての 確率を 語りたいなら、 μ \mu μ を 確率変数と みる ベイズ統計の 信用区間( 第7章 )を 使う。
例 4.4 (正規性が 崩れると)定理 4.2 は 正規母集団を 仮定している。正規でない 母集団で 名目 95% の 区間の 被覆確率を 各 20 万回の シミュレーションで 調べると、次のようになった。
母集団と 区間
n = 10 n = 10 n = 10
n = 30 n = 30 n = 30
n = 100 n = 100 n = 100
正規分布・μ \mu μ の t t t 区間
0.950
0.950
0.949
指数分布・μ \mu μ の t t t 区間
0.900
0.928
0.942
対数正規分布 e N ( 0 , 1 ) e^{N(0, 1)} e N ( 0 , 1 ) ・μ \mu μ の t t t 区間
0.839
0.884
0.916
指数分布・σ 2 \sigma^2 σ 2 の 区間
0.766
0.716
0.690
t t t 区間は 中心極限定理に より n n n とともに 95% に 近づくが、歪んだ 分布では 遅い。分散の 区間は n n n を 増やしても 良くならない。 n ( S 2 − σ 2 ) \sqrt{n}(S^2 - \sigma^2) n ( S 2 − σ 2 ) の 漸近分散は 4 次の 中心モーメント μ 4 \mu_4 μ 4 を 使って μ 4 − σ 4 \mu_4 - \sigma^4 μ 4 − σ 4 であり、正規分布では 2 σ 4 2\sigma^4 2 σ 4 だが、指数分布では 8 σ 4 8\sigma^4 8 σ 4 に なる。区間は 正規分布を 前提に 半分の 標準偏差で 作られているので、被覆確率は P ( ∣ Z ∣ ≤ 1.96 / 2 ) = 0.673 P(\lvert Z \rvert \leq 1.96/2) = 0.673 P (∣ Z ∣ ≤ 1.96/2 ) = 0.673 に 近づく。
命題 4.5 (母比率の 信頼区間) X 1 , … , X n X_1, \dots, X_n X 1 , … , X n を B ( 1 , p ) B(1, p) B ( 1 , p ) (0 < p < 1 0 < p < 1 0 < p < 1 )からの i.i.d.、p ^ = X ˉ \hat{p} = \bar{X} p ^ = X ˉ 、z = z α / 2 z = z_{\alpha/2} z = z α /2 と する。次は いずれも p p p の 漸近的な 信頼係数 1 − α 1 - \alpha 1 − α の 信頼区間である。
(ワルド区間)p ^ ± z p ^ ( 1 − p ^ ) / n \hat{p} \pm z\sqrt{\hat{p}(1 - \hat{p})/n} p ^ ± z p ^ ( 1 − p ^ ) / n
(ウィルソン区間){ p ′ ∈ [ 0 , 1 ] ∣ ∣ p ^ − p ′ ∣ ≤ z p ′ ( 1 − p ′ ) / n } \lbrace p' \in [0, 1] \mid \lvert \hat{p} - p' \rvert \leq z\sqrt{p'(1 - p')/n} \rbrace { p ′ ∈ [ 0 , 1 ] ∣ ∣ p ^ − p ′ ∣ ≤ z p ′ ( 1 − p ′ ) / n } 。これは 中心 p ^ + z 2 / ( 2 n ) 1 + z 2 / n \frac{\hat{p} + z^2/(2n)}{1 + z^2/n} 1 + z 2 / n p ^ + z 2 / ( 2 n ) 、半幅 z 1 + z 2 / n p ^ ( 1 − p ^ ) n + z 2 4 n 2 \frac{z}{1 + z^2/n}\sqrt{\frac{\hat{p}(1 - \hat{p})}{n} + \frac{z^2}{4n^2}} 1 + z 2 / n z n p ^ ( 1 − p ^ ) + 4 n 2 z 2 の 区間である。
証明. 中心極限定理より Z n = n ( p ^ − p ) / p ( 1 − p ) → d N ( 0 , 1 ) Z_n = \sqrt{n}(\hat{p} - p)/\sqrt{p(1-p)} \xrightarrow{d} N(0, 1) Z n = n ( p ^ − p ) / p ( 1 − p ) d N ( 0 , 1 ) 。2 の 集合が p p p を 含むことは ∣ Z n ∣ ≤ z \lvert Z_n \rvert \leq z ∣ Z n ∣ ≤ z と 同値なので、被覆確率は P ( ∣ Z ∣ ≤ z ) = 1 − α P(\lvert Z \rvert \leq z) = 1 - \alpha P (∣ Z ∣ ≤ z ) = 1 − α に 収束する。1 では、大数の 法則より p ^ → P p \hat{p} \xrightarrow{P} p p ^ P p なので p ( 1 − p ) / ( p ^ ( 1 − p ^ ) ) → P 1 \sqrt{p(1-p)/(\hat{p}(1 - \hat{p}))} \xrightarrow{P} 1 p ( 1 − p ) / ( p ^ ( 1 − p ^ )) P 1 (p ^ ∈ { 0 , 1 } \hat{p} \in \lbrace 0, 1 \rbrace p ^ ∈ { 0 , 1 } と なる 確率は 0 0 0 に 近づく)で、スルツキーの 定理より n ( p ^ − p ) / p ^ ( 1 − p ^ ) → d N ( 0 , 1 ) \sqrt{n}(\hat{p} - p)/\sqrt{\hat{p}(1 - \hat{p})} \xrightarrow{d} N(0, 1) n ( p ^ − p ) / p ^ ( 1 − p ^ ) d N ( 0 , 1 ) 。2 の 区間の 形は、不等式を 2 乗した ( 1 + z 2 / n ) p ′ 2 − ( 2 p ^ + z 2 / n ) p ′ + p ^ 2 ≤ 0 (1 + z^2/n)p'^2 - (2\hat{p} + z^2/n)p' + \hat{p}^2 \leq 0 ( 1 + z 2 / n ) p ′2 − ( 2 p ^ + z 2 / n ) p ′ + p ^ 2 ≤ 0 を 解けば 得られる(判別式の 4 分の 1 は z 2 p ^ ( 1 − p ^ ) / n + z 4 / ( 4 n 2 ) z^2\hat{p}(1 - \hat{p})/n + z^4/(4n^2) z 2 p ^ ( 1 − p ^ ) / n + z 4 / ( 4 n 2 ) )。□ \square □
例 4.6 (不良品が 少ない とき)50 個中 2 個が 不良( p ^ = 0.04 \hat{p} = 0.04 p ^ = 0.04 )なら、ワルド区間は [ − 0.014 , 0.094 ] [-0.014, 0.094] [ − 0.014 , 0.094 ] と 負の 値を 含み、ウィルソン区間は [ 0.011 , 0.135 ] [0.011, 0.135] [ 0.011 , 0.135 ] である。真の 不良率が p = 0.04 p = 0.04 p = 0.04 、n = 50 n = 50 n = 50 の とき、二項分布で 正確に 計算した 被覆確率は、ワルド区間が 0.867 0.867 0.867 、ウィルソン区間が 0.951 0.951 0.951 である。n p np n p が 小さい とき、ワルド区間は 信頼係数を 大きく 下回る。極端なのは 不良が 0 個の ときで、ワルド区間は 1 点 { 0 } \lbrace 0 \rbrace { 0 } に つぶれ、 p > 0 p > 0 p > 0 を 決して 含まない(ウィルソン区間は [ 0 , z 2 / ( n + z 2 ) ] [0, z^2/(n + z^2)] [ 0 , z 2 / ( n + z 2 )] で、n = 50 n = 50 n = 50 なら [ 0 , 0.071 ] [0, 0.071] [ 0 , 0.071 ] である)。したがって n n n を 固定して p → 0 p \to 0 p → 0 と すると、ワルド区間の 被覆確率は 1 − P ( p ^ = 0 ) = 1 − ( 1 − p ) n 1 - P(\hat{p} = 0) = 1 - (1 - p)^n 1 − P ( p ^ = 0 ) = 1 − ( 1 − p ) n 以下なので 0 0 0 に 近づく。命題 4.5 の「漸近的」は 各 p p p ごとの 収束であって、 p p p に ついて 一様ではない。
4.2 仮説検定の 枠組み
検定では、パラメータ 空間を Θ 0 \Theta_0 Θ 0 と Θ 1 \Theta_1 Θ 1 に 分け、 帰無仮説 (null hypothesis) H 0 : θ ∈ Θ 0 H_0\colon \theta \in \Theta_0 H 0 : θ ∈ Θ 0 と 対立仮説 (alternative hypothesis) H 1 : θ ∈ Θ 1 H_1\colon \theta \in \Theta_1 H 1 : θ ∈ Θ 1 を 立てる。データ x x x を 見て H 0 H_0 H 0 を 棄却するか どうかを 決める 規則を 検定と いい、理論の ためには、 x x x を 見た ときに H 0 H_0 H 0 を 棄却する 確率 ϕ ( x ) ∈ [ 0 , 1 ] \phi(x) \in [0, 1] ϕ ( x ) ∈ [ 0 , 1 ] で 検定を 表す( ϕ \phi ϕ が 0 0 0 か 1 1 1 だけを とる とき、 ϕ = 1 \phi = 1 ϕ = 1 と なる 集合を 棄却域と いう)。
定義 4.7 検定 ϕ \phi ϕ に ついて、 π ϕ ( θ ) = E θ [ ϕ ( X ) ] \pi_\phi(\theta) = E_\theta[\phi(X)] π ϕ ( θ ) = E θ [ ϕ ( X )] を 検出力関数 (power function) と いう。
H 0 H_0 H 0 が 正しい( θ ∈ Θ 0 \theta \in \Theta_0 θ ∈ Θ 0 )のに 棄却する 誤りを 第 1 種の 過誤 (type I error)、H 1 H_1 H 1 が 正しい( θ ∈ Θ 1 \theta \in \Theta_1 θ ∈ Θ 1 )のに 棄却しない 誤りを 第 2 種の 過誤 (type II error) と いう。その 確率は π ϕ ( θ ) \pi_\phi(\theta) π ϕ ( θ ) と 1 − π ϕ ( θ ) 1 - \pi_\phi(\theta) 1 − π ϕ ( θ ) である。
sup θ ∈ Θ 0 π ϕ ( θ ) ≤ α \sup_{\theta \in \Theta_0}\pi_\phi(\theta) \leq \alpha sup θ ∈ Θ 0 π ϕ ( θ ) ≤ α の とき、 ϕ \phi ϕ を 有意水準 (significance level) α \alpha α の 検定と いう。 θ ∈ Θ 1 \theta \in \Theta_1 θ ∈ Θ 1 での π ϕ ( θ ) \pi_\phi(\theta) π ϕ ( θ ) を 検出力 (power) と いう。
2 種類の 過誤は 同時には 小さく できないので、第 1 種の 過誤の 確率を α \alpha α 以下に 抑えたうえで 検出力を 大きくする。 H 0 H_0 H 0 と H 1 H_1 H 1 は 対称ではなく、「棄却しない」ことは「 H 0 H_0 H 0 が 正しいと 示された」ことを 意味しない。
例 4.8 (片側 z z z 検定と 検出力) σ \sigma σ が 既知の N ( μ , σ 2 ) N(\mu, \sigma^2) N ( μ , σ 2 ) からの 標本で、 H 0 : μ ≤ μ 0 H_0\colon \mu \leq \mu_0 H 0 : μ ≤ μ 0 、H 1 : μ > μ 0 H_1\colon \mu > \mu_0 H 1 : μ > μ 0 とし、Z = n ( X ˉ − μ 0 ) / σ > z α Z = \sqrt{n}(\bar{X} - \mu_0)/\sigma > z_\alpha Z = n ( X ˉ − μ 0 ) / σ > z α の とき棄却する。 n ( X ˉ − μ ) / σ ∼ N ( 0 , 1 ) \sqrt{n}(\bar{X} - \mu)/\sigma \sim N(0, 1) n ( X ˉ − μ ) / σ ∼ N ( 0 , 1 ) より
π ( μ ) = P μ ( Z > z α ) = 1 − Φ ( z α − n ( μ − μ 0 ) σ ) \pi(\mu) = P_\mu(Z > z_\alpha) = 1 - \Phi\Bigl(z_\alpha - \frac{\sqrt{n}(\mu - \mu_0)}{\sigma}\Bigr) π ( μ ) = P μ ( Z > z α ) = 1 − Φ ( z α − σ n ( μ − μ 0 ) )
は μ \mu μ に ついて 増加で π ( μ 0 ) = α \pi(\mu_0) = \alpha π ( μ 0 ) = α だから、有意水準 α \alpha α の 検定である。 μ = μ 0 + δ \mu = \mu_0 + \delta μ = μ 0 + δ での 検出力を 1 − β 1 - \beta 1 − β 以上に するには n δ / σ ≥ z α + z β \sqrt{n}\delta/\sigma \geq z_\alpha + z_\beta n δ / σ ≥ z α + z β 、すな わち n ≥ ( ( z α + z β ) σ / δ ) 2 n \geq ((z_\alpha + z_\beta)\sigma/\delta)^2 n ≥ (( z α + z β ) σ / δ ) 2 が 必要である( δ = 0.2 σ \delta = 0.2\sigma δ = 0.2 σ 、α = 0.05 \alpha = 0.05 α = 0.05 、検出力 0.8 0.8 0.8 なら n ≥ 155 n \geq 155 n ≥ 155 )。標本の 大きさの 設計は 第8章で 扱う。
4.3 p p p 値
定義 4.9 (p p p 値, p-value)値が 大きい ほど H 0 H_0 H 0 に 不利な 検定統計量 T T T を 考える。単純な 帰無仮説 H 0 : θ = θ 0 H_0\colon \theta = \theta_0 H 0 : θ = θ 0 に ついて、観測値 t = T ( x ) t = T(x) t = T ( x ) に 対する p ( x ) = P θ 0 ( T ( X ) ≥ t ) p(x) = P_{\theta_0}(T(X) \geq t) p ( x ) = P θ 0 ( T ( X ) ≥ t ) を p p p 値と いう。複合仮説では sup θ ∈ Θ 0 P θ ( T ( X ) ≥ t ) \sup_{\theta \in \Theta_0}P_\theta(T(X) \geq t) sup θ ∈ Θ 0 P θ ( T ( X ) ≥ t ) と する。
p p p 値は「H 0 H_0 H 0 が 正しいとした とき、観測された ものと 同じか それ以上に 極端な 値が 出る 確率」である。両側検定では T = ∣ Z ∣ T = \lvert Z \rvert T = ∣ Z ∣ などと すればよい。
定理 4.10 (p p p 値の 分布) H 0 : θ = θ 0 H_0\colon \theta = \theta_0 H 0 : θ = θ 0 のもとで 次が 成り立つ。
T T T の 分布関数 F F F が 連続ならば、 p ( X ) p(X) p ( X ) は 一様分布 U ( 0 , 1 ) U(0, 1) U ( 0 , 1 ) に 従う。
一般に、すべての u ∈ [ 0 , 1 ] u \in [0, 1] u ∈ [ 0 , 1 ] に ついて P θ 0 ( p ( X ) ≤ u ) ≤ u P_{\theta_0}(p(X) \leq u) \leq u P θ 0 ( p ( X ) ≤ u ) ≤ u 。
したがって「p ( X ) ≤ α p(X) \leq \alpha p ( X ) ≤ α なら 棄却する」検定は 有意水準 α \alpha α の 検定である。
証明. G ( t ) = P θ 0 ( T ≥ t ) G(t) = P_{\theta_0}(T \geq t) G ( t ) = P θ 0 ( T ≥ t ) と おくと p ( X ) = G ( T ) p(X) = G(T) p ( X ) = G ( T ) で、G G G は 単調非増加である。1. F F F が 連続なら P ( T = t ) = 0 P(T = t) = 0 P ( T = t ) = 0 なので G ( t ) = 1 − F ( t ) G(t) = 1 - F(t) G ( t ) = 1 − F ( t ) 、p ( X ) = 1 − F ( T ) p(X) = 1 - F(T) p ( X ) = 1 − F ( T ) 。第2章 の 確率積分変換(命題 2.19 の 3)より F ( T ) ∼ U ( 0 , 1 ) F(T) \sim U(0, 1) F ( T ) ∼ U ( 0 , 1 ) なので、1 − F ( T ) ∼ U ( 0 , 1 ) 1 - F(T) \sim U(0, 1) 1 − F ( T ) ∼ U ( 0 , 1 ) 。2. A = { t ∣ G ( t ) ≤ u } A = \lbrace t \mid G(t) \leq u \rbrace A = { t ∣ G ( t ) ≤ u } と おくと、 G G G が 非増加なので、 t ∈ A t \in A t ∈ A かつ t ′ > t t' > t t ′ > t なら t ′ ∈ A t' \in A t ′ ∈ A である。A = ∅ A = \emptyset A = ∅ なら P ( G ( T ) ≤ u ) = 0 P(G(T) \leq u) = 0 P ( G ( T ) ≤ u ) = 0 。A = R A = \mathbb{R} A = R なら t → − ∞ t \to -\infty t → − ∞ で G ( t ) → 1 G(t) \to 1 G ( t ) → 1 より u = 1 u = 1 u = 1 で、主張は 自明である。それ以外では s = inf A s = \inf A s = inf A は 実数で、 s ∈ A s \in A s ∈ A なら { G ( T ) ≤ u } = { T ≥ s } \lbrace G(T) \leq u \rbrace = \lbrace T \geq s \rbrace { G ( T ) ≤ u } = { T ≥ s } の 確率は G ( s ) ≤ u G(s) \leq u G ( s ) ≤ u 。s ∉ A s \notin A s ∈ / A なら { G ( T ) ≤ u } = { T > s } \lbrace G(T) \leq u \rbrace = \lbrace T > s \rbrace { G ( T ) ≤ u } = { T > s } の 確率は lim t → s + 0 G ( t ) ≤ u \lim_{t \to s + 0}G(t) \leq u lim t → s + 0 G ( t ) ≤ u である。□ \square □
次の コードは、 N ( μ , 1 ) N(\mu, 1) N ( μ , 1 ) からの n = 20 n = 20 n = 20 の 標本で H 0 : μ = 0 H_0\colon \mu = 0 H 0 : μ = 0 を 両側 z z z 検定する ことを 10 万回繰り返し、 p p p 値を 0.1 0.1 0.1 刻みの 区間に 分けた 割合を 表示する。
import math
import numpy as np
rng = np.random.default_rng(0)
n, reps = 20, 100_000
def p_values(mu):
# N(mu, 1) の標本で H0: mu = 0 を両側 z 検定する(sigma = 1 は既知とする)
z = rng.normal(mu, 1, size=(reps, n)).mean(axis=1) * math.sqrt(n)
return np.array([math.erfc(abs(v) / math.sqrt(2)) for v in z]) # = 2(1 - Phi(|z|))
for mu in [0.0, 0.5]:
counts, _ = np.histogram(p_values(mu), bins=10, range=(0, 1))
print(f"mu={mu}:", " ".join(f"{c / reps:.3f}" for c in counts))
mu=0.0: 0.100 0.100 0.102 0.100 0.099 0.101 0.100 0.099 0.099 0.099
mu=0.5: 0.721 0.107 0.057 0.035 0.023 0.017 0.013 0.010 0.009 0.008
H 0 H_0 H 0 のもとでは 各区間に ほぼ 10% ずつ 入る(定理 4.10)。 μ = 0.5 \mu = 0.5 μ = 0.5 では 72% が 0.1 0.1 0.1 未満に 集まるが、 p > 0.5 p > 0.5 p > 0.5 と なる 標本も 約 6% ある。効果が あっても、 p p p 値は 実験ごとに 大きく 揺れる。
注意
p p p 値に ついての よく ある 誤解
p p p 値は「H 0 H_0 H 0 が 正しい 確率」ではない。 H 0 H_0 H 0 を 仮定した ときに、観測された ものと 同じか それ以上に 極端な データが 得られる 確率であり、 H 0 H_0 H 0 の 確率を 語るには 事前の 確率が 要る( 第7章 )。検討する 施策の うち本当に 効果が ある ものが 10% しかなく、検出力 0.8 0.8 0.8 、α = 0.05 \alpha = 0.05 α = 0.05 で 検定すると、有意に なった 施策の うち割合 0.9 × 0.05 0.9 × 0.05 + 0.1 × 0.8 = 0.36 \frac{0.9 \times 0.05}{0.9 \times 0.05 + 0.1 \times 0.8} = 0.36 0.9 × 0.05 + 0.1 × 0.8 0.9 × 0.05 = 0.36 が 実は 効果の ない ものである。
「有意でない」は「差が ない」ではない。検出力が 低ければ、本当に 差が あっても 有意に ならない ことが 多い(例 4.26)。
「有意」は「重要」ではない。標本が 大きければ、実務上無視できる 差も 有意に なる(例 4.26)。
p = 0.049 p = 0.049 p = 0.049 と p = 0.051 p = 0.051 p = 0.051 に 本質的な 違いは ない。
多数の 検定を して 有意な ものだけを 選んで 報告すると、報告された p p p 値には 定理 4.10 の 保証が 当ては まらない(多重比較と p p p ハッキング。第8章 )。
4.4 ネイマン–ピアソンの 補題
どんな 検定が 最も 検出力が 高いか。単純仮説どうしの 場合には 完全な 答えが ある。
定理 4.11 (ネイマン–ピアソンの 補題, Neyman–Pearson lemma) X X X の 同時確率関数または 同時密度に ついて、 H 0 : f = f 0 H_0\colon f = f_0 H 0 : f = f 0 と H 1 : f = f 1 H_1\colon f = f_1 H 1 : f = f 1 を 考える。
定数 k ≥ 0 k \geq 0 k ≥ 0 に ついて、 f 1 ( x ) > k f 0 ( x ) f_1(x) > kf_0(x) f 1 ( x ) > k f 0 ( x ) なら ϕ ∗ ( x ) = 1 \phi^{\ast}(x) = 1 ϕ ∗ ( x ) = 1 、f 1 ( x ) < k f 0 ( x ) f_1(x) < kf_0(x) f 1 ( x ) < k f 0 ( x ) なら ϕ ∗ ( x ) = 0 \phi^{\ast}(x) = 0 ϕ ∗ ( x ) = 0 と なる 検定 ϕ ∗ \phi^{\ast} ϕ ∗ (等号の 点での 値は 任意)を とり、 α = E 0 [ ϕ ∗ ] \alpha = E_0[\phi^{\ast}] α = E 0 [ ϕ ∗ ] と する。この とき E 0 [ ϕ ] ≤ α E_0[\phi] \leq \alpha E 0 [ ϕ ] ≤ α を 満たす任意の 検定 ϕ \phi ϕ に ついて E 1 [ ϕ ] ≤ E 1 [ ϕ ∗ ] E_1[\phi] \leq E_1[\phi^{\ast}] E 1 [ ϕ ] ≤ E 1 [ ϕ ∗ ] 。すな わち ϕ ∗ \phi^{\ast} ϕ ∗ は 有意水準 α \alpha α の 最強力検定 (most powerful test) である。
任意の α ∈ ( 0 , 1 ) \alpha \in (0, 1) α ∈ ( 0 , 1 ) に ついて、1 の 形の 検定で、等号の 点では 定数 γ ∈ [ 0 , 1 ] \gamma \in [0, 1] γ ∈ [ 0 , 1 ] を とり、 E 0 [ ϕ ∗ ] = α E_0[\phi^{\ast}] = \alpha E 0 [ ϕ ∗ ] = α と なる ものが ある。
証明. 1. すべての x x x で ( ϕ ∗ ( x ) − ϕ ( x ) ) ( f 1 ( x ) − k f 0 ( x ) ) ≥ 0 (\phi^{\ast}(x) - \phi(x))(f_1(x) - kf_0(x)) \geq 0 ( ϕ ∗ ( x ) − ϕ ( x )) ( f 1 ( x ) − k f 0 ( x )) ≥ 0 である(f 1 > k f 0 f_1 > kf_0 f 1 > k f 0 なら ϕ ∗ = 1 ≥ ϕ \phi^{\ast} = 1 \geq \phi ϕ ∗ = 1 ≥ ϕ 、f 1 < k f 0 f_1 < kf_0 f 1 < k f 0 なら ϕ ∗ = 0 ≤ ϕ \phi^{\ast} = 0 \leq \phi ϕ ∗ = 0 ≤ ϕ )。これを x x x に ついて 積分(離散なら 和を )すると
E 1 [ ϕ ∗ ] − E 1 [ ϕ ] ≥ k ( E 0 [ ϕ ∗ ] − E 0 [ ϕ ] ) ≥ 0 E_1[\phi^{\ast}] - E_1[\phi] \geq k\bigl(E_0[\phi^{\ast}] - E_0[\phi]\bigr) \geq 0 E 1 [ ϕ ∗ ] − E 1 [ ϕ ] ≥ k ( E 0 [ ϕ ∗ ] − E 0 [ ϕ ] ) ≥ 0
H 0 H_0 H 0 のもとで 確率 1 1 1 で f 0 ( X ) > 0 f_0(X) > 0 f 0 ( X ) > 0 なので、Λ = f 1 ( X ) / f 0 ( X ) \Lambda = f_1(X)/f_0(X) Λ = f 1 ( X ) / f 0 ( X ) が 定まる。 G ( k ) = P 0 ( Λ > k ) G(k) = P_0(\Lambda > k) G ( k ) = P 0 ( Λ > k ) は 非増加かつ右連続で、 k → ∞ k \to \infty k → ∞ で 0 0 0 に 近づく。 k 0 = inf { k ≥ 0 ∣ G ( k ) ≤ α } k_0 = \inf\lbrace k \geq 0 \mid G(k) \leq \alpha \rbrace k 0 = inf { k ≥ 0 ∣ G ( k ) ≤ α } と おくと、右連続性より G ( k 0 ) ≤ α G(k_0) \leq \alpha G ( k 0 ) ≤ α であり、P 0 ( Λ ≥ k 0 ) ≥ α P_0(\Lambda \geq k_0) \geq \alpha P 0 ( Λ ≥ k 0 ) ≥ α である(k 0 > 0 k_0 > 0 k 0 > 0 なら k < k 0 k < k_0 k < k 0 で G ( k ) > α G(k) > \alpha G ( k ) > α だから、k → k 0 − 0 k \to k_0 - 0 k → k 0 − 0 の 極限から。 k 0 = 0 k_0 = 0 k 0 = 0 なら P 0 ( Λ ≥ 0 ) = 1 P_0(\Lambda \geq 0) = 1 P 0 ( Λ ≥ 0 ) = 1 )。P 0 ( Λ = k 0 ) > 0 P_0(\Lambda = k_0) > 0 P 0 ( Λ = k 0 ) > 0 なら γ = ( α − G ( k 0 ) ) / P 0 ( Λ = k 0 ) ∈ [ 0 , 1 ] \gamma = (\alpha - G(k_0))/P_0(\Lambda = k_0) \in [0, 1] γ = ( α − G ( k 0 )) / P 0 ( Λ = k 0 ) ∈ [ 0 , 1 ] 、そうでなければ γ = 0 \gamma = 0 γ = 0 と おくと、 E 0 [ ϕ ∗ ] = G ( k 0 ) + γ P 0 ( Λ = k 0 ) = α E_0[\phi^{\ast}] = G(k_0) + \gamma P_0(\Lambda = k_0) = \alpha E 0 [ ϕ ∗ ] = G ( k 0 ) + γ P 0 ( Λ = k 0 ) = α と なる(後者の 場合は G ( k 0 ) = P 0 ( Λ ≥ k 0 ) ≥ α G(k_0) = P_0(\Lambda \geq k_0) \geq \alpha G ( k 0 ) = P 0 ( Λ ≥ k 0 ) ≥ α より G ( k 0 ) = α G(k_0) = \alpha G ( k 0 ) = α )。□ \square □
2 の γ \gamma γ に よる 乱択は、離散分布で ちょうど 水準 α \alpha α に する ための 理論上の 工夫である。たとえば B ( 10 , p ) B(10, p) B ( 10 , p ) で H 0 : p = 0.5 H_0\colon p = 0.5 H 0 : p = 0.5 を 大きい値で 棄却する とき、 P 0 ( X ≥ 9 ) = 0.011 P_0(X \geq 9) = 0.011 P 0 ( X ≥ 9 ) = 0.011 、P 0 ( X ≥ 8 ) = 0.055 P_0(X \geq 8) = 0.055 P 0 ( X ≥ 8 ) = 0.055 で、ちょうど 0.05 0.05 0.05 の 棄却域は ない。実務では 保守的な 棄却域を 使うか、 p p p 値を 報告する。
例 4.12 (正規平均の 片側検定は 一様 最強力) σ \sigma σ が 既知の 正規標本で H 0 : μ = μ 0 H_0\colon \mu = \mu_0 H 0 : μ = μ 0 、H 1 : μ = μ 1 H_1\colon \mu = \mu_1 H 1 : μ = μ 1 (μ 1 > μ 0 \mu_1 > \mu_0 μ 1 > μ 0 )と すると
f 1 ( x ) f 0 ( x ) = exp ( n ( μ 1 − μ 0 ) σ 2 x ˉ − n ( μ 1 2 − μ 0 2 ) 2 σ 2 ) \frac{f_1(x)}{f_0(x)} = \exp\Bigl(\frac{n(\mu_1 - \mu_0)}{\sigma^2}\bar{x} - \frac{n(\mu_1^2 - \mu_0^2)}{2\sigma^2}\Bigr) f 0 ( x ) f 1 ( x ) = exp ( σ 2 n ( μ 1 − μ 0 ) x ˉ − 2 σ 2 n ( μ 1 2 − μ 0 2 ) )
は x ˉ \bar{x} x ˉ の 増加関数なので、最強力検定は「 x ˉ \bar{x} x ˉ が 大きいとき棄却」、すな わち例 4.8 の z z z 検定である。この 検定は μ 1 \mu_1 μ 1 に よらないので、すべての μ 1 > μ 0 \mu_1 > \mu_0 μ 1 > μ 0 に 対して 同時に 最強力である。例 4.8 より H 0 : μ ≤ μ 0 H_0\colon \mu \leq \mu_0 H 0 : μ ≤ μ 0 に 対しても 水準 α \alpha α なので、これは H 0 : μ ≤ μ 0 H_0\colon \mu \leq \mu_0 H 0 : μ ≤ μ 0 、H 1 : μ > μ 0 H_1\colon \mu > \mu_0 H 1 : μ > μ 0 の 一様 最強力検定 (uniformly most powerful test) である。一方、両側の 対立仮説 μ ≠ μ 0 \mu \neq \mu_0 μ = μ 0 では、μ 1 > μ 0 \mu_1 > \mu_0 μ 1 > μ 0 と μ 1 < μ 0 \mu_1 < \mu_0 μ 1 < μ 0 で 最強力検定が 異なるので、一様 最強力検定は 存在しない。
4.5 尤度比検定と ウィルクスの 定理
定義 4.13 (尤度比検定, likelihood ratio test)尤度 L ( θ ) L(\theta) L ( θ ) に ついて Λ n = sup θ ∈ Θ 0 L ( θ ) / sup θ ∈ Θ L ( θ ) \Lambda_n = \sup_{\theta \in \Theta_0}L(\theta)\big/\sup_{\theta \in \Theta}L(\theta) Λ n = sup θ ∈ Θ 0 L ( θ ) / sup θ ∈ Θ L ( θ ) とし、− 2 log Λ n -2\log\Lambda_n − 2 log Λ n が 大きいとき H 0 H_0 H 0 を 棄却する 検定を 尤度比検定と いう。
0 ≤ Λ n ≤ 1 0 \leq \Lambda_n \leq 1 0 ≤ Λ n ≤ 1 である。単純仮説どうしの ネイマン–ピアソンの 検定も、尤度の 比 f 1 / f 0 f_1/f_0 f 1 / f 0 が 大きい ときに 棄却する 検定であり、尤度比検定は その 考え方を 複合仮説に 広げた ものである。一般には − 2 log Λ n -2\log\Lambda_n − 2 log Λ n の 分布は 複雑だが、標本が 大きい ときは 次が 成り立つ。
定理 4.14 (ウィルクスの 定理, Wilks' theorem) Θ ⊂ R k \Theta \subset \mathbb{R}^k Θ ⊂ R k を 開集合とし、 H 0 H_0 H 0 は θ \theta θ の k k k 個の 成分の うち k − r k - r k − r 個を 既知の 値に 固定する もの( Θ 0 = { θ ∈ Θ ∣ θ r + 1 = c r + 1 , … , θ k = c k } \Theta_0 = \lbrace \theta \in \Theta \mid \theta_{r+1} = c_{r+1}, \dots, \theta_k = c_k \rbrace Θ 0 = { θ ∈ Θ ∣ θ r + 1 = c r + 1 , … , θ k = c k } )と する。 第3章 の 最尤推定量の 漸近正規性(定理 3.32)の 多次元版が 成り立つ正則条件のもとで、真の 値が Θ 0 \Theta_0 Θ 0 に 属するならば − 2 log Λ n → d χ 2 ( k − r ) -2\log\Lambda_n \xrightarrow{d} \chi^2(k - r) − 2 log Λ n d χ 2 ( k − r ) 。
主張のみと する(Casella–Berger、竹村『現代数理統計学』を 参照)。 k = 1 k = 1 k = 1 , Θ 0 = { θ 0 } \Theta_0 = \lbrace \theta_0 \rbrace Θ 0 = { θ 0 } の 場合の 考え方は 次の とおりである。 ℓ n \ell_n ℓ n を 最尤推定量 θ ^ \hat{\theta} θ ^ の まわりで 展開すると、 ℓ n ′ ( θ ^ ) = 0 \ell_n'(\hat{\theta}) = 0 ℓ n ′ ( θ ^ ) = 0 と − ℓ n ′ ′ / n ≈ I 1 ( θ 0 ) -\ell_n''/n \approx I_1(\theta_0) − ℓ n ′′ / n ≈ I 1 ( θ 0 ) より ℓ n ( θ 0 ) ≈ ℓ n ( θ ^ ) − 1 2 n I 1 ( θ 0 ) ( θ ^ − θ 0 ) 2 \ell_n(\theta_0) \approx \ell_n(\hat{\theta}) - \frac{1}{2}nI_1(\theta_0)(\hat{\theta} - \theta_0)^2 ℓ n ( θ 0 ) ≈ ℓ n ( θ ^ ) − 2 1 n I 1 ( θ 0 ) ( θ ^ − θ 0 ) 2 。よって − 2 log Λ n ≈ ( n I 1 ( θ 0 ) ( θ ^ − θ 0 ) ) 2 -2\log\Lambda_n \approx \bigl(\sqrt{nI_1(\theta_0)}(\hat{\theta} - \theta_0)\bigr)^2 − 2 log Λ n ≈ ( n I 1 ( θ 0 ) ( θ ^ − θ 0 ) ) 2 で、漸近正規性から これは χ 2 ( 1 ) \chi^2(1) χ 2 ( 1 ) に 近い。自由度は H 0 H_0 H 0 で 固定した パラメータの 個数である。ロジスティック回帰などの 入れ子の モデルの 比較( 第6章 )は、この 定理に 基づく。
例 4.15 (ポアソン平均の 検定)1 日の 問い合わせ件数 X i ∼ Po ( λ ) X_i \sim \operatorname{Po}(\lambda) X i ∼ Po ( λ ) に ついて H 0 : λ = λ 0 H_0\colon \lambda = \lambda_0 H 0 : λ = λ 0 と すると、 λ ^ = X ˉ \hat{\lambda} = \bar{X} λ ^ = X ˉ より
− 2 log Λ n = 2 n ( X ˉ log X ˉ λ 0 − ( X ˉ − λ 0 ) ) -2\log\Lambda_n = 2n\Bigl(\bar{X}\log\frac{\bar{X}}{\lambda_0} - (\bar{X} - \lambda_0)\Bigr) − 2 log Λ n = 2 n ( X ˉ log λ 0 X ˉ − ( X ˉ − λ 0 ) )
30 日の 平均が 4.6 4.6 4.6 、λ 0 = 4 \lambda_0 = 4 λ 0 = 4 なら これは 2.57 2.57 2.57 で、χ 2 ( 1 ) \chi^2(1) χ 2 ( 1 ) に よる p p p 値は 0.109 0.109 0.109 である。
4.6 t t t 検定
定理 4.17 (t t t 検定)
(1 標本)N ( μ , σ 2 ) N(\mu, \sigma^2) N ( μ , σ 2 ) からの 大きさ n n n の 標本に ついて、 H 0 : μ = μ 0 H_0\colon \mu = \mu_0 H 0 : μ = μ 0 のもとで T = n ( X ˉ − μ 0 ) / S ∼ t ( n − 1 ) T = \sqrt{n}(\bar{X} - \mu_0)/S \sim t(n-1) T = n ( X ˉ − μ 0 ) / S ∼ t ( n − 1 ) 。両側検定は ∣ T ∣ > t α / 2 ( n − 1 ) \lvert T \rvert > t_{\alpha/2}(n-1) ∣ T ∣ > t α /2 ( n − 1 ) で 棄却し、 p p p 値は T ′ ∼ t ( n − 1 ) T' \sim t(n-1) T ′ ∼ t ( n − 1 ) と して 2 P ( T ′ ≥ ∣ t ∣ ) 2P(T' \geq \lvert t \rvert) 2 P ( T ′ ≥ ∣ t ∣) である。
(対応の ある 場合)組 ( X i , Y i ) (X_i, Y_i) ( X i , Y i ) の 差 D i = X i − Y i D_i = X_i - Y_i D i = X i − Y i が i.i.d. で N ( δ , σ D 2 ) N(\delta, \sigma_D^2) N ( δ , σ D 2 ) に 従うなら、 D i D_i D i に 1 を 適用する。
(2 標本・ 等分散) X 1 , … , X m ∼ N ( μ X , σ 2 ) X_1, \dots, X_m \sim N(\mu_X, \sigma^2) X 1 , … , X m ∼ N ( μ X , σ 2 ) と Y 1 , … , Y n ∼ N ( μ Y , σ 2 ) Y_1, \dots, Y_n \sim N(\mu_Y, \sigma^2) Y 1 , … , Y n ∼ N ( μ Y , σ 2 ) が すべて 独立なら、 S p 2 = ( m − 1 ) S X 2 + ( n − 1 ) S Y 2 m + n − 2 S_p^2 = \frac{(m-1)S_X^2 + (n-1)S_Y^2}{m+n-2} S p 2 = m + n − 2 ( m − 1 ) S X 2 + ( n − 1 ) S Y 2 と して
T = X ˉ − Y ˉ − ( μ X − μ Y ) S p 1 / m + 1 / n ∼ t ( m + n − 2 ) T = \frac{\bar{X} - \bar{Y} - (\mu_X - \mu_Y)}{S_p\sqrt{1/m + 1/n}} \sim t(m + n - 2) T = S p 1/ m + 1/ n X ˉ − Y ˉ − ( μ X − μ Y ) ∼ t ( m + n − 2 )
証明. 1 は 第2章 の t t t 統計量の 分布 その もので、2 は 1 の 言い 換えである。3: Z = X ˉ − Y ˉ − ( μ X − μ Y ) σ 1 / m + 1 / n ∼ N ( 0 , 1 ) Z = \frac{\bar{X} - \bar{Y} - (\mu_X - \mu_Y)}{\sigma\sqrt{1/m + 1/n}} \sim N(0, 1) Z = σ 1/ m + 1/ n X ˉ − Y ˉ − ( μ X − μ Y ) ∼ N ( 0 , 1 ) である。第2章の 正規標本の 基本定理(定理 2.8)と 2 つの 標本の 独立性から、 X ˉ \bar{X} X ˉ , S X 2 S_X^2 S X 2 , Y ˉ \bar{Y} Y ˉ , S Y 2 S_Y^2 S Y 2 は 互いに 独立で、 ( m − 1 ) S X 2 / σ 2 ∼ χ 2 ( m − 1 ) (m-1)S_X^2/\sigma^2 \sim \chi^2(m-1) ( m − 1 ) S X 2 / σ 2 ∼ χ 2 ( m − 1 ) 、( n − 1 ) S Y 2 / σ 2 ∼ χ 2 ( n − 1 ) (n-1)S_Y^2/\sigma^2 \sim \chi^2(n-1) ( n − 1 ) S Y 2 / σ 2 ∼ χ 2 ( n − 1 ) 。 独立な χ 2 \chi^2 χ 2 分布の 和は χ 2 \chi^2 χ 2 分布なので(第2章 定理 2.6)、V = ( m + n − 2 ) S p 2 / σ 2 ∼ χ 2 ( m + n − 2 ) V = (m+n-2)S_p^2/\sigma^2 \sim \chi^2(m+n-2) V = ( m + n − 2 ) S p 2 / σ 2 ∼ χ 2 ( m + n − 2 ) で、Z Z Z と V V V は 独立だから、 t t t 分布の 定義より T = Z / V / ( m + n − 2 ) ∼ t ( m + n − 2 ) T = Z/\sqrt{V/(m+n-2)} \sim t(m+n-2) T = Z / V / ( m + n − 2 ) ∼ t ( m + n − 2 ) 。□ \square □
例 4.18 (1)(配送時間)例 4.3 で、従来ルートの 平均 50 分と 比べて H 0 : μ = 50 H_0\colon \mu = 50 H 0 : μ = 50 を 検定すると、 t = ( 53.6 − 50 ) / 1.368 = 2.63 t = (53.6 - 50)/1.368 = 2.63 t = ( 53.6 − 50 ) /1.368 = 2.63 、自由度 9、p = 0.027 p = 0.027 p = 0.027 で、有意水準 5% で 棄却される。95% 信頼区間 [ 50.51 , 56.69 ] [50.51, 56.69] [ 50.51 , 56.69 ] が 50 を 含まない ことに 対応している(4.8 節)。
(2)(対応の ある 比較)8 人の 作業者が 同じ 作業を 旧ツールと 新ツールで 行った 所要時間(分)は、旧が 25, 31, 22, 35, 28, 40, 27, 33、新が 23, 30, 19, 33, 28, 38, 26, 30 だった。差(旧 − 新)は 2, 1, 3, 2, 0, 2, 1, 3 で、 d ˉ = 1.75 \bar{d} = 1.75 d ˉ = 1.75 、s d = 1.035 s_d = 1.035 s d = 1.035 、t = 4.78 t = 4.78 t = 4.78 、自由度 7、p = 0.002 p = 0.002 p = 0.002 、差の 95% 信頼区間は [ 0.88 , 2.62 ] [0.88, 2.62] [ 0.88 , 2.62 ] 分である。同じ データを 誤って 独立な 2 標本と みて 3 を 使うと、 t = 0.60 t = 0.60 t = 0.60 、p = 0.56 p = 0.56 p = 0.56 と なる。作業者に よる 違い(標準偏差は 約 5.8 分)が 大きく、対に して それを 打ち消す ことで 小さな 改善が 見えるのである。
3 は 2 群の 分散が 等しい ことを 仮定している。仮定しない ときは 次の 近似を 使う。
定義 4.19 (ウェルチの t t t 検定, Welch's t-test)T W = X ˉ − Y ˉ − ( μ X − μ Y ) S X 2 / m + S Y 2 / n T_W = \frac{\bar{X} - \bar{Y} - (\mu_X - \mu_Y)}{\sqrt{S_X^2/m + S_Y^2/n}} T W = S X 2 / m + S Y 2 / n X ˉ − Y ˉ − ( μ X − μ Y ) を、自由度
ν ^ = ( S X 2 / m + S Y 2 / n ) 2 ( S X 2 / m ) 2 m − 1 + ( S Y 2 / n ) 2 n − 1 \hat{\nu} = \frac{(S_X^2/m + S_Y^2/n)^2}{\frac{(S_X^2/m)^2}{m-1} + \frac{(S_Y^2/n)^2}{n-1}} ν ^ = m − 1 ( S X 2 / m ) 2 + n − 1 ( S Y 2 / n ) 2 ( S X 2 / m + S Y 2 / n ) 2
の t t t 分布で 近似する 検定を ウェルチの t t t 検定と いう。
T W T_W T W の 正確な 分布は 未知の 比 σ X 2 / σ Y 2 \sigma_X^2/\sigma_Y^2 σ X 2 / σ Y 2 に 依存し、 t t t 分布には ならない(ベーレンス–フィッシャー問題)。 ν ^ \hat{\nu} ν ^ は 次のように 決める。 W = S X 2 / m + S Y 2 / n W = S_X^2/m + S_Y^2/n W = S X 2 / m + S Y 2 / n と おくと、 T W T_W T W は N ( 0 , 1 ) N(0, 1) N ( 0 , 1 ) に 従う 変数と、それと 独立な W / E [ W ] \sqrt{W/E[W]} W / E [ W ] の 比である。そこで W / E [ W ] W/E[W] W / E [ W ] を χ 2 ( ν ) / ν \chi^2(\nu)/\nu χ 2 ( ν ) / ν (平均 1 1 1 、分散 2 / ν 2/\nu 2/ ν )で 近似し、分散を 合わせる。 Var ( S X 2 ) = 2 σ X 4 / ( m − 1 ) \operatorname{Var}(S_X^2) = 2\sigma_X^4/(m-1) Var ( S X 2 ) = 2 σ X 4 / ( m − 1 ) などから
Var ( W E [ W ] ) = 2 ( σ X 2 / m + σ Y 2 / n ) 2 ( σ X 4 m 2 ( m − 1 ) + σ Y 4 n 2 ( n − 1 ) ) = 2 ν \operatorname{Var}\Bigl(\frac{W}{E[W]}\Bigr) = \frac{2}{(\sigma_X^2/m + \sigma_Y^2/n)^2}\Bigl(\frac{\sigma_X^4}{m^2(m-1)} + \frac{\sigma_Y^4}{n^2(n-1)}\Bigr) = \frac{2}{\nu} Var ( E [ W ] W ) = ( σ X 2 / m + σ Y 2 / n ) 2 2 ( m 2 ( m − 1 ) σ X 4 + n 2 ( n − 1 ) σ Y 4 ) = ν 2
を ν \nu ν に ついて 解き、 σ 2 \sigma^2 σ 2 を S 2 S^2 S 2 で 置き換えた ものが ν ^ \hat{\nu} ν ^ である。
例 4.20 (等分散を 仮定すると 誤る)2 つの 倉庫で 1 件あたりの ピッキング時間(秒)を 測った。倉庫 A( m = 12 m = 12 m = 12 )は 31, 33, 30, 32, 34, 32, 33, 32, 30, 34, 32, 31(x ˉ = 32 \bar{x} = 32 x ˉ = 32 , s X 2 = 20 / 11 s_X^2 = 20/11 s X 2 = 20/11 )、新設の 倉庫 B( n = 6 n = 6 n = 6 )は 37, 28, 42, 31, 45, 39(y ˉ = 37 \bar{y} = 37 y ˉ = 37 , s Y 2 = 42 s_Y^2 = 42 s Y 2 = 42 )だった。
検定
標準誤差
t t t 値
自由度
p p p 値
差の 95% 信頼区間
等分散の t t t 検定
1.90
2.64
16
0.018
[ 0.98 , 9.02 ] [0.98, 9.02] [ 0.98 , 9.02 ]
ウェルチの t t t 検定
2.67
1.87
5.22
0.118
[ − 1.79 , 11.79 ] [-1.79, 11.79] [ − 1.79 , 11.79 ]
等分散を 仮定すると、ばら つきの 小さい A が プールした 分散を 引き下げ、B の 平均の 不確かさを 過小評価する。どちらが 正しく 働くかを、平均が 等しいと いう H 0 H_0 H 0 のもとで 100 万回の シミュレーションで 調べると、名目 5% の 検定の 実際の 第 1 種の 過誤の 確率は 次の とおりだった。
群 1( 大きさ、標準偏差)
群 2( 大きさ、標準偏差)
等分散の t t t 検定
ウェルチの t t t 検定
12, 1
6, 5
18.3%
5.2%
6, 1
12, 5
1.2%
5.0%
10, 1
10, 3
5.9%
5.1%
12, 1
6, 1
5.0%
5.1%
小さい 群の 分散が 大きいと 等分散の 検定は 有意を 出しすぎ、逆なら 保守的に なって 検出力を 失う。ウェルチの 検定は 分散が 本当に 等しい ときの 損失も 小さい(群の 大きさ 12 と 6、平均の 差が σ \sigma σ の とき、検出力は 0.47 0.47 0.47 対 0.44 0.44 0.44 )。
ヒント
実務では
2 群の 平均の 比較では、ウェルチの 検定を 既定に するのが よい。「まず 等分散の 検定を して、その 結果で 使う 検定を 選ぶ」二段階の 手順は、全体と しての 有意水準が 保証されないので 勧められない。ソフトウェアの 既定値も 違い、R の t.test は ウェルチ、SciPy の scipy.stats.ttest_ind は 等分散( equal_var=True)が 既定である。また、同じ 対象を 2 回測った データは 対応の ある t t t 検定で 分析する(例 4.18 (2))。いずれの t t t 検定も、歪んだ 分布で 標本が 小さいと 例 4.4 のように 精度が 落ちる。
4.7 χ 2 \chi^2 χ 2 検定
定理 4.21 (ピアソンの χ 2 \chi^2 χ 2 適合度検定)独立な n n n 回の 試行で、各回は 確率 p j > 0 p_j > 0 p j > 0 で カテゴリ j j j (j = 1 , … , k j = 1, \dots, k j = 1 , … , k )に なるとし、カテゴリ j j j の 度数を N j N_j N j と する。 n → ∞ n \to \infty n → ∞ の とき
X 2 = ∑ j = 1 k ( N j − n p j ) 2 n p j → d χ 2 ( k − 1 ) X^2 = \sum_{j=1}^k \frac{(N_j - np_j)^2}{np_j} \xrightarrow{d} \chi^2(k - 1) X 2 = j = 1 ∑ k n p j ( N j − n p j ) 2 d χ 2 ( k − 1 )
証明. i i i 回目の 試行が カテゴリ j j j の とき第 j j j 成分だけが 1 1 1 の ベクトルを Y i ∈ R k Y_i \in \mathbb{R}^k Y i ∈ R k と すると、 N = ( N 1 , … , N k ) ⊤ = ∑ i Y i N = (N_1, \dots, N_k)^{\top} = \sum_i Y_i N = ( N 1 , … , N k ) ⊤ = ∑ i Y i で、Y i Y_i Y i は i.i.d.、E [ Y i ] = p E[Y_i] = p E [ Y i ] = p 、E [ Y i j Y i l ] = δ j l p j E[Y_{ij}Y_{il}] = \delta_{jl}p_j E [ Y ij Y i l ] = δ j l p j より Cov ( Y i ) = diag ( p ) − p p ⊤ \operatorname{Cov}(Y_i) = \operatorname{diag}(p) - pp^{\top} Cov ( Y i ) = diag ( p ) − p p ⊤ である(A ⊤ A^{\top} A ⊤ は 転置で、 02 線形代数 の t A {}^tA t A と 同じ)。 D = diag ( p 1 , … , p k ) D = \operatorname{diag}(\sqrt{p_1}, \dots, \sqrt{p_k}) D = diag ( p 1 , … , p k ) 、q = ( p 1 , … , p k ) ⊤ q = (\sqrt{p_1}, \dots, \sqrt{p_k})^{\top} q = ( p 1 , … , p k ) ⊤ と おくと ∥ q ∥ = 1 \lVert q \rVert = 1 ∥ q ∥ = 1 で、Z n = D − 1 ( N − n p ) / n Z_n = D^{-1}(N - np)/\sqrt{n} Z n = D − 1 ( N − n p ) / n は、多次元の 中心極限定理( 第1章 定理 1.28)より
Z n → d N k ( 0 , D − 1 ( diag ( p ) − p p ⊤ ) D − 1 ) = N k ( 0 , I − q q ⊤ ) Z_n \xrightarrow{d} N_k\bigl(0, D^{-1}(\operatorname{diag}(p) - pp^{\top})D^{-1}\bigr) = N_k(0, I - qq^{\top}) Z n d N k ( 0 , D − 1 ( diag ( p ) − p p ⊤ ) D − 1 ) = N k ( 0 , I − q q ⊤ )
を 満たす。 P = I − q q ⊤ P = I - qq^{\top} P = I − q q ⊤ は q q q の 直交補空間( k − 1 k - 1 k − 1 次元)への 直交射影である。 W ∼ N k ( 0 , I ) W \sim N_k(0, I) W ∼ N k ( 0 , I ) と すると P W ∼ N k ( 0 , P P ⊤ ) = N k ( 0 , P ) PW \sim N_k(0, PP^{\top}) = N_k(0, P) P W ∼ N k ( 0 , P P ⊤ ) = N k ( 0 , P ) なので、極限は P W PW P W と 同じ 分布であり、 第2章 の 正規ベクトルの 直交分解(定理 2.7)より ∥ P W ∥ 2 ∼ χ 2 ( k − 1 ) \lVert PW \rVert^2 \sim \chi^2(k-1) ∥ P W ∥ 2 ∼ χ 2 ( k − 1 ) 。X 2 = ∥ Z n ∥ 2 X^2 = \lVert Z_n \rVert^2 X 2 = ∥ Z n ∥ 2 で x ↦ ∥ x ∥ 2 x \mapsto \lVert x \rVert^2 x ↦ ∥ x ∥ 2 は 連続なので、連続写像定理(第1章 定理 1.29)より X 2 → d χ 2 ( k − 1 ) X^2 \xrightarrow{d} \chi^2(k-1) X 2 d χ 2 ( k − 1 ) 。□ \square □
期待度数 n p j np_j n p j が おおむね 5 以上なら 近似が よい、と いうのは 経験則であり、度数の 小さい カテゴリが ある ときは 正確な 検定を 使う。また、 p j p_j p j が s s s 個の 未知パラメータで 決まる モデルを 検定する とき、その パラメータを 度数 N 1 , … , N k N_1, \dots, N_k N 1 , … , N k から 最尤法で 推定して n p j np_j n p j を 置き換えると、極限は χ 2 ( k − 1 − s ) \chi^2(k - 1 - s) χ 2 ( k − 1 − s ) に なる(主張のみ)。分類する 前の 元の データから 推定した 値(たとえば 連続データの 標本平均と 標本分 散)を 使った 場合は、極限は χ 2 ( k − 1 − s ) \chi^2(k - 1 - s) χ 2 ( k − 1 − s ) と χ 2 ( k − 1 ) \chi^2(k - 1) χ 2 ( k − 1 ) の 間に ある 分布に なり、 χ 2 ( k − 1 − s ) \chi^2(k - 1 - s) χ 2 ( k − 1 − s ) の 棄却点を 使うと 有意を 出しすぎる(チャーノフ–レーマンの 結果)。
例 4.22 (サンプル比率の 不一致)A/B/C の 3 案に 訪問者を 1:1:1 で 無作為に 振り分けたはずが、人数は 5,060、4,980、4,760 だった。 H 0 : p = ( 1 / 3 , 1 / 3 , 1 / 3 ) H_0\colon p = (1/3, 1/3, 1/3) H 0 : p = ( 1/3 , 1/3 , 1/3 ) で X 2 = 9.78 X^2 = 9.78 X 2 = 9.78 、自由度 2、p = 0.0075 p = 0.0075 p = 0.0075 である。振り 分けや ログの 記録の 不具合が 疑われ、このまま 3 案の 成果を 比べるのは 危険である。オンライン実験では、この 検査を 毎回 行うことが 勧められている(Kohavi–Tang–Xu)。
定理 4.23 (独立性の χ 2 \chi^2 χ 2 検定)n n n 個の 対象を 2 つの 属性( r r r 通りと c c c 通り)で 分類した 度数を N i j N_{ij} N ij とし、N i ⋅ = ∑ j N i j N_{i\cdot} = \sum_j N_{ij} N i ⋅ = ∑ j N ij 、N ⋅ j = ∑ i N i j N_{\cdot j} = \sum_i N_{ij} N ⋅ j = ∑ i N ij 、E ^ i j = N i ⋅ N ⋅ j / n \hat{E}_{ij} = N_{i\cdot}N_{\cdot j}/n E ^ ij = N i ⋅ N ⋅ j / n と する。各対象が 独立に 同じ 分布に 従い、2 つの 属性が 独立( H 0 H_0 H 0 )で、周辺確率が すべて 正ならば
X 2 = ∑ i = 1 r ∑ j = 1 c ( N i j − E ^ i j ) 2 E ^ i j → d χ 2 ( ( r − 1 ) ( c − 1 ) ) X^2 = \sum_{i=1}^r\sum_{j=1}^c \frac{(N_{ij} - \hat{E}_{ij})^2}{\hat{E}_{ij}} \xrightarrow{d} \chi^2\bigl((r-1)(c-1)\bigr) X 2 = i = 1 ∑ r j = 1 ∑ c E ^ ij ( N ij − E ^ ij ) 2 d χ 2 ( ( r − 1 ) ( c − 1 ) )
主張のみと する。自由度は、全体の r c − 1 rc - 1 r c − 1 個の 自由な パラメータから、 H 0 H_0 H 0 のもとで 推定する ( r − 1 ) + ( c − 1 ) (r - 1) + (c - 1) ( r − 1 ) + ( c − 1 ) 個を 引いた ものである。行ごとの 人数を 実験者が 決める 場合(群ごとの 比率が 等しいかの 検定)も、同じ 統計量と 自由度を 使う。
例 4.24 (第1章の A/B テスト) 2 × 2 の 分割表(A は 購入 210・非購入 9,790、B は 購入 240・非購入 9,760)で X 2 = 2.05 X^2 = 2.05 X 2 = 2.05 、自由度 1、p = 0.153 p = 0.153 p = 0.153 である。2 × 2 表の X 2 X^2 X 2 は、2 群を 合わせた 比率 p ˉ \bar{p} p ˉ を 使った 比率の 差の z z z 統計量 z = ( p ^ B − p ^ A ) / p ˉ ( 1 − p ˉ ) ( 1 / m + 1 / n ) z = (\hat{p}_B - \hat{p}_A)/\sqrt{\bar{p}(1 - \bar{p})(1/m + 1/n)} z = ( p ^ B − p ^ A ) / p ˉ ( 1 − p ˉ ) ( 1/ m + 1/ n ) の 2 乗に 等しい(問題 4.4。ここでは z = 1.43 z = 1.43 z = 1.43 )。なお、R の chisq.test と SciPy の chi2_contingency は、2 × 2 表では 既定で イェーツの 連続修正を かける(この 例では X 2 = 1.91 X^2 = 1.91 X 2 = 1.91 、p = 0.167 p = 0.167 p = 0.167 )。ツールに よって 数値が 違う ときは、こうした 既定値を 確かめる。
4.8 検定と 信頼区間の 双対性
定理 4.25 (検定と 信頼区間の 双対性)
各 θ 0 ∈ Θ \theta_0 \in \Theta θ 0 ∈ Θ に ついて H 0 : θ = θ 0 H_0\colon \theta = \theta_0 H 0 : θ = θ 0 の 有意水準 α \alpha α の 検定が あり、その 受容域(棄却しない x x x の 集合)を A ( θ 0 ) A(\theta_0) A ( θ 0 ) と する。この とき C ( x ) = { θ 0 ∈ Θ ∣ x ∈ A ( θ 0 ) } C(x) = \lbrace \theta_0 \in \Theta \mid x \in A(\theta_0) \rbrace C ( x ) = { θ 0 ∈ Θ ∣ x ∈ A ( θ 0 )} は、すべての θ \theta θ で P θ ( θ ∈ C ( X ) ) ≥ 1 − α P_\theta(\theta \in C(X)) \geq 1 - \alpha P θ ( θ ∈ C ( X )) ≥ 1 − α を 満たす(信頼係数 1 − α 1 - \alpha 1 − α の 信頼集合 )。
逆に C ( X ) C(X) C ( X ) が 信頼係数 1 − α 1 - \alpha 1 − α の 信頼集合なら、 A ( θ 0 ) = { x ∣ θ 0 ∈ C ( x ) } A(\theta_0) = \lbrace x \mid \theta_0 \in C(x) \rbrace A ( θ 0 ) = { x ∣ θ 0 ∈ C ( x )} を 受容域と する 検定は、 H 0 : θ = θ 0 H_0\colon \theta = \theta_0 H 0 : θ = θ 0 の 有意水準 α \alpha α の 検定である。
証明. どちらの 場合も θ 0 ∈ C ( x ) ⟺ x ∈ A ( θ 0 ) \theta_0 \in C(x) \iff x \in A(\theta_0) θ 0 ∈ C ( x ) ⟺ x ∈ A ( θ 0 ) なので、P θ 0 ( θ 0 ∈ C ( X ) ) = P θ 0 ( X ∈ A ( θ 0 ) ) P_{\theta_0}(\theta_0 \in C(X)) = P_{\theta_0}(X \in A(\theta_0)) P θ 0 ( θ 0 ∈ C ( X )) = P θ 0 ( X ∈ A ( θ 0 )) である。この 値が 1 − α 1 - \alpha 1 − α 以上である ことと、 θ 0 \theta_0 θ 0 で 棄却する 確率が α \alpha α 以下である ことは 同値である。 □ \square □
t t t 区間と 両側 t t t 検定(例 4.18 (1))、ウィルソン区間と「∣ p ^ − p 0 ∣ / p 0 ( 1 − p 0 ) / n > z α / 2 \lvert \hat{p} - p_0 \rvert/\sqrt{p_0(1-p_0)/n} > z_{\alpha/2} ∣ p ^ − p 0 ∣ / p 0 ( 1 − p 0 ) / n > z α /2 なら 棄却する」スコア検定(命題 4.5 の 2)は、この 意味で 対応している。ワルド区間と スコア検定のように 作り方の 違う 区間と 検定は、境目で 結論が 食い 違うことが あるので、同じ 方法の ものを 組に して 報告する。 p p p 値は「θ 0 \theta_0 θ 0 から どれだけ離れているか」しか 示さないが、信頼区間は パラメータの ありうる 範囲を 示し、すべての θ 0 \theta_0 θ 0 に ついての 検定の 結果を 含んでいる。
4.9 効果量
有意か どうかは、効果の 大きさと 標本の 大きさの 両方で 決まる。効果の 大きさ その ものを 表す量を 効果量 (effect size) と いう。元の 単位での 差(平均の 差、比率の 差)、比(相対的な 改善率 p ^ B / p ^ A − 1 \hat{p}_B/\hat{p}_A - 1 p ^ B / p ^ A − 1 )、標準偏差を 単位に した 差 d = ( x ˉ − y ˉ ) / s p d = (\bar{x} - \bar{y})/s_p d = ( x ˉ − y ˉ ) / s p (コーエンの d d d )などが ある。 d d d に ついて 0.2・0.5・0.8 を 小・中・大と する 目安は 行動科学の 慣習であり、実務上の 重要さは 文脈で 決まる。等分散の t t t 統計量は t = d m n / ( m + n ) t = d\sqrt{mn/(m+n)} t = d mn / ( m + n ) と 書けるので、 d d d が 一定でも t t t は n \sqrt{n} n に 比例して 大きくなる。
例 4.26 (1)(有意だが 重要でない) m = n = 10000 m = n = 10000 m = n = 10000 で d = 0.05 d = 0.05 d = 0.05 なら t = 3.54 t = 3.54 t = 3.54 、p = 0.0004 p = 0.0004 p = 0.0004 で「高度に 有意」だが、平均の 差は 標準偏差の 5% に すぎず、2 群の 分布は ほとんど 重なっている。
(2)(有意でないが、差が ないとは 言えない)第1章の A/B テストでは p = 0.153 p = 0.153 p = 0.153 で 有意でないが、購入率の 差の 95% 信頼区間(ワルド型)は [ − 0.11 , 0.71 ] [-0.11, 0.71] [ − 0.11 , 0.71 ] ポイントで、A の 購入率 2.1% で 割って 概算すると、相対的には − 5 -5 − 5 % から + 34 +34 + 34 % の 改善に 当たる。データは「効果なし」とも「3 割以上の 改善」とも 両立しており、「B は 効果が ない」とは 結論できない。仮に 真の 差が 0.3 ポイント(相対 14% の 改善)あったとしても、この 標本の 大きさでの 検出力は 約 0.30 0.30 0.30 しかない。ただし、検出力は 本来、実験の 前に「実務上意味の ある 最小の 差」に ついて 計算する ものである(次の TIP)。観測された 差を そのまま真の 差と みなして 事後的に 計算した 検出力は p p p 値の 言い 換えに すぎず(両側 z z z 検定なら、p > 0.05 p > 0.05 p > 0.05 の とき およそ 0.5 0.5 0.5 以下に なる)、 p p p 値以上の 情報を もたない。
ヒント
実務では
結果は「推定値と 信頼区間(と 効果量)」で 報告し、 p p p 値は その 補足に と どめる。事前に「実務上意味の ある 最小の 差」を 決め、それを 検出できる 標本の 大きさを 確保する( 第8章 )。「差が ない」ことを 示したい ときは、許容できる 幅 ± Δ \pm\Delta ± Δ を 前もって 決め、差の 1 − 2 α 1 - 2\alpha 1 − 2 α 信頼区間が ( − Δ , Δ ) (-\Delta, \Delta) ( − Δ , Δ ) に 収まるかを 確かめる(同等性検定)。
まとめ
信頼区間は 枢軸量から 作る。「95%」は 区間を 作る 手続きの 被覆確率であり、計算済みの 区間が θ \theta θ を 含む 確率ではない。
正規平均の t t t 区間は 非正規性に 比較的強いが、分散の χ 2 \chi^2 χ 2 区間は 正規性が 崩れると n n n を 増やしても 正しくならない。母比率では、 n p np n p が 小さい ときワルド区間より ウィルソン区間が よい。
検定は 第 1 種の 過誤の 確率を α \alpha α 以下に 抑え、検出力を 大きくする。棄却しない ことは H 0 H_0 H 0 の 証明ではない。
連続な 検定統計量の p p p 値は H 0 H_0 H 0 のもとで 一様分布に 従い、一般にも P ( p ≤ u ) ≤ u P(p \leq u) \leq u P ( p ≤ u ) ≤ u である。p p p 値は H 0 H_0 H 0 が 正しい 確率ではない。
単純仮説どうしでは 尤度比で 棄却する 検定が 最強力である(ネイマン–ピアソンの 補題)。尤度比検定の 統計量 − 2 log Λ n -2\log\Lambda_n − 2 log Λ n は、正則条件と 内点の 仮定のもとで χ 2 \chi^2 χ 2 分布に 近づく(ウィルクスの 定理)。
平均の 比較には t t t 検定を 使う。対応の ある データは 差を とり、2 群の 比較は ウェルチの 検定を 既定に する。
χ 2 \chi^2 χ 2 検定は 度数の 適合度と 独立性を 調べる。2 × 2 表では 比率の 差の z z z 検定と 同じである。
検定と 信頼区間は 表裏一体であり(双対性)、結果は 効果量と 信頼区間で 報告する。「有意でない」は「差が ない」ではなく、「有意」は「重要」ではない。
演習問題
問題 4.1 ★ 例 4.3 の 95% 信頼区間 [ 50.51 , 56.69 ] [50.51, 56.69] [ 50.51 , 56.69 ] に ついて、次の 解釈の 正誤を 答えよ。(a) μ \mu μ が この 区間に 入る 確率は 95% である。(b) 同じ 方法で 区間を 何度も 作れば、約 95% の 区間が μ \mu μ を 含む。(c) 今後の 配送の 約 95% は、この 範囲の 時間で 終わる。(d) 有意水準 5% の 両側 t t t 検定で、H 0 : μ = 55 H_0\colon \mu = 55 H 0 : μ = 55 は 棄却されない。
解答
(a) 誤り。μ \mu μ は 定数で、確率 95% は 区間を 作る 手続きの 性質である。(b) 正しい。これが 信頼係数の 意味である。(c) 誤り。信頼区間は 平均 μ \mu μ の 範囲であり、個々の 配送時間は 標準偏差 4.3 4.3 4.3 分程度で ばらつく。次の 1 回の 値 X n + 1 X_{n+1} X n + 1 に ついて ( X n + 1 − X ˉ ) / ( S 1 + 1 / n ) ∼ t ( n − 1 ) (X_{n+1} - \bar{X})/(S\sqrt{1 + 1/n}) \sim t(n-1) ( X n + 1 − X ˉ ) / ( S 1 + 1/ n ) ∼ t ( n − 1 ) なので、その 95% の 範囲(予測区間)は 53.6 ± 2.262 × 4.326 × 1.1 = [ 43.3 , 63.9 ] 53.6 \pm 2.262 \times 4.326 \times \sqrt{1.1} = [43.3, 63.9] 53.6 ± 2.262 × 4.326 × 1.1 = [ 43.3 , 63.9 ] と ずっと 広い。(d) 正しい。55 は 区間に 含まれるので、双対性(定理 4.25)より 棄却されない(実際 p = 0.33 p = 0.33 p = 0.33 )。
問題 4.2 ★ 大きさ 16 の 標本で x ˉ = 102.5 \bar{x} = 102.5 x ˉ = 102.5 、s = 6.0 s = 6.0 s = 6.0 だった。正規母集団を 仮定して、 H 0 : μ = 100 H_0\colon \mu = 100 H 0 : μ = 100 の 両側 t t t 検定(有意水準 5%)を 行い、 μ \mu μ の 95% 信頼区間を 求めよ( t 0.025 ( 15 ) = 2.131 t_{0.025}(15) = 2.131 t 0.025 ( 15 ) = 2.131 )。結果が 有意でなかった ことから「 μ = 100 \mu = 100 μ = 100 である」と 結論して よいか。
解答
標準誤差は 6 / 4 = 1.5 6/4 = 1.5 6/4 = 1.5 、t = 2.5 / 1.5 = 1.67 < 2.131 t = 2.5/1.5 = 1.67 < 2.131 t = 2.5/1.5 = 1.67 < 2.131 なので 棄却されない( p = 0.116 p = 0.116 p = 0.116 )。信頼区間は 102.5 ± 2.131 × 1.5 = [ 99.30 , 105.70 ] 102.5 \pm 2.131 \times 1.5 = [99.30, 105.70] 102.5 ± 2.131 × 1.5 = [ 99.30 , 105.70 ] 。区間は 100 を 含むが、105 付近までの 値も 含んでいる。データは μ = 100 \mu = 100 μ = 100 とも μ = 105 \mu = 105 μ = 105 とも 両立しており、「 μ = 100 \mu = 100 μ = 100 である」とは 結論できない。言えるのは「 μ = 100 \mu = 100 μ = 100 を 否定する 十分な 証拠は ない」ことだけである。
問題 4.3 ★ ★ 部品の 寿命 X 1 , … , X n X_1, \dots, X_n X 1 , … , X n が i.i.d. で Exp ( λ ) \operatorname{Exp}(\lambda) Exp ( λ ) に 従う。 H 0 : λ = λ 0 H_0\colon \lambda = \lambda_0 H 0 : λ = λ 0 、H 1 : λ = λ 1 H_1\colon \lambda = \lambda_1 H 1 : λ = λ 1 (λ 1 < λ 0 \lambda_1 < \lambda_0 λ 1 < λ 0 。平均寿命が 長い)に ついて、(1) 最強力検定が「 ∑ i X i \sum_i X_i ∑ i X i が 大きいとき棄却」である ことを 示し、 2 λ 0 ∑ i X i ∼ χ 2 ( 2 n ) 2\lambda_0\sum_i X_i \sim \chi^2(2n) 2 λ 0 ∑ i X i ∼ χ 2 ( 2 n ) を 使って 棄却点を 求めよ。(2) これが H 1 : λ < λ 0 H_1\colon \lambda < \lambda_0 H 1 : λ < λ 0 の 一様 最強力検定である ことを 示せ。(3) H 0 H_0 H 0 の 平均寿命が 1000 時間、 n = 10 n = 10 n = 10 、有意水準 5% の とき、 x ˉ \bar{x} x ˉ が いくつを 超えたら 棄却するか( χ 0.05 2 ( 20 ) = 31.41 \chi^2_{0.05}(20) = 31.41 χ 0.05 2 ( 20 ) = 31.41 )。
解答
(1) f 1 ( x ) f 0 ( x ) = ( λ 1 λ 0 ) n exp ( ( λ 0 − λ 1 ) ∑ i x i ) \frac{f_1(x)}{f_0(x)} = \bigl(\frac{\lambda_1}{\lambda_0}\bigr)^n\exp\bigl((\lambda_0 - \lambda_1)\sum_i x_i\bigr) f 0 ( x ) f 1 ( x ) = ( λ 0 λ 1 ) n exp ( ( λ 0 − λ 1 ) ∑ i x i ) は λ 0 > λ 1 \lambda_0 > \lambda_1 λ 0 > λ 1 より ∑ i x i \sum_i x_i ∑ i x i の 増加関数なので、定理 4.11 より 最強力検定は ∑ i X i > c \sum_i X_i > c ∑ i X i > c で 棄却する。 H 0 H_0 H 0 のもとで ∑ i X i ∼ Gamma ( n , λ 0 ) \sum_i X_i \sim \operatorname{Gamma}(n, \lambda_0) ∑ i X i ∼ Gamma ( n , λ 0 ) で、密度の 変数変換より 2 λ 0 ∑ i X i ∼ Gamma ( n , 1 / 2 ) = χ 2 ( 2 n ) 2\lambda_0\sum_i X_i \sim \operatorname{Gamma}(n, 1/2) = \chi^2(2n) 2 λ 0 ∑ i X i ∼ Gamma ( n , 1/2 ) = χ 2 ( 2 n ) (第2章 定理 2.6)。よって c = χ α 2 ( 2 n ) / ( 2 λ 0 ) c = \chi^2_\alpha(2n)/(2\lambda_0) c = χ α 2 ( 2 n ) / ( 2 λ 0 ) 。(2) この 検定は λ 1 \lambda_1 λ 1 に よらないので、すべての λ 1 < λ 0 \lambda_1 < \lambda_0 λ 1 < λ 0 に 対して 最強力である。(3) c = 31.41 × 1000 / 2 = 15705 c = 31.41 \times 1000/2 = 15705 c = 31.41 × 1000/2 = 15705 時間、すな わち x ˉ > 1570.5 \bar{x} > 1570.5 x ˉ > 1570.5 時間で 棄却する。真の 平均寿命が 2000 時間でも、検出力は P ( χ 2 ( 20 ) > 15.705 ) ≈ 0.73 P(\chi^2(20) > 15.705) \approx 0.73 P ( χ 2 ( 20 ) > 15.705 ) ≈ 0.73 にと どまる。
問題 4.4 ★ ★ 2 × 2 表で、群 A の 成功・失敗の 度数を a , b a, b a , b 、群 B の 成功・失敗の 度数を c , d c, d c , d とし、m = a + b m = a + b m = a + b 、n = c + d n = c + d n = c + d 、N = m + n N = m + n N = m + n 、s = a + c s = a + c s = a + c 、f = b + d f = b + d f = b + d と する。独立性の χ 2 \chi^2 χ 2 統計量が X 2 = N ( a d − b c ) 2 m n s f X^2 = \frac{N(ad - bc)^2}{mnsf} X 2 = mn s f N ( a d − b c ) 2 に 等しく、比率の 差の z z z 統計量(例 4.24)の 2 乗に 一致する ことを 示せ。
解答
E ^ 11 = m s / N \hat{E}_{11} = ms/N E ^ 11 = m s / N なので a − E ^ 11 = a ( a + b + c + d ) − ( a + b ) ( a + c ) N = a d − b c N a - \hat{E}_{11} = \frac{a(a + b + c + d) - (a + b)(a + c)}{N} = \frac{ad - bc}{N} a − E ^ 11 = N a ( a + b + c + d ) − ( a + b ) ( a + c ) = N a d − b c 。他の セルも 符号を 除いて 同じ値である(行和・ 列和が 一致するから)。よって
X 2 = ( a d − b c ) 2 N 2 ( N m s + N m f + N n s + N n f ) = ( a d − b c ) 2 N ⋅ ( m + n ) ( s + f ) m n s f = N ( a d − b c ) 2 m n s f X^2 = \frac{(ad - bc)^2}{N^2}\Bigl(\frac{N}{ms} + \frac{N}{mf} + \frac{N}{ns} + \frac{N}{nf}\Bigr) = \frac{(ad - bc)^2}{N}\cdot\frac{(m + n)(s + f)}{mnsf} = \frac{N(ad - bc)^2}{mnsf} X 2 = N 2 ( a d − b c ) 2 ( m s N + m f N + n s N + n f N ) = N ( a d − b c ) 2 ⋅ mn s f ( m + n ) ( s + f ) = mn s f N ( a d − b c ) 2
一方 p ^ A − p ^ B = a m − c n = a n − c m m n \hat{p}_A - \hat{p}_B = \frac{a}{m} - \frac{c}{n} = \frac{an - cm}{mn} p ^ A − p ^ B = m a − n c = mn an − c m で、a n − c m = a ( c + d ) − c ( a + b ) = a d − b c an - cm = a(c + d) - c(a + b) = ad - bc an − c m = a ( c + d ) − c ( a + b ) = a d − b c 。p ˉ = s / N \bar{p} = s/N p ˉ = s / N より p ˉ ( 1 − p ˉ ) ( 1 m + 1 n ) = s f N 2 ⋅ N m n = s f N m n \bar{p}(1 - \bar{p})(\frac{1}{m} + \frac{1}{n}) = \frac{sf}{N^2}\cdot\frac{N}{mn} = \frac{sf}{Nmn} p ˉ ( 1 − p ˉ ) ( m 1 + n 1 ) = N 2 s f ⋅ mn N = N mn s f 。よって z 2 = ( a d − b c ) 2 m 2 n 2 ⋅ N m n s f = N ( a d − b c ) 2 m n s f = X 2 z^2 = \frac{(ad - bc)^2}{m^2n^2}\cdot\frac{Nmn}{sf} = \frac{N(ad - bc)^2}{mnsf} = X^2 z 2 = m 2 n 2 ( a d − b c ) 2 ⋅ s f N mn = mn s f N ( a d − b c ) 2 = X 2 。
問題 4.5 ★ ★ 例 4.15 の 統計量に ついて、 H 0 H_0 H 0 のもとで − 2 log Λ n − n ( X ˉ − λ 0 ) 2 / λ 0 → P 0 -2\log\Lambda_n - n(\bar{X} - \lambda_0)^2/\lambda_0 \xrightarrow{P} 0 − 2 log Λ n − n ( X ˉ − λ 0 ) 2 / λ 0 P 0 を 示し、ウィルクスの 定理の 結論 − 2 log Λ n → d χ 2 ( 1 ) -2\log\Lambda_n \xrightarrow{d} \chi^2(1) − 2 log Λ n d χ 2 ( 1 ) を 直接確かめよ。例 4.15 の 数値で n ( x ˉ − λ 0 ) 2 / λ 0 n(\bar{x} - \lambda_0)^2/\lambda_0 n ( x ˉ − λ 0 ) 2 / λ 0 を 計算せよ。
解答
g ( x ) = x log ( x / λ 0 ) − ( x − λ 0 ) g(x) = x\log(x/\lambda_0) - (x - \lambda_0) g ( x ) = x log ( x / λ 0 ) − ( x − λ 0 ) と おくと g ( λ 0 ) = 0 g(\lambda_0) = 0 g ( λ 0 ) = 0 、g ′ ( x ) = log ( x / λ 0 ) g'(x) = \log(x/\lambda_0) g ′ ( x ) = log ( x / λ 0 ) 、g ′ ′ ( x ) = 1 / x g''(x) = 1/x g ′′ ( x ) = 1/ x 、g ′ ′ ′ ( x ) = − 1 / x 2 g'''(x) = -1/x^2 g ′′′ ( x ) = − 1/ x 2 。h = X ˉ − λ 0 h = \bar{X} - \lambda_0 h = X ˉ − λ 0 、∣ h ∣ ≤ λ 0 / 2 \lvert h \rvert \leq \lambda_0/2 ∣ h ∣ ≤ λ 0 /2 の とき、テイラーの 定理より g ( X ˉ ) = h 2 2 λ 0 + R g(\bar{X}) = \frac{h^2}{2\lambda_0} + R g ( X ˉ ) = 2 λ 0 h 2 + R 、∣ R ∣ ≤ 4 6 λ 0 2 ∣ h ∣ 3 \lvert R \rvert \leq \frac{4}{6\lambda_0^2}\lvert h \rvert^3 ∣ R ∣ ≤ 6 λ 0 2 4 ∣ h ∣ 3 。よって − 2 log Λ n = 2 n g ( X ˉ ) = n h 2 λ 0 + 2 n R -2\log\Lambda_n = 2ng(\bar{X}) = \frac{nh^2}{\lambda_0} + 2nR − 2 log Λ n = 2 n g ( X ˉ ) = λ 0 n h 2 + 2 n R 。中心極限定理より n h → d N ( 0 , λ 0 ) \sqrt{n}h \xrightarrow{d} N(0, \lambda_0) n h d N ( 0 , λ 0 ) なので、P ( ∣ h ∣ > λ 0 / 2 ) → 0 P(\lvert h \rvert > \lambda_0/2) \to 0 P (∣ h ∣ > λ 0 /2 ) → 0 で、n ∣ h ∣ 3 = ( n ∣ h ∣ ) 3 / n → P 0 n\lvert h \rvert^3 = (\sqrt{n}\lvert h \rvert)^3/\sqrt{n} \xrightarrow{P} 0 n ∣ h ∣ 3 = ( n ∣ h ∣ ) 3 / n P 0 。したがって 2 n R → P 0 2nR \xrightarrow{P} 0 2 n R P 0 で、スルツキーの 定理より − 2 log Λ n -2\log\Lambda_n − 2 log Λ n は n h 2 / λ 0 = ( n h / λ 0 ) 2 nh^2/\lambda_0 = (\sqrt{n}h/\sqrt{\lambda_0})^2 n h 2 / λ 0 = ( n h / λ 0 ) 2 と 同じ 極限 χ 2 ( 1 ) \chi^2(1) χ 2 ( 1 ) を もつ(連続写像定理)。数値は 30 × 0.6 2 / 4 = 2.70 30 \times 0.6^2/4 = 2.70 30 × 0. 6 2 /4 = 2.70 (p = 0.100 p = 0.100 p = 0.100 )で、− 2 log Λ n = 2.57 -2\log\Lambda_n = 2.57 − 2 log Λ n = 2.57 (p = 0.109 p = 0.109 p = 0.109 )に 近い。これは スコア検定の 統計量である。
問題 4.6 ★ ★ 【この 結論は 正しいか 】メールの 件名を 変える テストで、各 2,000 通を 送り、開封率は 旧件名 20.0%、新件名 21.0% だった。比率の 差の 検定で p = 0.43 p = 0.43 p = 0.43 と なり、担当者は「新しい 件名には 効果が なかった」と 報告した。この 結論の 問題点を 指摘し、何を 報告すべきか 述べよ。
解答
「有意でない」ことは「効果が ない」ことを 示さない。差の 95% 信頼区間(ワルド型)は 0.01 ± 1.96 0.2 × 0.8 / 2000 + 0.21 × 0.79 / 2000 = [ − 1.5 , 3.5 ] 0.01 \pm 1.96\sqrt{0.2 \times 0.8/2000 + 0.21 \times 0.79/2000} = [-1.5, 3.5] 0.01 ± 1.96 0.2 × 0.8/2000 + 0.21 × 0.79/2000 = [ − 1.5 , 3.5 ] ポイントで、データは 悪化 1.5 ポイントとも 改善 3.5 ポイントとも 両立する。この 標本の 大きさで、真の 改善が 2 ポイント(20% → 22%)あったとしても、有意水準 5% の 両側検定の 検出力は 約 0.34 0.34 0.34 しかない。報告すべきは「差の 推定値 +1.0 ポイント、95% 信頼区間 [ − 1.5 , 3.5 ] [-1.5, 3.5] [ − 1.5 , 3.5 ] ポイント、この 実験では 判断できない」であり、実務上意味の ある 差を 決めて 必要な 標本の 大きさを 計算し直すべきである。効果が ない ことを 主張したいなら、許容幅を 決めて 同等性検定を 行う。
問題 4.7 ★ ★ 【この 分析の どこが 危ないか 】ある A/B テストで、クリック率・滞在時間・購入率など 20 個の 指標を 比べた ところ、1 個だけで p = 0.03 p = 0.03 p = 0.03 と なったので、「新デザインは その 指標を 改善した」と 報告した。何が 問題か。すべての 指標で 真の 差が なく、20 個の 検定が 独立だと して、少なくとも 1 個が p < 0.05 p < 0.05 p < 0.05 と なる 確率を 求めよ。
解答
各検定は 単独では 有意水準 5% だが、20 個の 中から 有意な ものを 選んで 報告すると、すべての 指標で 真の 差が なくても、どれかが「有意」に なる 確率(ファミリーワイズの 誤り率)は 5% よりはるかに 大きい。独立なら 少なくとも 1 個が 有意に なる 確率は 1 − 0.95 20 ≈ 0.64 1 - 0.95^{20} \approx 0.64 1 − 0.9 5 20 ≈ 0.64 である(実際の 指標は 互いに 相関するので 値は 変わるが、問題は 残る)。したがって p = 0.03 p = 0.03 p = 0.03 の 指標が 1 個 見つかった ことは、新デザインの 効果の 証拠と しては きわめて 弱い。主要な 指標を 事前に 1 つ 決めて おく、複数の 指標を 同時に 評価するなら ボンフェローニ法(各検定を 0.05 / 20 = 0.0025 0.05/20 = 0.0025 0.05/20 = 0.0025 で 行う)や ホルム法などの 多重比較の 補正を 使う( 第8章 )、その 他の 指標の 結果は 探索的な ものとして 扱い、別の 実験で 確かめる、などが 必要である。