この 章の 目標
推定量を 不偏性・ 一致性・平均二乗誤差で 比べ、バイアス–バリアンス分解を 使える
モーメント法と 最尤法で 推定量を 作り、正規・ポアソン・指数・ 二項分布の 最尤推定量を 導ける
十分統計量を 分解定理で 見つけ、ラオ–ブラックウェルの 定理で 推定量を 改良できる
フィッシャー情報量を 計算し、クラメール–ラオの 不等式を その 仮定(正則条件)とともに 説明できる
最尤推定量の 漸近正規性を 仮定つきで 述べ、標準誤差の 計算に 使える
正則条件が 崩れる 例や、不偏性に こだわると 困る 例を 挙げられる
前提 :第1章 、第2章 。積分記号下の 微分の 十分条件は 06 第3章 定理 3.25 に あるが、本章では それを 仮定と して 扱うので、測度論は 使わない。
製造ラインの 不良率、Web サイトの 購入率、1 時間 あたりの 問い合わせ件数、機械が 故障するまでの 時間。実務で 知りたい量の 多くは 確率分布の パラメータであり、データから その 値を 一つの 数で 推し量る ことを 点推定 (point estimation) と いう。推定に 使う 式(推定量)は 標本の 関数なので 確率変数であり、その 良し悪しは 一回の 推定値ではなく 分布で 判断しなければならない。
本章では 良さの 基準と 推定量の 作り方(モーメント法・ 最尤法)を 学び、十分統計量と フィッシャー情報量を 使って、不偏推定量の 分散の 下界(クラメール–ラオの 不等式)と 推定量の 改良法(ラオ–ブラックウェルの 定理)を 証明する。これらの 定理の 仮定が 崩れた ときに 何が 起こるかにも 注意を 払う。
本章を 通じて、観測値 x 1 , … , x n x_1, \dots, x_n x 1 , … , x n を、確率関数または 密度 f ( x ; θ ) f(x; \theta) f ( x ; θ ) を もつ 分布からの i.i.d. 標本 X 1 , … , X n X_1, \dots, X_n X 1 , … , X n の 実現値と みなす。 θ \theta θ は 未知の パラメータ (parameter) で、パラメータ 空間 Θ \Theta Θ を 動く。真の 値が θ \theta θ の ときの 確率・期待値・分散を P θ P_\theta P θ , E θ E_\theta E θ , Var θ \operatorname{Var}_\theta Var θ と 書き、離散の 場合は 積分を 和に 読み替える。分布の 記号は 第1章に 従う( Exp ( λ ) \operatorname{Exp}(\lambda) Exp ( λ ) , Gamma ( α , λ ) \operatorname{Gamma}(\alpha, \lambda) Gamma ( α , λ ) の λ \lambda λ は 率)。
3.1 推定量の 良さ
定義 3.1 (推定量, estimator)統計量(第2章 )の うち、 θ \theta θ や その 関数 g ( θ ) g(\theta) g ( θ ) を 推し量る ために 用いる ものを 推定量と いい、 θ ^ = θ ^ ( X 1 , … , X n ) \hat{\theta} = \hat{\theta}(X_1, \dots, X_n) θ ^ = θ ^ ( X 1 , … , X n ) などと 書く。観測値を 代入した 値 θ ^ ( x 1 , … , x n ) \hat{\theta}(x_1, \dots, x_n) θ ^ ( x 1 , … , x n ) を 推定値 (estimate) と いう。
定義 3.2 Θ ⊂ R \Theta \subset \mathbb{R} Θ ⊂ R とし、θ ^ \hat{\theta} θ ^ を θ \theta θ の 推定量と する。
b ( θ ) = E θ [ θ ^ ] − θ b(\theta) = E_\theta[\hat{\theta}] - \theta b ( θ ) = E θ [ θ ^ ] − θ を バイアス (bias) と いう。すべての θ ∈ Θ \theta \in \Theta θ ∈ Θ で b ( θ ) = 0 b(\theta) = 0 b ( θ ) = 0 の とき、 θ ^ \hat{\theta} θ ^ を 不偏推定量 (unbiased estimator) と いう。
MSE θ ( θ ^ ) = E θ [ ( θ ^ − θ ) 2 ] \operatorname{MSE}_\theta(\hat{\theta}) = E_\theta[(\hat{\theta} - \theta)^2] MSE θ ( θ ^ ) = E θ [( θ ^ − θ ) 2 ] を 平均二乗誤差 (mean squared error) と いう。
標本の 大きさ n n n ごとの 推定量の 列 θ ^ n \hat{\theta}_n θ ^ n が、すべての θ ∈ Θ \theta \in \Theta θ ∈ Θ に ついて θ ^ n → P θ \hat{\theta}_n \xrightarrow{P} \theta θ ^ n P θ (n → ∞ n \to \infty n → ∞ )を 満たすとき、 一致推定量 (consistent estimator) と いう。
「すべての θ \theta θ で」が 要点である。つねに 5 5 5 と 答える 推定量は、真の 値が たまたま 5 5 5 なら 誤差が 0 0 0 だが、不偏でも 一致的でもない。
定理 3.3 (バイアス–バリアンス分解, bias–variance decomposition)E θ [ θ ^ 2 ] < ∞ E_\theta[\hat{\theta}^2] < \infty E θ [ θ ^ 2 ] < ∞ ならば
MSE θ ( θ ^ ) = Var θ ( θ ^ ) + b ( θ ) 2 \operatorname{MSE}_\theta(\hat{\theta}) = \operatorname{Var}_\theta(\hat{\theta}) + b(\theta)^2 MSE θ ( θ ^ ) = Var θ ( θ ^ ) + b ( θ ) 2
証明. m = E θ [ θ ^ ] m = E_\theta[\hat{\theta}] m = E θ [ θ ^ ] と おくと ( θ ^ − θ ) 2 = ( θ ^ − m ) 2 + 2 ( θ ^ − m ) ( m − θ ) + ( m − θ ) 2 (\hat{\theta} - \theta)^2 = (\hat{\theta} - m)^2 + 2(\hat{\theta} - m)(m - \theta) + (m - \theta)^2 ( θ ^ − θ ) 2 = ( θ ^ − m ) 2 + 2 ( θ ^ − m ) ( m − θ ) + ( m − θ ) 2 。期待値を とると 中央の 項は 2 ( m − θ ) E θ [ θ ^ − m ] = 0 2(m - \theta)E_\theta[\hat{\theta} - m] = 0 2 ( m − θ ) E θ [ θ ^ − m ] = 0 に なり、第 1 項は Var θ ( θ ^ ) \operatorname{Var}_\theta(\hat{\theta}) Var θ ( θ ^ ) 、第 3 項は b ( θ ) 2 b(\theta)^2 b ( θ ) 2 である。□ \square □
命題 3.4 すべての θ \theta θ で MSE θ ( θ ^ n ) → 0 \operatorname{MSE}_\theta(\hat{\theta}_n) \to 0 MSE θ ( θ ^ n ) → 0 ならば、θ ^ n \hat{\theta}_n θ ^ n は 一致推定量である。特に、バイアスと 分散が ともに 0 0 0 に 収束すれば 一致推定量である。
証明. マルコフの 不等式( 第1章 定理 1.25)を ( θ ^ n − θ ) 2 (\hat{\theta}_n - \theta)^2 ( θ ^ n − θ ) 2 に 使うと、 ε > 0 \varepsilon > 0 ε > 0 に ついて P θ ( ∣ θ ^ n − θ ∣ ≥ ε ) ≤ MSE θ ( θ ^ n ) / ε 2 → 0 P_\theta(\lvert \hat{\theta}_n - \theta \rvert \geq \varepsilon) \leq \operatorname{MSE}_\theta(\hat{\theta}_n)/\varepsilon^2 \to 0 P θ (∣ θ ^ n − θ ∣ ≥ ε ) ≤ MSE θ ( θ ^ n ) / ε 2 → 0 。後半は 定理 3.3 に よる。 □ \square □
例 3.5 (分散の 推定量の 比較) X i ∼ N ( μ , σ 2 ) X_i \sim N(\mu, \sigma^2) X i ∼ N ( μ , σ 2 ) 、n ≥ 2 n \geq 2 n ≥ 2 とし、Q = ∑ i = 1 n ( X i − X ˉ ) 2 Q = \sum_{i=1}^n (X_i - \bar{X})^2 Q = ∑ i = 1 n ( X i − X ˉ ) 2 の 定数倍 c Q cQ c Q で σ 2 \sigma^2 σ 2 を 推定する。 第2章 の 定理 2.8 より Q / σ 2 ∼ χ 2 ( n − 1 ) Q/\sigma^2 \sim \chi^2(n-1) Q / σ 2 ∼ χ 2 ( n − 1 ) で、その 平均は n − 1 n - 1 n − 1 、分散は 2 ( n − 1 ) 2(n - 1) 2 ( n − 1 ) だから、定理 3.3 より
MSE ( c Q ) = σ 4 { 2 ( n − 1 ) c 2 + ( ( n − 1 ) c − 1 ) 2 } \operatorname{MSE}(cQ) = \sigma^4 \bigl\lbrace 2(n-1)c^2 + \bigl((n-1)c - 1\bigr)^2 \bigr\rbrace MSE ( c Q ) = σ 4 { 2 ( n − 1 ) c 2 + ( ( n − 1 ) c − 1 ) 2 }
c c c で 微分して 0 0 0 と おくと 2 c + ( n − 1 ) c − 1 = 0 2c + (n-1)c - 1 = 0 2 c + ( n − 1 ) c − 1 = 0 と なり、 c = 1 / ( n + 1 ) c = 1/(n+1) c = 1/ ( n + 1 ) で 最小に なる。
c c c
推定量
バイアス
平均二乗誤差
1 / ( n − 1 ) 1/(n-1) 1/ ( n − 1 )
不偏分散 S 2 S^2 S 2
0 0 0
2 σ 4 / ( n − 1 ) 2\sigma^4/(n-1) 2 σ 4 / ( n − 1 )
1 / n 1/n 1/ n
σ ^ 2 = Q / n \hat{\sigma}^2 = Q/n σ ^ 2 = Q / n (例 3.13)
− σ 2 / n -\sigma^2/n − σ 2 / n
( 2 n − 1 ) σ 4 / n 2 (2n-1)\sigma^4/n^2 ( 2 n − 1 ) σ 4 / n 2
1 / ( n + 1 ) 1/(n+1) 1/ ( n + 1 )
Q / ( n + 1 ) Q/(n+1) Q / ( n + 1 )
− 2 σ 2 / ( n + 1 ) -2\sigma^2/(n+1) − 2 σ 2 / ( n + 1 )
2 σ 4 / ( n + 1 ) 2\sigma^4/(n+1) 2 σ 4 / ( n + 1 )
n = 10 n = 10 n = 10 なら 平均二乗誤差は 順に 0.222 σ 4 0.222\sigma^4 0.222 σ 4 , 0.190 σ 4 0.190\sigma^4 0.190 σ 4 , 0.182 σ 4 0.182\sigma^4 0.182 σ 4 である。少し 小さめに 推定して バイアスを 入れると、分散の 減少が それを 上回る。不偏推定量が 平均二乗誤差の 意味で 最良とは 限らない(この 比較は 正規分布の 4 次モーメントに よる もので、裾の 重い 分布では 変わりうる)。一方、すべての θ \theta θ で 平均二乗誤差を 最小に する 推定量は 一般に 存在しない( μ \mu μ を c X ˉ c\bar{X} c X ˉ で 推定する とき、平均二乗誤差 c 2 σ 2 / n + ( c − 1 ) 2 μ 2 c^2\sigma^2/n + (c-1)^2\mu^2 c 2 σ 2 / n + ( c − 1 ) 2 μ 2 を 最小に する c c c は 未知の μ , σ 2 \mu, \sigma^2 μ , σ 2 に 依存する)。そこで 不偏推定量の 中で 比べる、漸近的に 比べる、などの 工夫を する。
ヒント
実務では
推定量を 選ぶ 基準は 目的で 決まる。一つの 値を 正確に 当てたいなら 平均二乗誤差が 基準で、機械学習の 正則化( 第6章 )は わざと バイアスを 入れて 分散を 減らす。一方、店舗ごとの 推定売上を 全社で 合計するように 多数の 推定値を 合算する ときは、独立な k k k 個の 誤差の 標準偏差は k \sqrt{k} k 倍に しかならないが、同じ 向きの バイアスは k k k 倍に 積み上がる。
3.2 モーメント法
最も 素朴な 推定法は、母集団の モーメントを 標本の モーメントで 置き換える ことである。
定義 3.7 (モーメント法, method of moments)θ = ( θ 1 , … , θ k ) \theta = (\theta_1, \dots, \theta_k) θ = ( θ 1 , … , θ k ) とし、μ j ( θ ) = E θ [ X 1 j ] \mu_j(\theta) = E_\theta[X_1^j] μ j ( θ ) = E θ [ X 1 j ] 、m j = 1 n ∑ i = 1 n X i j m_j = \frac{1}{n}\sum_{i=1}^n X_i^j m j = n 1 ∑ i = 1 n X i j と する。連立方程式 μ j ( θ ) = m j \mu_j(\theta) = m_j μ j ( θ ) = m j (j = 1 , … , k j = 1, \dots, k j = 1 , … , k )の 解 θ ~ \tilde{\theta} θ ~ を モーメント推定量と いう。
例 3.8 (1) Gamma ( α , λ ) \operatorname{Gamma}(\alpha, \lambda) Gamma ( α , λ ) では E [ X ] = α / λ E[X] = \alpha/\lambda E [ X ] = α / λ 、Var ( X ) = α / λ 2 \operatorname{Var}(X) = \alpha/\lambda^2 Var ( X ) = α / λ 2 なので、σ ^ 2 = m 2 − m 1 2 = 1 n ∑ i ( X i − X ˉ ) 2 \hat{\sigma}^2 = m_2 - m_1^2 = \frac{1}{n}\sum_i (X_i - \bar{X})^2 σ ^ 2 = m 2 − m 1 2 = n 1 ∑ i ( X i − X ˉ ) 2 と おいて λ ~ = X ˉ / σ ^ 2 \tilde{\lambda} = \bar{X}/\hat{\sigma}^2 λ ~ = X ˉ / σ ^ 2 , α ~ = X ˉ 2 / σ ^ 2 \tilde{\alpha} = \bar{X}^2/\hat{\sigma}^2 α ~ = X ˉ 2 / σ ^ 2 。α \alpha α の 最尤推定量は 閉じた 式で 書けないので、これは 数値計算の 初期値にも 使われる。
(2) U ( 0 , θ ) U(0, \theta) U ( 0 , θ ) では E [ X ] = θ / 2 E[X] = \theta/2 E [ X ] = θ /2 だから θ ~ = 2 X ˉ \tilde{\theta} = 2\bar{X} θ ~ = 2 X ˉ 。これは 不偏で、分散は 4 ⋅ θ 2 12 n = θ 2 3 n 4 \cdot \frac{\theta^2}{12n} = \frac{\theta^2}{3n} 4 ⋅ 12 n θ 2 = 3 n θ 2 である。ただし観測値が 0.1 , 0.1 , 0.9 0.1, 0.1, 0.9 0.1 , 0.1 , 0.9 なら θ ~ = 0.733 … \tilde{\theta} = 0.733\ldots θ ~ = 0.733 … と、観測された 0.9 0.9 0.9 より 小さい。データと 矛盾する 推定値を 出しうるのは モーメント法の 弱点である。
モーメント推定量は 多くの 場合に 一致推定量である。 E θ [ ∣ X 1 ∣ k ] < ∞ E_\theta[\lvert X_1 \rvert^k] < \infty E θ [∣ X 1 ∣ k ] < ∞ で、θ = h ( μ 1 ( θ ) , … , μ k ( θ ) ) \theta = h(\mu_1(\theta), \dots, \mu_k(\theta)) θ = h ( μ 1 ( θ ) , … , μ k ( θ )) と なる h h h が その点で 連続ならば、大数の 法則( 第1章 定理 1.27)より 各 m j → P μ j ( θ ) m_j \xrightarrow{P} \mu_j(\theta) m j P μ j ( θ ) であり、h h h の 連続性から h ( m 1 , … , m k ) → P θ h(m_1, \dots, m_k) \xrightarrow{P} \theta h ( m 1 , … , m k ) P θ と なる( 第1章 定理 1.29 の 連続写像定理と 同じ 議論)。
3.3 最尤推定
定義 3.9 (尤度・ 最尤推定量)観測値 x = ( x 1 , … , x n ) x = (x_1, \dots, x_n) x = ( x 1 , … , x n ) を 固定して θ \theta θ の 関数とみた L ( θ ) = ∏ i = 1 n f ( x i ; θ ) L(\theta) = \prod_{i=1}^n f(x_i; \theta) L ( θ ) = ∏ i = 1 n f ( x i ; θ ) を 尤度関数 (likelihood function)、ℓ ( θ ) = log L ( θ ) \ell(\theta) = \log L(\theta) ℓ ( θ ) = log L ( θ ) を 対数尤度 (log-likelihood) と いう。 L L L を Θ \Theta Θ 上で 最大に する θ ^ = θ ^ ( x ) \hat{\theta} = \hat{\theta}(x) θ ^ = θ ^ ( x ) を 最尤推定値 、x x x に 標本 X X X を 代入した θ ^ ( X ) \hat{\theta}(X) θ ^ ( X ) を 最尤推定量 (maximum likelihood estimator, MLE) と いう。
観測された データが 最も 起こりやすくなる パラメータを 選ぶ、と いう 考え方である。尤度は θ \theta θ に ついての 確率分布ではない( θ \theta θ で 積分しても 1 1 1 に なるとは 限らない)。以下の 4 つの 例では、候補が 本当に 最大を 与える ことまで 確かめる。
例 3.10 (ベルヌーイ分布・ 二項分布) X i ∼ B ( 1 , p ) X_i \sim B(1, p) X i ∼ B ( 1 , p ) 、Θ = [ 0 , 1 ] \Theta = [0, 1] Θ = [ 0 , 1 ] 、s = ∑ i x i s = \sum_i x_i s = ∑ i x i と すると L ( p ) = p s ( 1 − p ) n − s L(p) = p^s(1-p)^{n-s} L ( p ) = p s ( 1 − p ) n − s 。0 < s < n 0 < s < n 0 < s < n なら L ( 0 ) = L ( 1 ) = 0 L(0) = L(1) = 0 L ( 0 ) = L ( 1 ) = 0 で、0 < p < 1 0 < p < 1 0 < p < 1 に おいて
ℓ ′ ( p ) = s p − n − s 1 − p = s − n p p ( 1 − p ) \ell'(p) = \frac{s}{p} - \frac{n-s}{1-p} = \frac{s - np}{p(1-p)} ℓ ′ ( p ) = p s − 1 − p n − s = p ( 1 − p ) s − n p
は p < s / n p < s/n p < s / n で 正、 p > s / n p > s/n p > s / n で 負だから、 L L L は p = s / n p = s/n p = s / n で 最大に なる。 s = 0 s = 0 s = 0 なら L = ( 1 − p ) n L = (1-p)^n L = ( 1 − p ) n は p = 0 p = 0 p = 0 で、s = n s = n s = n なら L = p n L = p^n L = p n は p = 1 p = 1 p = 1 で 最大。いずれの 場合も p ^ = X ˉ \hat{p} = \bar{X} p ^ = X ˉ (標本比率)である。m m m を 既知として X i ∼ B ( m , p ) X_i \sim B(m, p) X i ∼ B ( m , p ) なら、尤度は 定数倍を 除いて p s ( 1 − p ) n m − s p^s(1-p)^{nm - s} p s ( 1 − p ) nm − s なので p ^ = X ˉ / m \hat{p} = \bar{X}/m p ^ = X ˉ / m 。
例 3.11 (ポアソン分布)X i ∼ Po ( λ ) X_i \sim \operatorname{Po}(\lambda) X i ∼ Po ( λ ) 、Θ = [ 0 , ∞ ) \Theta = [0, \infty) Θ = [ 0 , ∞ ) と する( Po ( 0 ) \operatorname{Po}(0) Po ( 0 ) は 0 0 0 に 確率 1 1 1 を もつ 分布と 約束する)。 s = ∑ i x i > 0 s = \sum_i x_i > 0 s = ∑ i x i > 0 なら L ( 0 ) = 0 L(0) = 0 L ( 0 ) = 0 で、λ > 0 \lambda > 0 λ > 0 では ℓ ′ ( λ ) = s / λ − n \ell'(\lambda) = s/\lambda - n ℓ ′ ( λ ) = s / λ − n が λ = s / n \lambda = s/n λ = s / n の 前後で 正から 負に 変わる。 s = 0 s = 0 s = 0 なら L ( λ ) = e − n λ L(\lambda) = e^{-n\lambda} L ( λ ) = e − nλ は λ = 0 \lambda = 0 λ = 0 で 最大。いずれの 場合も λ ^ = X ˉ \hat{\lambda} = \bar{X} λ ^ = X ˉ 。
例 3.12 (指数分布)X i ∼ Exp ( λ ) X_i \sim \operatorname{Exp}(\lambda) X i ∼ Exp ( λ ) 、Θ = ( 0 , ∞ ) \Theta = (0, \infty) Θ = ( 0 , ∞ ) 、s = ∑ i x i > 0 s = \sum_i x_i > 0 s = ∑ i x i > 0 と すると、 ℓ ( λ ) = n log λ − λ s \ell(\lambda) = n\log\lambda - \lambda s ℓ ( λ ) = n log λ − λ s で ℓ ′ ( λ ) = n / λ − s \ell'(\lambda) = n/\lambda - s ℓ ′ ( λ ) = n / λ − s は λ = n / s \lambda = n/s λ = n / s の 前後で 正から 負に 変わるので、 λ ^ = 1 / X ˉ \hat{\lambda} = 1/\bar{X} λ ^ = 1/ X ˉ 。これは 不偏ではなく、 n ≥ 2 n \geq 2 n ≥ 2 なら E λ [ 1 / X ˉ ] = n n − 1 λ E_\lambda[1/\bar{X}] = \frac{n}{n-1}\lambda E λ [ 1/ X ˉ ] = n − 1 n λ と 過大に 推定する(問題 3.3)。
例 3.13 (正規分布)θ = ( μ , v ) \theta = (\mu, v) θ = ( μ , v ) , v = σ 2 v = \sigma^2 v = σ 2 、Θ = R × ( 0 , ∞ ) \Theta = \mathbb{R} \times (0, \infty) Θ = R × ( 0 , ∞ ) とし、観測値の すべてが 等しくは ないと する( n ≥ 2 n \geq 2 n ≥ 2 なら 確率 1 1 1 )。Q = ∑ i ( x i − x ˉ ) 2 > 0 Q = \sum_i (x_i - \bar{x})^2 > 0 Q = ∑ i ( x i − x ˉ ) 2 > 0 と おくと ∑ i ( x i − μ ) 2 = Q + n ( x ˉ − μ ) 2 \sum_i (x_i - \mu)^2 = Q + n(\bar{x} - \mu)^2 ∑ i ( x i − μ ) 2 = Q + n ( x ˉ − μ ) 2 だから
ℓ ( μ , v ) = − n 2 log ( 2 π v ) − Q + n ( x ˉ − μ ) 2 2 v ≤ − n 2 log ( 2 π v ) − Q 2 v = : g ( v ) \ell(\mu, v) = -\frac{n}{2}\log(2\pi v) - \frac{Q + n(\bar{x} - \mu)^2}{2v} \leq -\frac{n}{2}\log(2\pi v) - \frac{Q}{2v} =: g(v) ℓ ( μ , v ) = − 2 n log ( 2 π v ) − 2 v Q + n ( x ˉ − μ ) 2 ≤ − 2 n log ( 2 π v ) − 2 v Q =: g ( v )
で、等号は μ = x ˉ \mu = \bar{x} μ = x ˉ の ときに 限る。 g ′ ( v ) = ( Q − n v ) / ( 2 v 2 ) g'(v) = (Q - nv)/(2v^2) g ′ ( v ) = ( Q − n v ) / ( 2 v 2 ) は v = Q / n v = Q/n v = Q / n の 前後で 正から 負に 変わる。よって 最尤推定量は μ ^ = X ˉ \hat{\mu} = \bar{X} μ ^ = X ˉ , σ ^ 2 = 1 n ∑ i ( X i − X ˉ ) 2 \hat{\sigma}^2 = \frac{1}{n}\sum_i (X_i - \bar{X})^2 σ ^ 2 = n 1 ∑ i ( X i − X ˉ ) 2 で、σ ^ 2 \hat{\sigma}^2 σ ^ 2 は 例 3.5 の とおりバイアスを もつ。すべての x i x_i x i が 等しいと v → 0 v \to 0 v → 0 で ℓ → ∞ \ell \to \infty ℓ → ∞ と なり、最尤推定値は 存在しない。
命題 3.14 (最尤推定量の 不変性) g : Θ → Θ ′ g\colon \Theta \to \Theta' g : Θ → Θ ′ を 全単射とし、モデルを η = g ( θ ) \eta = g(\theta) η = g ( θ ) で 表し直す。 θ ^ \hat{\theta} θ ^ が θ \theta θ の 最尤推定量ならば、 g ( θ ^ ) g(\hat{\theta}) g ( θ ^ ) は η \eta η の 最尤推定量である。
証明. η \eta η で 表した 尤度は L ′ ( η ) = L ( g − 1 ( η ) ) L'(\eta) = L(g^{-1}(\eta)) L ′ ( η ) = L ( g − 1 ( η )) なので、任意の η \eta η で L ′ ( η ) ≤ L ( θ ^ ) = L ′ ( g ( θ ^ ) ) L'(\eta) \leq L(\hat{\theta}) = L'(g(\hat{\theta})) L ′ ( η ) ≤ L ( θ ^ ) = L ′ ( g ( θ ^ )) 。□ \square □
g g g が 単射でなくても g ( θ ^ ) g(\hat{\theta}) g ( θ ^ ) を g ( θ ) g(\theta) g ( θ ) の 最尤推定量と 定めるのが 普通である( sup { L ( θ ) ∣ g ( θ ) = η } \sup \lbrace L(\theta) \mid g(\theta) = \eta \rbrace sup { L ( θ ) ∣ g ( θ ) = η } を 最大に するのが η = g ( θ ^ ) \eta = g(\hat{\theta}) η = g ( θ ^ ) )。たとえば σ \sigma σ の 最尤推定量は σ ^ 2 \sqrt{\hat{\sigma}^2} σ ^ 2 、指数分布の 平均 1 / λ 1/\lambda 1/ λ の 最尤推定量は X ˉ \bar{X} X ˉ である。不偏性には この 性質が ない(注意 3.6)。
例 3.15 (一様分布 U ( 0 , θ ) U(0, \theta) U ( 0 , θ ) )f ( x ; θ ) = 1 θ 1 [ 0 , θ ] ( x ) f(x; \theta) = \frac{1}{\theta}\mathbf{1}_{[0, \theta]}(x) f ( x ; θ ) = θ 1 1 [ 0 , θ ] ( x ) とし、観測値 x i ≥ 0 x_i \geq 0 x i ≥ 0 の 最大値を M M M と する。 L ( θ ) L(\theta) L ( θ ) は θ < M \theta < M θ < M で 0 0 0 、θ ≥ M \theta \geq M θ ≥ M で θ − n \theta^{-n} θ − n なので、最尤推定量は X ( n ) = max i X i X_{(n)} = \max_i X_i X ( n ) = max i X i である。θ > M \theta > M θ > M で ℓ ′ ( θ ) = − n / θ ≠ 0 \ell'(\theta) = -n/\theta \neq 0 ℓ ′ ( θ ) = − n / θ = 0 なので、尤度方程式 ℓ ′ ( θ ) = 0 \ell'(\theta) = 0 ℓ ′ ( θ ) = 0 を 解いても 見つからない。 0 ≤ t ≤ θ 0 \leq t \leq \theta 0 ≤ t ≤ θ で P θ ( X ( n ) ≤ t ) = ( t / θ ) n P_\theta(X_{(n)} \leq t) = (t/\theta)^n P θ ( X ( n ) ≤ t ) = ( t / θ ) n だから、X ( n ) X_{(n)} X ( n ) の 密度は n t n − 1 / θ n nt^{n-1}/\theta^n n t n − 1 / θ n で
E θ [ X ( n ) ] = n n + 1 θ , E θ [ X ( n ) 2 ] = n n + 2 θ 2 , Var θ ( X ( n ) ) = n θ 2 ( n + 1 ) 2 ( n + 2 ) E_\theta[X_{(n)}] = \frac{n}{n+1}\theta, \qquad E_\theta[X_{(n)}^2] = \frac{n}{n+2}\theta^2, \qquad \operatorname{Var}_\theta(X_{(n)}) = \frac{n\theta^2}{(n+1)^2(n+2)} E θ [ X ( n ) ] = n + 1 n θ , E θ [ X ( n ) 2 ] = n + 2 n θ 2 , Var θ ( X ( n ) ) = ( n + 1 ) 2 ( n + 2 ) n θ 2
最尤推定量は つねに 過小評価し、平均二乗誤差は 2 θ 2 ( n + 1 ) ( n + 2 ) \frac{2\theta^2}{(n+1)(n+2)} ( n + 1 ) ( n + 2 ) 2 θ 2 である。θ ^ U = n + 1 n X ( n ) \hat{\theta}_U = \frac{n+1}{n}X_{(n)} θ ^ U = n n + 1 X ( n ) は 不偏で、分散は θ 2 n ( n + 2 ) \frac{\theta^2}{n(n+2)} n ( n + 2 ) θ 2 。c X ( n ) cX_{(n)} c X ( n ) の 形では、平均二乗誤差 θ 2 ( n n + 2 c 2 − 2 n n + 1 c + 1 ) \theta^2\bigl(\frac{n}{n+2}c^2 - \frac{2n}{n+1}c + 1\bigr) θ 2 ( n + 2 n c 2 − n + 1 2 n c + 1 ) を 最小に するのは c = n + 2 n + 1 c = \frac{n+2}{n+1} c = n + 1 n + 2 で、最小値 θ 2 ( n + 1 ) 2 \frac{\theta^2}{(n+1)^2} ( n + 1 ) 2 θ 2 は θ ^ U \hat{\theta}_U θ ^ U の 分散より 小さい。いずれも、モーメント推定量 2 X ˉ 2\bar{X} 2 X ˉ の 分散 θ 2 3 n \frac{\theta^2}{3n} 3 n θ 2 と 違い 1 / n 2 1/n^2 1/ n 2 の オーダーで 減る( θ = 1 \theta = 1 θ = 1 , n = 10 n = 10 n = 10 で 10 万回シミュレーションすると、2 X ˉ 2\bar{X} 2 X ˉ , X ( n ) X_{(n)} X ( n ) , θ ^ U \hat{\theta}_U θ ^ U の 平均二乗誤差は 0.0333 0.0333 0.0333 , 0.0151 0.0151 0.0151 , 0.0083 0.0083 0.0083 で、理論値 1 / 30 1/30 1/30 , 1 / 66 1/66 1/66 , 1 / 120 1/120 1/120 と 一致した)。
3.4 十分統計量
例 3.10・3.11 の 最尤推定量は 和 ∑ i x i \sum_i x_i ∑ i x i だけで 決まった。データを ある 統計量に 要約しても θ \theta θ に ついての 情報を 失わない、と いう ことを 定式化する。
定義 3.17 (十分統計量, sufficient statistic)標本 X = ( X 1 , … , X n ) X = (X_1, \dots, X_n) X = ( X 1 , … , X n ) が 離散分布に 従う(可算集合に 値を とる)と する。統計量 T = T ( X ) T = T(X) T = T ( X ) が θ \theta θ の 十分統計量 であるとは、P θ ( T = t ) > 0 P_\theta(T = t) > 0 P θ ( T = t ) > 0 と なる すべての θ \theta θ , t t t と、すべての x x x に ついて、 P θ ( X = x ∣ T = t ) P_\theta(X = x \mid T = t) P θ ( X = x ∣ T = t ) が θ \theta θ に よらない ことを いう。
T T T の 値が わかれば、残りの ばら つきは θ \theta θ と 無関係である。 T T T だけから、θ \theta θ を 知らなくても 乱数で X X X と 同じ 分布の データを 作り直せるので、 X X X で できる 推測は T T T でも できる。
例 3.18 (ベルヌーイ分布)0 < p < 1 0 < p < 1 0 < p < 1 、T = ∑ i X i T = \sum_i X_i T = ∑ i X i と する。 ∑ i x i = t \sum_i x_i = t ∑ i x i = t と なる x ∈ { 0 , 1 } n x \in \lbrace 0, 1 \rbrace^n x ∈ { 0 , 1 } n に ついて
P p ( X = x ∣ T = t ) = p t ( 1 − p ) n − t ( n t ) p t ( 1 − p ) n − t = ( n t ) − 1 P_p(X = x \mid T = t) = \frac{p^t(1-p)^{n-t}}{\binom{n}{t}p^t(1-p)^{n-t}} = \binom{n}{t}^{-1} P p ( X = x ∣ T = t ) = ( t n ) p t ( 1 − p ) n − t p t ( 1 − p ) n − t = ( t n ) − 1
であり、∑ i x i ≠ t \sum_i x_i \neq t ∑ i x i = t なら 0 0 0 である。どちらも p p p に よらないので T T T は 十分統計量である。不良品の 個数が わかれば、何番目が 不良だったかは p p p に ついて 何も 教えない。
定理 3.19 (フィッシャー–ネイマンの 分解定理, factorization theorem)離散の 場合、 T T T が θ \theta θ の 十分統計量である ための 必要十分条件は、関数 g ( t ; θ ) ≥ 0 g(t; \theta) \geq 0 g ( t ; θ ) ≥ 0 と h ( x ) ≥ 0 h(x) \geq 0 h ( x ) ≥ 0 が あって、すべての x x x と θ \theta θ に ついて
P θ ( X = x ) = g ( T ( x ) ; θ ) h ( x ) P_\theta(X = x) = g(T(x); \theta)\, h(x) P θ ( X = x ) = g ( T ( x ) ; θ ) h ( x )
と 書ける ことである。
証明. (必要性)g ( t ; θ ) = P θ ( T = t ) g(t; \theta) = P_\theta(T = t) g ( t ; θ ) = P θ ( T = t ) と おく。各 x x x に ついて、 P θ 0 ( T = T ( x ) ) > 0 P_{\theta_0}(T = T(x)) > 0 P θ 0 ( T = T ( x )) > 0 と なる θ 0 \theta_0 θ 0 が あれば h ( x ) = P θ 0 ( X = x ∣ T = T ( x ) ) h(x) = P_{\theta_0}(X = x \mid T = T(x)) h ( x ) = P θ 0 ( X = x ∣ T = T ( x )) と おき(十分性より θ 0 \theta_0 θ 0 の 選び方に よらない)、なければ h ( x ) = 0 h(x) = 0 h ( x ) = 0 と おく。 P θ ( T = T ( x ) ) > 0 P_\theta(T = T(x)) > 0 P θ ( T = T ( x )) > 0 なら、{ X = x } ⊂ { T = T ( x ) } \lbrace X = x \rbrace \subset \lbrace T = T(x) \rbrace { X = x } ⊂ { T = T ( x )} より P θ ( X = x ) = P θ ( T = T ( x ) ) P θ ( X = x ∣ T = T ( x ) ) = g ( T ( x ) ; θ ) h ( x ) P_\theta(X = x) = P_\theta(T = T(x))P_\theta(X = x \mid T = T(x)) = g(T(x); \theta)h(x) P θ ( X = x ) = P θ ( T = T ( x )) P θ ( X = x ∣ T = T ( x )) = g ( T ( x ) ; θ ) h ( x ) 。P θ ( T = T ( x ) ) = 0 P_\theta(T = T(x)) = 0 P θ ( T = T ( x )) = 0 なら、P θ ( X = x ) ≤ P θ ( T = T ( x ) ) = 0 P_\theta(X = x) \leq P_\theta(T = T(x)) = 0 P θ ( X = x ) ≤ P θ ( T = T ( x )) = 0 で、右辺も g ( T ( x ) ; θ ) = 0 g(T(x); \theta) = 0 g ( T ( x ) ; θ ) = 0 より 0 0 0 である。
(十分性)P θ ( T = t ) > 0 P_\theta(T = t) > 0 P θ ( T = t ) > 0 とし、A t = { y ∣ T ( y ) = t } A_t = \lbrace y \mid T(y) = t \rbrace A t = { y ∣ T ( y ) = t } と おく。 P θ ( T = t ) = g ( t ; θ ) ∑ y ∈ A t h ( y ) > 0 P_\theta(T = t) = g(t; \theta)\sum_{y \in A_t}h(y) > 0 P θ ( T = t ) = g ( t ; θ ) ∑ y ∈ A t h ( y ) > 0 なので、g ( t ; θ ) > 0 g(t; \theta) > 0 g ( t ; θ ) > 0 かつ ∑ y ∈ A t h ( y ) > 0 \sum_{y \in A_t}h(y) > 0 ∑ y ∈ A t h ( y ) > 0 。x ∈ A t x \in A_t x ∈ A t なら
P θ ( X = x ∣ T = t ) = g ( t ; θ ) h ( x ) g ( t ; θ ) ∑ y ∈ A t h ( y ) = h ( x ) ∑ y ∈ A t h ( y ) P_\theta(X = x \mid T = t) = \frac{g(t; \theta)h(x)}{g(t; \theta)\sum_{y \in A_t}h(y)} = \frac{h(x)}{\sum_{y \in A_t}h(y)} P θ ( X = x ∣ T = t ) = g ( t ; θ ) ∑ y ∈ A t h ( y ) g ( t ; θ ) h ( x ) = ∑ y ∈ A t h ( y ) h ( x )
で、x ∉ A t x \notin A_t x ∈ / A t なら 0 0 0 である。いずれも θ \theta θ に よらない。 □ \square □
例 3.21 (1) ポアソン分布:∏ i e − λ λ x i / x i ! = e − n λ λ ∑ i x i ⋅ ∏ i ( 1 / x i ! ) \prod_i e^{-\lambda}\lambda^{x_i}/x_i! = e^{-n\lambda}\lambda^{\sum_i x_i} \cdot \prod_i (1/x_i!) ∏ i e − λ λ x i / x i ! = e − nλ λ ∑ i x i ⋅ ∏ i ( 1/ x i !) より ∑ i X i \sum_i X_i ∑ i X i は 十分統計量である。(2) 正規分布:同時密度 ( 2 π σ 2 ) − n / 2 exp ( − ( ∑ i x i 2 − 2 μ ∑ i x i + n μ 2 ) / ( 2 σ 2 ) ) (2\pi\sigma^2)^{-n/2}\exp\bigl(-(\sum_i x_i^2 - 2\mu\sum_i x_i + n\mu^2)/(2\sigma^2)\bigr) ( 2 π σ 2 ) − n /2 exp ( − ( ∑ i x i 2 − 2 μ ∑ i x i + n μ 2 ) / ( 2 σ 2 ) ) より ( ∑ i X i , ∑ i X i 2 ) (\sum_i X_i, \sum_i X_i^2) ( ∑ i X i , ∑ i X i 2 ) 、したがって それと 互いに 他方の 関数である ( X ˉ , S 2 ) (\bar{X}, S^2) ( X ˉ , S 2 ) は ( μ , σ 2 ) (\mu, \sigma^2) ( μ , σ 2 ) の 十分統計量である。(3) U ( 0 , θ ) U(0, \theta) U ( 0 , θ ) :同時密度 θ − n 1 { max i x i ≤ θ } ⋅ 1 { min i x i ≥ 0 } \theta^{-n}\mathbf{1}_{\lbrace \max_i x_i \leq \theta \rbrace} \cdot \mathbf{1}_{\lbrace \min_i x_i \geq 0 \rbrace} θ − n 1 { m a x i x i ≤ θ } ⋅ 1 { m i n i x i ≥ 0 } より X ( n ) X_{(n)} X ( n ) は 十分統計量である。
分解 L ( θ ) = g ( T ( x ) ; θ ) h ( x ) L(\theta) = g(T(x); \theta)h(x) L ( θ ) = g ( T ( x ) ; θ ) h ( x ) から、尤度を 最大に する θ \theta θ は T ( x ) T(x) T ( x ) だけで 決まる。最尤推定量が 一意なら、それは 任意の 十分統計量の 関数である。
ヒント
実務では
正規モデルを 前提に するなら、各群の ( n , x ˉ , s ) (n, \bar{x}, s) ( n , x ˉ , s ) だけで 平均の 推定・信頼区間・ t t t 検定(第4章 )が 再現できる。報告書の 要約統計量から 再分析できるのは この ためである。しかし 十分性は モデルが 正しい ことを 前提に した 概念で、外れ値・分布の 歪み・ 時間に よる 変化の 点検には 元の データが 要る。要約だけを 残して データを 捨てると、モデルの 誤りに 後から 気づけない。
3.5 フィッシャー情報量と クラメール–ラオの 不等式
不偏推定量どうしなら、平均二乗誤差は 分散 その ものである。分散は どこまで 小さく できるのか。 θ \theta θ を 少し 動かした ときに 分布が 大きく 変わる ほど、データから θ \theta θ を 正確に 見分けられるはずである。この 節では Θ \Theta Θ を 開区間とし、 f ( x ; θ ) f(x; \theta) f ( x ; θ ) で 標本全体 x = ( x 1 , … , x n ) x = (x_1, \dots, x_n) x = ( x 1 , … , x n ) の 同時確率関数または 同時密度を 表す。
定義 3.22 (正則条件, regularity conditions)次の (R1)〜(R3) を 正則条件と いう。
(R1) 台 { x ∣ f ( x ; θ ) > 0 } \lbrace x \mid f(x; \theta) > 0 \rbrace { x ∣ f ( x ; θ ) > 0 } が θ \theta θ に よらない。
(R2) 台の 各点 x x x で、θ ↦ f ( x ; θ ) \theta \mapsto f(x; \theta) θ ↦ f ( x ; θ ) は 微分可能である。
(R3) ∫ f ( x ; θ ) d x = 1 \int f(x; \theta)\ dx = 1 ∫ f ( x ; θ ) d x = 1 を 積分記号下で 微分できる。すな わち ∫ ∂ θ f ( x ; θ ) d x = 0 \int \partial_\theta f(x; \theta)\ dx = 0 ∫ ∂ θ f ( x ; θ ) d x = 0 。
定義 3.23 (スコア関数・フィッシャー情報量)台の 上で 定まる s ( x ; θ ) = ∂ θ log f ( x ; θ ) s(x; \theta) = \partial_\theta \log f(x; \theta) s ( x ; θ ) = ∂ θ log f ( x ; θ ) を スコア関数 (score function)、I ( θ ) = E θ [ s ( X ; θ ) 2 ] I(\theta) = E_\theta[s(X; \theta)^2] I ( θ ) = E θ [ s ( X ; θ ) 2 ] を フィッシャー情報量 (Fisher information) と いう。1 個の 観測の ものを I 1 ( θ ) I_1(\theta) I 1 ( θ ) 、大きさ n n n の 標本全体の ものを I n ( θ ) I_n(\theta) I n ( θ ) と 書く。
補題 3.24 正則条件のもとで 次が 成り立つ。
E θ [ s ( X ; θ ) ] = 0 E_\theta[s(X; \theta)] = 0 E θ [ s ( X ; θ )] = 0 。したがって I ( θ ) = Var θ ( s ( X ; θ ) ) I(\theta) = \operatorname{Var}_\theta(s(X; \theta)) I ( θ ) = Var θ ( s ( X ; θ )) 。
X 1 , … , X n X_1, \dots, X_n X 1 , … , X n が i.i.d. で、1 個の 観測の モデルが 正則条件を 満たすならば、 I n ( θ ) = n I 1 ( θ ) I_n(\theta) = nI_1(\theta) I n ( θ ) = n I 1 ( θ ) 。
さらに f f f が θ \theta θ に ついて 2 回微分可能で ∫ ∂ θ 2 f ( x ; θ ) d x = 0 \int \partial_\theta^2 f(x; \theta)\ dx = 0 ∫ ∂ θ 2 f ( x ; θ ) d x = 0 ならば、I ( θ ) = − E θ [ ∂ θ 2 log f ( X ; θ ) ] I(\theta) = -E_\theta[\partial_\theta^2 \log f(X; \theta)] I ( θ ) = − E θ [ ∂ θ 2 log f ( X ; θ )] 。
証明. 1. (R1) より 積分範囲は θ \theta θ に よらない 台であり、(R3) より E θ [ s ] = ∫ ( ∂ θ f / f ) f d x = ∫ ∂ θ f d x = 0 E_\theta[s] = \int (\partial_\theta f/f)f\ dx = \int \partial_\theta f\ dx = 0 E θ [ s ] = ∫ ( ∂ θ f / f ) f d x = ∫ ∂ θ f d x = 0 。2. 標本全体の スコアは i.i.d. な s 1 ( X i ; θ ) s_1(X_i; \theta) s 1 ( X i ; θ ) の 和で あり、1 より 各項は 平均 0 0 0 、分散 I 1 ( θ ) I_1(\theta) I 1 ( θ ) である。3. ∂ θ 2 log f = ∂ θ 2 f / f − s 2 \partial_\theta^2 \log f = \partial_\theta^2 f/f - s^2 ∂ θ 2 log f = ∂ θ 2 f / f − s 2 の 期待値を とり、 E θ [ ∂ θ 2 f / f ] = ∫ ∂ θ 2 f d x = 0 E_\theta[\partial_\theta^2 f/f] = \int \partial_\theta^2 f\ dx = 0 E θ [ ∂ θ 2 f / f ] = ∫ ∂ θ 2 f d x = 0 を 使う。 □ \square □
定理 3.25 (クラメール–ラオの 不等式, Cramér–Rao inequality)正則条件を 仮定し、 0 < I n ( θ ) < ∞ 0 < I_n(\theta) < \infty 0 < I n ( θ ) < ∞ と する。統計量 T T T が E θ [ T 2 ] < ∞ E_\theta[T^2] < \infty E θ [ T 2 ] < ∞ を 満たし、 ψ ( θ ) = E θ [ T ] \psi(\theta) = E_\theta[T] ψ ( θ ) = E θ [ T ] が 積分記号下で 微分できる、すな わち ψ ′ ( θ ) = ∫ T ( x ) ∂ θ f ( x ; θ ) d x \psi'(\theta) = \int T(x)\partial_\theta f(x; \theta)\ dx ψ ′ ( θ ) = ∫ T ( x ) ∂ θ f ( x ; θ ) d x と する。この とき
Var θ ( T ) ≥ ψ ′ ( θ ) 2 I n ( θ ) \operatorname{Var}_\theta(T) \geq \frac{\psi'(\theta)^2}{I_n(\theta)} Var θ ( T ) ≥ I n ( θ ) ψ ′ ( θ ) 2
特に i.i.d. の 場合、 T T T が θ \theta θ の 不偏推定量なら Var θ ( T ) ≥ 1 / ( n I 1 ( θ ) ) \operatorname{Var}_\theta(T) \geq 1/(nI_1(\theta)) Var θ ( T ) ≥ 1/ ( n I 1 ( θ )) 。
証明. 仮定と 補題 3.24 の 1 より
ψ ′ ( θ ) = ∫ T ∂ θ f d x = ∫ T s f d x = E θ [ T s ] = E θ [ ( T − ψ ( θ ) ) s ] = Cov θ ( T , s ) \psi'(\theta) = \int T\,\partial_\theta f\ dx = \int T\,s\,f\ dx = E_\theta[Ts] = E_\theta[(T - \psi(\theta))s] = \operatorname{Cov}_\theta(T, s) ψ ′ ( θ ) = ∫ T ∂ θ f d x = ∫ T s f d x = E θ [ T s ] = E θ [( T − ψ ( θ )) s ] = Cov θ ( T , s )
コーシー–シュワルツの 不等式( 第1章 命題 1.8 の 4 の ∣ ρ ∣ ≤ 1 \lvert \rho \rvert \leq 1 ∣ ρ ∣ ≤ 1 )より ψ ′ ( θ ) 2 ≤ Var θ ( T ) Var θ ( s ) = Var θ ( T ) I n ( θ ) \psi'(\theta)^2 \leq \operatorname{Var}_\theta(T)\operatorname{Var}_\theta(s) = \operatorname{Var}_\theta(T)I_n(\theta) ψ ′ ( θ ) 2 ≤ Var θ ( T ) Var θ ( s ) = Var θ ( T ) I n ( θ ) 。□ \square □
例 3.27 (フィッシャー情報量の 計算)パラメータ 空間は いずれも 開区間と する。
モデル
スコア s 1 ( x ; θ ) s_1(x; \theta) s 1 ( x ; θ )
I 1 ( θ ) I_1(\theta) I 1 ( θ )
不偏推定量の 分散の 下界
B ( 1 , p ) B(1, p) B ( 1 , p )
( x − p ) / ( p ( 1 − p ) ) (x - p)/(p(1-p)) ( x − p ) / ( p ( 1 − p ))
1 / ( p ( 1 − p ) ) 1/(p(1-p)) 1/ ( p ( 1 − p ))
p ( 1 − p ) / n = Var ( X ˉ ) p(1-p)/n = \operatorname{Var}(\bar{X}) p ( 1 − p ) / n = Var ( X ˉ )
Po ( λ ) \operatorname{Po}(\lambda) Po ( λ )
x / λ − 1 x/\lambda - 1 x / λ − 1
1 / λ 1/\lambda 1/ λ
λ / n = Var ( X ˉ ) \lambda/n = \operatorname{Var}(\bar{X}) λ / n = Var ( X ˉ )
N ( μ , σ 2 ) N(\mu, \sigma^2) N ( μ , σ 2 ) (σ 2 \sigma^2 σ 2 既知)
( x − μ ) / σ 2 (x - \mu)/\sigma^2 ( x − μ ) / σ 2
1 / σ 2 1/\sigma^2 1/ σ 2
σ 2 / n = Var ( X ˉ ) \sigma^2/n = \operatorname{Var}(\bar{X}) σ 2 / n = Var ( X ˉ )
Exp ( λ ) \operatorname{Exp}(\lambda) Exp ( λ )
1 / λ − x 1/\lambda - x 1/ λ − x
1 / λ 2 1/\lambda^2 1/ λ 2
λ 2 / n \lambda^2/n λ 2 / n
I 1 I_1 I 1 は スコアの 分散と して 計算でき、上の 3 つでは X ˉ \bar{X} X ˉ が 有効推定量である。指数分布では、不偏推定量 n − 1 n X ˉ \frac{n-1}{n\bar{X}} n X ˉ n − 1 (n ≥ 3 n \geq 3 n ≥ 3 )の 分散は λ 2 n − 2 \frac{\lambda^2}{n-2} n − 2 λ 2 で 下界に 届かない(問題 3.3。これが UMVU である ことは 注意 3.31 で 述べる)。一方、平均 ψ ( λ ) = 1 / λ \psi(\lambda) = 1/\lambda ψ ( λ ) = 1/ λ に 対する 下界は ψ ′ ( λ ) 2 / ( n I 1 ( λ ) ) = 1 / ( n λ 2 ) = Var ( X ˉ ) \psi'(\lambda)^2/(nI_1(\lambda)) = 1/(n\lambda^2) = \operatorname{Var}(\bar{X}) ψ ′ ( λ ) 2 / ( n I 1 ( λ )) = 1/ ( n λ 2 ) = Var ( X ˉ ) で、X ˉ \bar{X} X ˉ は 有効である。何を 推定するかで 有効性は 変わる。
例 3.28 (正則条件が 崩れる 例:一様分布) U ( 0 , θ ) U(0, \theta) U ( 0 , θ ) では 台 [ 0 , θ ] [0, \theta] [ 0 , θ ] が θ \theta θ に 依存し、(R1) が 成り立たない。台の 上では 形式的に s = ∂ θ log f 1 ( x ; θ ) = − 1 / θ s = \partial_\theta \log f_1(x; \theta) = -1/\theta s = ∂ θ log f 1 ( x ; θ ) = − 1/ θ なので、定義どおりの「情報量」は E θ [ s 2 ] = 1 / θ 2 E_\theta[s^2] = 1/\theta^2 E θ [ s 2 ] = 1/ θ 2 、「下界」は θ 2 / n \theta^2/n θ 2 / n に なる。ところが 例 3.15 の 不偏推定量 θ ^ U = n + 1 n X ( n ) \hat{\theta}_U = \frac{n+1}{n}X_{(n)} θ ^ U = n n + 1 X ( n ) の 分散は θ 2 n ( n + 2 ) < θ 2 n \frac{\theta^2}{n(n+2)} < \frac{\theta^2}{n} n ( n + 2 ) θ 2 < n θ 2 であり、しかも 1 / n 2 1/n^2 1/ n 2 の オーダーで 小さくなる。壊れたのは 積分記号下の 微分 (R3) で、補題 3.24 の 1 が 成り立たず、実際 E θ [ s ] = − 1 / θ E_\theta[s] = -1/\theta E θ [ s ] = − 1/ θ である(その ため I n = n I 1 I_n = nI_1 I n = n I 1 も 成り立たない。標本全体の 形式的な スコア − n / θ -n/\theta − n / θ から「下界」を 作っても θ 2 / n 2 \theta^2/n^2 θ 2 / n 2 で、θ ^ U \hat{\theta}_U θ ^ U の 分散は やはり それを 下回る)。積分の 上端が θ \theta θ に 依存するので
d d θ ∫ 0 θ 1 θ d x = 0 ≠ − 1 θ = ∫ 0 θ ∂ ∂ θ ( 1 θ ) d x \frac{d}{d\theta}\int_0^\theta \frac{1}{\theta}\,dx = 0 \neq -\frac{1}{\theta} = \int_0^\theta \frac{\partial}{\partial\theta}\Bigl(\frac{1}{\theta}\Bigr)dx d θ d ∫ 0 θ θ 1 d x = 0 = − θ 1 = ∫ 0 θ ∂ θ ∂ ( θ 1 ) d x
と なり、(R3) の 積分記号下の 微分が できない(差は 上端から 来る 境界項 f 1 ( θ ; θ ) f_1(\theta; \theta) f 1 ( θ ; θ ) )。台の 端 θ \theta θ は データの 最大値に くっきり 現れるので、密度の なめらかな 変化から 読み取るよりはるかに 速く 決まるのである。
3.6 ラオ–ブラックウェルの 定理
十分統計量を 使うと、与えられた 推定量を 改良できる。
定理 3.29 (ラオ–ブラックウェルの 定理, Rao–Blackwell theorem) T T T を θ \theta θ の 十分統計量、 δ \delta δ を すべての θ \theta θ で E θ [ δ 2 ] < ∞ E_\theta[\delta^2] < \infty E θ [ δ 2 ] < ∞ を 満たす推定量とし、 δ ∗ = E [ δ ∣ T ] \delta^{\ast} = E[\delta \mid T] δ ∗ = E [ δ ∣ T ] と おく。この とき
δ ∗ \delta^{\ast} δ ∗ は θ \theta θ に よらない(統計量である)。
E θ [ δ ∗ ] = E θ [ δ ] E_\theta[\delta^{\ast}] = E_\theta[\delta] E θ [ δ ∗ ] = E θ [ δ ] 。特に δ \delta δ が g ( θ ) g(\theta) g ( θ ) の 不偏推定量なら δ ∗ \delta^{\ast} δ ∗ も そうである。
g ( θ ) g(\theta) g ( θ ) の 推定量と して MSE θ ( δ ∗ ) ≤ MSE θ ( δ ) \operatorname{MSE}_\theta(\delta^{\ast}) \leq \operatorname{MSE}_\theta(\delta) MSE θ ( δ ∗ ) ≤ MSE θ ( δ ) であり、等号は P θ ( δ = δ ∗ ) = 1 P_\theta(\delta = \delta^{\ast}) = 1 P θ ( δ = δ ∗ ) = 1 の ときに 限る。
証明. 離散の 場合に 示す。1. P θ ( T = t ) > 0 P_\theta(T = t) > 0 P θ ( T = t ) > 0 と なる t t t に ついて δ ∗ ( t ) = ∑ x δ ( x ) P θ ( X = x ∣ T = t ) \delta^{\ast}(t) = \sum_x \delta(x)P_\theta(X = x \mid T = t) δ ∗ ( t ) = ∑ x δ ( x ) P θ ( X = x ∣ T = t ) であり、十分性より 右辺は θ \theta θ に よらない。2. 第1章 の 全期待値の 公式(命題 1.12)より E θ [ δ ∗ ] = E θ [ E θ [ δ ∣ T ] ] = E θ [ δ ] E_\theta[\delta^{\ast}] = E_\theta[E_\theta[\delta \mid T]] = E_\theta[\delta] E θ [ δ ∗ ] = E θ [ E θ [ δ ∣ T ]] = E θ [ δ ] 。3. 全分散の 公式より
Var θ ( δ ) = E θ [ Var θ ( δ ∣ T ) ] + Var θ ( δ ∗ ) \operatorname{Var}_\theta(\delta) = E_\theta\bigl[\operatorname{Var}_\theta(\delta \mid T)\bigr] + \operatorname{Var}_\theta(\delta^{\ast}) Var θ ( δ ) = E θ [ Var θ ( δ ∣ T ) ] + Var θ ( δ ∗ )
2 より δ \delta δ と δ ∗ \delta^{\ast} δ ∗ の バイアスは 等しいので、定理 3.3 から MSE θ ( δ ) − MSE θ ( δ ∗ ) = E θ [ Var θ ( δ ∣ T ) ] ≥ 0 \operatorname{MSE}_\theta(\delta) - \operatorname{MSE}_\theta(\delta^{\ast}) = E_\theta[\operatorname{Var}_\theta(\delta \mid T)] \geq 0 MSE θ ( δ ) − MSE θ ( δ ∗ ) = E θ [ Var θ ( δ ∣ T )] ≥ 0 。これが 0 0 0 に なるのは、 P θ ( T = t ) > 0 P_\theta(T = t) > 0 P θ ( T = t ) > 0 と なる 各 t t t で Var θ ( δ ∣ T = t ) = 0 \operatorname{Var}_\theta(\delta \mid T = t) = 0 Var θ ( δ ∣ T = t ) = 0 、すな わち { T = t } \lbrace T = t \rbrace { T = t } の 上で 確率 1 1 1 で δ = δ ∗ ( t ) \delta = \delta^{\ast}(t) δ = δ ∗ ( t ) と なる ときに 限る。一般の 場合も、条件付き期待値の 性質( 11 第5章 命題 5.4)を 使って 同様に 示せる。 □ \square □
十分性は 1 でだけ 使われる。十分でない 統計量で 条件づけると、 E [ δ ∣ T ] E[\delta \mid T] E [ δ ∣ T ] は 一般に θ \theta θ に 依存し、推定量に ならない。
例 3.30 (ゼロ件の 確率の 推定)1 日の 問い合わせ件数が i.i.d. で Po ( λ ) \operatorname{Po}(\lambda) Po ( λ ) に 従うとし、 n n n 日分の データから、問い合わせが 1 件も ない 日の 確率 e − λ e^{-\lambda} e − λ を 推定する。 δ = 1 { X 1 = 0 } \delta = \mathbf{1}_{\lbrace X_1 = 0 \rbrace} δ = 1 { X 1 = 0 } は 不偏だが、1 日目しか 使っていない。十分統計量 T = ∑ i X i ∼ Po ( n λ ) T = \sum_i X_i \sim \operatorname{Po}(n\lambda) T = ∑ i X i ∼ Po ( nλ ) で 条件づけると、 ∑ i ≥ 2 X i ∼ Po ( ( n − 1 ) λ ) \sum_{i \geq 2} X_i \sim \operatorname{Po}((n-1)\lambda) ∑ i ≥ 2 X i ∼ Po (( n − 1 ) λ ) より
P ( X 1 = k ∣ T = t ) = P ( X 1 = k ) P ( ∑ i ≥ 2 X i = t − k ) P ( T = t ) = ( t k ) ( 1 n ) k ( 1 − 1 n ) t − k P(X_1 = k \mid T = t) = \frac{P(X_1 = k)\,P\bigl(\sum_{i \geq 2} X_i = t - k\bigr)}{P(T = t)} = \binom{t}{k}\Bigl(\frac{1}{n}\Bigr)^k\Bigl(1 - \frac{1}{n}\Bigr)^{t-k} P ( X 1 = k ∣ T = t ) = P ( T = t ) P ( X 1 = k ) P ( ∑ i ≥ 2 X i = t − k ) = ( k t ) ( n 1 ) k ( 1 − n 1 ) t − k
なので δ ∗ = ( 1 − 1 / n ) T \delta^{\ast} = (1 - 1/n)^T δ ∗ = ( 1 − 1/ n ) T 。Po ( μ ) \operatorname{Po}(\mu) Po ( μ ) に ついて E [ a T ] = e μ ( a − 1 ) E[a^T] = e^{\mu(a-1)} E [ a T ] = e μ ( a − 1 ) だから、E λ [ δ ∗ ] = e − λ E_\lambda[\delta^{\ast}] = e^{-\lambda} E λ [ δ ∗ ] = e − λ 、Var λ ( δ ∗ ) = e − 2 λ ( e λ / n − 1 ) \operatorname{Var}_\lambda(\delta^{\ast}) = e^{-2\lambda}(e^{\lambda/n} - 1) Var λ ( δ ∗ ) = e − 2 λ ( e λ / n − 1 ) 。λ = 1 \lambda = 1 λ = 1 , n = 10 n = 10 n = 10 では Var ( δ ) = e − 1 ( 1 − e − 1 ) ≈ 0.233 \operatorname{Var}(\delta) = e^{-1}(1 - e^{-1}) \approx 0.233 Var ( δ ) = e − 1 ( 1 − e − 1 ) ≈ 0.233 に 対し Var ( δ ∗ ) ≈ 0.0142 \operatorname{Var}(\delta^{\ast}) \approx 0.0142 Var ( δ ∗ ) ≈ 0.0142 と、約 16 分の 1 に なる。 ψ ( λ ) = e − λ \psi(\lambda) = e^{-\lambda} ψ ( λ ) = e − λ の クラメール–ラオの 下界は λ e − 2 λ / n ≈ 0.0135 \lambda e^{-2\lambda}/n \approx 0.0135 λ e − 2 λ / n ≈ 0.0135 で、e u − 1 > u e^u - 1 > u e u − 1 > u より δ ∗ \delta^{\ast} δ ∗ は わずかに 届かない。
3.7 最尤推定量の 漸近的性質
最尤推定量が 広く 使われるのは、正則な モデルでは、標本が 大きい ときに ほぼ不偏で クラメール–ラオの 下界を 達成するからである。
定理 3.32 (最尤推定量の 一致性と 漸近正規性) X 1 , X 2 , … X_1, X_2, \dots X 1 , X 2 , … を f 1 ( x ; θ 0 ) f_1(x; \theta_0) f 1 ( x ; θ 0 ) からの i.i.d. とし、Θ \Theta Θ を 開区間、 θ 0 ∈ Θ \theta_0 \in \Theta θ 0 ∈ Θ と する。次を 仮定する。
(A1)(識別 可能性) θ ≠ θ ′ \theta \neq \theta' θ = θ ′ ならば f 1 ( ⋅ ; θ ) f_1(\cdot; \theta) f 1 ( ⋅ ; θ ) と f 1 ( ⋅ ; θ ′ ) f_1(\cdot; \theta') f 1 ( ⋅ ; θ ′ ) は 異なる 分布を 定める。
(A2) 1 個の 観測の モデルが 正則条件を 満たし、 0 < I 1 ( θ 0 ) < ∞ 0 < I_1(\theta_0) < \infty 0 < I 1 ( θ 0 ) < ∞ 。
(A3) 台の 各点 x x x で log f 1 ( x ; θ ) \log f_1(x; \theta) log f 1 ( x ; θ ) は θ \theta θ に ついて 3 回連続微分可能で、 ∫ f 1 ( x ; θ ) d x \int f_1(x; \theta)\ dx ∫ f 1 ( x ; θ ) d x は 積分記号下で 2 回微分できる。さらに、 θ 0 \theta_0 θ 0 の ある 近傍の すべての θ \theta θ で ∣ ∂ θ 3 log f 1 ( x ; θ ) ∣ ≤ M ( x ) \lvert \partial_\theta^3 \log f_1(x; \theta) \rvert \leq M(x) ∣ ∂ θ 3 log f 1 ( x ; θ )∣ ≤ M ( x ) 、E θ 0 [ M ( X 1 ) ] < ∞ E_{\theta_0}[M(X_1)] < \infty E θ 0 [ M ( X 1 )] < ∞ と なる 関数 M M M が ある。
この とき、尤度方程式 ℓ n ′ ( θ ) = 0 \ell_n'(\theta) = 0 ℓ n ′ ( θ ) = 0 が 解を もつ 確率は 1 1 1 に 近づき、 θ ^ n → P θ 0 \hat{\theta}_n \xrightarrow{P} \theta_0 θ ^ n P θ 0 と なる 解の 列 θ ^ n \hat{\theta}_n θ ^ n が とれる。そのような 解の 列に ついて
n ( θ ^ n − θ 0 ) → d N ( 0 , 1 I 1 ( θ 0 ) ) \sqrt{n}\,(\hat{\theta}_n - \theta_0) \xrightarrow{d} N\Bigl(0, \frac{1}{I_1(\theta_0)}\Bigr) n ( θ ^ n − θ 0 ) d N ( 0 , I 1 ( θ 0 ) 1 )
である。尤度方程式の 解が つねに ただ 一つで 最尤推定量と 一致する 場合(対数尤度が 狭義凹の ときなど)は、最尤推定量 その ものに ついて これが 成り立つ。
主張と 証明の 概略に と どめる。 θ ∈ R k \theta \in \mathbb{R}^k θ ∈ R k でも、同様の 条件のもとで n ( θ ^ n − θ 0 ) → d N k ( 0 , I 1 ( θ 0 ) − 1 ) \sqrt{n}(\hat{\theta}_n - \theta_0) \xrightarrow{d} N_k(0, I_1(\theta_0)^{-1}) n ( θ ^ n − θ 0 ) d N k ( 0 , I 1 ( θ 0 ) − 1 ) が 成り立つ(主張のみ)。
証明の 概略. (一致性)イェンセンの 不等式( log \log log は 狭義凹)と (A1)・ (R1) から、 θ ≠ θ 0 \theta \neq \theta_0 θ = θ 0 なら
E θ 0 [ log f 1 ( X 1 ; θ ) f 1 ( X 1 ; θ 0 ) ] < log E θ 0 [ f 1 ( X 1 ; θ ) f 1 ( X 1 ; θ 0 ) ] = log ∫ f 1 ( x ; θ ) d x = 0 E_{\theta_0}\Bigl[\log\frac{f_1(X_1; \theta)}{f_1(X_1; \theta_0)}\Bigr] < \log E_{\theta_0}\Bigl[\frac{f_1(X_1; \theta)}{f_1(X_1; \theta_0)}\Bigr] = \log\int f_1(x; \theta)\ dx = 0 E θ 0 [ log f 1 ( X 1 ; θ 0 ) f 1 ( X 1 ; θ ) ] < log E θ 0 [ f 1 ( X 1 ; θ 0 ) f 1 ( X 1 ; θ ) ] = log ∫ f 1 ( x ; θ ) d x = 0
((A1) より 比は 定数でないので 狭義)。大数の 法則より 1 n ( ℓ n ( θ 0 ± a ) − ℓ n ( θ 0 ) ) \frac{1}{n}(\ell_n(\theta_0 \pm a) - \ell_n(\theta_0)) n 1 ( ℓ n ( θ 0 ± a ) − ℓ n ( θ 0 )) は 負の 値に 確率収束するので、確率が 1 1 1 に 近づく 事象の 上で ℓ n ( θ 0 ± a ) < ℓ n ( θ 0 ) \ell_n(\theta_0 \pm a) < \ell_n(\theta_0) ℓ n ( θ 0 ± a ) < ℓ n ( θ 0 ) と なり、 ( θ 0 − a , θ 0 + a ) (\theta_0 - a, \theta_0 + a) ( θ 0 − a , θ 0 + a ) に 尤度方程式の 解(極大点)が ある。 a > 0 a > 0 a > 0 は いくらでも 小さくとれる。
(漸近正規性)0 = ℓ n ′ ( θ ^ n ) 0 = \ell_n'(\hat{\theta}_n) 0 = ℓ n ′ ( θ ^ n ) を θ 0 \theta_0 θ 0 の まわりで テイラー展開し、 θ ^ n \hat{\theta}_n θ ^ n と θ 0 \theta_0 θ 0 の 間の θ ~ n \tilde{\theta}_n θ ~ n を 使って 整理すると
n ( θ ^ n − θ 0 ) = n − 1 / 2 ℓ n ′ ( θ 0 ) − n − 1 ℓ n ′ ′ ( θ 0 ) − 1 2 n ( θ ^ n − θ 0 ) ℓ n ′ ′ ′ ( θ ~ n ) \sqrt{n}\,(\hat{\theta}_n - \theta_0) = \frac{n^{-1/2}\ell_n'(\theta_0)}{-n^{-1}\ell_n''(\theta_0) - \frac{1}{2n}(\hat{\theta}_n - \theta_0)\ell_n'''(\tilde{\theta}_n)} n ( θ ^ n − θ 0 ) = − n − 1 ℓ n ′′ ( θ 0 ) − 2 n 1 ( θ ^ n − θ 0 ) ℓ n ′′′ ( θ ~ n ) n − 1/2 ℓ n ′ ( θ 0 )
分子は 平均 0 0 0 、分散 I 1 ( θ 0 ) I_1(\theta_0) I 1 ( θ 0 ) の i.i.d. な 項の 和を n \sqrt{n} n で 割った ものなので、中心極限定理( 第1章 定理 1.28)より N ( 0 , I 1 ( θ 0 ) ) N(0, I_1(\theta_0)) N ( 0 , I 1 ( θ 0 )) に 分布収束する。分母の 第 1 項は 大数の 法則と 補題 3.24 の 3 より I 1 ( θ 0 ) I_1(\theta_0) I 1 ( θ 0 ) に 確率収束し、第 2 項は ∣ n − 1 ℓ n ′ ′ ′ ( θ ~ n ) ∣ ≤ n − 1 ∑ i M ( X i ) \lvert n^{-1}\ell_n'''(\tilde{\theta}_n) \rvert \leq n^{-1}\sum_i M(X_i) ∣ n − 1 ℓ n ′′′ ( θ ~ n )∣ ≤ n − 1 ∑ i M ( X i ) が 有界にと どまるので 0 0 0 に 確率収束する。スルツキーの 定理( 第1章 定理 1.29)より 全体は N ( 0 , 1 / I 1 ( θ 0 ) ) N(0, 1/I_1(\theta_0)) N ( 0 , 1/ I 1 ( θ 0 )) に 分布収束する。剰余項の 扱いの 細部は 省略した(竹村『現代数理統計学』、Casella–Berger を 参照)。 □ \square □
漸近分散 1 / ( n I 1 ( θ 0 ) ) 1/(nI_1(\theta_0)) 1/ ( n I 1 ( θ 0 )) は クラメール–ラオの 下界に 等しく、この 意味で 最尤推定量は 漸近有効 (asymptotically efficient) である。
例 3.33 (標準誤差)θ ^ n \hat{\theta}_n θ ^ n は およそ N ( θ 0 , 1 / ( n I 1 ( θ 0 ) ) ) N(\theta_0, 1/(nI_1(\theta_0))) N ( θ 0 , 1/ ( n I 1 ( θ 0 ))) に 従うので、 θ 0 \theta_0 θ 0 を θ ^ n \hat{\theta}_n θ ^ n で 置き換えた 1 / n I 1 ( θ ^ n ) 1/\sqrt{nI_1(\hat{\theta}_n)} 1/ n I 1 ( θ ^ n ) (または 観測情報量に よる 1 / − ℓ n ′ ′ ( θ ^ n ) 1/\sqrt{-\ell_n''(\hat{\theta}_n)} 1/ − ℓ n ′′ ( θ ^ n ) )を 標準誤差 (standard error, SE) と して 報告する( 第4章 の 信頼区間の 材料に なる)。ポアソン分布なら SE = X ˉ / n \operatorname{SE} = \sqrt{\bar{X}/n} SE = X ˉ / n 、指数分布なら I 1 ( λ ) = 1 / λ 2 I_1(\lambda) = 1/\lambda^2 I 1 ( λ ) = 1/ λ 2 より SE = λ ^ / n \operatorname{SE} = \hat{\lambda}/\sqrt{n} SE = λ ^ / n である(後者は 第1章で デルタ法( 定理 1.31)から 得た 漸近分散と 一致する)。
注意
定理 3.32 は n → ∞ n \to \infty n → ∞ の 極限に ついての 主張で、有限の n n n での 精度は 別問題である。指数分布で n = 10 n = 10 n = 10 なら、λ ^ = 1 / X ˉ \hat{\lambda} = 1/\bar{X} λ ^ = 1/ X ˉ の 平均は 10 9 λ \frac{10}{9}\lambda 9 10 λ 、分散は 正確には n 2 λ 2 ( n − 1 ) 2 ( n − 2 ) ≈ 1.54 × λ 2 n \frac{n^2\lambda^2}{(n-1)^2(n-2)} \approx 1.54 \times \frac{\lambda^2}{n} ( n − 1 ) 2 ( n − 2 ) n 2 λ 2 ≈ 1.54 × n λ 2 で、漸近分散より 5 割以上 大きい( n = 200 n = 200 n = 200 でも 2% 大きい)。また、パラメータの 個数が n n n とともに 増える モデルでは、最尤推定量は 一致性さえ 失いうる(問題 3.6)。
3.8 不偏推定量が 存在しない・ 最良でない 例
例 3.35 (不偏推定量が 存在しない) X ∼ B ( n , p ) X \sim B(n, p) X ∼ B ( n , p ) , 0 < p < 1 0 < p < 1 0 < p < 1 と する。任意の 推定量 δ ( X ) \delta(X) δ ( X ) に ついて E p [ δ ( X ) ] = ∑ k = 0 n δ ( k ) ( n k ) p k ( 1 − p ) n − k E_p[\delta(X)] = \sum_{k=0}^n \delta(k)\binom{n}{k}p^k(1-p)^{n-k} E p [ δ ( X )] = ∑ k = 0 n δ ( k ) ( k n ) p k ( 1 − p ) n − k は p p p の 多項式で、 ( 0 , 1 ) (0, 1) ( 0 , 1 ) 上で max k ∣ δ ( k ) ∣ \max_k \lvert \delta(k) \rvert max k ∣ δ ( k )∣ 以下に 有界である。一方 1 / p 1/p 1/ p (初めて 成功するまでの 平均試行回数)は p → 0 p \to 0 p → 0 で 発散するので、 1 / p 1/p 1/ p の 不偏推定量は 存在しない。オッズ p / ( 1 − p ) p/(1-p) p / ( 1 − p ) や 対数オッズも 有界でないので 同様であり、ロジスティック回帰( 第6章 )が 不偏性でなく 最尤法に 頼る 理由の 一つである。
まとめ
推定量の 良さは 分布で 評価する。平均二乗誤差は バイアスの 2 乗と 分散の 和に 分解される(定理 3.3)。
不偏推定量が 平均二乗誤差の 意味で 最良とは 限らず、不偏性は 変数変換で 保たれない。最尤推定量は 変数変換に ついて 不変である。
モーメント法は 手軽で 一致性を もつが、データと 矛盾する 推定値を 出しうる。最尤推定量は 正規・ポアソン・指数・ 二項分布では 閉じた 形で 求まる。
十分統計量は パラメータの 情報を すべて 含む 要約であり、分解定理で 見つけられる(定理 3.19)。
正則条件のもとで、不偏推定量の 分散は 1 / ( n I 1 ( θ ) ) 1/(nI_1(\theta)) 1/ ( n I 1 ( θ )) 以上である(クラメール–ラオの 不等式)。台が パラメータに 依存する 一様分布では これが 崩れ、分散が 1 / n 2 1/n^2 1/ n 2 の オーダーの 不偏推定量が ある。
十分統計量で 条件づけると 推定量は 改良される(ラオ–ブラックウェルの 定理)。
正則条件のもとで 最尤推定量は 一致性と 漸近正規性を もち、漸近分散は 下界に 等しい。標準誤差は これから 計算するが、有限の n n n での 精度は 別に 確かめる 必要が ある。
不偏推定量が 存在しない 量( 1 / p 1/p 1/ p 、オッズ)が あり、バイアスの ある 推定量の ほうが 平均二乗誤差の 小さい ことも 多い。
演習問題
問題 3.1 ★ 幾何分布 Ge ( p ) \operatorname{Ge}(p) Ge ( p ) (0 < p ≤ 1 0 < p \leq 1 0 < p ≤ 1 )に ついて、(1) 最尤推定量が p ^ = 1 / X ˉ \hat{p} = 1/\bar{X} p ^ = 1/ X ˉ である ことを 示せ。(2) 0 < p < 1 0 < p < 1 0 < p < 1 と して フィッシャー情報量を 求めよ。(3) 50 人の 顧客の、初めて 購入するまでの 来店回数の 平均が 4.0 4.0 4.0 回だった。p p p の 最尤推定値と 標準誤差(例 3.33)を 求めよ。
解答
(1) s = ∑ i x i ≥ n s = \sum_i x_i \geq n s = ∑ i x i ≥ n と すると ℓ ( p ) = ( s − n ) log ( 1 − p ) + n log p \ell(p) = (s - n)\log(1-p) + n\log p ℓ ( p ) = ( s − n ) log ( 1 − p ) + n log p 。s > n s > n s > n なら ℓ ′ ( p ) = n p − s − n 1 − p = n − s p p ( 1 − p ) \ell'(p) = \frac{n}{p} - \frac{s-n}{1-p} = \frac{n - sp}{p(1-p)} ℓ ′ ( p ) = p n − 1 − p s − n = p ( 1 − p ) n − s p は p = n / s p = n/s p = n / s の 前後で 正から 負に 変わり、 p → 1 p \to 1 p → 1 で ℓ → − ∞ \ell \to -\infty ℓ → − ∞ 。s = n s = n s = n なら L = p n L = p^n L = p n は p = 1 p = 1 p = 1 で 最大。いずれも p ^ = n / s = 1 / X ˉ \hat{p} = n/s = 1/\bar{X} p ^ = n / s = 1/ X ˉ 。
(2) ∂ p 2 log f 1 = − 1 p 2 − k − 1 ( 1 − p ) 2 \partial_p^2 \log f_1 = -\frac{1}{p^2} - \frac{k-1}{(1-p)^2} ∂ p 2 log f 1 = − p 2 1 − ( 1 − p ) 2 k − 1 と E [ X − 1 ] = 1 − p p E[X - 1] = \frac{1-p}{p} E [ X − 1 ] = p 1 − p 、補題 3.24 の 3 より I 1 ( p ) = 1 p 2 + 1 p ( 1 − p ) = 1 p 2 ( 1 − p ) I_1(p) = \frac{1}{p^2} + \frac{1}{p(1-p)} = \frac{1}{p^2(1-p)} I 1 ( p ) = p 2 1 + p ( 1 − p ) 1 = p 2 ( 1 − p ) 1 。
(3) p ^ = 0.25 \hat{p} = 0.25 p ^ = 0.25 、SE = 1 / n I 1 ( p ^ ) = p ^ ( 1 − p ^ ) / n = 0.25 0.75 / 50 ≈ 0.031 \operatorname{SE} = 1/\sqrt{nI_1(\hat{p})} = \hat{p}\sqrt{(1 - \hat{p})/n} = 0.25\sqrt{0.75/50} \approx 0.031 SE = 1/ n I 1 ( p ^ ) = p ^ ( 1 − p ^ ) / n = 0.25 0.75/50 ≈ 0.031 。
問題 3.2 ★ ★ 分解定理(注意 3.20)を 使って 十分統計量を 求めよ。(1) 形状 α \alpha α が 既知の Gamma ( α , λ ) \operatorname{Gamma}(\alpha, \lambda) Gamma ( α , λ ) の λ \lambda λ 。(2) 一様分布 U ( θ , θ + 1 ) U(\theta, \theta + 1) U ( θ , θ + 1 ) の θ \theta θ 。また (2) で 最尤推定量が 一意でない ことを 示せ。
解答
(1) 同時密度は λ n α e − λ ∑ i x i ⋅ ∏ i x i α − 1 Γ ( α ) 1 { x i > 0 } \lambda^{n\alpha}e^{-\lambda\sum_i x_i} \cdot \prod_i \frac{x_i^{\alpha - 1}}{\Gamma(\alpha)}\mathbf{1}_{\lbrace x_i > 0 \rbrace} λ n α e − λ ∑ i x i ⋅ ∏ i Γ ( α ) x i α − 1 1 { x i > 0 } なので、g ( t ; λ ) = λ n α e − λ t g(t; \lambda) = \lambda^{n\alpha}e^{-\lambda t} g ( t ; λ ) = λ n α e − λ t と して ∑ i X i \sum_i X_i ∑ i X i が 十分統計量である。
(2) 同時密度は ∏ i 1 { θ ≤ x i ≤ θ + 1 } = 1 { θ ≤ x ( 1 ) } 1 { x ( n ) ≤ θ + 1 } \prod_i \mathbf{1}_{\lbrace \theta \leq x_i \leq \theta + 1 \rbrace} = \mathbf{1}_{\lbrace \theta \leq x_{(1)} \rbrace}\mathbf{1}_{\lbrace x_{(n)} \leq \theta + 1 \rbrace} ∏ i 1 { θ ≤ x i ≤ θ + 1 } = 1 { θ ≤ x ( 1 ) } 1 { x ( n ) ≤ θ + 1 } (x ( 1 ) = min i x i x_{(1)} = \min_i x_i x ( 1 ) = min i x i )なので、( X ( 1 ) , X ( n ) ) (X_{(1)}, X_{(n)}) ( X ( 1 ) , X ( n ) ) が 十分統計量である。パラメータは 1 次元でも、十分統計量は 2 次元に なる。尤度は x ( n ) − 1 ≤ θ ≤ x ( 1 ) x_{(n)} - 1 \leq \theta \leq x_{(1)} x ( n ) − 1 ≤ θ ≤ x ( 1 ) で 1 1 1 、それ以外で 0 0 0 であり、この 区間(データから 空でない)の すべての 点が 最尤推定値に なる。区間の 幅は 確率 1 1 1 で 正なので、最尤推定値は 無数に ある。
問題 3.3 ★ ★ X i ∼ Exp ( λ ) X_i \sim \operatorname{Exp}(\lambda) X i ∼ Exp ( λ ) i.i.d.、S = ∑ i X i S = \sum_i X_i S = ∑ i X i と する。(1) n ≥ 2 n \geq 2 n ≥ 2 なら E [ 1 / X ˉ ] = n n − 1 λ E[1/\bar{X}] = \frac{n}{n-1}\lambda E [ 1/ X ˉ ] = n − 1 n λ を 示せ。(2) n ≥ 3 n \geq 3 n ≥ 3 なら 不偏推定量 λ ~ = n − 1 S \tilde{\lambda} = \frac{n-1}{S} λ ~ = S n − 1 の 分散が λ 2 n − 2 \frac{\lambda^2}{n-2} n − 2 λ 2 である ことを 示し、クラメール–ラオの 下界と 比べよ。
解答
S ∼ Gamma ( n , λ ) S \sim \operatorname{Gamma}(n, \lambda) S ∼ Gamma ( n , λ ) (第1章 系 1.17)なので、k < n k < n k < n に ついて
E [ S − k ] = ∫ 0 ∞ s − k λ n s n − 1 e − λ s ( n − 1 ) ! d s = λ k ( n − k − 1 ) ! ( n − 1 ) ! E[S^{-k}] = \int_0^\infty s^{-k}\,\frac{\lambda^n s^{n-1}e^{-\lambda s}}{(n-1)!}\,ds = \frac{\lambda^k(n-k-1)!}{(n-1)!} E [ S − k ] = ∫ 0 ∞ s − k ( n − 1 )! λ n s n − 1 e − λ s d s = ( n − 1 )! λ k ( n − k − 1 )!
(1) E [ 1 / X ˉ ] = n E [ 1 / S ] = n λ n − 1 E[1/\bar{X}] = nE[1/S] = \frac{n\lambda}{n-1} E [ 1/ X ˉ ] = n E [ 1/ S ] = n − 1 nλ 。(2) E [ λ ~ ] = λ E[\tilde{\lambda}] = \lambda E [ λ ~ ] = λ 、E [ λ ~ 2 ] = ( n − 1 ) 2 λ 2 ( n − 1 ) ( n − 2 ) = ( n − 1 ) λ 2 n − 2 E[\tilde{\lambda}^2] = (n-1)^2\frac{\lambda^2}{(n-1)(n-2)} = \frac{(n-1)\lambda^2}{n-2} E [ λ ~ 2 ] = ( n − 1 ) 2 ( n − 1 ) ( n − 2 ) λ 2 = n − 2 ( n − 1 ) λ 2 より Var ( λ ~ ) = λ 2 n − 2 \operatorname{Var}(\tilde{\lambda}) = \frac{\lambda^2}{n-2} Var ( λ ~ ) = n − 2 λ 2 。これは 下界 λ 2 n \frac{\lambda^2}{n} n λ 2 (例 3.27)より 大きい。標本全体の スコア n / λ − S n/\lambda - S n / λ − S に 対し λ ~ \tilde{\lambda} λ ~ は その 1 次式ではないので、等号条件(注意 3.26)を 満たさない。
問題 3.4 ★ ★ 部品の 不良の 有無 X 1 , … , X n X_1, \dots, X_n X 1 , … , X n (n ≥ 2 n \geq 2 n ≥ 2 )が i.i.d. で B ( 1 , p ) B(1, p) B ( 1 , p ) に 従う。2 個の 部品が ともに 不良である 確率 p 2 p^2 p 2 に ついて、(1) δ = X 1 X 2 \delta = X_1X_2 δ = X 1 X 2 が 不偏である ことを 確かめ、 T = ∑ i X i T = \sum_i X_i T = ∑ i X i で 条件づけた δ ∗ = E [ δ ∣ T ] \delta^{\ast} = E[\delta \mid T] δ ∗ = E [ δ ∣ T ] を 求めよ。(2) δ ∗ \delta^{\ast} δ ∗ が 不偏である ことを 直接確かめ、最尤推定量 X ˉ 2 \bar{X}^2 X ˉ 2 の バイアスを 求めよ。
解答
(1) 独立性より E [ X 1 X 2 ] = p 2 E[X_1X_2] = p^2 E [ X 1 X 2 ] = p 2 。例 3.18 より、T = t T = t T = t のもとで X X X は「1 1 1 が t t t 個ある 長さ n n n の 0-1 列」全体の 上の 一様 分布に 従う。 X 1 = X 2 = 1 X_1 = X_2 = 1 X 1 = X 2 = 1 と なる 列は ( n − 2 t − 2 ) \binom{n-2}{t-2} ( t − 2 n − 2 ) 個(t < 2 t < 2 t < 2 なら 0 0 0 個)なので
δ ∗ = ( n − 2 T − 2 ) / ( n T ) = T ( T − 1 ) n ( n − 1 ) \delta^{\ast} = \binom{n-2}{T-2}\Big/\binom{n}{T} = \frac{T(T-1)}{n(n-1)} δ ∗ = ( T − 2 n − 2 ) / ( T n ) = n ( n − 1 ) T ( T − 1 )
(2) T ∼ B ( n , p ) T \sim B(n, p) T ∼ B ( n , p ) より E [ T ( T − 1 ) ] = Var ( T ) + E [ T ] 2 − E [ T ] = n ( n − 1 ) p 2 E[T(T-1)] = \operatorname{Var}(T) + E[T]^2 - E[T] = n(n-1)p^2 E [ T ( T − 1 )] = Var ( T ) + E [ T ] 2 − E [ T ] = n ( n − 1 ) p 2 なので E [ δ ∗ ] = p 2 E[\delta^{\ast}] = p^2 E [ δ ∗ ] = p 2 。また E [ X ˉ 2 ] = Var ( X ˉ ) + p 2 E[\bar{X}^2] = \operatorname{Var}(\bar{X}) + p^2 E [ X ˉ 2 ] = Var ( X ˉ ) + p 2 より、X ˉ 2 \bar{X}^2 X ˉ 2 の バイアスは p ( 1 − p ) n \frac{p(1-p)}{n} n p ( 1 − p ) (過大評価)である。
問題 3.5 ★ ★ 【この 結論は 正しいか 】ある コールセンターで 1 日の 問い合わせ件数を 100 日分 記録した。担当者は ポアソン分布を 仮定し、 λ \lambda λ の 最尤推定値 x ˉ = 40 \bar{x} = 40 x ˉ = 40 と 標準誤差 x ˉ / n ≈ 0.63 \sqrt{\bar{x}/n} \approx 0.63 x ˉ / n ≈ 0.63 を 報告した。ところが 日ごとの 件数の 不偏分散は s 2 = 160 s^2 = 160 s 2 = 160 だった。この 報告の 問題点を 指摘し、どう 直すべきか 述べよ。
解答
ポアソン分布なら 分散は 平均に 等しいは ずだが、観測された 分散は 平均の 4 倍ある( 過分散 )。曜日や キャンペーンなどで 日ごとに λ \lambda λ 自体が 変動していると 考えられ、モデルが 誤っている。 X ˉ \bar{X} X ˉ は 分布に よらず 母平均の 不偏推定量なので 推定値 40 40 40 は 使えるが、標準誤差 x ˉ / n \sqrt{\bar{x}/n} x ˉ / n は「分散 = = = 平均」と いう モデルの 性質から 計算した もので、分布を 仮定しない s / n = 160 / 100 ≈ 1.26 s/\sqrt{n} = \sqrt{160/100} \approx 1.26 s / n = 160/100 ≈ 1.26 の 半分しかない。標準誤差を s / n s/\sqrt{n} s / n で 計算し直す、負の 二項分布や、曜日などを 説明変数に 入れた ポアソン回帰( 第6章 )を 使う、などで 直す。日ごとの 件数に 自己相関が あれば s / n s/\sqrt{n} s / n も 過小に なる。
問題 3.6 ★ ★ ★ (ネイマン–スコットの 例) n n n 個の 製品を 同じ 測定器で 2 回ずつ測り、 X i 1 , X i 2 ∼ N ( μ i , σ 2 ) X_{i1}, X_{i2} \sim N(\mu_i, \sigma^2) X i 1 , X i 2 ∼ N ( μ i , σ 2 ) (すべて 独立、 i = 1 , … , n i = 1, \dots, n i = 1 , … , n )を 得た。パラメータは μ 1 , … , μ n , σ 2 \mu_1, \dots, \mu_n, \sigma^2 μ 1 , … , μ n , σ 2 である。(1) σ 2 \sigma^2 σ 2 の 最尤推定量が σ ^ 2 = 1 4 n ∑ i ( X i 1 − X i 2 ) 2 \hat{\sigma}^2 = \frac{1}{4n}\sum_i (X_{i1} - X_{i2})^2 σ ^ 2 = 4 n 1 ∑ i ( X i 1 − X i 2 ) 2 である ことを 示せ。(2) σ ^ 2 → P σ 2 / 2 \hat{\sigma}^2 \xrightarrow{P} \sigma^2/2 σ ^ 2 P σ 2 /2 を 示し、定理 3.32 の 仮定の どこが 満たされていないか説明せよ。
解答
(1) v = σ 2 v = \sigma^2 v = σ 2 と すると 対数尤度は − n log ( 2 π v ) − 1 2 v ∑ i ∑ j = 1 2 ( x i j − μ i ) 2 -n\log(2\pi v) - \frac{1}{2v}\sum_i\sum_{j=1}^{2}(x_{ij} - \mu_i)^2 − n log ( 2 π v ) − 2 v 1 ∑ i ∑ j = 1 2 ( x ij − μ i ) 2 。各 v v v に ついて、 μ i \mu_i μ i に 関する 最大は μ ^ i = ( x i 1 + x i 2 ) / 2 \hat{\mu}_i = (x_{i1} + x_{i2})/2 μ ^ i = ( x i 1 + x i 2 ) /2 でとられ、その とき ∑ j ( x i j − μ ^ i ) 2 = ( x i 1 − x i 2 ) 2 / 2 \sum_j (x_{ij} - \hat{\mu}_i)^2 = (x_{i1} - x_{i2})^2/2 ∑ j ( x ij − μ ^ i ) 2 = ( x i 1 − x i 2 ) 2 /2 。R = ∑ i ( x i 1 − x i 2 ) 2 / 2 R = \sum_i (x_{i1} - x_{i2})^2/2 R = ∑ i ( x i 1 − x i 2 ) 2 /2 と して − n log ( 2 π v ) − R 2 v -n\log(2\pi v) - \frac{R}{2v} − n log ( 2 π v ) − 2 v R は、例 3.13 と 同様に v = R 2 n v = \frac{R}{2n} v = 2 n R で 最大に なる。よって σ ^ 2 = 1 4 n ∑ i ( X i 1 − X i 2 ) 2 \hat{\sigma}^2 = \frac{1}{4n}\sum_i (X_{i1} - X_{i2})^2 σ ^ 2 = 4 n 1 ∑ i ( X i 1 − X i 2 ) 2 。
(2) D i = X i 1 − X i 2 ∼ N ( 0 , 2 σ 2 ) D_i = X_{i1} - X_{i2} \sim N(0, 2\sigma^2) D i = X i 1 − X i 2 ∼ N ( 0 , 2 σ 2 ) は i.i.d. なので、大数の 法則より 1 n ∑ i D i 2 → P 2 σ 2 \frac{1}{n}\sum_i D_i^2 \xrightarrow{P} 2\sigma^2 n 1 ∑ i D i 2 P 2 σ 2 、したがって σ ^ 2 → P σ 2 / 2 \hat{\sigma}^2 \xrightarrow{P} \sigma^2/2 σ ^ 2 P σ 2 /2 。定理 3.32 は パラメータの 次元が 固定された i.i.d. モデルの 定理だが、ここでは 観測を 2 個増やすごとに パラメータ μ i \mu_i μ i が 1 個増え、各 μ i \mu_i μ i の 情報は 増えない。補正した 1 2 n ∑ i D i 2 \frac{1}{2n}\sum_i D_i^2 2 n 1 ∑ i D i 2 は 不偏かつ 一致的である。