この章の目標
- 確率変数・期待値・分散・共分散を、離散型と密度をもつ場合について定義し、計算に使える
- 主要な分布(二項・ポアソン・幾何・一様・指数・ガンマ・ベータ・正規)の性質と相互関係を、モーメント母関数と変数変換で導ける
- 多変量正規分布の線形変換・周辺分布・条件付き分布の公式を証明し、「平均への回帰」を説明できる
- チェビシェフの不等式を証明し、大数の法則・中心極限定理・デルタ法を仮定つきで正しく使える
- 「無相関なら独立」「n が大きければ正規分布で近似できる」といった推論が、どこで破綻するかを説明できる
前提:01 微分積分学 第9章、02 線形代数 第7章・第8章。ガンマ関数・ベータ関数は 01 微分積分学 第5章 5.10 節のものを使う。高校の確率・統計(P6)を知っていると読みやすいが、前提にはしない。
ある通販サイトで、新しい商品ページ B を従来の A と比べたところ、それぞれ 1 万人の訪問者のうち A では 210 人、B では 240 人が購入した。B のほうが良いと言えるだろうか。実験をやり直せば購入者数は変わるので、データを偶然に揺らぐ量の実現値とみて、揺らぎの大きさを見積もらなければ答えられない(例 1.30)。統計学では、データを確率変数の実現値とみなし、データを生む仕組みを確率分布で表して、データから分布について何が言えて何が言えないかを調べる。本章ではそのための確率の言葉を準備する。
測度論(11 確率論)は前提にしない。分布は確率関数(離散型)か密度(連続型)で与えられるものに限り、和とリーマン積分(広義積分を含む)で計算する。また、現れる集合にはすべて確率が与えられているものとする(厳密には、確率を与える集合を σ-加法族に制限する必要がある)。測度論が本当に必要な箇所では、11 確率論 の該当箇所を示して結果を認める。
1.1 確率変数と分布
定義 1.1(確率, probability)集合 Ω(標本空間, sample space)の部分集合(事象, event)A に実数 P(A) を対応させる規則 P が、(1) P(A)≥0、(2) P(Ω)=1、(3) 互いに交わらない事象 A1,A2,… について P(⋃iAi)=∑iP(Ai)(可算加法性)をみたすとき、P を確率という。P(B)>0 のとき P(A∣B)=P(A∩B)/P(B) を条件付き確率 (conditional probability) という。
ここから P(∅)=0、P(Ac)=1−P(A)、A⊂B⇒P(A)≤P(B) などが従う。
定義 1.2(確率変数・分布)Ω 上の実数値関数 X を確率変数 (random variable)、Rn に値をとる関数 X=(X1,…,Xn) を確率ベクトル (random vector) という。FX(x)=P(X≤x) を分布関数といい、集合 A に P(X∈A) を対応させる規則を X の分布 (distribution) という。
- X が有限個または可算個の値 x1,x2,… だけをとるとき離散型といい、p(xk)=P(X=xk) を確率関数 (probability mass function) という。
- 関数 f≥0 で、すべての x について FX(x)=∫−∞xf(t) dt となるものがあるとき連続型といい、f を確率密度関数(密度, density)という。
- 確率ベクトルについて、区間の直積 D⊂Rn に対して P(X∈D)=∫Df(x) dx となる f≥0 を同時密度 (joint density) という。同時確率関数 p(x1,…,xn)=P(X1=x1,…,Xn=xn) も同様に定める。
分布は分布関数で決まる(11 確率論 第1章 定理 1.7)。X の分布が μ であることを X∼μ、X と Y の分布が等しいことを X=dY と書く。観測値 x は確率変数 X の実現値 (realization) とみて、確率変数を大文字、実現値を小文字で書く。
本科目の密度はすべて区分的に連続とする。このとき P(a<X≤b)=∫abf、P(X=a)=0 で、f が連続な点では FX′=f である(01 微分積分学 第5章 定理 5.12)。密度の値は確率ではなく(区間 (0,1/2) 上の一様分布の密度は 2)、小さな h>0 について P(x<X≤x+h)≈f(x)h と読む。(X,Y) が同時密度 f をもてば、フビニの定理により X は周辺密度 (marginal density) fX(x)=∫f(x,y) dy をもつ。
定義 1.3(独立性)確率変数(または確率ベクトル)X1,…,Xn が独立 (independent) であるとは、すべての x1,…,xn について
P(X1≤x1,…,Xn≤xn)=P(X1≤x1)⋯P(Xn≤xn)
が成り立つことをいう(ベクトルの不等号は成分ごとに読む)。無限列は、任意の有限個が独立であるとき独立という。同じ分布に従う独立な確率変数の列を i.i.d.(独立同分布)という。
命題 1.4(独立性の言い換え)
- 離散型の X1,…,Xn が独立であることは、すべての値で P(X1=x1,…,Xn=xn)=∏iP(Xi=xi) となることと同値である。
- Xi が密度 fi をもつとき、X1,…,Xn が独立であることは、(X1,…,Xn) が同時密度 f1(x1)⋯fn(xn) をもつことと同値である。
- X1,…,Xn が独立ならば、重ならない変数の組から作った関数、たとえば g(X1,…,Xk) と h(Xk+1,…,Xn) も独立である。
主張のみとする(11 確率論 第1章 系 1.24・定理 1.25)。2 の「⇐ 」は、同時密度を (−∞,x1]×⋯×(−∞,xn] 上で積分してフビニの定理を使えばわかる。
1.2 期待値・分散・共分散
定義 1.5(期待値, expectation)X が離散型で ∑k∣xk∣p(xk)<∞ のとき E[X]=∑kxkp(xk)、密度 f をもち ∫∣x∣f(x) dx<∞ のとき E[X]=∫xf(x) dx と定め、X の期待値(平均, mean)という。絶対収束しないときは期待値は存在しないという。
たとえば密度 π(1+x2)1 のコーシー分布は、左右対称なのに ∫−RRπ(1+x2)∣x∣ dx=π1log(1+R2)→∞ で、期待値をもたない。関数 g について、g(X) の期待値は(右辺が絶対収束するとき)
E[g(X)]=k∑g(xk)p(xk),E[g(X)]=∫Rng(x)f(x)dx
で計算できる(X は確率ベクトルでもよい)。これが g(X) の分布から定義どおり計算した値と一致することは、離散型なら和の並べ替えでわかり、密度の場合は 11 確率論 第1章 定理 1.12 による。
命題 1.6(期待値の性質)以下の期待値はすべて存在するとする。
- (線形性)E[aX+bY+c]=aE[X]+bE[Y]+c。
- (単調性)X≤Y ならば E[X]≤E[Y]。
- X と Y が独立ならば E[g(X)h(Y)]=E[g(X)]E[h(Y)]。
証明. 同時密度 f をもつ場合を示す(離散型は積分を和に置き換えればよい。一般の場合は 11 確率論 第1章)。1 は積分の線形性と ∬xf(x,y) dx dy=∫xfX(x) dx による。2 は f が {x≤y} の外で 0 としてよいことによる。3 は、命題 1.4 の 2 より同時密度が fX(x)fY(y) で、フビニの定理により積分が積に分かれることによる。□
定義 1.7(分散・共分散・相関係数)E[X2],E[Y2]<∞ のとき、
Var(X)=E[(X−E[X])2],Cov(X,Y)=E[(X−E[X])(Y−E[Y])],ρ(X,Y)=Var(X)Var(Y)Cov(X,Y)
をそれぞれ分散、共分散、相関係数という(相関係数は分母が正のとき)。Var(X) を標準偏差、Cov(X,Y)=0 のとき無相関という。
命題 1.8
- Var(X)=E[X2]−E[X]2、Var(aX+b)=a2Var(X)、Cov(X,Y)=E[XY]−E[X]E[Y]。
- X と Y が独立ならば無相関である。
- Var(∑iaiXi)=∑i,jaiajCov(Xi,Xj)。特に、互いに無相関なら和の分散は分散の和である。
- ∣ρ(X,Y)∣≤1。
証明. 1・3 は定義を展開して命題 1.6 の 1 を使えばよく、2 は命題 1.6 の 3 による。4:任意の実数 t について 0≤E[((Y−E[Y])−t(X−E[X]))2]=Var(Y)−2tCov(X,Y)+t2Var(X) なので、t の 2 次式の判別式は 0 以下である。□
4 はコーシー–シュワルツの不等式であり、高校で学ぶデータの相関係数の −1≤r≤1 と同じ形をしている。
例 1.9(無相関でも独立とは限らない)X が −1,0,1 を確率 1/3 ずつとり、Y=X2 とする。Cov(X,Y)=E[X3]−E[X]E[X2]=0 だが、P(X=0,Y=1)=0=P(X=0)P(Y=1) なので独立でない。相関係数は直線的な関係の強さしか測らない。
確率ベクトル X=(X1,…,Xn)⊤ の平均ベクトル E[X]=(E[X1],…,E[Xn])⊤ と、(i,j) 成分が Cov(Xi,Xj) の共分散行列 Cov(X)=E[(X−E[X])(X−E[X])⊤] を考える(Var(X) と書く本も多い)。A⊤ は転置行列で、02 線形代数 の tA と同じものである(統計学の文献の慣習に合わせる)。ベクトルは列ベクトルとする。
命題 1.10 確率ベクトル X∈Rn の各成分の 2 乗の期待値は有限とする。B を m×n 行列、c∈Rm とすると、E[BX+c]=BE[X]+c、Cov(BX+c)=BCov(X)B⊤。特に Cov(X) は対称な半正定値行列である。
証明. 成分ごとの線形性から Cov(BX+c)=E[B(X−E[X])(X−E[X])⊤B⊤]=BCov(X)B⊤。a∈Rn について a⊤Cov(X)a=Var(a⊤X)≥0。□
定義 1.11(条件付き分布)(X,Y)(それぞれ確率ベクトルでもよい)が同時密度 f をもつとき、fX(x)>0 となる x について fY∣X(y∣x)=f(x,y)/fX(x) を X=x が与えられたときの Y の条件付き密度 (conditional density)、E[Y∣X=x]=∫yfY∣X(y∣x) dy を条件付き期待値という。h(x)=E[Y∣X=x] として、確率変数 h(X) を E[Y∣X] と書く。条件付き分散 Var(Y∣X=x) も同様に定め、離散型では P(Y=y∣X=x) を使う。
連続型では P(X=x)=0 なので、これは初等的な条件付き確率ではない。f が連続なら P(Y≤y∣x<X≤x+h) の h→+0 での極限として正当化でき、一般論は 11 確率論 第5章 で扱う。
命題 1.12(全期待値と全分散の公式)E[Y2]<∞ ならば E[Y]=E[E[Y∣X]]、Var(Y)=E[Var(Y∣X)]+Var(E[Y∣X])。
証明. 同時密度をもつ場合を示す(離散型も、積分を和に置き換えれば同様である)。フビニの定理より E[h(X)]=∫(∫yf(x,y) dy)dx=E[Y]。Y2 にも同じことを使うと E[Var(Y∣X)]=E[Y2]−E[h(X)2] で、これに Var(h(X))=E[h(X)2]−E[Y]2 を足せばよい。□
1.3 主要な分布
パラメータは n∈N, 0≤p≤1(幾何分布では 0<p≤1), λ,α,σ>0, μ∈R とし、一様分布では実数 a<b、ベータ分布では a,b>0 とする。密度は表の範囲の外で 0 とする。モーメント母関数(1.4 節)は、特に書かない限りすべての t で有限である。
| 分布 |
確率関数・密度 |
平均 |
分散 |
モーメント母関数 |
| 二項 B(n,p) |
(kn)pk(1−p)n−k, k=0,…,n |
np |
np(1−p) |
(1−p+pet)n |
| ポアソン Po(λ) |
e−λλk/k!, k=0,1,… |
λ |
λ |
exp(λ(et−1)) |
| 幾何 Ge(p) |
(1−p)k−1p, k=1,2,… |
1/p |
(1−p)/p2 |
1−(1−p)etpet((1−p)et<1) |
| 一様 U(a,b)(a<b) |
b−a1, a<x<b |
2a+b |
12(b−a)2 |
(b−a)tebt−eat(t=0) |
| 指数 Exp(λ) |
λe−λx, x>0 |
1/λ |
1/λ2 |
λ−tλ(t<λ) |
| ガンマ Gamma(α,λ) |
Γ(α)λαxα−1e−λx, x>0 |
α/λ |
α/λ2 |
(λ−tλ)α(t<λ) |
| ベータ Beta(a,b) |
B(a,b)xa−1(1−x)b−1, 0<x<1 |
a+ba |
(a+b)2(a+b+1)ab |
(一般には初等関数で書けない) |
| 正規 N(μ,σ2) |
2πσ1e−(x−μ)2/(2σ2) |
μ |
σ2 |
eμt+σ2t2/2 |
二項分布は、成功確率 p の独立な試行を n 回行ったときの成功回数の分布で、購入や不良品の件数の基本モデルである。B(1,p) をベルヌーイ分布といい、B(n,p) は B(1,p) に従う n 個の i.i.d. の和の分布だから、平均と分散は命題 1.6・1.8 からわかる。ポアソン分布は、一定時間内のまれな出来事の回数(1 分あたりのアクセス数など)のモデルで、二項分布の極限である。
命題 1.13(ポアソンの少数の法則)n→∞ のとき pn→0 かつ npn→λ>0 ならば、各 k∈Z≥0 について (kn)pnk(1−pn)n−k→e−λλk/k!。
証明. 左辺を nkn(n−1)⋯(n−k+1)⋅k!(npn)k⋅(1−pn)n−k と分解すると、第 1 因子は 1 に、第 2 因子は λk/k! に収束し、log(1−p)=−p+O(p2) より (n−k)log(1−pn)→−λ である。□
幾何分布は初めて成功するまでの試行回数の分布で P(X>k)=(1−p)k、指数分布は待ち時間のモデルで P(X>t)=e−λt である。どちらも無記憶性 (memorylessness) P(X>s+t∣X>s)=P(X>t) をもつ(指数分布なら左辺は e−λ(s+t)/e−λs)。「10 分待ったのだから、そろそろ来るはずだ」は、指数分布に従う待ち時間には当てはまらない。
ガンマ分布は α=1 で指数分布になり、n 個の独立な Exp(λ) の和は Gamma(n,λ) に従う(系 1.17)。y=λx と置換すると E[Xk]=Γ(α+k)/(λkΓ(α)) がわかり、Γ(s+1)=sΓ(s) から表の平均・分散を得る。第2章の χ2 分布は Gamma(k/2,1/2) である。ベータ分布は割合のモデルで、E[Xk]=B(a+k,b)/B(a,b) と B(a+1,b)=a+baB(a,b)(01 微分積分学 第5章 定理 5.24)から表の値を得る。U(0,1)=Beta(1,1) である。
N(0,1) を標準正規分布といい、密度を ϕ(z)=e−z2/2/2π、分布関数を Φ と書く(∫ϕ=1 はガウス積分、01 微分積分学 第9章 定理 9.17)。Z∼N(0,1) について P(∣Z∣≤1)=0.6827、P(∣Z∣≤2)=0.9545、P(∣Z∣≤3)=0.9973 である。P(Z>zα)=α となる zα を上側 α 点といい、z0.05=1.645、z0.025=1.960、z0.005=2.576 である。
ヒント
実務では
同じ名前の分布でも、パラメータの付け方は文献やソフトウェアで異なる。この科目では指数分布・ガンマ分布を率 λ で書くが、NumPy の exponential(scale) や gamma(shape, scale) は尺度 1/λ を引数にとり、normal(loc, scale) の scale は分散ではなく標準偏差である。幾何分布には「初めて成功するまでの試行回数(1 以上)」と「それまでの失敗回数(0 以上)」の 2 流儀がある(NumPy の geometric は前者)。乱数を生成したら、標本の平均と分散を理論値と比べて確かめるとよい。
1.4 モーメント母関数
定義 1.14(モーメント母関数, moment generating function)MX(t)=E[etX](右辺が有限な t で定義)を X のモーメント母関数という。確率ベクトル X∈Rn については MX(t)=E[et⊤X](t∈Rn)とする。
定理 1.15 ある δ>0 について、∣t∣<δ(ベクトルなら ∥t∥<δ)で MX(t)<∞ とする。
- すべての k で E[∣X∣k]<∞ であり、∣t∣<δ で MX(t)=∑k=0∞E[Xk]tk/k!。特に E[Xk]=MX(k)(0)。
- (一意性)∣t∣<δ で MY(t)=MX(t) ならば X=dY。確率ベクトルについても同様である。
主張のみとする。1 は e∣tx∣≤etx+e−tx と優収束定理による。2 は、MX を複素数の t に拡張すると ∣Ret∣<δ で正則になることと一致の定理から特性関数の一致を導き、特性関数の一意性定理(11 確率論 第3章 系 3.17、多次元は第4章 定理 4.15)に帰着させる。
X と Y が独立なら etX と etY も独立なので(命題 1.4 の 3)、命題 1.6 の 3 より MX+Y(t)=MX(t)MY(t) である。
例 1.16(正規分布)Z∼N(0,1) について、平方完成により
MZ(t)=∫−∞∞etz2πe−z2/2dz=et2/2∫−∞∞2πe−(z−t)2/2dz=et2/2
である。et2/2=∑k≥0t2k/(2kk!) を定理 1.15 の 1 と比べると、E[Z2]=1、E[Z4]=3、奇数次のモーメントは 0 である。X=μ+σZ なら MX(t)=eμtMZ(σt)=eμt+σ2t2/2 で、MX′(0)=μ、MX′′(0)=σ2+μ2 より Var(X)=σ2。
系 1.17(再生性, reproductive property)X1,…,Xn を独立とする。
- Xi∼N(μi,σi2) ならば ∑iaiXi∼N(∑iaiμi,∑iai2σi2)(ai のどれかは 0 でない)。
- Xi∼Po(λi) ならば ∑iXi∼Po(∑iλi)。Xi∼B(ni,p) ならば ∑iXi∼B(∑ini,p)。
- Xi∼Gamma(αi,λ)(λ は共通)ならば ∑iXi∼Gamma(∑iαi,λ)。
証明. モーメント母関数の積を計算して定理 1.15 の 2 を使う。たとえば 1 では MaiXi(t)=MXi(ait)=eaiμit+ai2σi2t2/2 の積が、3 では t<λ での ∏i(λ/(λ−t))αi が、右辺の分布のモーメント母関数である。□
モーメント母関数は 0 の近くで有限とは限らない(コーシー分布や、logX∼N(0,1) となる対数正規分布では t>0 で MX(t)=∞)。このため確率論では、常に存在する特性関数を使う。
1.5 変数変換
定理 1.18(密度の変換公式)X∈Rn が同時密度 fX をもち、開集合 U の外で fX=0 とする。φ:U→V が開集合 V への C1 級の全単射で、U 上 detDφ=0 ならば、Y=φ(X) は V 上で同時密度 fY(y)=fX(φ−1(y))∣detDφ−1(y)∣ をもつ(V の外では 0)。n=1 では ∣detDφ−1(y)∣=∣(φ−1)′(y)∣ である。
証明の方針. n=1 で U が開区間、φ′>0 なら、y∈V について FY(y)=P(X≤φ−1(y))=∫infUφ−1(y)fX(x) dx で、x=φ−1(s) と置換すると(01 微分積分学 第5章 定理 5.14)これは ∫infVyfX(φ−1(s))(φ−1)′(s) ds に等しい(φ′<0 なら符号が反転する)。一般の n では、逆関数定理(01 微分積分学 第8章)より φ−1 も C1 級で、変数変換公式(01 微分積分学 第9章 定理 9.13)を φ−1 に使うと
P(Y∈D)=∫φ−1(D)fX(x)dx=∫DfX(φ−1(y))detDφ−1(y)dy
となる。定理 9.13 はコンパクトな集合上の連続関数についての定理なので、非有界な集合や区分的に連続な密度への拡張(広義積分による近似)と、区間の直積の上で確率が一致すれば分布が一致すること(11 確率論 第1章)が必要になるが、その細部は省略する。□
例 1.19 (1) Y=aX+b(a=0)の密度は fX((y−b)/a)/∣a∣。特に X∼N(μ,σ2) と (X−μ)/σ∼N(0,1) は同値である(標準化)。
(2) Z∼N(0,1), Y=Z2 とする。z↦z2 は単射でないが、分布関数を経由すればよい。y>0 で FY(y)=P(−y≤Z≤y)=2Φ(y)−1 を微分し、Γ(1/2)=π を使うと
fY(y)=yϕ(y)=2π1y−1/2e−y/2=Γ(1/2)(1/2)1/2y1/2−1e−y/2(y>0)
すなわち Z2∼Gamma(1/2,1/2) である。
例 1.20(ガンマ分布とベータ分布)X∼Gamma(a,λ), Y∼Gamma(b,λ) が独立ならば、U=X+Y と V=X/(X+Y) は独立で、U∼Gamma(a+b,λ), V∼Beta(a,b) である。実際、φ(x,y)=(x+y,x/(x+y)) は (0,∞)2 から (0,∞)×(0,1) への全単射で、φ−1(u,v)=(uv,u(1−v)) のヤコビ行列式は v⋅(−u)−u(1−v)=−u である。定理 1.18 と B(a,b)=Γ(a)Γ(b)/Γ(a+b)(01 微分積分学 第9章 定理 9.18)より
fU,V(u,v)=Γ(a)Γ(b)λa+b(uv)a−1(u(1−v))b−1e−λuu=Γ(a+b)λa+bua+b−1e−λu⋅B(a,b)va−1(1−v)b−1
で、Gamma(a+b,λ) と Beta(a,b) の密度の積に分かれるから、命題 1.4 の 2 より主張が従う。これは系 1.17 の 3 の別証明にもなる。第2章では、この例から F 分布の密度を導く。
1.6 多変量正規分布
回帰分析や多変量の推測の多くは、多変量正規分布を土台にしている。ここでは独立な標準正規分布の線形結合として定義する。こうすると、共分散行列が正則でない場合(回帰分析の残差ベクトルなど)も同じ枠組みで扱える。
定義 1.21(多変量正規分布, multivariate normal distribution)Z1,…,Zk が i.i.d. で N(0,1) に従うとき、Z=(Z1,…,Zk)⊤ を k 次元の標準正規ベクトルという(同時密度は (2π)−k/2e−∥z∥2/2)。確率ベクトル X∈Rn が多変量正規分布に従うとは、ある k、μ∈Rn、n×k 行列 A、k 次元標準正規ベクトル Z について X=dμ+AZ となることをいう。
定理 1.22(多変量正規分布の基本性質)X=dμ+AZ を定義 1.21 のとおりとし、Σ=AA⊤ とおく。
- E[X]=μ、Cov(X)=Σ、MX(t)=exp(t⊤μ+21t⊤Σt)(t∈Rn)である。したがって X の分布は μ と Σ だけで決まる。これを Nn(μ,Σ) と書く。任意の μ と対称な半正定値行列 Σ について、Nn(μ,Σ) に従う確率ベクトルが存在する。
- (線形変換)X∼Nn(μ,Σ)、B を m×n 行列、c∈Rm とすると BX+c∼Nm(Bμ+c,BΣB⊤)。
- (周辺分布)X=(X1⊤,…,Xm⊤)⊤(Xi∈Rni)とブロックに分け、μ=(μ1⊤,…,μm⊤)⊤ と Σ も対応するブロック Σij(ni×nj 行列)に分けると、Xi∼Nni(μi,Σii)。
- (密度)Σ が正定値ならば、X は同時密度
f(x)=(2π)n/2(detΣ)1/21exp(−21(x−μ)⊤Σ−1(x−μ))
をもつ。
5. (独立性)3 の分け方について、X1,…,Xm が独立であることと、i=j のとき Σij=O であることは同値である。
証明. 1. 命題 1.10 より E[X]=μ、Cov(X)=ACov(Z)A⊤=AA⊤。s=A⊤t とおくと、Zj の独立性と例 1.16 から MX(t)=et⊤μ∏jE[esjZj]=et⊤μ+∥s∥2/2=et⊤μ+t⊤Σt/2。これは k や A のとり方によらないので、定理 1.15 の 2 より分布は μ,Σ だけで決まる。存在は、半正定値行列の平方根 Σ1/2(02 線形代数 第8章 命題 8.15)を使って X=μ+Σ1/2Z とすればよい。
-
BX+c=d(Bμ+c)+(BA)Z で、(BA)(BA)⊤=BΣB⊤。 3. 2 で B を X から Xi を取り出す行列 (O ⋯ I ⋯ O) とする。
-
1 より X=dμ+Σ1/2Z(Z は n 次元)としてよい。Σ1/2 は正則で、z↦μ+Σ1/2z の逆写像 x↦Σ−1/2(x−μ) のヤコビ行列式は (detΣ)−1/2 である。定理 1.18 と ∥Σ−1/2(x−μ)∥2=(x−μ)⊤Σ−1(x−μ) から従う。
-
独立なら無相関なので Σij=O(i=j)。逆を示す。独立な標準正規ベクトル Zi∈Rni(i=1,…,m)について Yi=μi+Σii1/2Zi とおくと、Y1,…,Ym は独立で(命題 1.4 の 3)、(Y1⊤,…,Ym⊤)⊤ は平均 μ、共分散行列 diag(Σ11,…,Σmm) の多変量正規分布に従う。仮定よりこの行列は Σ に等しいので、1 よりこれは X と同じ分布である。独立性は同時分布だけで決まる性質なので(定義 1.3)、X1,…,Xm も独立である。□
特に、Nn(μ,Σ) の各成分は正規分布に従い、Σ が対角行列なら n 個の成分は独立である(5 で m=n とする)。
定理 1.23(条件付き分布)X∼Nn(μ,Σ) を定理 1.22 の 3 のように 2 つのブロック X1,X2 に分け、Σ11 は正則とする。B=Σ21Σ11−1、Σ22⋅1=Σ22−Σ21Σ11−1Σ12 とおく。
- W=X2−BX1 は X1 と独立で、W∼Nn2(μ2−Bμ1,Σ22⋅1) である。
- Σ が正定値ならば、X1=x1 が与えられたときの X2 の条件付き密度は Nn2(μ2+Σ21Σ11−1(x1−μ1), Σ22⋅1) の密度である。
証明. 1. 次の M について (X1⊤,W⊤)⊤=MX だから、定理 1.22 の 2 より (X1,W) は多変量正規分布に従う。Σ11 の対称性から B⊤=Σ11−1Σ12 なので
M=(I−BOI),MΣM⊤=(Σ11Σ21−BΣ11Σ12−Σ11B⊤Σ22−BΣ12−Σ21B⊤+BΣ11B⊤)=(Σ11OOΣ22⋅1)
となる。定理 1.22 の 5 より X1 と W は独立で、E[W]=μ2−Bμ1 である。
- M は正則なので、Σ が正定値なら MΣM⊤ も正定値で、Σ11, Σ22⋅1 は正定値である。よって X1, W は密度 f1, g をもち(定理 1.22 の 4)、(X1,W) の同時密度は f1(x1)g(w) である(命題 1.4 の 2)。(x1,x2)↦(x1,x2−Bx1) のヤコビ行列式は 1 だから、定理 1.18 より X の同時密度は f1(x1)g(x2−Bx1) で、条件付き密度は g(x2−Bx1)、すなわち Nn2(μ2−Bμ1+Bx1,Σ22⋅1) の密度である。□
条件付き期待値は x1 の一次関数で、条件付き共分散行列は x1 によらない。これが、正規分布のもとで線形回帰(第5章)が自然なモデルになる理由の一つである。
例 1.24(平均への回帰)(X,Y) が 2 変量正規分布に従い、平均 μX,μY、標準偏差 σX,σY>0、相関係数 ρ(∣ρ∣<1)をもつとすると、定理 1.23 より
Y∣X=x ∼ N(μY+ρσXσY(x−μX), σY2(1−ρ2))
である。2 回のテストの点数 X,Y がともに平均 60、標準偏差 10、ρ=0.6 なら、1 回目に 80 点だった人の 2 回目の点数は N(72,82) に従い、2 回目も 80 点以上である確率は P(Z≥1)=0.159 にすぎない。平均すると 72 点に「戻る」。これを平均への回帰 (regression toward the mean) という。2 回目に 80 点だった人の 1 回目の平均も 72 点であり、因果ではなく、相関が 1 未満であることの帰結である。
注意
「各成分が正規分布に従い、無相関ならば独立」は誤りである。定理 1.22 の 5 は、ベクトル全体が多変量正規分布に従うときにだけ使える(反例は 11 確率論 第4章 例 4.18:成分はどちらも N(0,1) に従い無相関だが、絶対値が等しい)。
ヒント
実務では
「前期に成績の悪かった店舗だけを選んで改善策を実施したら、今期は成績が上がった」という分析は、平均への回帰だけで説明できることがある。選ばれた時点の成績が偶然悪かった分は、何もしなくても次の期には平均の側に戻るからである。効果を測るには、同じ基準で選んだ店舗を無作為に実施群と対照群に分けて比べる必要がある(第8章)。
1.7 不等式と極限定理
定理 1.25(マルコフの不等式・チェビシェフの不等式)
- X≥0 かつ a>0 ならば P(X≥a)≤E[X]/a。
- E[X2]<∞ かつ a>0 ならば P(∣X−E[X]∣≥a)≤Var(X)/a2。
証明. 1. A={X≥a} とすると、各 ω で X(ω)≥a1A(ω) だから、命題 1.6 の 2 と E[1A]=P(A) より E[X]≥aP(A)。2. {∣X−E[X]∣≥a}={(X−E[X])2≥a2} に 1 を使う。□
チェビシェフの不等式は分散が有限なすべての分布で成り立つ代わりに粗い。標準偏差を σ とすると P(∣X−E[X]∣≥kσ)≤1/k2 は k=2,3 で 0.25, 0.111 だが、正規分布では 0.0455, 0.0027 である。
定義 1.26(確率収束・分布収束)
- 任意の ε>0 で P(∣Xn−X∣>ε)→0 となるとき、Xn は X(定数でもよい)に確率収束するといい、XnPX と書く。
- X の分布関数 F の連続点 x すべてで FXn(x)→F(x) となるとき、Xn は X に分布収束するといい、XndX と書く。極限の分布を書いて XndN(0,1) のようにも書く。
確率ベクトルの分布収束は、すべての有界連続関数 g で E[g(Xn)]→E[g(X)] となることで定める(1 次元では 2 と同値。11 確率論 第3章 定理 3.6)。以下 Xˉn=n1∑i=1nXi と書く。
定理 1.27(大数の法則, law of large numbers)
- X1,X2,… が互いに無相関で E[Xi]=μ、Var(Xi)=σ2<∞ ならば、XˉnPμ。
- X1,X2,… が i.i.d. で E[∣X1∣]<∞ ならば、μ=E[X1] について XˉnPμ(弱法則)であり、さらに確率 1 で Xˉn→μ となる(強法則)。
証明. 1 だけを示す。E[Xˉn]=μ、Var(Xˉn)=σ2/n(命題 1.8 の 3)なので、チェビシェフの不等式から P(∣Xˉn−μ∣≥ε)≤σ2/(nε2)→0。2 の証明は 11 確率論 第2章 定理 2.4・定理 2.7 にある。□
定理 1.28(中心極限定理, central limit theorem)X1,X2,… が i.i.d. で E[X1]=μ、Var(X1)=σ2∈(0,∞) ならば、n(Xˉn−μ)/σdN(0,1)、すなわちすべての x で P(n(Xˉn−μ)/σ≤x)→Φ(x)。確率ベクトル Xi∈Rd が i.i.d. で平均 μ、共分散行列 Σ をもつ(各成分の分散が有限)ならば、n(Xˉn−μ)dNd(0,Σ)。
主張のみとする(証明は 11 確率論 第4章 定理 4.3・定理 4.21)。仮定は i.i.d. と分散の有限性だけで、分布の形は問わない。
定理 1.29(スルツキーの定理, Slutsky's theorem)XndX かつ YnPc(定数)ならば、Xn+YndX+c、YnXndcX であり、c=0 なら Xn/YndX/c である。また g が連続ならば g(Xn)dg(X)、g(Yn)Pg(c) である(連続写像定理)。
主張のみとする(和の場合は 11 確率論 第3章 問題 3.3、連続写像定理は同章 系 3.7)。
例 1.30(A/B テストの揺らぎ)冒頭の例で、A と B の真の購入率がともに p=0.0225 だとする。各訪問者の購入の有無を B(1,p) に従う独立な確率変数とみると、購入率の差 p^B−p^A の平均は 0、標準偏差は 2p(1−p)/10000≈0.0021 である。中心極限定理により差はおよそ正規分布に従うので、真の購入率が等しくても、観測された 0.003(標準偏差の約 1.43 倍)以上の差が生じる確率は P(∣Z∣≥1.43)≈0.15 である。この程度の差は偶然でも珍しくない。この推論を検定として定式化するのは第4章である。
注意
「n≥30 なら正規近似してよい」は定理ではなく経験則である。ベリー–エシーンの定理(11 確率論 第4章 定理 4.23)は、有限の n での分布関数の誤差を CE[∣X1−μ∣3]/(σ3n)(C は分布によらない定数)で抑える。この上界は分布の歪みや裾の重さとともに大きくなり、実際の誤差もそうなりやすい。Xi∼Exp(1)、n=30 では、Xˉn が平均から標準偏差の 2 倍以上上にずれる確率は 0.0316、下にずれる確率は 0.0122 で(系 1.17 よりガンマ分布で正確に計算できる)、正規近似の 0.0228 から上下逆向きにずれる。S∼B(100,0.01) では P(S≥4)=0.0184 だが、半整数補正をした正規近似は 0.0060 で、ポアソン近似の 0.0190 のほうがずっとよい。分散が無限大なら定理 1.28 は使えない。極端な例がコーシー分布(平均も存在しない)で、その i.i.d. 列では Xˉn は n によらず X1 と同じ分布に従い、いくら n を増やしても定数にも正規分布にも近づかない(11 確率論 第3章 問題 3.4)。
定理 1.31(デルタ法, delta method)n(Tn−θ)dN(0,σ2) とし、関数 g は θ で微分可能とする。このとき n(g(Tn)−g(θ))dN(0,g′(θ)2σ2) である(N(0,0) は 0 に集中した分布と約束する)。
証明. スルツキーの定理を認めて示す。h(x)=(g(x)−g(θ))/(x−θ)(x=θ)、h(θ)=g′(θ) とおくと、h は θ で連続で、すべての x で g(x)−g(θ)=h(x)(x−θ) である。スルツキーの定理より Tn−θ=n−1/2⋅n(Tn−θ)d0 で、定数への分布収束は確率収束と同値だから(11 確率論 第3章 定理 3.2)、TnPθ。h の連続性から h(Tn)Pg′(θ)(∣x−θ∣<η で ∣h(x)−g′(θ)∣<ε となる η をとればよい)。再びスルツキーの定理より n(g(Tn)−g(θ))=h(Tn)⋅n(Tn−θ)dg′(θ)N(0,σ2)。□
たとえば Xi∼Exp(λ) i.i.d. なら、中心極限定理と g(m)=1/m から n(1/Xˉn−λ)dN(0,λ2) となる。確率ベクトル版(多変量デルタ法)では、n(Tn−θ)dNk(0,Σ) で g:Rk→Rm が θ で微分可能なら、ヤコビ行列 J=Dg(θ) について n(g(Tn)−g(θ))dNm(0,JΣJ⊤) となる(証明は同様)。A/B テストの改善率 p^B/p^A−1 のような比の標準誤差の計算に使われる。
まとめ
- 分布は、離散型なら確率関数、連続型なら密度で与えられる。密度の値は確率ではなく、P(x<X≤x+h)≈f(x)h と読む。
- 期待値は線形で、独立なら積の期待値は期待値の積になる。独立なら無相関だが逆は成り立たない。共分散行列は Cov(BX+c)=BCov(X)B⊤ と変換される半正定値行列である。
- 主要な分布の平均・分散・モーメント母関数を表にした。ポアソン分布は二項分布の極限、指数分布の和はガンマ分布、ガンマ分布の比からベータ分布が得られる。モーメント母関数は 0 の近くで有限なら分布を決める。
- 多変量正規分布は平均と共分散行列で決まり、線形変換と周辺化で閉じている。成分の組が独立であることと共分散が O であることは同値で、条件付き分布は N(μ2+Σ21Σ11−1(x1−μ1),Σ22−Σ21Σ11−1Σ12) である。平均への回帰はここから生じ、効果と取り違えやすい。
- チェビシェフの不等式は分散だけから確率を評価する。大数の法則と中心極限定理は i.i.d. と有限の平均・分散を仮定する。正規近似の精度は分布の歪みと裾に依存し、「n≥30」は経験則にすぎない。
- デルタ法は、推定量の滑らかな関数の漸近分布を一次近似から求める。
演習問題
問題 1.1 ★ 3 台のサーバーが故障するまでの時間 X1,X2,X3(単位は時間)は独立で、Xi∼Exp(λi)、λ1=0.001、λ2=λ3=0.002 とする。(1) 最初の故障までの時間 M=min(X1,X2,X3) の分布と平均を求めよ。(2) 最初に故障するのがサーバー 1 である確率を求めよ。
解答
(1) t≥0 で P(M>t)=∏iP(Xi>t)=e−0.005t なので M∼Exp(0.005)、平均 200 時間。
(2) (1) と同様に Y=min(X2,X3)∼Exp(ν)、ν=0.004 で、Y は X1 と独立である(命題 1.4 の 3)。よって
P(X1<Y)=∫0∞λ1e−λ1xP(Y>x)dx=∫0∞λ1e−(λ1+ν)xdx=λ1+νλ1=0.2
問題 1.2 ★ ある機能を使う顧客の割合 p を、無作為に選んだ n 人での割合 p^=Xˉn(Xi∼B(1,p) i.i.d.)で推定し、P(∣p^−p∣≥0.01)≤0.05 としたい。(1) チェビシェフの不等式を使うと、p によらず何人あれば十分か。(2) 中心極限定理による正規近似では何人か。(3) 両者の違いを説明せよ。
解答
Var(p^)=p(1−p)/n≤1/(4n) である。(1) P(∣p^−p∣≥0.01)≤4n⋅0.0121=n2500 なので n≥50000 で十分。(2) P(∣p^−p∣≥0.01)≈P(∣Z∣≥0.01n/(p(1−p)))≤P(∣Z∣≥0.02n) で、0.02n≥1.960、すなわち n≥9604。(3) チェビシェフの不等式は分散が同じすべての分布で成り立つ保証なので、正規分布に近い場合には 5 倍以上も過大になる。正規近似は n→∞ の極限にもとづく近似で保証ではないが、p が 0 や 1 に近すぎなければ、この規模の二項分布では十分よい。
問題 1.3 ★★ ある装置で測定した n=10000 個の値 X1,…,Xn は、どれも平均 μ、分散 1 をもつが、装置の日ごとの癖のため、どの 2 つの相関係数も ρ=0.05 である。分析者は「標本平均の標準誤差は 1/n=0.01 だから、μ は非常に精密に推定できている」と報告した。この結論は正しいか。Var(Xˉn) を計算し、n→∞ としたときのふるまいも調べよ。
解答
正しくない。命題 1.8 の 3 より Var(Xˉn)=n21(n+n(n−1)ρ)=n1+(n−1)ρ で、n=10000 では 0.050095、標準誤差は約 0.224 と報告の 22 倍になる。n→∞ でも Var(Xˉn)→ρ=0.05 で、標準誤差は 0.224 より小さくならない。すべての測定値に共通する成分(装置の癖)は平均しても消えないからである。この n 個は、独立な測定値 n/(1+(n−1)ρ)≈20 個ぶんの情報しかもたない。1/n の公式は無相関を仮定しており、同じ装置・同じ利用者・同じ日のデータのような相関のあるデータに使うと、精度を大きく過大評価する。
問題 1.4 ★★ X=(X1,X2,X3)⊤∼N3(μ,Σ) とし、μ と Σ は下のとおりとする。(1) X2=x2 が与えられたときの X3 の条件付き分布を求めよ。(2) (X1,X2)=(x1,x2) が与えられたときの X3 の条件付き分布を求めよ。(3) X2 と X3 は相関しているのに、(2) の条件付き平均が x2 によらないのはなぜか。X1=x1 を与えたときの (X2,X3) の条件付き共分散行列を計算して説明せよ。
μ=123,Σ=422231212
解答
首座小行列式は 4,8,8 なので Σ は正定値である(02 線形代数 第8章 定理 8.13)。
(1) 例 1.24 の形で、Cov(X2,X3)=1、Var(X2)=3 より X3∣X2=x2∼N(3+3x2−2, 2−31)=N(3+3x2−2, 35)。
(2) 定理 1.23 で、
Σ11=(4223),Σ11−1=81(3−2−24),B=(2 1)Σ11−1=(21 0)
Σ22⋅1=2−BΣ12=2−1=1 なので、X3∣(X1,X2)=(x1,x2)∼N(3+2x1−1, 1) で、x2 によらない。
(3) 定理 1.23 を X1 と (X2,X3) の分け方で使うと、条件付き共分散行列は
(3112)−41(22)(22)=(2001)
で対角行列だから、X1 を与えると X2 と X3 は独立になる(定理 1.23 の 1 の W に定理 1.22 の 5 を使う)。X2 と X3 の相関は、両方が X1 と相関していることだけから生じている。たとえば X1 を気温、X2 をアイスクリームの売上、X3 を熱中症の救急搬送の件数と考えるとよい。これは交絡の典型的な構造であり、第8章で扱う。
問題 1.5 ★★ X1,X2,… を Po(λ) に従う i.i.d. とする。(1) n(Xˉn−λ) と n(Xˉn−λ) の極限分布を求めよ。(2) 平方根をとると何がうれしいか説明せよ。
解答
(1) Var(X1)=λ(1.3 節の表)なので、中心極限定理より n(Xˉn−λ)dN(0,λ)。g(x)=x は g′(λ)=1/(2λ) をみたすので、デルタ法より n(Xˉn−λ)dN(0,1/4)。
(2) Xˉn の漸近分散 λ/n は未知の λ に依存するが、Xˉn の漸近分散 1/(4n) は λ によらない(分散安定化変換)。たとえば P(∣Xˉn−λ∣≤1.96/(2n))≈0.95 が λ を知らなくても使え、区間推定(第4章)や、件数データのばらつきをそろえて比べるときに役立つ。
問題 1.6 ★★ Web サーバーの応答時間を大量に測ったところ、平均 200 ミリ秒、標準偏差 300 ミリ秒だった。分析者は「応答時間が N(200,3002) に従うとすると、1000 ミリ秒を超える確率は P(Z>2.67)≈0.4 % だから、遅い応答はほとんど起きない」と結論した。(1) この推論の問題点を指摘せよ。(2) 平均と標準偏差だけから、チェビシェフの不等式で何が言えるか。(3) 応答時間 X が平均と標準偏差の同じ対数正規分布(logX∼N(m,s2))に従う場合の P(X>1000) を求めよ。
解答
(1) 中心極限定理は平均の分布についての定理で、個々の観測値が正規分布に従う根拠にはならない。しかも N(200,3002) では P(X<0)=Φ(−0.67)≈0.25 で、応答時間が負になる確率が 25 % もある。正の値しかとらないのに標準偏差が平均より大きいことは、分布が右に大きく歪んでいることを示している。
(2) P(X≥1000)≤P(∣X−200∣≥800)≤3002/8002≈0.14。チェビシェフの不等式から言えるのは「14 % 以下」ということだけである。逆に、87.5 と 1000 にそれぞれ確率 64/73、9/73 を置く 2 点分布は、E[X]=200、E[X2]=130000 より平均 200、標準偏差 300 をもち、P(X≥1000)=9/73≈0.12 である。平均と標準偏差しかわからなければ、遅い応答が 1 割を超える可能性も否定できない。
(3) Y=logX とすると、例 1.16 より E[X]=MY(1)=em+s2/2、E[X2]=MY(2)=e2m+2s2 なので Var(X)/E[X]2=es2−1=(300/200)2。よって s2=log3.25≈1.179、s≈1.086、m=log200−s2/2≈4.709 で、P(X>1000)=P(Z>(log1000−m)/s)≈P(Z>2.03)≈0.021。分析者の値の 5 倍以上である。遅い応答の頻度を知るには、平均と標準偏差ではなく分布の裾(たとえば観測値の 99 % 点)を直接見るべきである。