この章の目標
- 確率収束と概収束の違いを理解し、大数の弱法則・強法則を証明できる
- 切断・部分列・ボレル–カンテリの補題を組み合わせる強法則の証明技法(エテマディの証明)を身につける
- コルモゴロフの 0-1 法則を証明し、末尾事象の確率が 0 か 1 であることを使える
- モンテカルロ法・正規数・ワイエルシュトラスの近似定理・グリヴェンコ–カンテリの定理への応用を説明できる
前提:第1章、06-measure-integration 第4章(測度収束)
2.1 二つの収束
公平なコインを n 回投げたときの表の回数を Sn とすると、経験的に相対頻度 Sn/n は 1/2 に近づく。確率論の出発点ともいえるこの経験則を定理として述べるには、「確率変数列が収束する」ことの意味を定める必要がある。この章では次の二つを使う(他の収束概念とあわせた比較は第3章で行う)。
定義 2.1(概収束・確率収束)確率変数列 Xn と確率変数 X について
- P(limnXn=X)=1 のとき、Xn は X に概収束 (almost sure convergence) するといい、Xn→X a.s. と書く。
- 任意の ε>0 について P(∣Xn−X∣>ε)→0 のとき、Xn は X に確率収束 (convergence in probability) するといい、XnPX と書く。
概収束は測度論の a.e. 収束、確率収束は測度収束(06-measure-integration 第4章 定義 4.15)である。全測度が有限なので概収束すれば確率収束するが、逆は成り立たない(第3章)。確率収束は「各時刻 n で大きくずれる確率が小さい」ことしか言わず、一つの標本路 n↦Xn(ω) の挙動については何も言わない。
以下、X1,X2,… に対し Sn=X1+⋯+Xn とおく。
2.2 大数の弱法則
定理 2.2(L2 弱法則)X1,X2,… は互いに無相関で、E[Xn]=m、Var(Xn)≤C(C は定数)を満たすとする。このとき Sn/n→m は L2 でも確率でも成り立つ。
証明. 無相関なので分散は加法的で、E[(Sn/n−m)2]=Var(Sn)/n2≤C/n→0。チェビシェフの不等式より P(∣Sn/n−m∣>ε)≤C/(nε2)→0。□
例 2.3 公平なコインでは Var(Xk)=1/4 なので P(∣Sn/n−1/2∣≥ε)≤1/(4nε2)。誤差 ε の典型的な大きさは 1/n の程度である。この n のスケールでの揺らぎを精密に述べるのが第4章の中心極限定理である。
分散が存在しなくても、平均さえあれば弱法則は成り立つ。証明の鍵は切断 (truncation) である。
定理 2.4(大数の弱法則, weak law of large numbers)X1,X2,… を i.i.d. で E[∣X1∣]<∞ とし、m=E[X1] とする。このとき Sn/nPm。
証明. n ごとに Yn,k=Xk1{∣Xk∣≤n}(1≤k≤n)、Tn=∑k=1nYn,k、μn=E[X1;∣X1∣≤n] とおく。
(a) P(Sn=Tn)≤∑k=1nP(∣Xk∣>n)=nP(∣X1∣>n)≤E[∣X1∣;∣X1∣>n]→0(優収束定理)。
(b) Yn,1,…,Yn,n は i.i.d. なので E[Tn]=nμn、Var(Tn)≤nE[X12;∣X1∣≤n]。0<M≤n とすると、{∣X1∣≤M} では X12≤M2、{M<∣X1∣≤n} では X12≤n∣X1∣ だから
Var(Tn/n)≤n1E[X12;∣X1∣≤n]≤nM2+E[∣X1∣;∣X1∣>M]
n→∞、次に M→∞ として Var(Tn/n)→0 を得る。
(c) 優収束定理より μn→m。ε>0 に対し n が十分大きく ∣μn−m∣<ε/2 となれば
P(∣Sn/n−m∣>ε)≤P(Sn=Tn)+P(∣Tn/n−μn∣>ε/2)≤P(Sn=Tn)+ε24Var(Tn/n)→0□
2.3 大数の強法則
弱法則は「n を一つ固定すれば、Sn/n が m から離れている確率は小さい」と言うだけである。コイン投げを延々と続けたとき、一つの試行列の上で相対頻度が 1/2 に収束するか、という問いに答えるのが強法則である。まずボレル–カンテリの補題が直接使える場合を扱う。
定理 2.6(4 次モーメントによる強法則)X1,X2,… は独立で、E[Xn]=m、E[(Xn−m)4]≤K(K は定数)を満たすとする。このとき Sn/n→m a.s.。
証明. Xn−m を改めて Xn とおき m=0 とする。Sn4=(∑iXi)4 を展開すると、独立性と E[Xi]=0 より、ある添字がちょうど 1 回だけ現れる項の期待値は 0 になる。残るのは Xi4 と Xi2Xj2(i=j)の項だけで
E[Sn4]=i=1∑nE[Xi4]+6i<j∑E[Xi2]E[Xj2]≤nK+3n(n−1)K≤3Kn2
である(E[Xi2]2≤E[Xi4]≤K を使った)。マルコフの不等式より P(∣Sn/n∣>ε)≤E[Sn4]/(n4ε4)≤3K/(ε4n2) で、これは n について総和有限である。ボレル–カンテリの第 1 補題より、a.s. で有限個の n を除き ∣Sn/n∣≤ε。ε=1/l(l∈N)について確率 1 の事象の共通部分をとれば Sn/n→0 a.s.。□
コイン投げのように有界な確率変数ならこれで十分である。一般の場合は、次の定理が最良である(逆が注意 2.8)。ここでは独立性を「対ごとの独立性」に弱めたエテマディ(N. Etemadi, 1981)の証明を与える。
定理 2.7(大数の強法則, strong law of large numbers)X1,X2,… は対ごとに独立で同分布、E[∣X1∣]<∞ とし、m=E[X1] とする。このとき Sn/n→m a.s.。
証明. Xn=Xn+−Xn− と分けると、(Xn+)n、(Xn−)n もそれぞれ対ごとに独立で同分布だから、Xn≥0 としてよい。
(1) 切断。Yk=Xk1{Xk≤k}、Tn=∑k=1nYk とおく。命題 1.14 より ∑kP(Xk=Yk)=∑kP(X1>k)≤E[X1]<∞ なので、第 1 補題より a.s. で有限個の k を除き Xk=Yk となり、(Sn−Tn)/n→0 a.s.。よって Tn/n→m a.s. を示せばよい。
(2) 分散の和の評価。x>0 について ∑k∈N,k≥xk−2≤2/x である(x≥1 なら k0=⌈x⌉ として ∑k≥k0k−2≤k0−2+∫k0∞t−2 dt≤2/k0、0<x<1 なら ∑kk−2<2<2/x)。トネリの定理より
k=1∑∞k2E[Yk2]=E[X12k≥X1∑k21]≤E[X12⋅X12;X1>0]=2E[X1]<∞
(3) 幾何級数的な部分列。α>1 を固定し k(n)=⌊αn⌋ とおく。Yk は対ごとに独立なので無相関で、Var(TN)=∑j≤NVar(Yj)。y≥1 で ⌊y⌋≥y/2 だから ∑n:k(n)≥jk(n)−2≤∑n:αn≥j4α−2n≤(1−α−2)j24。チェビシェフの不等式と和の順序交換により
n=1∑∞P(∣Tk(n)−E[Tk(n)]∣>εk(n))≤ε21n∑k(n)21j≤k(n)∑Var(Yj)≤ε2(1−α−2)4j∑j2Var(Yj)<∞
第 1 補題と ε=1/l の共通部分により (Tk(n)−E[Tk(n)])/k(n)→0 a.s.。単調収束定理より E[Yk]=E[X1;X1≤k]↑m なので、チェザロ平均も E[Tn]/n→m。よって Tk(n)/k(n)→m a.s.。
(4) 補間。Yk≥0 より Tl は l について単調非減少だから、k(n)≤l≤k(n+1) のとき
k(n+1)k(n)⋅k(n)Tk(n)≤lTl≤k(n+1)Tk(n+1)⋅k(n)k(n+1)
k(n+1)/k(n)→α なので、a.s. で m/α≤liminflTl/l≤limsuplTl/l≤αm。α=1+1/j(j∈N)について共通部分をとれば Tl/l→m a.s.。□
2.4 コルモゴロフの 0-1 法則
コイン投げで「相対頻度が収束する」という事象は、最初の有限回の結果をどう変えても起こるかどうかが変わらない。このような事象の確率は 0 か 1 に限られる。
定義 2.9(末尾 σ-加法族, tail σ-algebra)確率変数列 X1,X2,… に対し Tn=σ(Xn+1,Xn+2,…)、T=⋂nTn とおく。T を末尾 σ-加法族、その元を末尾事象 (tail event) という。
例 2.10 {∑nXn が収束}、{Sn/n が収束} は末尾事象であり、limsupnSn/n は T-可測である(どの m についても、(Sn−Sm)/n の挙動で決まり、それは Tm-可測)。一方 {Sn>0 i.o.} は、X1 の値を変えると変わりうるので一般には末尾事象ではない。
定理 2.11(コルモゴロフの 0-1 法則, Kolmogorov's zero-one law)X1,X2,… が独立ならば、任意の A∈T について P(A)=0 または 1 である。
証明. An=σ(X1,…,Xn) とおく。グループ化(系 1.24)により An と Tn は独立で、T⊂Tn だから T は各 An と独立である。An は増大列なので ⋃nAn は π-系であり、定理 1.23 より T は σ(⋃nAn)=σ(X1,X2,…) と独立である。T はこれに含まれるので、A∈T は自分自身と独立で P(A)=P(A∩A)=P(A)2。□
系 2.12 Xn が独立ならば、T-可測な [−∞,∞] 値確率変数 Y は a.s. で定数である。
証明. 各 x について P(Y≤x)∈{0,1} なので、c=inf{x∈R∣P(Y≤x)=1}∈[−∞,∞](inf∅=∞)とおけば Y=c a.s.。□
したがって独立な確率変数の級数は、確率 1 で収束するか確率 1 で発散するかのどちらかである。どちらになるかを判定する道具が次節の定理である。
2.5 コルモゴロフの不等式と級数の収束
定理 2.13(コルモゴロフの不等式, Kolmogorov's inequality)X1,…,Xn は独立で E[Xk]=0、E[Xk2]<∞ とする。λ>0 について
P(1≤k≤nmax∣Sk∣≥λ)≤λ2Var(Sn)
チェビシェフの不等式は ∣Sn∣ だけを評価するが、この不等式は途中の最大値まで同じ上界で評価する。
証明. Ak={∣Sk∣≥λ, ∣Sj∣<λ (j<k)} は互いに交わらず、和集合が左辺の事象である。Sk1Ak は σ(X1,…,Xk)-可測、Sn−Sk はそれと独立で平均 0 なので E[Sk1Ak(Sn−Sk)]=0。よって
E[Sn2]≥k=1∑nE[Sn2;Ak]≥k=1∑nE[Sk2+2Sk(Sn−Sk);Ak]=k=1∑nE[Sk2;Ak]≥λ2k=1∑nP(Ak)□
定理 2.14 X1,X2,… は独立で E[Xn]=0、∑nVar(Xn)<∞ を満たすとする。このとき ∑nXn は a.s. で収束する。
証明. m<n とし、Xm+1,…,Xn に定理 2.13 を適用して n→∞ とすれば
P(k>msup∣Sk−Sm∣>ε)≤ε21k>m∑Var(Xk)
Wm=supj,k>m∣Sj−Sk∣ は m について単調非増加で、Wm≤2supk>m∣Sk−Sm∣。極限 W=limmWm について P(W>2ε)≤P(Wm>2ε)≤ε−2∑k>mVar(Xk)→0 なので W=0 a.s.、すなわち (Sn) は a.s. でコーシー列である。□
例 2.15(ランダムな符号の調和級数)εn を P(εn=±1)=1/2 の i.i.d. とすると、∑n1/n2<∞ なので ∑nεn/n は a.s. で収束する。調和級数は発散し交代調和級数は収束するが、符号を公平なコインで決めると確率 1 で収束する。
定理 2.16(コルモゴロフの 3 級数定理, three-series theorem)X1,X2,… を独立とし、A>0、Yn=Xn1{∣Xn∣≤A} とおく。∑nXn が a.s. で収束するための必要十分条件は、次の三つの級数がすべて収束することである。
(i) n∑P(∣Xn∣>A),(ii) n∑E[Yn],(iii) n∑Var(Yn)
証明の概略. 十分性:(i) と第 1 補題より a.s. で有限個を除き Xn=Yn。(iii) と定理 2.14 より ∑n(Yn−E[Yn]) は a.s. で収束し、(ii) と合わせて ∑nYn、したがって ∑nXn が a.s. で収束する(ここまでは完全な証明である)。必要性:∑nXn が収束すれば Xn→0 なので、第 2 補題の対偶から (i) が従う。(iii) は、独立なコピー Yn′ との差 Yn−Yn′(対称化)を考え、有界な項の和が収束するなら分散の和も有限であること(コルモゴロフの不等式の逆向きの評価、または中心極限定理による)を示して得る。(ii) は (iii) と定理 2.14 から従う。詳細は Durrett の教科書を参照。□
2.6 応用
モンテカルロ法
f:[0,1]d→R が可積分なら、[0,1]d 上の一様分布に従う i.i.d. U1,U2,… について、強法則より
n1k=1∑nf(Uk)→∫[0,1]df(x) dxa.s.
例 2.17(π の推定)d=2、f=4⋅1{x12+x22≤1} とすれば積分は π である。Var(f(U))=16⋅4π(1−4π)=4π−π2≈2.70 なので、チェビシェフの不等式より n=106 点で P(∣π^n−π∣≥0.01)≤2.70/(106⋅10−4)=0.027。誤差は Var(f(U))/n の程度で、次元 d によらない。格子点を使う数値積分では、1 軸あたり N1/d 点しか置けず高次元で精度が急速に落ちるのと対照的である。
ボレルの正規数定理
x∈[0,1) の b 進展開(b≥2)で、長さ k のすべての数字列 w が極限頻度 b−k で現れるとき、x は b 進正規数 (normal number) であるという。
定理 2.18(ボレルの正規数定理, Borel 1909)ルベーグ測度についてほとんどすべての x∈[0,1) は、すべての b≥2 について b 進正規数である。
証明. b を固定する。例 1.32 と同様に、b 進展開の各桁 d1,d2,… はルベーグ測度のもとで {0,…,b−1} 上の一様分布に従う i.i.d. である。長さ k の数字列 w を固定し、ηj=1{(dj,…,dj+k−1)=w} とおく。ηj たちは重なりのために独立ではないが、剰余 r∈{1,…,k} ごとに ηr,ηr+k,ηr+2k,… は重ならないブロックで決まるので Be(b−k) の i.i.d. である。定理 2.6 より各 r について N1∑i=0N−1ηr+ik→b−k a.s. であり、j≤n を剰余で k 組に分けて和をとれば n1∑j=1nηj→b−k a.s.。b、k、w は可算個なので、例外集合の和も零集合である。□
ほとんどすべての数が正規数であるにもかかわらず、2、π、e が 10 進正規数かどうかは知られていない。確率論的な存在証明は、具体例を与えずに「ほとんどすべて」を示せるという特徴をもつ。
ワイエルシュトラスの近似定理
定理 2.19(バーンスタイン多項式による近似)f∈C([0,1]) に対し
Bnf(p)=k=0∑nf(nk)(kn)pk(1−p)n−k
とおくと、Bnf→f は [0,1] 上一様収束する。特に連続関数は多項式で一様近似できる。
証明. Sn∼B(n,p) とすると Bnf(p)=E[f(Sn/n)] である(コインの表の出る確率 p を相対頻度 Sn/n で推定して f に代入する)。f は一様連続なので、ε>0 に対し ∣x−y∣<δ なら ∣f(x)−f(y)∣<ε となる δ>0 がある。M=max∣f∣ とすると、チェビシェフの不等式と p(1−p)≤1/4 より
∣Bnf(p)−f(p)∣≤E[∣f(Sn/n)−f(p)∣]≤ε+2MP(nSn−p≥δ)≤ε+nδ22Mp(1−p)≤ε+2nδ2M
右辺は p によらないので limsupnmaxp∣Bnf(p)−f(p)∣≤ε。□
解析的な証明は 01-calculus 第6章 も参照。確率論的な証明は近似多項式を具体的に与える点に特徴がある。
2.7 経験分布関数とグリヴェンコ–カンテリの定理
未知の分布 F に従う i.i.d. な観測値 X1,…,Xn から F を推定したい。自然な推定量は経験分布関数 (empirical distribution function)
Fn(x)=n1k=1∑n1{Xk≤x}
である。各 x を固定すれば、強法則より Fn(x)→F(x) a.s.。しかし例外集合は x に依存し、x は非可算個あるので、これだけでは「関数として」の収束は言えない。
定理 2.20(グリヴェンコ–カンテリの定理, Glivenko–Cantelli theorem)X1,X2,… を分布関数 F をもつ i.i.d. とすると
x∈Rsup∣Fn(x)−F(x)∣→0a.s.
証明. k∈N を固定し、x0=−∞、xk=∞、1≤j≤k−1 について xj=inf{y∣F(y)≥j/k} とおく。右連続性から F(xj)≥j/k、下限の定義から F(xj−)≤j/k である(F(−∞)=0、F(∞−)=1 と約束する)。よって各 j で F(xj−)−F(xj−1)≤1/k。強法則を 1{Xi≤xj} と 1{Xi<xj} に適用すると、a.s. で
εn:=jmax(∣Fn(xj)−F(xj)∣+∣Fn(xj−)−F(xj−)∣)→0
x∈[xj−1,xj) とすると、単調性から
Fn(x)≤Fn(xj−)≤F(xj−)+εn≤F(xj−1)+k1+εn≤F(x)+k1+εn
同様に Fn(x)≥Fn(xj−1)≥F(xj−1)−εn≥F(xj−)−k1−εn≥F(x)−k1−εn。よって limsupnsupx∣Fn(x)−F(x)∣≤1/k a.s.。k∈N について共通部分をとればよい。□
この定理は「データを集めれば真の分布がわかる」ことの数学的な保証であり、統計学の基本定理とも呼ばれる。誤差 nsupx∣Fn−F∣ の極限分布(コルモゴロフ–スミルノフ検定の基礎)は第7章のブラウン運動(ブラウン橋)と関係する。
まとめ
- 概収束(a.e. 収束)は標本路ごとの収束、確率収束(測度収束)は各時刻での分布の集中であり、前者の方が強い。
- L2 弱法則はチェビシェフの不等式から、一般の弱法則は切断から従う。
- 4 次モーメントがあればボレル–カンテリの補題で強法則が直ちに示せる。一般の強法則(E[∣X1∣]<∞)は、切断・幾何級数的な部分列・単調性による補間で示す(エテマディ)。i.i.d. では可積分性は強法則の必要十分条件である。
- 独立列の末尾事象の確率は 0 か 1(コルモゴロフの 0-1 法則)。
- コルモゴロフの不等式から、分散の和が有限な独立級数は a.s. で収束する。収束の判定は 3 級数定理で完全に与えられる。
- 応用:モンテカルロ法(誤差は次元によらず n−1/2 程度)、ほとんどすべての実数は正規数、バーンスタイン多項式による一様近似、経験分布関数の一様収束。
演習問題
問題 2.1 ★ 公平なコインを n 回投げる。チェビシェフの不等式を用いて、表の相対頻度と 1/2 との差が 0.01 未満である確率が 0.95 以上となることを保証するには、n をいくつ以上にすればよいか。
解答
P(∣Sn/n−1/2∣≥0.01)≤n⋅10−41/4=n2500 なので、2500/n≤0.05、すなわち n≥50000 ならよい。(中心極限定理を使えば約 9600 回で足りることがわかる。チェビシェフの不等式は安全側の粗い評価である。)
問題 2.2 ★ X1,X2,… を i.i.d. で P(X1=±1)=1/2 とする。limsupnSn/n は a.s. で定数(±∞ も許す)であることを示せ。
解答
m を固定すると Sm/n→0 なので limsupnSn/n=limsupn(Sn−Sm)/n であり、右辺は σ(Xm+1,Xm+2,…)-可測である。m は任意なので T-可測で、系 2.12 より a.s. で定数である。(実は +∞ である。第4章 問題 4.3 を参照。)
問題 2.3 ★★ Xn を i.i.d. で E[X1+]=∞、E[X1−]<∞ とする。Sn/n→∞ a.s. を示せ。
解答
M>0 について Xn∧M は i.i.d. で可積分(∣Xn∧M∣≤M+Xn−)だから、強法則より n1∑k≤n(Xk∧M)→E[X1∧M] a.s.。Sn≥∑k≤n(Xk∧M) なので liminfnSn/n≥E[X1∧M] a.s.。E[X1∧M]=E[X1+∧M]−E[X1−]→∞(M→∞、単調収束定理)なので、M∈N について共通部分をとればよい。
問題 2.4 ★★ (1)(クロネッカーの補題)実数列 an について ∑nan/n が収束するならば n1∑k=1nak→0 であることを示せ。(2) Xn が独立で E[Xn]=0、∑nVar(Xn)/n2<∞ ならば Sn/n→0 a.s. であることを示せ。
解答
(1) b0=0、bn=∑k≤nak/k→b とおく。ak=k(bk−bk−1) だから、アーベルの総和法により
n1k=1∑nak=n1(nbn−k=0∑n−1bk)=bn−n1k=0∑n−1bk→b−b=0
(チェザロ平均は元の数列と同じ極限をもつ)。(2) Xn/n に定理 2.14 を適用すると ∑nXn/n は a.s. で収束し、(1) より Sn/n→0 a.s.。
問題 2.5 ★★ εn を P(εn=±1)=1/2 の i.i.d. とする。∑nεnn−α が a.s. で収束するための必要十分条件は α>1/2 であることを示せ。
解答
α>1/2 なら ∑nVar(εnn−α)=∑nn−2α<∞ なので定理 2.14 より収束する。α≤1/2 のとき 3 級数定理を A=2 で適用すると、Yn=Xn=εnn−α で (i) (ii) は成り立つが (iii) ∑nn−2α=∞ が成り立たない。よって a.s. 収束はせず、0-1 法則により確率 1 で発散する。
問題 2.6 ★★(再生定理)ξ1,ξ2,… を正の値をとる i.i.d. で E[ξ1]=μ<∞ とし、Tn=ξ1+⋯+ξn(電球を n 個使い切る時刻)、N(t)=max{n≥0∣Tn≤t}(T0=0)とする。N(t)/t→1/μ a.s.(t→∞)を示せ。
解答
強法則より Tn/n→μ a.s.。この事象の上では Tn→∞ なので N(t)<∞、また各 Tn<∞ より N(t)→∞(t→∞)。N(t)≥1 のとき TN(t)≤t<TN(t)+1 だから
N(t)TN(t)≤N(t)t<N(t)+1TN(t)+1⋅N(t)N(t)+1
両端は μ に収束するので t/N(t)→μ。
問題 2.7 ★★★ (1) Xn が i.i.d. で xP(∣X1∣>x)→0(x→∞)ならば、μn=E[X1;∣X1∣≤n] について Sn/n−μnP0 を示せ。(2) X1 が対称分布で x≥e について P(∣X1∣>x)=e/(xlogx) を満たすとき、Sn/nP0 だが Sn/n は a.s. 収束しないことを示せ。
解答
(1) 定理 2.4 の証明と同じ記号を使う。(a) P(Sn=Tn)≤nP(∣X1∣>n)→0。(b) 命題 1.14 の証明と同様に E[X12;∣X1∣≤n]=∫0∞2yP(y<∣X1∣≤n) dy≤∫0n2yP(∣X1∣>y) dy。g(y)=2yP(∣X1∣>y) は有界で y→∞ で 0 に収束するので、n1∫0ng(y) dy→0。よって Var(Tn/n)≤n1E[X12;∣X1∣≤n]→0。(a)(b) とチェビシェフの不等式から P(∣Sn/n−μn∣>ε)≤P(Sn=Tn)+Var(Tn/n)/ε2→0。
(2) xP(∣X1∣>x)=e/logx→0 で、対称性より μn=0 だから (1) より Sn/nP0。一方 E[∣X1∣]=∫0∞P(∣X1∣>x) dx≥∫e∞xlogxe dx=∞ なので、注意 2.8 より limsupn∣Sn∣/n=∞ a.s.。