Lemma数学ロードマップ

11 確率論 · 第 1 章

確率空間と確率変数

目安 14〜20 時間定理など 13演習 9 問

この章の目標

  • 確率空間・確率変数・分布・期待値・独立性を測度論の言葉で定義し、確率論の用語と測度論の用語の対応を説明できる
  • 分布関数の性質を証明し、代表的な離散分布・連続分布を扱える
  • マルコフ・チェビシェフ・イェンセンの不等式を使える
  • π-系による独立性の判定とボレル–カンテリの補題を証明し、応用できる

前提:06-measure-integration 第1章、第3章、第5章

1.1 確率空間

サイコロを 1 回振るなら、標本点の集合 Ω={1,…,6}\Omega = \lbrace 1, \dots, 6 \rbrace の部分集合 AA に確率 ∣A∣/6\lvert A \rvert / 6 を与えればよい。コインを nn 回投げるなら Ω={0,1}n\Omega = \lbrace 0, 1 \rbrace^n(1 が表)で P(A)=∣A∣/2nP(A) = \lvert A \rvert / 2^n である。有限の場合、確率は「数えること」で済む。

ところが次の二つの状況では、数えることが破綻する。

  • コインを無限回投げる。Ω={0,1}N\Omega = \lbrace 0, 1 \rbrace^{\mathbb{N}} は非可算で、特定の一つの列が出る確率は 0 である。点の確率を足し合わせて事象の確率を得ることはできない。
  • 区間 [0,1][0, 1] から一様に点を選ぶ。P([a,b])=b−aP([a, b]) = b - a であってほしいが、これはルベーグ測度そのものであり、ヴィタリの定理(06-measure-integration 第2章 定理 2.16)によって、平行移動で不変という性質を保ったまま [0,1][0,1] のすべての部分集合に確率を与えることはできない。

したがって、確率を与える集合(事象)の族を σ-加法族に制限し、確率を測度として公理化する必要がある。これがコルモゴロフ(A. N. Kolmogorov, 1933)の確率論の公理化である。実は上の二つの状況は本質的に同じものである(例 1.32)。

定義 1.1(確率空間, probability space)測度空間 (Ω,F,P)(\Omega, \mathcal{F}, P) で P(Ω)=1P(\Omega) = 1 を満たすものを確率空間という。Ω\Omega を標本空間 (sample space)、F\mathcal{F} の元を事象 (event)、PP を確率測度 (probability measure)、P(A)P(A) を事象 AA の確率という。ある性質が確率 1 の事象の上で成り立つとき、その性質はほとんど確実に (almost surely, a.s.) 成り立つという。

「a.s.」は測度論の「PP-a.e.」と同じ意味である。

例 1.2(離散確率空間)Ω\Omega を有限または可算集合、p ⁣:Ω→[0,1]p\colon \Omega \to [0, 1] を ∑ω∈Ωp(ω)=1\sum_{\omega \in \Omega} p(\omega) = 1 を満たす関数とし、F=P(Ω)\mathcal{F} = \mathcal{P}(\Omega)、P(A)=∑ω∈Ap(ω)P(A) = \sum_{\omega \in A} p(\omega) とおく。非負項級数は並べ替えても和が変わらないので PP は可算加法的であり、(Ω,F,P)(\Omega, \mathcal{F}, P) は確率空間になる。Ω\Omega が有限で pp が定数のとき P(A)=∣A∣/∣Ω∣P(A) = \lvert A \rvert / \lvert \Omega \rvert であり、これが「同様に確からしい」場合の古典的な確率である。

例 1.3(一様分布)Ω=[0,1]\Omega = [0, 1]、F=B([0,1])\mathcal{F} = \mathcal{B}([0,1])、PP をルベーグ測度 λ\lambda とすると確率空間になる。各点 {ω}\lbrace \omega \rbrace の確率は 0 であるが、どれかの点は必ず選ばれる。確率 0 の事象は「起こりえない」事象ではない。

命題 1.4 確率空間 (Ω,F,P)(\Omega, \mathcal{F}, P) と A,B,An∈FA, B, A_n \in \mathcal{F} について次が成り立つ。

  1. P(Ac)=1−P(A)P(A^c) = 1 - P(A)。A⊂BA \subset B ならば P(A)≤P(B)P(A) \leq P(B)。
  2. P(A∪B)=P(A)+P(B)−P(A∩B)P(A \cup B) = P(A) + P(B) - P(A \cap B)。
  3. (劣加法性)P(⋃nAn)≤∑nP(An)P\left(\bigcup_n A_n\right) \leq \sum_n P(A_n)。
  4. (連続性)An↑AA_n \uparrow A ならば P(An)→P(A)P(A_n) \to P(A)。An↓AA_n \downarrow A ならば P(An)→P(A)P(A_n) \to P(A)。

証明. 1 と 2 は有限加法性を Ω=A⊔Ac\Omega = A \sqcup A^c、B=A⊔(B∖A)B = A \sqcup (B \setminus A)(A⊂BA \subset B のとき)、A∪B=A⊔(B∖A)A \cup B = A \sqcup (B \setminus A)、B=(B∖A)⊔(A∩B)B = (B \setminus A) \sqcup (A \cap B) に適用すればよい。3 と 4 は一般の測度の性質である(06-measure-integration 第1章 命題 1.19、定理 1.20)。上からの連続性に必要な有限性は P(A1)≤1P(A_1) \leq 1 で保証される。□\square

1.2 確率変数と分布

実験で観測するのは多くの場合「数」である。サイコロ 2 個の目の和、nn 回のコイン投げでの表の回数などは、標本点 ω\omega に数を対応させる関数である。「和が 7 以下である確率」を問うには {ω∣X(ω)≤7}\lbrace \omega \mid X(\omega) \leq 7 \rbrace が事象でなければならない。これが可測性の要請である。

定義 1.5(確率変数, random variable)確率空間 (Ω,F,P)(\Omega, \mathcal{F}, P) 上の F\mathcal{F}-可測関数 X ⁣:Ω→RX\colon \Omega \to \mathbb{R} を確率変数という。すなわち、任意の B∈B(R)B \in \mathcal{B}(\mathbb{R}) について {X∈B}:=X−1(B)∈F\lbrace X \in B \rbrace := X^{-1}(B) \in \mathcal{F} である。Rd\mathbb{R}^d 値の可測写像を dd 次元確率ベクトル (random vector) という。B(Rd)\mathcal{B}(\mathbb{R}^d) 上の確率測度

μX(B)=P(X∈B)=P(X−1(B))(B∈B(Rd))\mu_X(B) = P(X \in B) = P(X^{-1}(B)) \qquad (B \in \mathcal{B}(\mathbb{R}^d))

を XX の分布 (distribution, law) という。σ(X)={X−1(B)∣B∈B(Rd)}\sigma(X) = \lbrace X^{-1}(B) \mid B \in \mathcal{B}(\mathbb{R}^d) \rbrace を XX が生成する σ-加法族という。

分布 μX\mu_X は測度論でいう像測度 P∘X−1P \circ X^{-1} である。XX と YY の分布が等しいとき X=dYX \overset{d}{=} Y と書く。σ-加法族 σ(X)\sigma(X) は「XX の値を観測すれば起こったかどうかが判定できる事象」の全体と解釈できる。可測性の判定には、すべての x∈Rx \in \mathbb{R} で {X≤x}∈F\lbrace X \leq x \rbrace \in \mathcal{F} を確かめれば十分である(06-measure-integration 第3章)。

定義 1.6(分布関数, distribution function)確率変数 XX に対し FX(x)=P(X≤x)F_X(x) = P(X \leq x)(x∈Rx \in \mathbb{R})を XX の分布関数という。

定理 1.7(分布関数の性質)F=FXF = F_X は次を満たす。

  1. 単調非減少である。
  2. 右連続である。
  3. lim⁡x→−∞F(x)=0\lim_{x \to -\infty} F(x) = 0、lim⁡x→∞F(x)=1\lim_{x \to \infty} F(x) = 1。

さらに F(x−):=lim⁡y↑xF(y)=P(X<x)F(x-) := \lim_{y \uparrow x} F(y) = P(X < x) であり、P(X=x)=F(x)−F(x−)P(X = x) = F(x) - F(x-) である。逆に、1〜3 を満たす関数 F ⁣:R→RF\colon \mathbb{R} \to \mathbb{R} に対し、分布関数が FF となる確率変数が存在し、その分布は FF によって一意に定まる。

証明. x≤yx \leq y ならば {X≤x}⊂{X≤y}\lbrace X \leq x \rbrace \subset \lbrace X \leq y \rbrace だから 1 が成り立つ。FF は単調なので、極限は単調な数列に沿って調べればよい。xn↓xx_n \downarrow x のとき {X≤xn}↓{X≤x}\lbrace X \leq x_n \rbrace \downarrow \lbrace X \leq x \rbrace だから、上からの連続性より F(xn)→F(x)F(x_n) \to F(x) となり 2 が従う。xn↓−∞x_n \downarrow -\infty なら {X≤xn}↓∅\lbrace X \leq x_n \rbrace \downarrow \emptyset、xn↑∞x_n \uparrow \infty なら XX が実数値なので {X≤xn}↑Ω\lbrace X \leq x_n \rbrace \uparrow \Omega であり、3 を得る。yn↑xy_n \uparrow x(yn<xy_n < x)なら {X≤yn}↑{X<x}\lbrace X \leq y_n \rbrace \uparrow \lbrace X < x \rbrace だから F(x−)=P(X<x)F(x-) = P(X < x) であり、P(X=x)=P(X≤x)−P(X<x)P(X = x) = P(X \leq x) - P(X < x) である。

逆を示す。Ω=(0,1)\Omega = (0, 1)、P=λP = \lambda とし、u∈(0,1)u \in (0,1) に対し

X(u)=inf⁡{y∈R∣F(y)≥u}X(u) = \inf \lbrace y \in \mathbb{R} \mid F(y) \geq u \rbrace

とおく。Au={y∣F(y)≥u}A_u = \lbrace y \mid F(y) \geq u \rbrace は、3 より空でなく下に有界であり、1 より y∈Auy \in A_u かつ y′>yy' > y ならば y′∈Auy' \in A_u を満たす。さらに 2 より下限 X(u)X(u) 自身が AuA_u に属するので、Au=[X(u),∞)A_u = [X(u), \infty) である。よって

X(u)≤x  ⟺  x∈Au  ⟺  u≤F(x)X(u) \leq x \iff x \in A_u \iff u \leq F(x)

であり、{X≤x}=(0,F(x)]∩(0,1)\lbrace X \leq x \rbrace = (0, F(x)] \cap (0, 1) となる。これはボレル集合で測度は F(x)F(x) である。ゆえに XX は確率変数で FX=FF_X = F である。一意性:分布関数 FF をもつ確率測度は区間 (a,b](a, b] に F(b)−F(a)F(b) - F(a) を与え、区間全体と ∅\emptyset は B(R)\mathcal{B}(\mathbb{R}) を生成する π-系だから、測度の一意性(06-measure-integration 第1章 系 1.32)により分布は一つに定まる。□\square

証明で作った X=F−1X = F^{-1} を分位点関数 (quantile function) という。UU が (0,1)(0,1) 上の一様分布に従えば F−1(U)F^{-1}(U) の分布関数は FF である。計算機で乱数を生成するときの逆関数法はこの事実に基づく。たとえば F(x)=1−e−λxF(x) = 1 - e^{-\lambda x}(x≥0x \geq 0)なら F−1(u)=−log⁡(1−u)/λF^{-1}(u) = -\log(1 - u)/\lambda である。

注意 1.8(分布の型)μX(C)=1\mu_X(C) = 1 となる可算集合 CC があるとき、XX は離散分布をもつという。可積分関数 f≥0f \geq 0 によって μX(B)=∫Bf dλ\mu_X(B) = \int_B f\ d\lambda と書けるとき、XX は絶対連続分布をもつといい、ff を確率密度関数 (probability density function) という。ラドン–ニコディムの定理(06-measure-integration 第6章)により、密度が存在することは μX≪λ\mu_X \ll \lambda と同値である。どちらでもない分布もある。カントール関数を分布関数とする分布は原子をもたない(FF が連続)が、ルベーグ零集合(カントール集合)に集中していて密度をもたない(特異連続分布、06-measure-integration 第7章)。

例 1.9(代表的な離散分布)0<p<10 < p < 1、λ>0\lambda > 0 とする。

  • ベルヌーイ分布 Be⁡(p)\operatorname{Be}(p):P(X=1)=pP(X = 1) = p、P(X=0)=1−pP(X = 0) = 1 - p。表の出る確率が pp のコインを 1 回投げたときの表の回数。
  • 二項分布 B(n,p)B(n, p):P(X=k)=(nk)pk(1−p)n−kP(X = k) = \binom{n}{k} p^k (1-p)^{n-k}(k=0,1,…,nk = 0, 1, \dots, n)。そのコインを nn 回投げたときの表の回数。
  • 幾何分布 Ge⁡(p)\operatorname{Ge}(p):P(X=k)=(1−p)k−1pP(X = k) = (1-p)^{k-1} p(k∈Nk \in \mathbb{N})。初めて表が出るまでに投げる回数。
  • ポアソン分布 Po⁡(λ)\operatorname{Po}(\lambda):P(X=k)=e−λλk/k!P(X = k) = e^{-\lambda} \lambda^k / k!(k∈Z≥0k \in \mathbb{Z}_{\geq 0})。まれな事象の生起回数のモデル(第4章の少数の法則)。

例 1.10(代表的な連続分布)密度関数で与える。a<ba < b、λ>0\lambda > 0、m∈Rm \in \mathbb{R}、σ>0\sigma > 0 とする。

  • 一様分布 U(a,b)U(a, b):f(x)=1b−a1(a,b)(x)f(x) = \frac{1}{b - a} \mathbf{1}_{(a, b)}(x)。
  • 指数分布 Exp⁡(λ)\operatorname{Exp}(\lambda):f(x)=λe−λx1(0,∞)(x)f(x) = \lambda e^{-\lambda x} \mathbf{1}_{(0, \infty)}(x)。待ち時間のモデル。
  • 正規分布 N(m,σ2)N(m, \sigma^2):f(x)=12πσ2exp⁡(−(x−m)22σ2)f(x) = \frac{1}{\sqrt{2\pi\sigma^2}} \exp\left(-\frac{(x - m)^2}{2\sigma^2}\right)。∫f=1\int f = 1 はガウス積分から従う。N(0,1)N(0,1) を標準正規分布といい、その分布関数を Φ\Phi と書く。
  • コーシー分布:f(x)=1π(1+x2)f(x) = \frac{1}{\pi(1 + x^2)}。Θ∼U(−π/2,π/2)\Theta \sim U(-\pi/2, \pi/2) のとき tan⁡Θ\tan \Theta がこの分布に従う(問題 1.6)。点 (0,1)(0, 1) から下半平面に向けて一様にランダムな向きに光線を出したとき、それが xx 軸と交わる位置の分布である。

平均と分散(1.3 節で定義する)をまとめておく。

分布 平均 分散
B(n,p)B(n, p) npnp np(1−p)np(1-p)
Ge⁡(p)\operatorname{Ge}(p) 1/p1/p (1−p)/p2(1-p)/p^2
Po⁡(λ)\operatorname{Po}(\lambda) λ\lambda λ\lambda
U(a,b)U(a, b) (a+b)/2(a+b)/2 (b−a)2/12(b-a)^2/12
Exp⁡(λ)\operatorname{Exp}(\lambda) 1/λ1/\lambda 1/λ21/\lambda^2
N(m,σ2)N(m, \sigma^2) mm σ2\sigma^2
コーシー分布 存在しない 存在しない

1.3 期待値

サイコロの目 XX の「平均的な値」は ∑k=16k⋅16=3.5\sum_{k=1}^6 k \cdot \frac{1}{6} = 3.5 である。一般には「値 × その値をとる確率」の和を考えたい。ルベーグ積分はまさに値域を分割して「値 × その値をとる集合の測度」を足し合わせる積分であり、期待値の定義にうってつけである。

定義 1.11(期待値, expectation)確率変数 X≥0X \geq 0 に対し E[X]=∫ΩX dP∈[0,∞]E[X] = \int_\Omega X\ dP \in [0, \infty] と定める。E[∣X∣]<∞E[\lvert X \rvert] < \infty のとき XX は可積分であるといい、E[X]=∫ΩX dPE[X] = \int_\Omega X\ dP を XX の期待値(平均, mean)という。A∈FA \in \mathcal{F} に対し E[X;A]:=E[X1A]E[X; A] := E[X \mathbf{1}_A] と書く。

期待値は積分なので、線形性・単調性・単調収束定理・ファトゥの補題・優収束定理(06-measure-integration 第3章)がそのまま使える。P(A)=E[1A]P(A) = E[\mathbf{1}_A] である。

定理 1.12(分布による期待値の計算)XX を Rd\mathbb{R}^d 値確率ベクトル、g ⁣:Rd→Rg\colon \mathbb{R}^d \to \mathbb{R} をボレル可測関数とする。g≥0g \geq 0 または E[∣g(X)∣]<∞E[\lvert g(X) \rvert] < \infty ならば

E[g(X)]=∫Rdg(x) μX(dx)E[g(X)] = \int_{\mathbb{R}^d} g(x)\ \mu_X(dx)

特に XX が離散分布 P(X=xk)=pkP(X = x_k) = p_k をもてば E[g(X)]=∑kg(xk)pkE[g(X)] = \sum_k g(x_k) p_k、密度 ff をもてば E[g(X)]=∫g(x)f(x) dxE[g(X)] = \int g(x) f(x)\ dx である。

証明. g=1Bg = \mathbf{1}_B なら両辺とも P(X∈B)=μX(B)P(X \in B) = \mu_X(B) である。線形性により非負単関数で成り立つ。可測な g≥0g \geq 0 に対しては単関数列 0≤gn↑g0 \leq g_n \uparrow g をとると(06-measure-integration 第3章 定理 3.7)gn(X)↑g(X)g_n(X) \uparrow g(X) なので、両辺に単調収束定理を用いればよい。一般の場合は g=g+−g−g = g^{+} - g^{-} と分ける。離散の場合は μX=∑kpkδxk\mu_X = \sum_k p_k \delta_{x_k}、密度の場合は μX(dx)=f(x) dx\mu_X(dx) = f(x)\ dx に対して同じ議論を行えばよい。□\square

この定理により、期待値は Ω\Omega の取り方によらず分布だけで決まる。確率論で標本空間 Ω\Omega を具体的に書かないことが多いのはこのためである。

例 1.13 X∼Exp⁡(λ)X \sim \operatorname{Exp}(\lambda) なら E[X]=∫0∞xλe−λx dx=1/λE[X] = \int_0^\infty x \lambda e^{-\lambda x}\ dx = 1/\lambda。X∼N(0,1)X \sim N(0, 1) なら xe−x2/2x e^{-x^2/2} が可積分な奇関数なので E[X]=0E[X] = 0、部分積分で E[X2]=1E[X^2] = 1。XX がコーシー分布に従うと E[∣X∣]=∫R∣x∣π(1+x2) dx=∞E[\lvert X \rvert] = \int_{\mathbb{R}} \frac{\lvert x \rvert}{\pi(1 + x^2)}\ dx = \infty であり、期待値は存在しない。

命題 1.14 X≥0X \geq 0 ならば E[X]=∫0∞P(X>t) dtE[X] = \int_0^\infty P(X > t)\ dt である。特に任意の確率変数 XX について

∑n=1∞P(∣X∣≥n)≤E[∣X∣]≤1+∑n=1∞P(∣X∣≥n)\sum_{n=1}^\infty P(\lvert X \rvert \geq n) \leq E[\lvert X \rvert] \leq 1 + \sum_{n=1}^\infty P(\lvert X \rvert \geq n)

であり、XX が可積分であることと ∑nP(∣X∣≥n)<∞\sum_n P(\lvert X \rvert \geq n) < \infty は同値である。

証明. X(ω)=∫0∞1{X(ω)>t} dtX(\omega) = \int_0^\infty \mathbf{1}_{\lbrace X(\omega) > t \rbrace}\ dt であり、(ω,t)↦X(ω)−t(\omega, t) \mapsto X(\omega) - t は直積 σ-加法族について可測であるから、トネリの定理(06-measure-integration 第5章 定理 5.6)により積分の順序を交換して最初の式を得る。t∈[n−1,n)t \in [n-1, n) のとき {∣X∣≥n}⊂{∣X∣>t}⊂{∣X∣≥n−1}\lbrace \lvert X \rvert \geq n \rbrace \subset \lbrace \lvert X \rvert > t \rbrace \subset \lbrace \lvert X \rvert \geq n - 1 \rbrace だから、[n−1,n)[n-1, n) 上で積分して n≥1n \geq 1 について足せば不等式を得る。□\square

定義 1.15(モーメントと分散)p>0p > 0 に対し E[∣X∣p]E[\lvert X \rvert^p] を pp 次の絶対モーメント、E[Xk]E[X^k] を kk 次のモーメント (moment) という。E[X2]<∞E[X^2] < \infty のとき

Var⁡(X)=E[(X−E[X])2]=E[X2]−E[X]2\operatorname{Var}(X) = E[(X - E[X])^2] = E[X^2] - E[X]^2

を分散 (variance)、Var⁡(X)\sqrt{\operatorname{Var}(X)} を標準偏差という。E[X2],E[Y2]<∞E[X^2], E[Y^2] < \infty のとき Cov⁡(X,Y)=E[(X−E[X])(Y−E[Y])]\operatorname{Cov}(X, Y) = E[(X - E[X])(Y - E[Y])] を共分散 (covariance) といい、Cov⁡(X,Y)=0\operatorname{Cov}(X, Y) = 0 のとき X,YX, Y は無相関 (uncorrelated) であるという。

後で見るように確率空間では L2⊂L1L^2 \subset L^1 なので(例 1.20)、分散は E[X2]<∞E[X^2] < \infty だけで定義できる。展開すると

Var⁡(∑i=1nXi)=∑i=1nVar⁡(Xi)+2∑i<jCov⁡(Xi,Xj)\operatorname{Var}\left(\sum_{i=1}^n X_i\right) = \sum_{i=1}^n \operatorname{Var}(X_i) + 2 \sum_{i < j} \operatorname{Cov}(X_i, X_j)

であり、無相関なら分散は加法的である。

例 1.16(期待値の線形性の威力)1,…,n1, \dots, n を一様ランダムに並べ替えたとき(n!n! 通りが同様に確からしい)、自分の位置に留まる数の個数 XX の期待値を求める。Ai={i は動かない}A_i = \lbrace i \text{ は動かない} \rbrace とおくと X=∑i1AiX = \sum_{i} \mathbf{1}_{A_i}、P(Ai)=(n−1)!/n!=1/nP(A_i) = (n-1)!/n! = 1/n だから、E[X]=∑iP(Ai)=1E[X] = \sum_i P(A_i) = 1 である。AiA_i たちは独立でないが、線形性は独立性を必要としない。

最後に、確率論の用語と測度論の用語の対応をまとめておく。確率論は「全測度が 1 の測度論」であり、定理の多くは測度論の定理をそのまま翻訳したものである。一方で、独立性と条件付けは確率論に固有の概念であり、確率論の個性はそこから生まれる。

確率論 測度論
標本空間 Ω\Omega、事象 全体集合、可測集合
確率測度 PP 全測度 1 の測度
確率変数 XX 可測関数
分布 μX\mu_X 像測度 P∘X−1P \circ X^{-1}
分布関数 FXF_X ルベーグ–スティルチェス測度を定める単調関数
確率密度関数 ルベーグ測度に関するラドン–ニコディム導関数
期待値 E[X]E[X] 積分 ∫ΩX dP\int_\Omega X\ dP
ほとんど確実に(a.s.) ほとんど至るところ(a.e.)
確率収束(第2章) 測度収束
独立性(1.5 節) 直積測度
条件付き期待値(第5章) ラドン–ニコディム導関数

1.4 基本的な不等式

分布が完全にはわからなくても、期待値や分散から確率を評価したい場面は多い。

定理 1.17(マルコフの不等式, Markov's inequality)X≥0X \geq 0、a>0a > 0 ならば P(X≥a)≤E[X]/aP(X \geq a) \leq E[X]/a である。より一般に、φ ⁣:[0,∞)→[0,∞)\varphi\colon [0, \infty) \to [0, \infty) が単調非減少で φ(a)>0\varphi(a) > 0 ならば P(∣X∣≥a)≤E[φ(∣X∣)]/φ(a)P(\lvert X \rvert \geq a) \leq E[\varphi(\lvert X \rvert)]/\varphi(a) である。

証明. 各点で φ(a)1{∣X∣≥a}≤φ(∣X∣)\varphi(a) \mathbf{1}_{\lbrace \lvert X \rvert \geq a \rbrace} \leq \varphi(\lvert X \rvert) が成り立つので、期待値をとればよい。□\square

系 1.18(チェビシェフの不等式, Chebyshev's inequality)E[X2]<∞E[X^2] < \infty、a>0a > 0 ならば P(∣X−E[X]∣≥a)≤Var⁡(X)/a2P(\lvert X - E[X] \rvert \geq a) \leq \operatorname{Var}(X)/a^2 である。

証明. X−E[X]X - E[X] と φ(x)=x2\varphi(x) = x^2 に定理 1.17 を適用する。□\square

たとえば公平なコインを 100 回投げたときの表の回数 SS は E[S]=50E[S] = 50、Var⁡(S)=25\operatorname{Var}(S) = 25 なので P(∣S−50∣≥10)≤1/4P(\lvert S - 50 \rvert \geq 10) \leq 1/4 である。実際の値は約 0.0570.057 なので評価は粗いが、分布の形によらず使えるのが強みである。

定理 1.19(イェンセンの不等式, Jensen's inequality)I⊂RI \subset \mathbb{R} を開区間、φ ⁣:I→R\varphi\colon I \to \mathbb{R} を凸関数とし、XX は可積分で P(X∈I)=1P(X \in I) = 1 とする。このとき E[X]∈IE[X] \in I であり、E[φ(X)]E[\varphi(X)] は (−∞,∞](-\infty, \infty] の値として定まって

φ(E[X])≤E[φ(X)]\varphi(E[X]) \leq E[\varphi(X)]

証明. m=E[X]m = E[X] とおく。II の左端 aa が有限なら X−a>0X - a > 0 a.s. なので E[X−a]≥0E[X - a] \geq 0 であり、等号なら X=aX = a a.s. となって矛盾するから m>am > a。右端についても同様で、m∈Im \in I である。凸関数の傾き φ(x)−φ(m)x−m\frac{\varphi(x) - \varphi(m)}{x - m} は xx について単調非減少なので、c=sup⁡x<mφ(x)−φ(m)x−mc = \sup_{x < m} \frac{\varphi(x) - \varphi(m)}{x - m} は有限で、すべての x∈Ix \in I について φ(x)≥φ(m)+c(x−m)\varphi(x) \geq \varphi(m) + c(x - m)(mm における支持直線)が成り立つ。凸関数は連続なので φ(X)\varphi(X) は確率変数であり、φ(X)≥φ(m)+c(X−m)\varphi(X) \geq \varphi(m) + c(X - m) の右辺は可積分だから φ(X)−\varphi(X)^{-} は可積分である。期待値をとって E[φ(X)]≥φ(m)E[\varphi(X)] \geq \varphi(m) を得る。□\square

例 1.20 (1) φ(x)=x2\varphi(x) = x^2 として E[X]2≤E[X2]E[X]^2 \leq E[X^2]。(2) φ(x)=ex\varphi(x) = e^x として eE[X]≤E[eX]e^{E[X]} \leq E[e^X]。(3)(リャプノフの不等式)0<p<q0 < p < q ならば E[∣X∣p]1/p≤E[∣X∣q]1/qE[\lvert X \rvert^p]^{1/p} \leq E[\lvert X \rvert^q]^{1/q}。実際、右辺が有限なら ∣X∣p≤1+∣X∣q\lvert X \rvert^p \leq 1 + \lvert X \rvert^q より Y=∣X∣pY = \lvert X \rvert^p は可積分で、凸関数 y↦∣y∣q/py \mapsto \lvert y \rvert^{q/p} にイェンセンの不等式を使えばよい。特に確率空間では Lq⊂LpL^q \subset L^p(p<qp < q)である。無限測度の空間ではこの包含は成り立たない(06-measure-integration 第4章)。

1.5 独立性

サイコロを 2 個振るとき「1 個目が 6 かつ 2 個目が 6」の確率は 1/36=16⋅161/36 = \frac{1}{6} \cdot \frac{1}{6} である。互いに影響しないという直観を、積の公式で定式化する。

定義 1.21(独立性, independence)

  1. 事象の族 (Aλ)λ∈Λ(A_\lambda)_{\lambda \in \Lambda} が独立であるとは、相異なる任意の有限個の添字 λ1,…,λk\lambda_1, \dots, \lambda_k について P(Aλ1∩⋯∩Aλk)=P(Aλ1)⋯P(Aλk)P(A_{\lambda_1} \cap \cdots \cap A_{\lambda_k}) = P(A_{\lambda_1}) \cdots P(A_{\lambda_k}) が成り立つことをいう。
  2. 部分集合族 Cλ⊂F\mathcal{C}_\lambda \subset \mathcal{F}(λ∈Λ\lambda \in \Lambda)が独立であるとは、各 λ\lambda について Aλ∈CλA_\lambda \in \mathcal{C}_\lambda をどう選んでも (Aλ)λ(A_\lambda)_\lambda が独立であることをいう。
  3. 確率変数(確率ベクトル)の族 (Xλ)λ(X_\lambda)_\lambda が独立であるとは、(σ(Xλ))λ(\sigma(X_\lambda))_\lambda が独立であることをいう。

確率変数については、任意の有限個の相異なる添字とボレル集合 BjB_j について P(Xλ1∈B1,…,Xλk∈Bk)=∏jP(Xλj∈Bj)P(X_{\lambda_1} \in B_1, \dots, X_{\lambda_k} \in B_k) = \prod_j P(X_{\lambda_j} \in B_j) が成り立つことと同値である。同じ分布をもつ独立な確率変数列を i.i.d.(independent and identically distributed, 独立同分布)という。

例 1.22(対ごとに独立でも独立とは限らない)公平なコインを 2 回投げ、A={1 回目が表}A = \lbrace 1 \text{ 回目が表} \rbrace、B={2 回目が表}B = \lbrace 2 \text{ 回目が表} \rbrace、C={2 回の結果が一致}C = \lbrace 2 \text{ 回の結果が一致} \rbrace とする。どの二つも積の公式を満たす(たとえば P(A∩C)=P(表表)=1/4P(A \cap C) = P(\text{表表}) = 1/4)が、P(A∩B∩C)=1/4≠1/8P(A \cap B \cap C) = 1/4 \neq 1/8 である。

独立性を定義どおりに確かめるには、σ-加法族のすべての元について積の公式を調べる必要がある。次の定理により、生成系が π-系ならその上で調べれば十分である。

定理 1.23(π-系による独立性の判定)P1,…,Pn⊂F\mathcal{P}_1, \dots, \mathcal{P}_n \subset \mathcal{F} をそれぞれ π-系とし、任意の Ai∈Pi∪{Ω}A_i \in \mathcal{P}_i \cup \lbrace \Omega \rbrace(i=1,…,ni = 1, \dots, n)について

P(A1∩⋯∩An)=P(A1)⋯P(An)P(A_1 \cap \cdots \cap A_n) = P(A_1) \cdots P(A_n)

が成り立つとする。このとき σ(P1),…,σ(Pn)\sigma(\mathcal{P}_1), \dots, \sigma(\mathcal{P}_n) は独立である。

証明. Ai∈Pi∪{Ω}A_i \in \mathcal{P}_i \cup \lbrace \Omega \rbrace(i=2,…,ni = 2, \dots, n)を固定し、C=A2∩⋯∩AnC = A_2 \cap \cdots \cap A_n、π=P(A2)⋯P(An)\pi = P(A_2) \cdots P(A_n) とおき

D={A∈F∣P(A∩C)=P(A)π}\mathcal{D} = \lbrace A \in \mathcal{F} \mid P(A \cap C) = P(A)\pi \rbrace

とする。D\mathcal{D} が λ-系であることを示す。仮定で A1=ΩA_1 = \Omega とすれば P(C)=πP(C) = \pi なので Ω∈D\Omega \in \mathcal{D}。A∈DA \in \mathcal{D} なら P(Ac∩C)=P(C)−P(A∩C)=π−P(A)π=P(Ac)πP(A^c \cap C) = P(C) - P(A \cap C) = \pi - P(A)\pi = P(A^c)\pi なので Ac∈DA^c \in \mathcal{D}。互いに交わらない Bk∈DB_k \in \mathcal{D} については、両辺の可算加法性から ⋃kBk∈D\bigcup_k B_k \in \mathcal{D}。仮定より P1⊂D\mathcal{P}_1 \subset \mathcal{D} だから、π-λ 定理(06-measure-integration 第1章 定理 1.30)により σ(P1)⊂D\sigma(\mathcal{P}_1) \subset \mathcal{D} である。こうして、定理の仮定は P1\mathcal{P}_1 を π-系 σ(P1)\sigma(\mathcal{P}_1) に置き換えても成り立つ。同じ議論を i=2,…,ni = 2, \dots, n について順に繰り返すと、すべての Ai∈σ(Pi)A_i \in \sigma(\mathcal{P}_i) について積の公式が成り立つ。一部の AiA_i を Ω∈σ(Pi)\Omega \in \sigma(\mathcal{P}_i) とすれば部分族についての積の公式も得られるので、σ(P1),…,σ(Pn)\sigma(\mathcal{P}_1), \dots, \sigma(\mathcal{P}_n) は独立である。□\square

系 1.24

  1. 確率変数 X1,…,XnX_1, \dots, X_n が独立であるための必要十分条件は、すべての x1,…,xn∈Rx_1, \dots, x_n \in \mathbb{R} について P(X1≤x1,…,Xn≤xn)=∏iP(Xi≤xi)P(X_1 \leq x_1, \dots, X_n \leq x_n) = \prod_{i} P(X_i \leq x_i) となることである。可算集合に値をとる場合は、すべての値 xix_i について P(X1=x1,…,Xn=xn)=∏iP(Xi=xi)P(X_1 = x_1, \dots, X_n = x_n) = \prod_i P(X_i = x_i) となることと同値である。
  2. (グループ化)σ-加法族の族 (Fλ)λ∈Λ(\mathcal{F}_\lambda)_{\lambda \in \Lambda} が独立で、Λ1,Λ2,…\Lambda_1, \Lambda_2, \dots が Λ\Lambda の互いに交わらない部分集合ならば、Gj=σ(⋃λ∈ΛjFλ)\mathcal{G}_j = \sigma\left(\bigcup_{\lambda \in \Lambda_j} \mathcal{F}_\lambda\right) たちは独立である。特に独立な X1,…,XnX_1, \dots, X_n とボレル関数 f,gf, g について、f(X1,…,Xk)f(X_1, \dots, X_k) と g(Xk+1,…,Xn)g(X_{k+1}, \dots, X_n) は独立である。

証明. 1. Pi={{Xi≤x}∣x∈R}\mathcal{P}_i = \lbrace \lbrace X_i \leq x \rbrace \mid x \in \mathbb{R} \rbrace は σ(Xi)\sigma(X_i) を生成する π-系である。一部の xi→∞x_i \to \infty とすれば、条件は Ai=ΩA_i = \Omega を許しても成り立つ。定理 1.23 を適用すればよい。可算値の場合は {{Xi=x}}∪{∅}\lbrace \lbrace X_i = x \rbrace \rbrace \cup \lbrace \emptyset \rbrace を π-系とし、Ω=⨆x{Xi=x}\Omega = \bigsqcup_x \lbrace X_i = x \rbrace について和をとれば Ai=ΩA_i = \Omega の場合も得られる。

  1. λ1,…,λk∈Λj\lambda_1, \dots, \lambda_k \in \Lambda_j と Aλl∈FλlA_{\lambda_l} \in \mathcal{F}_{\lambda_l} による有限共通部分 Aλ1∩⋯∩AλkA_{\lambda_1} \cap \cdots \cap A_{\lambda_k} の全体 Pj\mathcal{P}_j は、Ω\Omega を含み Gj\mathcal{G}_j を生成する π-系である。有限個の Pj1,…,Pjm\mathcal{P}_{j_1}, \dots, \mathcal{P}_{j_m} について積の公式が成り立つことは (Fλ)(\mathcal{F}_\lambda) の独立性から従うので、定理 1.23 よりよい。関数については σ(f(X1,…,Xk))⊂σ(X1,…,Xk)\sigma(f(X_1, \dots, X_k)) \subset \sigma(X_1, \dots, X_k) に注意すればよい。□\square

定理 1.25(独立性と直積測度)確率ベクトル X=(X1,…,Xn)X = (X_1, \dots, X_n) について、X1,…,XnX_1, \dots, X_n が独立であることと、XX の分布が直積測度 μX1⊗⋯⊗μXn\mu_{X_1} \otimes \cdots \otimes \mu_{X_n} に等しいことは同値である。このとき、X1,…,XnX_1, \dots, X_n が可積分ならば X1⋯XnX_1 \cdots X_n も可積分で

E[X1⋯Xn]=E[X1]⋯E[Xn]E[X_1 \cdots X_n] = E[X_1] \cdots E[X_n]

証明. 二つの確率測度 μX\mu_X と μX1⊗⋯⊗μXn\mu_{X_1} \otimes \cdots \otimes \mu_{X_n} が長方形 B1×⋯×BnB_1 \times \cdots \times B_n 上で一致することは、独立性の定義そのものである。長方形全体は B(Rn)=B(R)⊗n\mathcal{B}(\mathbb{R}^n) = \mathcal{B}(\mathbb{R})^{\otimes n} を生成する π-系なので、測度の一意性(06-measure-integration 第1章 定理 1.31)より同値性が従う。後半は、定理 1.12 とトネリの定理から E[∣X1⋯Xn∣]=∫∣x1∣⋯∣xn∣ d(μX1⊗⋯⊗μXn)=∏iE[∣Xi∣]<∞E[\lvert X_1 \cdots X_n \rvert] = \int \lvert x_1 \rvert \cdots \lvert x_n \rvert\ d(\mu_{X_1} \otimes \cdots \otimes \mu_{X_n}) = \prod_i E[\lvert X_i \rvert] < \infty であり、絶対値を外した等式はフビニの定理(06-measure-integration 第5章 定理 5.7)から従う。□\square

特に独立ならば無相関であり、独立な確率変数の和の分散は各分散の和になる。逆は成り立たない。X∼N(0,1)X \sim N(0, 1)、Y=X2Y = X^2 なら Cov⁡(X,Y)=E[X3]=0\operatorname{Cov}(X, Y) = E[X^3] = 0 だが、P(∣X∣≤1,Y>1)=0≠P(∣X∣≤1)P(Y>1)P(\lvert X \rvert \leq 1, Y > 1) = 0 \neq P(\lvert X \rvert \leq 1) P(Y > 1) である。

例 1.26 独立な事象 A1,…,AnA_1, \dots, A_n で P(Ai)=pP(A_i) = p となるものについて、S=∑i1Ai∼B(n,p)S = \sum_i \mathbf{1}_{A_i} \sim B(n, p) であり、Var⁡(1Ai)=p−p2\operatorname{Var}(\mathbf{1}_{A_i}) = p - p^2 だから Var⁡(S)=np(1−p)\operatorname{Var}(S) = np(1-p) である。

例 1.27(独立な和と畳み込み)X,YX, Y が独立で密度 f,gf, g をもてば、X+YX + Y は密度 f∗gf \ast g(06-measure-integration 第5章 定義 5.12)をもつ。実際、定理 1.25 とトネリの定理、変数変換 u=x+yu = x + y により

P(X+Y≤z)=∬1{x+y≤z}f(x)g(y) dx dy=∫−∞z(∫f(u−y)g(y) dy)duP(X + Y \leq z) = \iint \mathbf{1}_{\lbrace x + y \leq z \rbrace} f(x) g(y)\ dx\,dy = \int_{-\infty}^{z} \left( \int f(u - y) g(y)\ dy \right) du

である。たとえば X,Y∼Exp⁡(λ)X, Y \sim \operatorname{Exp}(\lambda) が独立なら、X+YX + Y の密度は z>0z > 0 で ∫0zλe−λxλe−λ(z−x) dx=λ2ze−λz\int_0^z \lambda e^{-\lambda x} \lambda e^{-\lambda(z - x)}\ dx = \lambda^2 z e^{-\lambda z} である(ガンマ分布)。

1.6 ボレル–カンテリの補題

コインを無限回投げるとき、「10 回連続で表」は無限回起こるだろうか。このような「無限にしばしば起こるか」という問いに答える基本道具がボレル–カンテリの補題である。事象列 (An)(A_n) に対し

lim sup⁡n→∞An=⋂n=1∞⋃k=n∞Ak={ω∣無限個の n で ω∈An}\limsup_{n \to \infty} A_n = \bigcap_{n=1}^\infty \bigcup_{k=n}^\infty A_k = \lbrace \omega \mid \text{無限個の } n \text{ で } \omega \in A_n \rbrace

を {An i.o.}\lbrace A_n \text{ i.o.} \rbrace(infinitely often, 無限にしばしば)とも書く。補集合は lim inf⁡nAnc=⋃n⋂k≥nAkc\liminf_n A_n^c = \bigcup_n \bigcap_{k \geq n} A_k^c(ある番号から先はずっと AncA_n^c)である。

定理 1.28(ボレル–カンテリの補題, Borel–Cantelli lemma)A1,A2,⋯∈FA_1, A_2, \dots \in \mathcal{F} とする。

  1. (第 1 補題)∑nP(An)<∞\sum_n P(A_n) < \infty ならば P(lim sup⁡nAn)=0P(\limsup_n A_n) = 0。
  2. (第 2 補題)AnA_n が独立で ∑nP(An)=∞\sum_n P(A_n) = \infty ならば P(lim sup⁡nAn)=1P(\limsup_n A_n) = 1。

証明. 1. 各 nn について P(lim sup⁡kAk)≤P(⋃k≥nAk)≤∑k≥nP(Ak)P(\limsup_k A_k) \leq P\left(\bigcup_{k \geq n} A_k\right) \leq \sum_{k \geq n} P(A_k) であり、右辺は収束級数の余りなので n→∞n \to \infty で 0 に収束する。

  1. 定理 1.23 を π-系 {Ak}\lbrace A_k \rbrace に適用すると σ(Ak)={∅,Ak,Akc,Ω}\sigma(A_k) = \lbrace \emptyset, A_k, A_k^c, \Omega \rbrace たちが独立なので、AkcA_k^c たちも独立である。1−x≤e−x1 - x \leq e^{-x} を使うと、n≤Nn \leq N について
P(⋂k=nNAkc)=∏k=nN(1−P(Ak))≤exp⁡(−∑k=nNP(Ak))→N→∞0P\left(\bigcap_{k=n}^N A_k^c\right) = \prod_{k=n}^N (1 - P(A_k)) \leq \exp\left(-\sum_{k=n}^N P(A_k)\right) \xrightarrow{N \to \infty} 0

上からの連続性より P(⋂k≥nAkc)=0P\left(\bigcap_{k \geq n} A_k^c\right) = 0 であり、可算個の和をとって P(lim inf⁡nAnc)=0P(\liminf_n A_n^c) = 0、すなわち P(lim sup⁡nAn)=1P(\limsup_n A_n) = 1 を得る。□\square

注意 1.29 第 2 補題で独立性は外せない。P(A)=1/2P(A) = 1/2 の事象 AA について An=AA_n = A とすれば ∑nP(An)=∞\sum_n P(A_n) = \infty だが P(lim sup⁡nAn)=1/2P(\limsup_n A_n) = 1/2 である。

例 1.30(パターンの出現)公平なコインを無限回投げ、BjB_j を「10j+110j + 1 回目から 10j+1010j + 10 回目までがすべて表」という事象とする。ブロックが重ならないので BjB_j たちは独立で(系 1.24)、P(Bj)=2−10P(B_j) = 2^{-10}、∑jP(Bj)=∞\sum_j P(B_j) = \infty である。第 2 補題より、10 連続の表は確率 1 で無限回現れる。同じ議論で、どんな有限のパターンも確率 1 で無限回現れる。

例 1.31(最大値の増え方)X1,X2,…X_1, X_2, \dots を Exp⁡(1)\operatorname{Exp}(1) に従う i.i.d. とすると P(Xn>clog⁡n)=n−cP(X_n > c \log n) = n^{-c} である。c>1c > 1 なら ∑nn−c<∞\sum_n n^{-c} < \infty なので、第 1 補題より a.s. で有限個の nn を除き Xn≤clog⁡nX_n \leq c \log n、すなわち lim sup⁡nXn/log⁡n≤c\limsup_n X_n/\log n \leq c である。c=1+1/kc = 1 + 1/k(k∈Nk \in \mathbb{N})について確率 1 の事象の共通部分をとれば lim sup⁡nXn/log⁡n≤1\limsup_n X_n/\log n \leq 1 a.s.。一方 c=1c = 1 なら ∑n1/n=∞\sum_n 1/n = \infty で事象 {Xn>log⁡n}\lbrace X_n > \log n \rbrace は独立だから、第 2 補題より lim sup⁡nXn/log⁡n≥1\limsup_n X_n/\log n \geq 1 a.s.。ゆえに

lim sup⁡n→∞Xnlog⁡n=1a.s.\limsup_{n \to \infty} \frac{X_n}{\log n} = 1 \quad \text{a.s.}

1.7 独立な確率変数列の存在

次章以降では「i.i.d. 列 X1,X2,…X_1, X_2, \dots をとる」ことから議論を始める。有限個なら直積測度 μ1⊗⋯⊗μn\mu_1 \otimes \cdots \otimes \mu_n 上の座標関数をとればよいが、無限列が存在するかは自明でない。まず、ルベーグ測度そのものが無限回のコイン投げであることを見る。

例 1.32(2 進展開とコイン投げ)Ω=[0,1)\Omega = [0, 1)、P=λP = \lambda とし、ω=∑n≥1dn(ω)2−n\omega = \sum_{n \geq 1} d_n(\omega) 2^{-n} を 2 進展開とする(有限で終わる展開を選ぶ)。e1,…,en∈{0,1}e_1, \dots, e_n \in \lbrace 0, 1 \rbrace について {d1=e1,…,dn=en}\lbrace d_1 = e_1, \dots, d_n = e_n \rbrace は長さ 2−n2^{-n} の区間 [a,a+2−n)[a, a + 2^{-n})(a=∑k≤nek2−ka = \sum_{k \leq n} e_k 2^{-k})だから

P(d1=e1,…,dn=en)=2−n=∏k=1nP(dk=ek)P(d_1 = e_1, \dots, d_n = e_n) = 2^{-n} = \prod_{k=1}^n P(d_k = e_k)

である。系 1.24 より d1,d2,…d_1, d_2, \dots は Be⁡(1/2)\operatorname{Be}(1/2) に従う i.i.d. である。[0,1)[0,1) から一様に点を選ぶことは、公平なコインを無限回投げることと同じである。

定理 1.33(独立な確率変数列の存在)R\mathbb{R} 上の確率測度の列 μ1,μ2,…\mu_1, \mu_2, \dots に対し、([0,1),B([0,1)),λ)([0,1), \mathcal{B}([0,1)), \lambda) 上に独立な確率変数列 X1,X2,…X_1, X_2, \dots で、各 XkX_k の分布が μk\mu_k となるものが存在する。

証明. N\mathbb{N} を互いに交わらない無限集合 Nk={2k−1(2j−1)∣j∈N}N_k = \lbrace 2^{k-1}(2j - 1) \mid j \in \mathbb{N} \rbrace(k∈Nk \in \mathbb{N})に分け、NkN_k の jj 番目の元を n(k,j)n(k, j) とする。Uk=∑j≥1dn(k,j)2−jU_k = \sum_{j \geq 1} d_{n(k,j)} 2^{-j} とおくと、UkU_k は σ(dn∣n∈Nk)\sigma(d_n \mid n \in N_k)-可測なので、系 1.24 の 2 より U1,U2,…U_1, U_2, \dots は独立である。UkU_k の分布を調べる。2 進区間 I=[a2−m,(a+1)2−m)I = [a 2^{-m}, (a+1) 2^{-m}) に対し、事象 {Uk∈I}\lbrace U_k \in I \rbrace と「(dn(k,1),…,dn(k,m))(d_{n(k,1)}, \dots, d_{n(k,m)}) が aa の 2 進表示に一致する」という事象の違いは、「j>mj > m で dn(k,j)=1d_{n(k,j)} = 1 がずっと続く」という確率 0 の事象に含まれる。よって P(Uk∈I)=2−m=λ(I)P(U_k \in I) = 2^{-m} = \lambda(I) である。2 進区間の全体に ∅\emptyset を加えた族は B([0,1))\mathcal{B}([0,1)) を生成する π-系だから、UkU_k は U(0,1)U(0,1) に従う(値 1 をとる確率 0 の事象では Uk=0U_k = 0 と定め直す)。最後に GkG_k を μk\mu_k の分位点関数(定理 1.7 の証明)として Xk=Gk(Uk)X_k = G_k(U_k) とおけば(Uk=0U_k = 0 となる確率 0 の事象では Xk=0X_k = 0 とする)、XkX_k の分布は μk\mu_k で、系 1.24 の 2 より XkX_k たちは独立である。□\square

依存関係のある列や、ブラウン運動(第7章)のような非可算個の確率変数の族を構成するには、次の定理が基本になる。

定理 1.34(コルモゴロフの拡張定理, Kolmogorov extension theorem)各 n∈Nn \in \mathbb{N} について Rn\mathbb{R}^n 上の確率測度 νn\nu_n が与えられ、整合性条件 νn+1(B×R)=νn(B)\nu_{n+1}(B \times \mathbb{R}) = \nu_n(B)(B∈B(Rn)B \in \mathcal{B}(\mathbb{R}^n))を満たすとする。このとき、RN\mathbb{R}^{\mathbb{N}} 上の直積 σ-加法族(すべての座標写像を可測にする最小の σ-加法族)上の確率測度 PP で、すべての nn と B∈B(Rn)B \in \mathcal{B}(\mathbb{R}^n) について P({ω∣(ω1,…,ωn)∈B})=νn(B)P(\lbrace \omega \mid (\omega_1, \dots, \omega_n) \in B \rbrace) = \nu_n(B) を満たすものがただ一つ存在する。

ここでは主張のみ述べる。一意性は筒集合 {(ω1,…,ωn)∈B}\lbrace (\omega_1, \dots, \omega_n) \in B \rbrace の全体が π-系であることから従う。存在の証明は、筒集合の代数上の有限加法的測度が可算加法的であることを Rn\mathbb{R}^n 上のボレル確率測度の内部正則性(コンパクト集合による近似)を使って示し、ホップの拡張定理(06-measure-integration 第2章 定理 2.6)を適用する(Durrett の教科書、Billingsley の教科書を参照)。νn=μ1⊗⋯⊗μn\nu_n = \mu_1 \otimes \cdots \otimes \mu_n とすれば無限直積測度 ⨂kμk\bigotimes_{k} \mu_k が得られ、座標関数 Xk(ω)=ωkX_k(\omega) = \omega_k が求める独立列になる。添字集合が非可算の場合にも、有限次元分布の整合的な族から確率測度が構成できる。

まとめ

  • 確率空間は全測度 1 の測度空間であり、確率変数は可測関数、分布は像測度、期待値はルベーグ積分、「a.s.」は「a.e.」である。
  • 分布関数は単調非減少・右連続で、−∞-\infty で 0、∞\infty で 1 に近づく。逆にこの性質をもつ関数は分位点関数によって確率変数として実現され、分布を一意に定める。
  • 期待値 E[g(X)]E[g(X)] は分布 μX\mu_X だけで決まる。E[X]=∫0∞P(X>t) dtE[X] = \int_0^\infty P(X > t)\ dt(X≥0X \geq 0)。
  • マルコフ・チェビシェフの不等式は期待値・分散から確率を評価する。イェンセンの不等式から、確率空間では p<qp < q のとき Lq⊂LpL^q \subset L^p。
  • 独立性は積の公式で定義され、生成系が π-系ならその上で確かめればよい(π-λ 定理)。独立性は分布が直積測度になることと同値である。
  • ボレル–カンテリの第 1 補題(和が有限なら有限回しか起こらない)と第 2 補題(独立で和が無限なら無限回起こる)は、a.s. の挙動を調べる基本道具である。
  • ルベーグ測度は無限回のコイン投げと同じであり、これを使えば任意の分布をもつ独立列が構成できる。一般にはコルモゴロフの拡張定理による。

演習問題

問題 1.1 ★ 分布関数 FF の不連続点は高々可算個であることを示せ。

解答

定理 1.7 より xx が不連続点であることと P(X=x)=F(x)−F(x−)>0P(X = x) = F(x) - F(x-) > 0 は同値である。Dk={x∣P(X=x)>1/k}D_k = \lbrace x \mid P(X = x) > 1/k \rbrace とおく。DkD_k の相異なる mm 点 x1,…,xmx_1, \dots, x_m について、事象 {X=xi}\lbrace X = x_i \rbrace は互いに交わらないので m/k<∑iP(X=xi)≤1m/k < \sum_i P(X = x_i) \leq 1、よって ∣Dk∣<k\lvert D_k \rvert < k である。不連続点全体は ⋃kDk\bigcup_k D_k なので高々可算である。

問題 1.2 ★ X∼Ge⁡(p)X \sim \operatorname{Ge}(p) について P(X>n)=(1−p)nP(X > n) = (1-p)^n を示し、E[X]=1/pE[X] = 1/p、Var⁡(X)=(1−p)/p2\operatorname{Var}(X) = (1-p)/p^2 を導け。

解答

q=1−pq = 1 - p とおく。{X>n}\lbrace X > n \rbrace は「最初の nn 回がすべて裏」なので P(X>n)=∑k>nqk−1p=qnP(X > n) = \sum_{k > n} q^{k-1} p = q^n。XX は整数値なので命題 1.14 より E[X]=∫0∞P(X>t) dt=∑n≥0P(X>n)=∑n≥0qn=1/pE[X] = \int_0^\infty P(X > t)\ dt = \sum_{n \geq 0} P(X > n) = \sum_{n \geq 0} q^n = 1/p。次に ∑k≥2k(k−1)qk−2=2/(1−q)3\sum_{k \geq 2} k(k-1) q^{k-2} = 2/(1-q)^3(べき級数 ∑kqk=1/(1−q)\sum_k q^k = 1/(1-q) を 2 回微分)より E[X(X−1)]=pq⋅2/p3=2q/p2E[X(X-1)] = pq \cdot 2/p^3 = 2q/p^2。よって

Var⁡(X)=E[X(X−1)]+E[X]−E[X]2=2qp2+1p−1p2=2q+p−1p2=qp2\operatorname{Var}(X) = E[X(X-1)] + E[X] - E[X]^2 = \frac{2q}{p^2} + \frac{1}{p} - \frac{1}{p^2} = \frac{2q + p - 1}{p^2} = \frac{q}{p^2}

問題 1.3 ★ X∼Po⁡(λ)X \sim \operatorname{Po}(\lambda) について E[X]=Var⁡(X)=λE[X] = \operatorname{Var}(X) = \lambda を示せ。また X∼Po⁡(λ)X \sim \operatorname{Po}(\lambda) と Y∼Po⁡(μ)Y \sim \operatorname{Po}(\mu) が独立ならば X+Y∼Po⁡(λ+μ)X + Y \sim \operatorname{Po}(\lambda + \mu) であることを示せ。

解答

E[X]=∑k≥1ke−λλk/k!=λ∑k≥1e−λλk−1/(k−1)!=λE[X] = \sum_{k \geq 1} k e^{-\lambda} \lambda^k / k! = \lambda \sum_{k \geq 1} e^{-\lambda} \lambda^{k-1}/(k-1)! = \lambda。同様に E[X(X−1)]=λ2E[X(X-1)] = \lambda^2 なので Var⁡(X)=λ2+λ−λ2=λ\operatorname{Var}(X) = \lambda^2 + \lambda - \lambda^2 = \lambda。独立性と二項定理より

P(X+Y=n)=∑k=0ne−λλkk!e−μμn−k(n−k)!=e−(λ+μ)n!∑k=0n(nk)λkμn−k=e−(λ+μ)(λ+μ)nn!P(X + Y = n) = \sum_{k=0}^n e^{-\lambda}\frac{\lambda^k}{k!} e^{-\mu} \frac{\mu^{n-k}}{(n-k)!} = \frac{e^{-(\lambda + \mu)}}{n!} \sum_{k=0}^n \binom{n}{k} \lambda^k \mu^{n-k} = e^{-(\lambda+\mu)} \frac{(\lambda + \mu)^n}{n!}

問題 1.4 ★★(無記憶性)XX は確率変数で、すべての t≥0t \geq 0 について P(X>t)>0P(X > t) > 0、かつ P(X>0)=1P(X > 0) = 1 とする。すべての s,t≥0s, t \geq 0 について P(X>s+t)=P(X>s)P(X>t)P(X > s + t) = P(X > s) P(X > t) が成り立つ(「ss だけ待ったという条件のもとで、さらに tt 待つ確率は最初と同じ」)ならば、ある λ>0\lambda > 0 について X∼Exp⁡(λ)X \sim \operatorname{Exp}(\lambda) であることを示せ。

解答

G(t)=P(X>t)G(t) = P(X > t) とおくと G(0)=1G(0) = 1、G>0G > 0、G(s+t)=G(s)G(t)G(s + t) = G(s)G(t) であり、GG は単調非増加かつ右連続である。G(1)=e−λG(1) = e^{-\lambda}(λ≥0\lambda \geq 0)と書くと、G(1/n)n=G(1)G(1/n)^n = G(1) より G(1/n)=e−λ/nG(1/n) = e^{-\lambda/n}、さらに G(m/n)=G(1/n)m=e−λm/nG(m/n) = G(1/n)^m = e^{-\lambda m/n} である。任意の t≥0t \geq 0 に有理数 rk↓tr_k \downarrow t をとれば右連続性から G(t)=e−λtG(t) = e^{-\lambda t}。t→∞t \to \infty で G(t)→0G(t) \to 0(XX は実数値)なので λ>0\lambda > 0 である。よって FX(t)=1−e−λtF_X(t) = 1 - e^{-\lambda t}(t≥0t \geq 0)、FX(t)=0F_X(t) = 0(t<0t < 0)となり、X∼Exp⁡(λ)X \sim \operatorname{Exp}(\lambda)。

問題 1.5 ★★ 確率変数 XX が自分自身と独立(XX と XX が独立)ならば、ある定数 cc について X=cX = c a.s. であることを示せ。

解答

F(x)=P(X≤x,X≤x)=F(x)2F(x) = P(X \leq x, X \leq x) = F(x)^2 なので F(x)∈{0,1}F(x) \in \lbrace 0, 1 \rbrace。FF は単調非減少で極限が 0 と 1 だから c=inf⁡{x∣F(x)=1}c = \inf\lbrace x \mid F(x) = 1 \rbrace は有限で、右連続性から F=1[c,∞)F = \mathbf{1}_{[c, \infty)}。よって P(X=c)=F(c)−F(c−)=1P(X = c) = F(c) - F(c-) = 1。

問題 1.6 ★★ Θ∼U(−π/2,π/2)\Theta \sim U(-\pi/2, \pi/2) とする。X=tan⁡ΘX = \tan \Theta がコーシー分布に従うことを示し、1/X1/X もコーシー分布に従うことを示せ。

解答

tan⁡\tan は (−π/2,π/2)(-\pi/2, \pi/2) 上で狭義単調増加なので P(X≤x)=P(Θ≤arctan⁡x)=1π(arctan⁡x+π2)P(X \leq x) = P(\Theta \leq \arctan x) = \frac{1}{\pi}\left(\arctan x + \frac{\pi}{2}\right)。微分して密度 1π(1+x2)\frac{1}{\pi(1 + x^2)} を得る。X≠0X \neq 0 a.s. であり、y≠0y \neq 0 について P(1/X≤y)P(1/X \leq y) を計算すると、y>0y > 0 なら P(1/X≤y)=P(X<0)+P(X≥1/y)=12+1π(π2−arctan⁡1y)P(1/X \leq y) = P(X < 0) + P(X \geq 1/y) = \frac{1}{2} + \frac{1}{\pi}\left(\frac{\pi}{2} - \arctan \frac{1}{y}\right)。y>0y > 0 で arctan⁡(1/y)=π/2−arctan⁡y\arctan(1/y) = \pi/2 - \arctan y だから、これは 12+1πarctan⁡y\frac{1}{2} + \frac{1}{\pi}\arctan y に等しく、コーシー分布の分布関数と一致する。y<0y < 0 も同様(または対称性 X=d−XX \overset{d}{=} -X を使う)。

問題 1.7 ★★ X1,X2,…X_1, X_2, \dots を i.i.d. とする。E[∣X1∣]<∞E[\lvert X_1 \rvert] < \infty であることと P(∣Xn∣≥n i.o.)=0P(\lvert X_n \rvert \geq n \text{ i.o.}) = 0 は同値であることを示せ。さらに E[∣X1∣]=∞E[\lvert X_1 \rvert] = \infty ならば lim sup⁡n∣Xn∣/n=∞\limsup_n \lvert X_n \rvert / n = \infty a.s. であることを示せ。

解答

同分布なので ∑nP(∣Xn∣≥n)=∑nP(∣X1∣≥n)\sum_n P(\lvert X_n \rvert \geq n) = \sum_n P(\lvert X_1 \rvert \geq n) であり、命題 1.14 よりこれが有限であることと E[∣X1∣]<∞E[\lvert X_1 \rvert] < \infty は同値である。有限ならボレル–カンテリの第 1 補題より P(∣Xn∣≥n i.o.)=0P(\lvert X_n \rvert \geq n \text{ i.o.}) = 0。無限なら、事象 {∣Xn∣≥n}\lbrace \lvert X_n \rvert \geq n \rbrace は独立なので第 2 補題より確率は 1 である。後半:C∈NC \in \mathbb{N} について E[∣X1/C∣]=∞E[\lvert X_1 / C \rvert] = \infty なので、前半を Xn/CX_n / C に適用して P(∣Xn∣≥Cn i.o.)=1P(\lvert X_n \rvert \geq Cn \text{ i.o.}) = 1。よって lim sup⁡n∣Xn∣/n≥C\limsup_n \lvert X_n \rvert / n \geq C a.s.。C∈NC \in \mathbb{N} について共通部分をとればよい。

問題 1.8 ★★★(連の長さ)公平なコインを無限回投げ、ℓn\ell_n を nn 回目から始まる表の連の長さ(nn 回目が裏なら 0)とする。lim sup⁡nℓn/log⁡2n=1\limsup_n \ell_n / \log_2 n = 1 a.s. を示せ。

解答

P(ℓn≥k)=2−kP(\ell_n \geq k) = 2^{-k} である。r>1r > 1 のとき P(ℓn≥rlog⁡2n)≤2−rlog⁡2n=n−rP(\ell_n \geq r \log_2 n) \leq 2^{-r \log_2 n} = n^{-r} は総和有限なので、第 1 補題より lim sup⁡nℓn/log⁡2n≤r\limsup_n \ell_n / \log_2 n \leq r a.s.。r=1+1/kr = 1 + 1/k として ≤1\leq 1 を得る。

逆向きには重ならないブロックを使う。n1=2n_1 = 2、nk+1=nk+⌈log⁡2nk⌉n_{k+1} = n_k + \lceil \log_2 n_k \rceil とし、AkA_k を「nkn_k 回目から nk+1−1n_{k+1} - 1 回目までがすべて表」とする。ブロックは重ならないので AkA_k たちは独立で、Ak⊂{ℓnk≥log⁡2nk}A_k \subset \lbrace \ell_{n_k} \geq \log_2 n_k \rbrace、P(Ak)=2−⌈log⁡2nk⌉≥1/(2nk)P(A_k) = 2^{-\lceil \log_2 n_k \rceil} \geq 1/(2 n_k)。h(x)=1/(xlog⁡2x)h(x) = 1/(x \log_2 x) は x≥2x \geq 2 で単調減少なので

1nk=nk+1−nknk⌈log⁡2nk⌉≥nk+1−nk2nklog⁡2nk≥12∫nknk+1dxxlog⁡2x\frac{1}{n_k} = \frac{n_{k+1} - n_k}{n_k \lceil \log_2 n_k \rceil} \geq \frac{n_{k+1} - n_k}{2 n_k \log_2 n_k} \geq \frac{1}{2} \int_{n_k}^{n_{k+1}} \frac{dx}{x \log_2 x}

(⌈log⁡2nk⌉≤2log⁡2nk\lceil \log_2 n_k \rceil \leq 2 \log_2 n_k を使った)。nk→∞n_k \to \infty なので ∑k1/nk≥12∫2∞dxxlog⁡2x=∞\sum_k 1/n_k \geq \frac{1}{2}\int_2^\infty \frac{dx}{x \log_2 x} = \infty。第 2 補題より AkA_k は a.s. 無限回起こり、lim sup⁡nℓn/log⁡2n≥1\limsup_n \ell_n / \log_2 n \geq 1 a.s.。

問題 1.9 ★★★ (N,P(N))(\mathbb{N}, \mathcal{P}(\mathbb{N})) 上の確率測度 PP で、すべての k∈Nk \in \mathbb{N} について P(kN)=1/kP(k\mathbb{N}) = 1/k を満たすもの(「自然数からの一様な選択」)は存在しないことを示せ。ただし素数の逆数の和が発散することは用いてよい。

解答

そのような PP があったとする。素数 pp について Ap=pNA_p = p\mathbb{N} とおく。相異なる素数 p1,…,prp_1, \dots, p_r について Ap1∩⋯∩Apr=(p1⋯pr)NA_{p_1} \cap \cdots \cap A_{p_r} = (p_1 \cdots p_r)\mathbb{N} だから、P(Ap1∩⋯∩Apr)=1p1⋯pr=∏iP(Api)P(A_{p_1} \cap \cdots \cap A_{p_r}) = \frac{1}{p_1 \cdots p_r} = \prod_i P(A_{p_i}) となり、(Ap)p(A_p)_p は独立である。∑pP(Ap)=∑p1/p=∞\sum_p P(A_p) = \sum_p 1/p = \infty なので、第 2 補題より「無限個の素数で割り切れる自然数」の集合の確率が 1 になる。しかしそのような自然数は存在しないので矛盾である。(有限加法的な「密度」なら存在しうるが、可算加法性と両立しない。)

この章を読み終えたら

「読了」にすると学習記録とロードマップに反映されます。演習の自己採点もお忘れなく。

この章の誤りを報告GitHub で見る