この 章の 目標
潜在結果 モデルで 因果効果を 定義し、SUTVA などの 仮定のもとで、無作為化に より 平均処置効果が 識別される ことを 証明できる
A/B テストの 検出力と 標本サイズの 近似公式を 導出し、何が 近似なのかを 説明できる
ボンフェローニ法・ ホルム法が FWER を、ベンジャミニ–ホッホベルク法が(独立な 場合に)FDR を 制御する ことを 証明できる
途中で 結果を のぞいて 有意に なったら 止めると 第 1 種の 過誤が 増える ことを、数値実験と 重複対数の 法則で 説明できる
交絡と シンプソンの パラドックスを 数値例で 説明し、傾向スコア・差の 差法・回帰不連続デザインの 考え方と 仮定を 述べられる
前提 :第1章 、第4章 。8.5 節では 11 確率論 の 重複対数の 法則と マルチンゲールの 不等式を 引用する。8.6 節の 傾向スコアの 推定では 第6章の ロジスティック回帰を、8.7 節では 第5章の 線形回帰を 使う。
ある アプリで、新機能を 使った ユーザーは、使わなかった ユーザーより 翌月の 利用時間が 30% 長かった。新機能が 利用時間を 延ばしたのだろうか。もともと 熱心な ユーザーほど 新機能を 試すの なら、この 差は 新機能の 効果ではなく、使った 人と 使わなかった 人の 違いを 映しているだけかもしれない。相関は 因果を 意味しない。では、因果効果とは 数学的に 何であり、どんな 条件のもとで データから 推定できるのか。
本章では、因果効果を 潜在結果で 定義し、 無作為化 が 因果効果の 推定を 可能に する 理由を 証明する。ウェブサービスで 日常的に 行われる A/B テスト (ユーザーを 無作為に 2 群に 分けて 施策を 比べる 実験)は、その 最も 単純な 応用である。続いて、実験の 設計(標本サイズ)と 解析の 落とし穴(多重比較、途中での ぞき 見る こと)を 扱い、最後に、無作為化できない 観察データから 因果効果に 迫る 方法(傾向スコア、差の 差法、回帰不連続デザイン)を 紹介する。
8.1 潜在結果 モデル
定義 8.1 (潜在結果・処置効果)各個体に ついて、処置を 受けた 場合の 結果 Y ( 1 ) Y(1) Y ( 1 ) と 受けなかった 場合の 結果 Y ( 0 ) Y(0) Y ( 0 ) を 考え、 潜在結果 (potential outcomes) と いう。 Y ( 1 ) − Y ( 0 ) Y(1) - Y(0) Y ( 1 ) − Y ( 0 ) を その個体の 処置効果と いう。処置の 有無を Z ∈ { 0 , 1 } Z \in \lbrace 0, 1 \rbrace Z ∈ { 0 , 1 } とし、個体ごとの ( Y ( 0 ) , Y ( 1 ) , Z ) (Y(0), Y(1), Z) ( Y ( 0 ) , Y ( 1 ) , Z ) を 確率ベクトルと みなして
τ A T E = E [ Y ( 1 ) − Y ( 0 ) ] , τ A T T = E [ Y ( 1 ) − Y ( 0 ) ∣ Z = 1 ] \tau_{\mathrm{ATE}} = E[Y(1) - Y(0)], \qquad \tau_{\mathrm{ATT}} = E[Y(1) - Y(0) \mid Z = 1] τ ATE = E [ Y ( 1 ) − Y ( 0 )] , τ ATT = E [ Y ( 1 ) − Y ( 0 ) ∣ Z = 1 ]
を 平均処置効果 (average treatment effect, ATE)、処置群の 平均処置効果 (average treatment effect on the treated, ATT) と いう。
この 枠組みは ネイマン(1923 年)が 農事試験の 解析の ために 導入し、ルービンが 1970 年代に 観察研究を 含む因果推論の 一般的な 枠組みに 発展させた( ルービンの 因果モデル )。1 つの 個体に ついては Y ( 1 ) Y(1) Y ( 1 ) と Y ( 0 ) Y(0) Y ( 0 ) の 一方しか 観測できないので、個体の 処置効果は 決して 観測できない。これを 因果推論の 根本問題と いう。観測値と 潜在結果を 結びつけるのが 次の 仮定である。
定義 8.2 (SUTVA)次の 2 つを 合わせて SUTVA (stable unit treatment value assumption)と いう。(1) 干渉が ない :各個体の 潜在結果は、ほかの 個体が 処置を 受けるか どうかに よらない。(2) 処置は 一通り :同じ「処置」の 中に、結果に 影響する 別の 版は ない。
SUTVA のもとで、各個体の 潜在結果は 自分の 処置だけで 決まる 2 つの 値と して 定義でき、観測される 結果は
Y = Z Y ( 1 ) + ( 1 − Z ) Y ( 0 ) Y = ZY(1) + (1 - Z)Y(0) Y = Z Y ( 1 ) + ( 1 − Z ) Y ( 0 )
である。以下、この 式を 使う ときは SUTVA を 仮定している。
命題 8.3 (単純比較の 偏り) 0 < P ( Z = 1 ) < 1 0 < P(Z = 1) < 1 0 < P ( Z = 1 ) < 1 とし、現れる 期待値は 存在すると する。SUTVA のもとで
E [ Y ∣ Z = 1 ] − E [ Y ∣ Z = 0 ] = τ A T T + ( E [ Y ( 0 ) ∣ Z = 1 ] − E [ Y ( 0 ) ∣ Z = 0 ] ) E[Y \mid Z = 1] - E[Y \mid Z = 0] = \tau_{\mathrm{ATT}} + \bigl(E[Y(0) \mid Z = 1] - E[Y(0) \mid Z = 0]\bigr) E [ Y ∣ Z = 1 ] − E [ Y ∣ Z = 0 ] = τ ATT + ( E [ Y ( 0 ) ∣ Z = 1 ] − E [ Y ( 0 ) ∣ Z = 0 ] )
証明. Z = 1 Z = 1 Z = 1 なら Y = Y ( 1 ) Y = Y(1) Y = Y ( 1 ) 、Z = 0 Z = 0 Z = 0 なら Y = Y ( 0 ) Y = Y(0) Y = Y ( 0 ) なので、左辺は E [ Y ( 1 ) ∣ Z = 1 ] − E [ Y ( 0 ) ∣ Z = 0 ] E[Y(1) \mid Z = 1] - E[Y(0) \mid Z = 0] E [ Y ( 1 ) ∣ Z = 1 ] − E [ Y ( 0 ) ∣ Z = 0 ] に 等しい。これに E [ Y ( 0 ) ∣ Z = 1 ] E[Y(0) \mid Z = 1] E [ Y ( 0 ) ∣ Z = 1 ] を 引いて 足せばよい。 □ \square □
右辺の 第 2 項を 選択 バイアス (selection bias) と いう。処置を 受けた 個体が、処置が なくても 結果の よい個体であれば 正に なる。冒頭の 例では、熱心な ユーザーほど 新機能を 使うなら、新機能が なくても 利用時間は 長いので、単純な 比較は 効果を 過大に 見せる。 第1章 例 1.24 の 後の TIP の、成績の 悪かった 店舗だけを 選んで 施策を 評価すると 平均への 回帰が 効果に 見える 例も、選び方に よる 偏りである。
8.2 無作為化に よる 識別
処置を 無作為に 割り付ければ、選択 バイアスは 消える。
定理 8.4 (無作為化に よる 識別) SUTVA を 仮定し、 Z Z Z が ( Y ( 0 ) , Y ( 1 ) ) (Y(0), Y(1)) ( Y ( 0 ) , Y ( 1 )) と 独立( 無作為化 )で、0 < P ( Z = 1 ) < 1 0 < P(Z = 1) < 1 0 < P ( Z = 1 ) < 1 、E [ ∣ Y ( 0 ) ∣ ] , E [ ∣ Y ( 1 ) ∣ ] < ∞ E[\lvert Y(0) \rvert], E[\lvert Y(1) \rvert] < \infty E [∣ Y ( 0 )∣] , E [∣ Y ( 1 )∣] < ∞ と する。この とき
E [ Y ∣ Z = 1 ] − E [ Y ∣ Z = 0 ] = τ A T E = τ A T T E[Y \mid Z = 1] - E[Y \mid Z = 0] = \tau_{\mathrm{ATE}} = \tau_{\mathrm{ATT}} E [ Y ∣ Z = 1 ] − E [ Y ∣ Z = 0 ] = τ ATE = τ ATT
である。特に、個体が i.i.d. の とき、処置群と 対照群の 標本平均の 差 τ ^ = Y ˉ 1 − Y ˉ 0 \hat{\tau} = \bar{Y}_1 - \bar{Y}_0 τ ^ = Y ˉ 1 − Y ˉ 0 は、個体数 N → ∞ N \to \infty N → ∞ で τ A T E \tau_{\mathrm{ATE}} τ ATE に 確率収束する。
証明. z ∈ { 0 , 1 } z \in \lbrace 0, 1 \rbrace z ∈ { 0 , 1 } に ついて、SUTVA より Y 1 { Z = z } = Y ( z ) 1 { Z = z } Y\mathbf{1}_{\lbrace Z = z \rbrace} = Y(z)\mathbf{1}_{\lbrace Z = z \rbrace} Y 1 { Z = z } = Y ( z ) 1 { Z = z } である。独立な 確率変数の 積の 期待値は 期待値の 積なので(第1章 命題 1.6 の 3)
E [ Y ∣ Z = z ] = E [ Y ( z ) 1 { Z = z } ] P ( Z = z ) = E [ Y ( z ) ] P ( Z = z ) P ( Z = z ) = E [ Y ( z ) ] E[Y \mid Z = z] = \frac{E[Y(z)\mathbf{1}_{\lbrace Z = z \rbrace}]}{P(Z = z)} = \frac{E[Y(z)]P(Z = z)}{P(Z = z)} = E[Y(z)] E [ Y ∣ Z = z ] = P ( Z = z ) E [ Y ( z ) 1 { Z = z } ] = P ( Z = z ) E [ Y ( z )] P ( Z = z ) = E [ Y ( z )]
よって 左辺は E [ Y ( 1 ) ] − E [ Y ( 0 ) ] = τ A T E E[Y(1)] - E[Y(0)] = \tau_{\mathrm{ATE}} E [ Y ( 1 )] − E [ Y ( 0 )] = τ ATE である。同様に、独立性から E [ Y ( 1 ) − Y ( 0 ) ∣ Z = 1 ] = E [ Y ( 1 ) − Y ( 0 ) ] E[Y(1) - Y(0) \mid Z = 1] = E[Y(1) - Y(0)] E [ Y ( 1 ) − Y ( 0 ) ∣ Z = 1 ] = E [ Y ( 1 ) − Y ( 0 )] 。後半:Y ˉ 1 \bar{Y}_1 Y ˉ 1 は 1 N ∑ i Y i 1 { Z i = 1 } \frac{1}{N}\sum_i Y_i\mathbf{1}_{\lbrace Z_i = 1 \rbrace} N 1 ∑ i Y i 1 { Z i = 1 } を 1 N ∑ i 1 { Z i = 1 } \frac{1}{N}\sum_i \mathbf{1}_{\lbrace Z_i = 1 \rbrace} N 1 ∑ i 1 { Z i = 1 } で 割った もので、分子と 分母は 大数の 法則(第1章 定理 1.27 の 2)に より それぞれ E [ Y 1 { Z = 1 } ] E[Y\mathbf{1}_{\lbrace Z = 1 \rbrace}] E [ Y 1 { Z = 1 } ] と P ( Z = 1 ) > 0 P(Z = 1) > 0 P ( Z = 1 ) > 0 に 確率収束するから、 Y ˉ 1 \bar{Y}_1 Y ˉ 1 は E [ Y ∣ Z = 1 ] E[Y \mid Z = 1] E [ Y ∣ Z = 1 ] に 確率収束する(第1章 定理 1.29 の 連続写像定理)。 Y ˉ 0 \bar{Y}_0 Y ˉ 0 も 同様である。 □ \square □
観測できる ( Z , Y ) (Z, Y) ( Z , Y ) の 分布だけで 目的の 量が 決まる ことを 識別 (identification) と いう。定理 8.4 は、無作為化のもとで 平均処置効果が 識別される ことを 示している。母集団を 考えず、実験に 参加した 個体だけに ついて 述べる こともできる。
定理 8.5 (完全無作為化実験)N N N 個の 個体の 潜在結果 y i ( 0 ) , y i ( 1 ) y_i(0), y_i(1) y i ( 0 ) , y i ( 1 ) (i = 1 , … , N i = 1, \dots, N i = 1 , … , N )を 定数とし、 N N N 個体から N 1 N_1 N 1 個体(1 ≤ N 1 ≤ N − 1 1 \leq N_1 \leq N - 1 1 ≤ N 1 ≤ N − 1 )を、どの 組合せも 等確率に なるように 選んで 処置群と する( N 0 = N − N 1 N_0 = N - N_1 N 0 = N − N 1 )。SUTVA のもとで、処置群と 対照群の 観測値の 平均の 差 τ ^ = Y ˉ 1 − Y ˉ 0 \hat{\tau} = \bar{Y}_1 - \bar{Y}_0 τ ^ = Y ˉ 1 − Y ˉ 0 は
τ f p = 1 N ∑ i = 1 N ( y i ( 1 ) − y i ( 0 ) ) \tau_{\mathrm{fp}} = \frac{1}{N}\sum_{i=1}^{N}\bigl(y_i(1) - y_i(0)\bigr) τ fp = N 1 i = 1 ∑ N ( y i ( 1 ) − y i ( 0 ) )
の 不偏推定量である。
証明. 個体 i i i が 処置群に 入る とき Z i = 1 Z_i = 1 Z i = 1 と すると、 P ( Z i = 1 ) = ( N − 1 N 1 − 1 ) / ( N N 1 ) = N 1 / N P(Z_i = 1) = \binom{N-1}{N_1-1}/\binom{N}{N_1} = N_1/N P ( Z i = 1 ) = ( N 1 − 1 N − 1 ) / ( N 1 N ) = N 1 / N 。SUTVA より Y ˉ 1 = 1 N 1 ∑ i Z i y i ( 1 ) \bar{Y}_1 = \frac{1}{N_1}\sum_i Z_iy_i(1) Y ˉ 1 = N 1 1 ∑ i Z i y i ( 1 ) なので、E [ Y ˉ 1 ] = 1 N 1 ∑ i N 1 N y i ( 1 ) = 1 N ∑ i y i ( 1 ) E[\bar{Y}_1] = \frac{1}{N_1}\sum_i \frac{N_1}{N}y_i(1) = \frac{1}{N}\sum_i y_i(1) E [ Y ˉ 1 ] = N 1 1 ∑ i N N 1 y i ( 1 ) = N 1 ∑ i y i ( 1 ) 。同様に E [ Y ˉ 0 ] = 1 N ∑ i y i ( 0 ) E[\bar{Y}_0] = \frac{1}{N}\sum_i y_i(0) E [ Y ˉ 0 ] = N 1 ∑ i y i ( 0 ) 。□ \square □
定理 8.5 では、確率は 割り付けの 無作為性だけから 生じ、潜在結果の 分布に ついては 何も 仮定していない。 τ ^ \hat{\tau} τ ^ の 分散は S 1 2 / N 1 + S 0 2 / N 0 − S τ 2 / N S_1^2/N_1 + S_0^2/N_0 - S_\tau^2/N S 1 2 / N 1 + S 0 2 / N 0 − S τ 2 / N である。ここで S z 2 S_z^2 S z 2 は y 1 ( z ) , … , y N ( z ) y_1(z), \dots, y_N(z) y 1 ( z ) , … , y N ( z ) の、S τ 2 S_\tau^2 S τ 2 は 個体の 処置効果 y i ( 1 ) − y i ( 0 ) y_i(1) - y_i(0) y i ( 1 ) − y i ( 0 ) の、N − 1 N - 1 N − 1 で 割った 分散である(ネイマンの 公式。主張のみ。Imbens–Rubin を 参照)。 S τ 2 S_\tau^2 S τ 2 は 観測できないので、各群の 不偏分散 s z 2 s_z^2 s z 2 に よる 通常の 推定量 s 1 2 / N 1 + s 0 2 / N 0 s_1^2/N_1 + s_0^2/N_0 s 1 2 / N 1 + s 0 2 / N 0 は、平均的に 真の 分散以上に なる(保守的)。
ヒント
実務では
A/B テストの 結論は 定理 8.4 の 仮定に 依存する。(1) まず、各群の 人数の 比が 設計ど おりかを 検定する。ずれていれば( 標本比率の 不一致 , sample ratio mismatch)、割り 付けや ログの 取り こぼしが 群に よって 違い、無作為化が 壊れている 疑いが ある。(2) SNS や、出品者と 購入者が いる マーケットプレイスでは、処置群の 行動が 対照群の 結果に 影響し、SUTVA の「干渉が ない」が 破れる。地域や 時間帯などの まとまり ごとに 割り付ける( クラスター無作為化 )などの 工夫が 要る。(3) 新しい ものへの 一時的な 好奇心( 新奇性効果 )の ために、短期の 効果が 長期の 効果と 違うことがある。詳しくは Kohavi–Tang–Xu の 本を 参照。
8.3 A/B テストの 検出力と 標本サイズ
A/B テストでは、実験の 前に「どれだけの 差を、どれだけの 確率で 検出したいか」を 決め、必要な 人数を 計算する。人数が 少な すぎる 実験は、効果が あっても 見逃しやすく( 第4章 4.9 節)、有意に なった ときには 効果を 過大に 推定しがちである( 第7章 の 勝者の 呪い)。
各群 n n n 人とし、差の 推定量を D D D (比率の 差 p ^ B − p ^ A \hat{p}_B - \hat{p}_A p ^ B − p ^ A や 平均の 差 Y ˉ B − Y ˉ A \bar{Y}_B - \bar{Y}_A Y ˉ B − Y ˉ A )、真の 差を δ \delta δ と する。中心極限定理に より、 D D D は 近似的に N ( δ , σ 1 2 / n ) N(\delta, \sigma_1^2/n) N ( δ , σ 1 2 / n ) に 従い、帰無仮説 δ = 0 \delta = 0 δ = 0 のもとでは N ( 0 , σ 0 2 / n ) N(0, \sigma_0^2/n) N ( 0 , σ 0 2 / n ) に 従う。両側有意水準 α \alpha α の 検定は ∣ D ∣ ≥ z α / 2 σ 0 / n \lvert D \rvert \geq z_{\alpha/2}\sigma_0/\sqrt{n} ∣ D ∣ ≥ z α /2 σ 0 / n の とき棄却する( z α z_\alpha z α は 上側 α \alpha α 点)。まず、正規分布が 厳密に 成り立つとして 計算する。
命題 8.6 (検出力と 標本サイズ) D ∼ N ( δ , s 1 2 ) D \sim N(\delta, s_1^2) D ∼ N ( δ , s 1 2 ) 、δ > 0 \delta > 0 δ > 0 とし、∣ D ∣ ≥ z α / 2 s 0 \lvert D \rvert \geq z_{\alpha/2}s_0 ∣ D ∣ ≥ z α /2 s 0 の とき棄却する 検定を 考える( s 0 , s 1 > 0 s_0, s_1 > 0 s 0 , s 1 > 0 )。この 検定の 検出力は
Φ ( δ − z α / 2 s 0 s 1 ) + Φ ( − δ − z α / 2 s 0 s 1 ) \Phi\left(\frac{\delta - z_{\alpha/2}s_0}{s_1}\right) + \Phi\left(\frac{-\delta - z_{\alpha/2}s_0}{s_1}\right) Φ ( s 1 δ − z α /2 s 0 ) + Φ ( s 1 − δ − z α /2 s 0 )
であり、0 < β < 1 / 2 0 < \beta < 1/2 0 < β < 1/2 に ついて、 δ ≥ z α / 2 s 0 + z β s 1 \delta \geq z_{\alpha/2}s_0 + z_\beta s_1 δ ≥ z α /2 s 0 + z β s 1 ならば 検出力は 1 − β 1 - \beta 1 − β 以上である。s 0 = σ 0 / n s_0 = \sigma_0/\sqrt{n} s 0 = σ 0 / n 、s 1 = σ 1 / n s_1 = \sigma_1/\sqrt{n} s 1 = σ 1 / n の とき、この 条件は 次と 同値である。
n ≥ ( z α / 2 σ 0 + z β σ 1 ) 2 δ 2 n \geq \frac{(z_{\alpha/2}\sigma_0 + z_\beta\sigma_1)^2}{\delta^2} n ≥ δ 2 ( z α /2 σ 0 + z β σ 1 ) 2
証明. ( D − δ ) / s 1 ∼ N ( 0 , 1 ) (D - \delta)/s_1 \sim N(0, 1) ( D − δ ) / s 1 ∼ N ( 0 , 1 ) と 1 − Φ ( − u ) = Φ ( u ) 1 - \Phi(-u) = \Phi(u) 1 − Φ ( − u ) = Φ ( u ) より
P ( D ≥ z α / 2 s 0 ) = P ( D − δ s 1 ≥ z α / 2 s 0 − δ s 1 ) = Φ ( δ − z α / 2 s 0 s 1 ) P(D \geq z_{\alpha/2}s_0) = P\left(\frac{D - \delta}{s_1} \geq \frac{z_{\alpha/2}s_0 - \delta}{s_1}\right) = \Phi\left(\frac{\delta - z_{\alpha/2}s_0}{s_1}\right) P ( D ≥ z α /2 s 0 ) = P ( s 1 D − δ ≥ s 1 z α /2 s 0 − δ ) = Φ ( s 1 δ − z α /2 s 0 )
であり、同様に P ( D ≤ − z α / 2 s 0 ) = Φ ( ( − δ − z α / 2 s 0 ) / s 1 ) P(D \leq -z_{\alpha/2}s_0) = \Phi((-\delta - z_{\alpha/2}s_0)/s_1) P ( D ≤ − z α /2 s 0 ) = Φ (( − δ − z α /2 s 0 ) / s 1 ) で、この 2 つの 和が 検出力である。第 2 項は 正なので、第 1 項が 1 − β = Φ ( z β ) 1 - \beta = \Phi(z_\beta) 1 − β = Φ ( z β ) 以上なら 検出力は 1 − β 1 - \beta 1 − β 以上であり、Φ \Phi Φ の 単調性より、それは ( δ − z α / 2 s 0 ) / s 1 ≥ z β (\delta - z_{\alpha/2}s_0)/s_1 \geq z_\beta ( δ − z α /2 s 0 ) / s 1 ≥ z β と 同値である。最後の 同値は、両辺に n \sqrt{n} n を 掛けて 整理すれば よい( z β > 0 z_\beta > 0 z β > 0 に 注意)。 □ \square □
命題 8.6 を A/B テストに 使う ときの 近似は、(i) D D D を 正規分布で 置き換える こと(中心極限定理に よる。有限の n n n での 誤差は、分布の 歪みや 裾の 重さとともに 大きくなりやすい。第1章 1.7 節の WARNING)と、(ii) 実際の 検定では 分散を 推定値で 置き換えるのに、それを 真の 値と みなすことの 2 点である。第 2 項を 無視するのは 検出力を 低めに 見積もる 側なので、それ自体は 安全側である。
系 8.7 (標本サイズの 近似公式)両側有意水準 α \alpha α 、検出力 1 − β 1 - \beta 1 − β で 差 δ ≠ 0 \delta \neq 0 δ = 0 を 検出する ための 1 群あたりの 人数は、近似的に 次の とおりである。
(比率の 差)購入率 p A p_A p A と p B = p A + δ p_B = p_A + \delta p B = p A + δ を、帰無仮説のもとでの 分散に プールした 比率を 使う z z z 検定で 比べるなら、 p ˉ = ( p A + p B ) / 2 \bar{p} = (p_A + p_B)/2 p ˉ = ( p A + p B ) /2 と して
n = ( z α / 2 2 p ˉ ( 1 − p ˉ ) + z β p A ( 1 − p A ) + p B ( 1 − p B ) ) 2 δ 2 n = \frac{\left(z_{\alpha/2}\sqrt{2\bar{p}(1 - \bar{p})} + z_\beta\sqrt{p_A(1 - p_A) + p_B(1 - p_B)}\right)^2}{\delta^2} n = δ 2 ( z α /2 2 p ˉ ( 1 − p ˉ ) + z β p A ( 1 − p A ) + p B ( 1 − p B ) ) 2
(平均の 差)両群の 標準偏差が 共通の σ \sigma σ なら、n = 2 σ 2 ( z α / 2 + z β ) 2 / δ 2 n = 2\sigma^2(z_{\alpha/2} + z_\beta)^2/\delta^2 n = 2 σ 2 ( z α /2 + z β ) 2 / δ 2 。
証明. 1. 各群 n n n 人なら Var ( p ^ B − p ^ A ) = ( p A ( 1 − p A ) + p B ( 1 − p B ) ) / n \operatorname{Var}(\hat{p}_B - \hat{p}_A) = (p_A(1 - p_A) + p_B(1 - p_B))/n Var ( p ^ B − p ^ A ) = ( p A ( 1 − p A ) + p B ( 1 − p B )) / n で、帰無仮説 p A = p B = p p_A = p_B = p p A = p B = p のもとでは 2 p ( 1 − p ) / n 2p(1 - p)/n 2 p ( 1 − p ) / n である。プールした 比率は p ˉ \bar{p} p ˉ の 近くの 値を とるので、 σ 0 2 = 2 p ˉ ( 1 − p ˉ ) \sigma_0^2 = 2\bar{p}(1 - \bar{p}) σ 0 2 = 2 p ˉ ( 1 − p ˉ ) 、σ 1 2 = p A ( 1 − p A ) + p B ( 1 − p B ) \sigma_1^2 = p_A(1 - p_A) + p_B(1 - p_B) σ 1 2 = p A ( 1 − p A ) + p B ( 1 − p B ) と して 命題 8.6 を 使う( δ < 0 \delta < 0 δ < 0 なら A と B を 入れ替える)。2. σ 0 2 = σ 1 2 = 2 σ 2 \sigma_0^2 = \sigma_1^2 = 2\sigma^2 σ 0 2 = σ 1 2 = 2 σ 2 と して 命題 8.6 を 使う。 □ \square □
α = 0.05 \alpha = 0.05 α = 0.05 、検出力 0.8 0.8 0.8 では z 0.025 = 1.960 z_{0.025} = 1.960 z 0.025 = 1.960 、z 0.2 = 0.842 z_{0.2} = 0.842 z 0.2 = 0.842 で、2 ( z 0.025 + z 0.2 ) 2 = 15.7 2(z_{0.025} + z_{0.2})^2 = 15.7 2 ( z 0.025 + z 0.2 ) 2 = 15.7 だから、平均の 差では n ≈ 16 σ 2 / δ 2 n \approx 16\sigma^2/\delta^2 n ≈ 16 σ 2 / δ 2 と 覚えて おくと 便利である。必要な 人数は δ 2 \delta^2 δ 2 に 反比例し、検出したい 差を 半分に すると 約 4 倍に なる。
例 8.8 購入率 p A = 0.10 p_A = 0.10 p A = 0.10 の ページで p B = 0.11 p_B = 0.11 p B = 0.11 (相対 10% の 改善)を、両側 5%、検出力 80% で 検出するには、系 8.7 の 1 より 1 群 n = 14751 n = 14751 n = 14751 人が 必要である。この n n n で 二項分布から 40 万回の シミュレーションを 行うと、プールした 比率の z z z 検定の 棄却率は p B = 0.11 p_B = 0.11 p B = 0.11 で 0.801 0.801 0.801 、p B = 0.10 p_B = 0.10 p B = 0.10 で 0.050 0.050 0.050 であり(計算機に よる)、近似は よい。検出したい 差を 2 倍の p B = 0.12 p_B = 0.12 p B = 0.12 に すると n = 3841 n = 3841 n = 3841 である。1 人あたり売上(標準偏差 σ = 3000 \sigma = 3000 σ = 3000 円)で δ = 100 \delta = 100 δ = 100 円の 差を 検出するには、系 8.7 の 2 より n = 14128 n = 14128 n = 14128 人が 必要である。売上のように 裾の 重い 分布では 中心極限定理に よる 近似が 遅く、少数の 高額購入者が 結果を 左右する ことにも 注意が 要る。
8.4 多重比較
一つの 実験で 多数の 指標を 検定すると、すべての 帰無仮説が 正しくても、どれかが 有意に なる 確率は 大きくなる(独立な 20 個の 検定なら 1 − 0.95 20 = 0.64 1 - 0.95^{20} = 0.64 1 − 0.9 5 20 = 0.64 。第4章 問題 4.7)。以下、m m m 個の 帰無仮説 H 1 , … , H m H_1, \dots, H_m H 1 , … , H m と その p p p 値 p 1 , … , p m p_1, \dots, p_m p 1 , … , p m を 考える。正しい 帰無仮説の 添字の 集合を I 0 I_0 I 0 、m 0 = ∣ I 0 ∣ m_0 = \lvert I_0 \rvert m 0 = ∣ I 0 ∣ とし、i ∈ I 0 i \in I_0 i ∈ I 0 の p p p 値は すべての u ∈ [ 0 , 1 ] u \in [0, 1] u ∈ [ 0 , 1 ] で P ( p i ≤ u ) ≤ u P(p_i \leq u) \leq u P ( p i ≤ u ) ≤ u を みたすと する(第4章 定理 4.10)。棄却した 仮説の 数を R R R 、そのうち正しい 帰無仮説の 数を V V V と する。
定義 8.9 (FWER と FDR)F W E R = P ( V ≥ 1 ) \mathrm{FWER} = P(V \geq 1) FWER = P ( V ≥ 1 ) を ファミリーワイズ・エラー率 (family-wise error rate)、F D R = E [ V / max ( R , 1 ) ] \mathrm{FDR} = E[V/\max(R, 1)] FDR = E [ V / max ( R , 1 )] を 偽発見率 (false discovery rate) と いう。
FWER は「一つでも 誤って 棄却する 確率」、FDR は「棄却した もの(発見)の うち誤りの 割合の 期待値」である。 V / max ( R , 1 ) ≤ 1 { V ≥ 1 } V/\max(R, 1) \leq \mathbf{1}_{\lbrace V \geq 1 \rbrace} V / max ( R , 1 ) ≤ 1 { V ≥ 1 } なので F D R ≤ F W E R \mathrm{FDR} \leq \mathrm{FWER} FDR ≤ FWER である。
定理 8.10 (ボンフェローニ法)p p p 値が α / m \alpha/m α / m 以下の 仮説を 棄却すると、 p p p 値の 間の 依存関係に よらず F W E R ≤ m 0 α / m ≤ α \mathrm{FWER} \leq m_0\alpha/m \leq \alpha FWER ≤ m 0 α / m ≤ α である。
証明. P ( V ≥ 1 ) = P ( ⋃ i ∈ I 0 { p i ≤ α / m } ) ≤ ∑ i ∈ I 0 P ( p i ≤ α / m ) ≤ m 0 α / m P(V \geq 1) = P\left(\bigcup_{i \in I_0}\lbrace p_i \leq \alpha/m \rbrace\right) \leq \sum_{i \in I_0}P(p_i \leq \alpha/m) \leq m_0\alpha/m P ( V ≥ 1 ) = P ( ⋃ i ∈ I 0 { p i ≤ α / m } ) ≤ ∑ i ∈ I 0 P ( p i ≤ α / m ) ≤ m 0 α / m 。□ \square □
定理 8.11 (ホルム法, Holm 1979)p p p 値を 小さい 順に p ( 1 ) ≤ ⋯ ≤ p ( m ) p_{(1)} \leq \cdots \leq p_{(m)} p ( 1 ) ≤ ⋯ ≤ p ( m ) と 並べ、対応する 仮説を H ( 1 ) , … , H ( m ) H_{(1)}, \dots, H_{(m)} H ( 1 ) , … , H ( m ) と する(同じ値は 任意の 順に 並べる)。 p ( k ) > α / ( m − k + 1 ) p_{(k)} > \alpha/(m - k + 1) p ( k ) > α / ( m − k + 1 ) と なる 最小の k k k を とり、 H ( 1 ) , … , H ( k − 1 ) H_{(1)}, \dots, H_{(k-1)} H ( 1 ) , … , H ( k − 1 ) を 棄却する( そのような k k k が なければ すべて 棄却する)。この とき、 p p p 値の 間の 依存関係に よらず F W E R ≤ α \mathrm{FWER} \leq \alpha FWER ≤ α である。
証明. m 0 ≥ 1 m_0 \geq 1 m 0 ≥ 1 と して よい。並べた順で 最初に 現れる 正しい 帰無仮説を j j j 番目と すると、それより 前の j − 1 j - 1 j − 1 個は すべて 誤った 帰無仮説なので j − 1 ≤ m − m 0 j - 1 \leq m - m_0 j − 1 ≤ m − m 0 、すな わち m − j + 1 ≥ m 0 m - j + 1 \geq m_0 m − j + 1 ≥ m 0 である。ホルム法は 並べた 順で 先頭から 続けて 棄却するので、正しい 帰無仮説が 一つでも 棄却されるなら H ( j ) H_{(j)} H ( j ) も 棄却されており、その ためには p ( j ) ≤ α / ( m − j + 1 ) ≤ α / m 0 p_{(j)} \leq \alpha/(m - j + 1) \leq \alpha/m_0 p ( j ) ≤ α / ( m − j + 1 ) ≤ α / m 0 でなければならない。p ( j ) = min i ∈ I 0 p i p_{(j)} = \min_{i \in I_0}p_i p ( j ) = min i ∈ I 0 p i だから
P ( V ≥ 1 ) ≤ P ( min i ∈ I 0 p i ≤ α m 0 ) ≤ ∑ i ∈ I 0 P ( p i ≤ α m 0 ) ≤ α □ P(V \geq 1) \leq P\left(\min_{i \in I_0}p_i \leq \frac{\alpha}{m_0}\right) \leq \sum_{i \in I_0}P\left(p_i \leq \frac{\alpha}{m_0}\right) \leq \alpha \qquad \square P ( V ≥ 1 ) ≤ P ( i ∈ I 0 min p i ≤ m 0 α ) ≤ i ∈ I 0 ∑ P ( p i ≤ m 0 α ) ≤ α □
ボンフェローニ法が 棄却する 仮説は ホルム法でも 棄却されるので( k ≤ m k \leq m k ≤ m で α / m ≤ α / ( m − k + 1 ) \alpha/m \leq \alpha/(m - k + 1) α / m ≤ α / ( m − k + 1 ) )、ホルム法は 同じ 保証のもとで、つねに 同じか それ以上の 数を 棄却する。
何千もの 候補(商品、広告の セグメント、遺伝子)から「さらに 調べる 価値の ある もの」を 選ぶ 場面では、一つの 誤りも 許さない FWER の 制御は 厳しすぎ、発見の うち誤りの 割合を 抑えれば 十分な ことが 多い。 第4章 4.3 節の WARNING(p p p 値の 誤解)の 例で、有意に なった 施策の 36% が 実は 効果の ない ものだったのは、この 割合が 大きい 状況である。
定理 8.12 (ベンジャミニ–ホッホベルク法, Benjamini–Hochberg 1995)R = max { k ∣ p ( k ) ≤ k α / m } R = \max\lbrace k \mid p_{(k)} \leq k\alpha/m \rbrace R = max { k ∣ p ( k ) ≤ k α / m } ( そのような k k k が なければ R = 0 R = 0 R = 0 )とし、H ( 1 ) , … , H ( R ) H_{(1)}, \dots, H_{(R)} H ( 1 ) , … , H ( R ) を 棄却する( BH 法 )。各 i ∈ I 0 i \in I_0 i ∈ I 0 に ついて、 p i p_i p i が ほかの p p p 値の 組 ( p j ) j ≠ i (p_j)_{j \neq i} ( p j ) j = i と 独立ならば、 F D R ≤ m 0 α / m ≤ α \mathrm{FDR} \leq m_0\alpha/m \leq \alpha FDR ≤ m 0 α / m ≤ α である。i ∈ I 0 i \in I_0 i ∈ I 0 の p i p_i p i が 一様分布に 従うなら、等号 F D R = m 0 α / m \mathrm{FDR} = m_0\alpha/m FDR = m 0 α / m が 成り立つ。
証明. c ( k ) = ∣ { j ∣ p j ≤ k α / m } ∣ c(k) = \lvert \lbrace j \mid p_j \leq k\alpha/m \rbrace \rvert c ( k ) = ∣{ j ∣ p j ≤ k α / m }∣ (k = 0 , 1 , … , m k = 0, 1, \dots, m k = 0 , 1 , … , m )と おくと、 p ( k ) ≤ k α / m ⟺ c ( k ) ≥ k p_{(k)} \leq k\alpha/m \iff c(k) \geq k p ( k ) ≤ k α / m ⟺ c ( k ) ≥ k なので、R = max { k ∣ c ( k ) ≥ k } R = \max\lbrace k \mid c(k) \geq k \rbrace R = max { k ∣ c ( k ) ≥ k } である(k = 0 k = 0 k = 0 は つねに 条件を みたす)。
(a) 棄却されるのは、ちょうど p j ≤ R α / m p_j \leq R\alpha/m p j ≤ R α / m と なる H j H_j H j である。実際、c ( R ) > R c(R) > R c ( R ) > R なら、c c c は 単調増加だから c ( c ( R ) ) ≥ c ( R ) c(c(R)) \geq c(R) c ( c ( R )) ≥ c ( R ) と なり、 R R R の 最大性に 反する。よって c ( R ) = R c(R) = R c ( R ) = R で、p j ≤ R α / m p_j \leq R\alpha/m p j ≤ R α / m と なる j j j は ちょうど R R R 個、すな わち p p p 値の 小さい 方から R R R 個である。
(b) i ∈ I 0 i \in I_0 i ∈ I 0 を 固定し、 p i p_i p i を 0 0 0 に 置き換えた 組で 計算した c , R c, R c , R を c ~ , R i \tilde{c}, R_i c ~ , R i と する。 R i R_i R i は ( p j ) j ≠ i (p_j)_{j \neq i} ( p j ) j = i だけの 関数で、 c ~ ( 1 ) ≥ 1 \tilde{c}(1) \geq 1 c ~ ( 1 ) ≥ 1 より R i ≥ 1 R_i \geq 1 R i ≥ 1 である。k ≥ 1 k \geq 1 k ≥ 1 に ついて
{ p i ≤ k α / m , R = k } = { p i ≤ k α / m , R i = k } \lbrace p_i \leq k\alpha/m,\ R = k \rbrace = \lbrace p_i \leq k\alpha/m,\ R_i = k \rbrace { p i ≤ k α / m , R = k } = { p i ≤ k α / m , R i = k }
を 示す。 c ~ ( l ) = c ( l ) + 1 { p i > l α / m } \tilde{c}(l) = c(l) + \mathbf{1}_{\lbrace p_i > l\alpha/m \rbrace} c ~ ( l ) = c ( l ) + 1 { p i > l α / m } なので、p i ≤ k α / m p_i \leq k\alpha/m p i ≤ k α / m なら l ≥ k l \geq k l ≥ k で c ~ ( l ) = c ( l ) \tilde{c}(l) = c(l) c ~ ( l ) = c ( l ) である。よって p i ≤ k α / m p_i \leq k\alpha/m p i ≤ k α / m のもとで、「c ( k ) ≥ k c(k) \geq k c ( k ) ≥ k かつ l > k l > k l > k では c ( l ) < l c(l) < l c ( l ) < l 」(R = k R = k R = k )と「c ~ ( k ) ≥ k \tilde{c}(k) \geq k c ~ ( k ) ≥ k かつ l > k l > k l > k では c ~ ( l ) < l \tilde{c}(l) < l c ~ ( l ) < l 」(R i = k R_i = k R i = k )は 同値である。
(c) H i H_i H i を 棄却する 事象を A i A_i A i と すると V = ∑ i ∈ I 0 1 A i V = \sum_{i \in I_0}\mathbf{1}_{A_i} V = ∑ i ∈ I 0 1 A i で、(a) より A i = { p i ≤ R α / m , R ≥ 1 } A_i = \lbrace p_i \leq R\alpha/m,\ R \geq 1 \rbrace A i = { p i ≤ R α / m , R ≥ 1 } である。よって V / max ( R , 1 ) = ∑ i ∈ I 0 ∑ k = 1 m 1 k 1 { p i ≤ k α / m , R = k } V/\max(R, 1) = \sum_{i \in I_0}\sum_{k=1}^{m}\frac{1}{k}\mathbf{1}_{\lbrace p_i \leq k\alpha/m,\ R = k \rbrace} V / max ( R , 1 ) = ∑ i ∈ I 0 ∑ k = 1 m k 1 1 { p i ≤ k α / m , R = k } であり、期待値を とって (b) と、 p i p_i p i と R i R_i R i の 独立性、 P ( p i ≤ u ) ≤ u P(p_i \leq u) \leq u P ( p i ≤ u ) ≤ u を 使うと
F D R = ∑ i ∈ I 0 ∑ k = 1 m 1 k P ( p i ≤ k α m , R = k ) = ∑ i ∈ I 0 ∑ k = 1 m 1 k P ( p i ≤ k α m ) P ( R i = k ) ≤ ∑ i ∈ I 0 ∑ k = 1 m α m P ( R i = k ) = m 0 α m \begin{aligned}
\mathrm{FDR} &= \sum_{i \in I_0}\sum_{k=1}^{m}\frac{1}{k}P\left(p_i \leq \frac{k\alpha}{m},\ R = k\right) = \sum_{i \in I_0}\sum_{k=1}^{m}\frac{1}{k}P\left(p_i \leq \frac{k\alpha}{m}\right)P(R_i = k) \\
&\leq \sum_{i \in I_0}\sum_{k=1}^{m}\frac{\alpha}{m}P(R_i = k) = \frac{m_0\alpha}{m}
\end{aligned} FDR = i ∈ I 0 ∑ k = 1 ∑ m k 1 P ( p i ≤ m k α , R = k ) = i ∈ I 0 ∑ k = 1 ∑ m k 1 P ( p i ≤ m k α ) P ( R i = k ) ≤ i ∈ I 0 ∑ k = 1 ∑ m m α P ( R i = k ) = m m 0 α
最後の 等号は、 R i ≥ 1 R_i \geq 1 R i ≥ 1 より ∑ k = 1 m P ( R i = k ) = 1 \sum_{k=1}^{m}P(R_i = k) = 1 ∑ k = 1 m P ( R i = k ) = 1 と なることに よる。 p i p_i p i が 一様分布なら、不等号は 等号に なる。 □ \square □
例 8.13 m = 10 m = 10 m = 10 、α = 0.05 \alpha = 0.05 α = 0.05 で、p p p 値を 小さい 順に 並べた ものと、ホルム法・ BH 法の 閾値が 次の とおりだったとする。
順位 k k k
1
2
3
4
5
6
7
8
9
10
p ( k ) p_{(k)} p ( k )
0.001
0.004
0.006
0.012
0.021
0.035
0.041
0.10
0.32
0.68
ホルム α / ( m − k + 1 ) \alpha/(m - k + 1) α / ( m − k + 1 )
0.00500
0.00556
0.00625
0.00714
0.00833
0.0100
0.0125
0.0167
0.0250
0.0500
BH k α / m k\alpha/m k α / m
0.005
0.010
0.015
0.020
0.025
0.030
0.035
0.040
0.045
0.050
ボンフェローニ法(閾値 0.005 0.005 0.005 )は 2 個、ホルム法は k = 4 k = 4 k = 4 で 0.012 > 0.00714 0.012 > 0.00714 0.012 > 0.00714 と なって 止まるので 3 個、BH 法は p ( k ) ≤ k α / m p_{(k)} \leq k\alpha/m p ( k ) ≤ k α / m と なる 最大の k k k が 5 5 5 なので 5 個を 棄却する。
8.5 途中での ぞき 見る ことと p p p ハッキング
A/B テストの 結果は、ダッシュボードで 毎日 見られる ことが 多い。「毎日 検定し、 p p p 値が 0.05 0.05 0.05 を 下回った 時点で 実験を 止めて B の 勝ちと する」運用は、第 1 種の 過誤の 確率を α \alpha α より ずっと 大きくする。次の コードは、購入率が ともに 10% の 2 群(A/A テスト:真の 差は 0 0 0 )で、1 日に 各群 500 人ずつ データが 増える 状況を 10 万回繰り返し、1 日目から k k k 日目まで 毎日 行う z z z 検定(両側 5%)で 一度でも 有意に なる 割合を 数える。
import numpy as np
rng = np.random.default_rng(0)
sims, looks, batch, p = 100000, 20, 500, 0.10 # A/A テスト:両群とも購入率 10%
xa = rng.binomial(batch, p, size=(sims, looks)).cumsum(axis=1) # A の累積購入数
xb = rng.binomial(batch, p, size=(sims, looks)).cumsum(axis=1) # B の累積購入数
n = batch * np.arange(1, looks + 1) # 各群の累積人数
pool = (xa + xb) / (2 * n)
z = (xb - xa) / n / np.sqrt(pool * (1 - pool) * 2 / n) # 比率の差の z 統計量
sig = np.abs(z) > 1.96 # 両側 5% で有意か
print(f"最後に 1 回だけ検定する : {sig[:, -1].mean():.3f}")
for k in (2, 5, 10, 20):
print(f"{k:2d} 回のぞき、一度でも有意 : {sig[:, :k].any(axis=1).mean():.3f}")
最後に 1 回だけ検定する : 0.051
2 回のぞき、一度でも有意 : 0.084
5 回のぞき、一度でも有意 : 0.142
10 回のぞき、一度でも有意 : 0.195
20 回のぞき、一度でも有意 : 0.250
20 日目に 1 回だけ検定すれば 有意に なる 割合は 5% の ままだが、毎日の ぞけば 20 日で 25% に なる。データを 正規分布で 近似した 同じ 計算を 200 万回繰り返すと、2・5・10・20・50・100 回の ぞいた 場合の 割合は 0.083 , 0.142 , 0.193 , 0.248 , 0.320 , 0.373 0.083, 0.142, 0.193, 0.248, 0.320, 0.373 0.083 , 0.142 , 0.193 , 0.248 , 0.320 , 0.373 で(計算機に よる)、の ぞく 回数とともに 増え続ける。実際、の ぞく 回数に 上限が なければ、いつかは 必ず 有意に なる。
命題 8.15 (の ぞき続ければ いつかは 有意に なる) D 1 , D 2 , … D_1, D_2, \dots D 1 , D 2 , … を i.i.d. で E [ D 1 ] = 0 E[D_1] = 0 E [ D 1 ] = 0 、Var ( D 1 ) = σ 2 ∈ ( 0 , ∞ ) \operatorname{Var}(D_1) = \sigma^2 \in (0, \infty) Var ( D 1 ) = σ 2 ∈ ( 0 , ∞ ) と し(帰無仮説のもとでの、1 組ずつの データの 差など)、 Z n = ( D 1 + ⋯ + D n ) / ( σ n ) Z_n = (D_1 + \cdots + D_n)/(\sigma\sqrt{n}) Z n = ( D 1 + ⋯ + D n ) / ( σ n ) と する。任意の c > 0 c > 0 c > 0 に ついて、確率 1 で ∣ Z n ∣ > c \lvert Z_n \rvert > c ∣ Z n ∣ > c と なる n n n が 存在する。
証明. 重複対数の 法則( 11 確率論 第4章 定理 4.26。証明は 同章でも 省略されている)を D k / σ D_k/\sigma D k / σ に 使うと、確率 1 で lim sup n Z n / 2 log log n = 1 \limsup_{n}Z_n/\sqrt{2\log\log n} = 1 lim sup n Z n / 2 log log n = 1 である。2 log log n → ∞ \sqrt{2\log\log n} \to \infty 2 log log n → ∞ なので、確率 1 で lim sup n Z n = ∞ \limsup_n Z_n = \infty lim sup n Z n = ∞ と なる。 □ \square □
止めるか どうかを データを 見て 決めると、最後に 計算した p p p 値は、もはや 第4章 定義 4.9 の 意味での p p p 値ではない。の ぞき 見る こと自体ではなく、 の ぞいた 結果で 止めるか どうかを 決める こと が 問題なのである。
の ぞき見を 含め、分析の 選択肢(指標、対象期間、セグメント、外れ値の 除外規則、共変量)を 試して 有意に なった ものだけを 報告する ことを p p p ハッキング (p p p -hacking) と いう。これは 報告されない 多重比較であり、報告された p p p 値の 保証は 失われる。対策は、主要な 指標・分析方法・ 標本の 大きさを 事前に 決めて 記録しておく こと( 事前登録 )、試した すべての 分析を 報告する こと、探索的に 見つけた 結果は 別の 実験で 確かめる ことである。
ヒント
実務では
「有意に なったら 早めに 止める」を 許すなら、その 規則を 事前に 決め、注意 8.16 の 方法で 規則に 合った 棄却値を 使う。一方、害が 大きいことが わかった 実験を 早く 止める(安全性の ための 停止)のは 正当であり、その 基準も 事前に 決めて おく。曜日に よって 利用者の 構成が 違うので、実験期間は 1 週間単位に する ことが 多い。
8.6 交絡と シンプソンの パラドックス
無作為化できない データでは、処置を 受けるか どうかが、結果に 関係する 性質に 左右される。処置と 結果の 両方に 影響する 変数を 交絡因子 (confounder) と いう( 第1章 問題 1.4 の、気温が アイスクリームの 売上と 熱中症の 救急搬送の 両方を 増やす例では、気温が 見かけの 相関を 生む 共通の 原因である)。
例 8.17 (シンプソンの パラドックス)新規顧客の 獲得の ために、クーポンを 主に 新規顧客に 配った。購入者数と 対象人数は 次の とおりである。
クーポンあり
クーポンなし
新規顧客
120/1000(12%)
20/200(10%)
既存顧客
90/200(45%)
400/1000(40%)
合計
210/1200(17.5%)
420/1200(35%)
どちらの 顧客層でも クーポンありの 購入率の ほうが 高い( + 2 +2 + 2 ポイントと + 5 +5 + 5 ポイント)のに、合計では クーポンありの ほうが 17.5 17.5 17.5 ポイントも 低い。これを シンプソンの パラドックス (Simpson's paradox) と いう。顧客層は、クーポンを 受け取るか どうかと 購入率の 両方に 関係する 交絡因子であり、合計の 比較は「新規顧客と 既存顧客の 比較」を 大きく 含んでしまう。クーポンの 配布が 顧客層だけで 決まったのなら、層ごとの 購入率を 全体の 人数の 比(新規 1200 1200 1200 人、既存 1200 1200 1200 人)で 平均した
( 0.5 ⋅ 0.12 + 0.5 ⋅ 0.45 ) − ( 0.5 ⋅ 0.10 + 0.5 ⋅ 0.40 ) = 0.285 − 0.25 = 0.035 (0.5 \cdot 0.12 + 0.5 \cdot 0.45) - (0.5 \cdot 0.10 + 0.5 \cdot 0.40) = 0.285 - 0.25 = 0.035 ( 0.5 ⋅ 0.12 + 0.5 ⋅ 0.45 ) − ( 0.5 ⋅ 0.10 + 0.5 ⋅ 0.40 ) = 0.285 − 0.25 = 0.035
が、クーポンの 平均処置効果の 推定値に なる( 標準化 )。その 根拠が 次の 定理である。
定理 8.18 (調整化公式)有限個の 値を とる 共変量 X X X に ついて、SUTVA と 次の 2 つを 仮定する。(1) 条件付き無視 可能性 :各 x x x に ついて、 X = x X = x X = x のもとで Z Z Z と ( Y ( 0 ) , Y ( 1 ) ) (Y(0), Y(1)) ( Y ( 0 ) , Y ( 1 )) は 条件付き独立である。(2) 正値性 :P ( X = x ) > 0 P(X = x) > 0 P ( X = x ) > 0 と なる すべての x x x で 0 < e ( x ) < 1 0 < e(x) < 1 0 < e ( x ) < 1 。ここで e ( x ) = P ( Z = 1 ∣ X = x ) e(x) = P(Z = 1 \mid X = x) e ( x ) = P ( Z = 1 ∣ X = x ) である。E [ ∣ Y ( 0 ) ∣ ] , E [ ∣ Y ( 1 ) ∣ ] < ∞ E[\lvert Y(0) \rvert], E[\lvert Y(1) \rvert] < \infty E [∣ Y ( 0 )∣] , E [∣ Y ( 1 )∣] < ∞ ならば、z = 0 , 1 z = 0, 1 z = 0 , 1 に ついて
E [ Y ( z ) ] = ∑ x E [ Y ∣ Z = z , X = x ] P ( X = x ) E[Y(z)] = \sum_x E[Y \mid Z = z, X = x]P(X = x) E [ Y ( z )] = x ∑ E [ Y ∣ Z = z , X = x ] P ( X = x )
であり、さらに E [ Y ( 1 ) ] = E [ Z Y / e ( X ) ] E[Y(1)] = E[ZY/e(X)] E [ Y ( 1 )] = E [ Z Y / e ( X )] 、E [ Y ( 0 ) ] = E [ ( 1 − Z ) Y / ( 1 − e ( X ) ) ] E[Y(0)] = E[(1 - Z)Y/(1 - e(X))] E [ Y ( 0 )] = E [( 1 − Z ) Y / ( 1 − e ( X ))] が 成り立つ。
証明. SUTVA と (1) より、E [ Y ∣ Z = z , X = x ] = E [ Y ( z ) ∣ Z = z , X = x ] = E [ Y ( z ) ∣ X = x ] E[Y \mid Z = z, X = x] = E[Y(z) \mid Z = z, X = x] = E[Y(z) \mid X = x] E [ Y ∣ Z = z , X = x ] = E [ Y ( z ) ∣ Z = z , X = x ] = E [ Y ( z ) ∣ X = x ] である((2) より 条件の 確率は 正)。これに P ( X = x ) P(X = x) P ( X = x ) を 掛けて 足すと、全期待値の 公式より E [ Y ( z ) ] E[Y(z)] E [ Y ( z )] に なる。後半: Z Y = Z Y ( 1 ) ZY = ZY(1) Z Y = Z Y ( 1 ) と (1) より E [ Z Y ∣ X = x ] = e ( x ) E [ Y ( 1 ) ∣ X = x ] E[ZY \mid X = x] = e(x)E[Y(1) \mid X = x] E [ Z Y ∣ X = x ] = e ( x ) E [ Y ( 1 ) ∣ X = x ] なので
E [ Z Y e ( X ) ] = ∑ x P ( X = x ) E [ Z Y ∣ X = x ] e ( x ) = ∑ x P ( X = x ) E [ Y ( 1 ) ∣ X = x ] = E [ Y ( 1 ) ] E\left[\frac{ZY}{e(X)}\right] = \sum_x P(X = x)\frac{E[ZY \mid X = x]}{e(x)} = \sum_x P(X = x)E[Y(1) \mid X = x] = E[Y(1)] E [ e ( X ) Z Y ] = x ∑ P ( X = x ) e ( x ) E [ Z Y ∣ X = x ] = x ∑ P ( X = x ) E [ Y ( 1 ) ∣ X = x ] = E [ Y ( 1 )]
Y ( 0 ) Y(0) Y ( 0 ) も 同様である。 □ \square □
後半の 式に よる 推定を 逆確率重み付け (inverse probability weighting, IPW) と いう。処置群の 各個体を、処置を 受ける 確率の 逆数 1 / e ( x ) 1/e(x) 1/ e ( x ) 倍に 数える ことで、処置群を 全体の 代表に 作り直している(問題 8.8)。(1) は「 X X X の ほかに 交絡因子が ない」と いう 仮定であり、データから 検証する ことは できない。
定理 8.19 (傾向スコア, Rosenbaum–Rubin 1983)e ( X ) = P ( Z = 1 ∣ X ) e(X) = P(Z = 1 \mid X) e ( X ) = P ( Z = 1 ∣ X ) を 傾向スコア (propensity score) と いう。(1) X X X と Z Z Z は、e ( X ) e(X) e ( X ) を 与えたもとで 条件付き独立である( バランス性 )。(2) 定理 8.18 の (1) と (2) が 成り立つなら、 e ( X ) e(X) e ( X ) を 与えたもとでも Z Z Z と ( Y ( 0 ) , Y ( 1 ) ) (Y(0), Y(1)) ( Y ( 0 ) , Y ( 1 )) は 条件付き独立である。(主張のみ。Imbens–Rubin、星野『調査観察データの 統計科学』を 参照。)
共変量が 多いと、 X X X の 値ごとの 層には 少数の 個体しかいなくなるが、定理 8.19 より、1 次元の e ( X ) e(X) e ( X ) で 層別・マッチング・重み付けを すれば 足りる。実際には e ( x ) e(x) e ( x ) は 未知なので、ロジスティック回帰( 第6章 )などで 推定し、推定した 傾向スコアで 重み付けした 後に 各共変量の 分布が 群の 間で そろったかを 確かめる。 e ( x ) e(x) e ( x ) が 0 0 0 や 1 1 1 に 近い個体が あると 重み 1 / e ( x ) 1/e(x) 1/ e ( x ) が 極端に 大きくなり、推定が 不安定に なる(正値性が ほとんど 破れている 状態である)。
注意
「変数を たくさん 調整する ほど 偏りが 減る」とは 限らない。処置の 結果と して 変わる 変数( 中間変数 。たとえば クーポンで 増えた サイト訪問回数)で 層別すると、効果の 一部を 消してしまう。処置と 結果の 両方から 影響を 受ける 変数( 合流点 )で 層別すると、もともとなかった 相関が 生まれる。調整すべきなのは、処置より 前に 決まっている 交絡因子である。どの 変数が 交絡因子かは データだけからは 決まらず、因果の 構造に ついての 知識と 仮定が 要る。そして、測っていない 交絡因子に よる 偏りは、どの 方法でも 取り除けない。
8.7 差の 差法と 回帰不連続デザイン(紹介)
差の 差法 (difference-in-differences, DiD):ある 地域 T でだけ施策(送料無料など)を 導入し、導入しなかった 地域 C と 比べる。T の 導入前後の 差には、施策の 効果と、季節などに よる 時間の 変化が 混ざっているので、C の 前後の 差で 時間の 変化を 見積もって 引く。期間 t ∈ { p r e , p o s t } t \in \lbrace \mathrm{pre}, \mathrm{post} \rbrace t ∈ { pre , post } の 潜在結果を Y t ( 0 ) , Y t ( 1 ) Y_t(0), Y_t(1) Y t ( 0 ) , Y t ( 1 ) 、群を G ∈ { T , C } G \in \lbrace T, C \rbrace G ∈ { T , C } と する。T は post にだけ処置を 受け、C は どちらの 期間にも 受けず、施策の 前には 効果が ない(両群で Y p r e = Y p r e ( 0 ) Y_{\mathrm{pre}} = Y_{\mathrm{pre}}(0) Y pre = Y pre ( 0 ) )と する。
命題 8.20 (差の 差法) 平行トレンド の 仮定 E [ Y p o s t ( 0 ) − Y p r e ( 0 ) ∣ G = T ] = E [ Y p o s t ( 0 ) − Y p r e ( 0 ) ∣ G = C ] E[Y_{\mathrm{post}}(0) - Y_{\mathrm{pre}}(0) \mid G = T] = E[Y_{\mathrm{post}}(0) - Y_{\mathrm{pre}}(0) \mid G = C] E [ Y post ( 0 ) − Y pre ( 0 ) ∣ G = T ] = E [ Y post ( 0 ) − Y pre ( 0 ) ∣ G = C ] のもとで、
( E [ Y p o s t ∣ T ] − E [ Y p r e ∣ T ] ) − ( E [ Y p o s t ∣ C ] − E [ Y p r e ∣ C ] ) = E [ Y p o s t ( 1 ) − Y p o s t ( 0 ) ∣ G = T ] \bigl(E[Y_{\mathrm{post}} \mid T] - E[Y_{\mathrm{pre}} \mid T]\bigr) - \bigl(E[Y_{\mathrm{post}} \mid C] - E[Y_{\mathrm{pre}} \mid C]\bigr) = E[Y_{\mathrm{post}}(1) - Y_{\mathrm{post}}(0) \mid G = T] ( E [ Y post ∣ T ] − E [ Y pre ∣ T ] ) − ( E [ Y post ∣ C ] − E [ Y pre ∣ C ] ) = E [ Y post ( 1 ) − Y post ( 0 ) ∣ G = T ]
である(∣ T \mid T ∣ T は ∣ G = T \mid G = T ∣ G = T の 略)。
証明. T では Y p o s t = Y p o s t ( 1 ) Y_{\mathrm{post}} = Y_{\mathrm{post}}(1) Y post = Y post ( 1 ) 、C では Y p o s t = Y p o s t ( 0 ) Y_{\mathrm{post}} = Y_{\mathrm{post}}(0) Y post = Y post ( 0 ) なので、T の 前後差は E [ Y p o s t ( 1 ) − Y p o s t ( 0 ) ∣ T ] + E [ Y p o s t ( 0 ) − Y p r e ( 0 ) ∣ T ] E[Y_{\mathrm{post}}(1) - Y_{\mathrm{post}}(0) \mid T] + E[Y_{\mathrm{post}}(0) - Y_{\mathrm{pre}}(0) \mid T] E [ Y post ( 1 ) − Y post ( 0 ) ∣ T ] + E [ Y post ( 0 ) − Y pre ( 0 ) ∣ T ] 、C の 前後差は E [ Y p o s t ( 0 ) − Y p r e ( 0 ) ∣ C ] E[Y_{\mathrm{post}}(0) - Y_{\mathrm{pre}}(0) \mid C] E [ Y post ( 0 ) − Y pre ( 0 ) ∣ C ] である。平行トレンドの 仮定より、第 2 項どうしが 打ち消し合う。 □ \square □
たとえば 1 店舗あたりの 週の 売上(万円)が、T で 導入前 100 100 100 から 導入後 130 130 130 、C で 80 80 80 から 95 95 95 に なったなら、推定値は ( 130 − 100 ) − ( 95 − 80 ) = 15 (130 - 100) - (95 - 80) = 15 ( 130 − 100 ) − ( 95 − 80 ) = 15 である。群の 水準の 違い( 100 100 100 と 80 80 80 )は 許されるが、「施策が なければ 両群は 同じだけ変化したはずだ」と いう 仮定は 直接は 検証できないので、導入前の 複数の 期間で 両群の 推移が 平行だったかを 確かめる。回帰の 言葉では、 Y = β 0 + β 1 1 T + β 2 1 p o s t + β 3 1 T 1 p o s t + ε Y = \beta_0 + \beta_1\mathbf{1}_T + \beta_2\mathbf{1}_{\mathrm{post}} + \beta_3\mathbf{1}_T\mathbf{1}_{\mathrm{post}} + \varepsilon Y = β 0 + β 1 1 T + β 2 1 post + β 3 1 T 1 post + ε の 交互作用の 係数 β 3 \beta_3 β 3 の 最小二乗推定値が、差の 差の 推定値に なる( 第5章 5.8 節)。
回帰不連続デザイン (regression discontinuity design, RDD):処置が、連続な 変数 X X X (割り当て 変数 )が 閾値 c c c 以上か どうかで 決まる 場合を 考える。たとえば 前年の 購入額が 5 万円以上の 顧客を 優待会員に する 場合で、 Z = 1 { X ≥ c } Z = \mathbf{1}_{\lbrace X \geq c \rbrace} Z = 1 { X ≥ c } である。c c c の すぐ 上と 下の 顧客は、処置の 有無を 除けば よく 似ているはずである。
命題 8.21 (回帰不連続デザイン)X X X は c c c の 近くで 正の 密度を もち、 x ↦ E [ Y ( 0 ) ∣ X = x ] x \mapsto E[Y(0) \mid X = x] x ↦ E [ Y ( 0 ) ∣ X = x ] と x ↦ E [ Y ( 1 ) ∣ X = x ] x \mapsto E[Y(1) \mid X = x] x ↦ E [ Y ( 1 ) ∣ X = x ] が x = c x = c x = c で 連続ならば、SUTVA のもとで
lim x → c + 0 E [ Y ∣ X = x ] − lim x → c − 0 E [ Y ∣ X = x ] = E [ Y ( 1 ) − Y ( 0 ) ∣ X = c ] \lim_{x \to c + 0}E[Y \mid X = x] - \lim_{x \to c - 0}E[Y \mid X = x] = E[Y(1) - Y(0) \mid X = c] x → c + 0 lim E [ Y ∣ X = x ] − x → c − 0 lim E [ Y ∣ X = x ] = E [ Y ( 1 ) − Y ( 0 ) ∣ X = c ]
証明. x ≥ c x \geq c x ≥ c なら Z = 1 Z = 1 Z = 1 なので E [ Y ∣ X = x ] = E [ Y ( 1 ) ∣ X = x ] E[Y \mid X = x] = E[Y(1) \mid X = x] E [ Y ∣ X = x ] = E [ Y ( 1 ) ∣ X = x ] 、x < c x < c x < c なら E [ Y ∣ X = x ] = E [ Y ( 0 ) ∣ X = x ] E[Y \mid X = x] = E[Y(0) \mid X = x] E [ Y ∣ X = x ] = E [ Y ( 0 ) ∣ X = x ] である。連続性より、それぞれの 極限は E [ Y ( 1 ) ∣ X = c ] E[Y(1) \mid X = c] E [ Y ( 1 ) ∣ X = c ] 、E [ Y ( 0 ) ∣ X = c ] E[Y(0) \mid X = c] E [ Y ( 0 ) ∣ X = c ] である。□ \square □
実際には、閾値の 両側で c c c の 近くの データだけを 使って 回帰直線を 当てはめ(局所線形回帰)、 c c c での 値の 差を 推定する。わかるのは 閾値の 近くの 顧客に ついての 効果だけである。また、顧客が 閾値を またぐように 行動を 変えられる(閾値の 直前に 買い足す)と、 c c c の 上下で 顧客の 性質が 変わり、連続性の 仮定が 崩れる。 X X X の 分布が c c c の 直上に 偏っていないかを 確かめるのが 標準的な 点検である。
まとめ
因果効果は 潜在結果の 差で 定義され、個体ごとには 観測できない。単純な 群間比較は、処置群での 効果と 選択 バイアスの 和である。
SUTVA と 無作為化のもとで、群の 平均の 差は 平均処置効果を 識別し、完全無作為化実験では 不偏推定量に なる。割り付け比の 点検と 干渉の 有無の 確認が、実務での 前提に なる。
1 群あたりの 人数は、正規近似のもとで 検出力の 式から n = ( z α / 2 σ 0 + z β σ 1 ) 2 / δ 2 n = (z_{\alpha/2}\sigma_0 + z_\beta\sigma_1)^2/\delta^2 n = ( z α /2 σ 0 + z β σ 1 ) 2 / δ 2 と 求まる(近似)。必要な 人数は 検出したい 差の 2 乗に 反比例する。
ボンフェローニ法と ホルム法は 任意の 依存関係のもとで FWER を、BH 法は 独立性のもとで FDR を m 0 α / m m_0\alpha/m m 0 α / m 以下に 制御する。
途中での ぞいて 有意に なったら 止めると、第 1 種の 過誤は 20 回の ぞけば 約 25% に なり、の ぞき続ければ 確率 1 で いつか 有意に なる。群逐次デザインや 尤度比の マルチンゲールを 使えば、の ぞきながらでも 誤りを 制御できる。
交絡は シンプソンの パラドックスを 生む。測った 交絡因子に ついては、条件付き無視 可能性と 正値性のもとで、標準化・逆確率重み付け・傾向スコアで 調整できるが、測っていない 交絡は 取り除けない。
差の 差法は 平行トレンドの 仮定のもとで、回帰不連続デザインは 閾値での 連続性のもとで、処置効果を 識別する。
演習問題
問題 8.1 ★ 購入率 5% の ページで、相対 10% の 改善( 5.5 5.5 5.5 %)を、両側 5%、検出力 80% で 検出する ための 1 群あたりの 人数を、系 8.7 で 求めよ( z 0.025 = 1.960 z_{0.025} = 1.960 z 0.025 = 1.960 、z 0.2 = 0.842 z_{0.2} = 0.842 z 0.2 = 0.842 と する)。相対 20% の 改善( 6 6 6 %)なら どうか。
解答
p B = 0.055 p_B = 0.055 p B = 0.055 の とき p ˉ = 0.0525 \bar{p} = 0.0525 p ˉ = 0.0525 、σ 0 = 2 ⋅ 0.0525 ⋅ 0.9475 = 0.31542 \sigma_0 = \sqrt{2 \cdot 0.0525 \cdot 0.9475} = 0.31542 σ 0 = 2 ⋅ 0.0525 ⋅ 0.9475 = 0.31542 、σ 1 = 0.05 ⋅ 0.95 + 0.055 ⋅ 0.945 = 0.31540 \sigma_1 = \sqrt{0.05 \cdot 0.95 + 0.055 \cdot 0.945} = 0.31540 σ 1 = 0.05 ⋅ 0.95 + 0.055 ⋅ 0.945 = 0.31540 で
n = ( 1.960 ⋅ 0.31542 + 0.842 ⋅ 0.31540 ) 2 0.005 2 = 31242.7 n = \frac{(1.960 \cdot 0.31542 + 0.842 \cdot 0.31540)^2}{0.005^2} = 31242.7 n = 0.00 5 2 ( 1.960 ⋅ 0.31542 + 0.842 ⋅ 0.31540 ) 2 = 31242.7
なので、1 群 31243 31243 31243 人である(z z z を 丸めずに 計算すると 31234 31234 31234 人)。p B = 0.06 p_B = 0.06 p B = 0.06 なら p ˉ = 0.055 \bar{p} = 0.055 p ˉ = 0.055 、σ 0 = 0.32241 \sigma_0 = 0.32241 σ 0 = 0.32241 、σ 1 = 0.32234 \sigma_1 = 0.32234 σ 1 = 0.32234 で n = 8160.1 n = 8160.1 n = 8160.1 、すな わち 8161 8161 8161 人(丸めずに 計算すると 8158 8158 8158 人)である。差が 2 倍に なると 人数は ほぼ 4 分の 1 に なる(分散が 少し 変わるので、ちょうど 4 分の 1 ではない)。購入率が 低い ページで 小さな 改善を 検出するには、非常に 多くの 訪問者が 必要である。
問題 8.2 ★ ★ 【この 計画は 妥当か 】新しい デザインの リスクを 抑える ため、訪問者の 10% だけを B に 割り付け、90% は A の ままに したい。(1) 総人数を N N N 、B に 割り付ける 割合を w w w 、両群の 標準偏差を 共通の σ \sigma σ と する とき、 Var ( Y ˉ B − Y ˉ A ) \operatorname{Var}(\bar{Y}_B - \bar{Y}_A) Var ( Y ˉ B − Y ˉ A ) を 求め、 w = 1 / 2 w = 1/2 w = 1/2 で 最小に なる ことを 示せ。(2) w = 0.1 w = 0.1 w = 0.1 では、w = 1 / 2 w = 1/2 w = 1/2 と 同じ 検出力を 得るのに 総人数が 何倍必要か。
解答
(1) Var ( Y ˉ B − Y ˉ A ) = σ 2 w N + σ 2 ( 1 − w ) N = σ 2 N w ( 1 − w ) \operatorname{Var}(\bar{Y}_B - \bar{Y}_A) = \frac{\sigma^2}{wN} + \frac{\sigma^2}{(1 - w)N} = \frac{\sigma^2}{Nw(1 - w)} Var ( Y ˉ B − Y ˉ A ) = w N σ 2 + ( 1 − w ) N σ 2 = N w ( 1 − w ) σ 2 。w ( 1 − w ) = 1 4 − ( w − 1 2 ) 2 ≤ 1 4 w(1 - w) = \frac{1}{4} - \left(w - \frac{1}{2}\right)^2 \leq \frac{1}{4} w ( 1 − w ) = 4 1 − ( w − 2 1 ) 2 ≤ 4 1 で、等号は w = 1 / 2 w = 1/2 w = 1/2 の ときに 限るので、分散は w = 1 / 2 w = 1/2 w = 1/2 で 最小に なる。
(2) 検出力は 差の 推定量の 分散で 決まる(命題 8.6 で s 0 = s 1 s_0 = s_1 s 0 = s 1 )。同じ 分散を 得るには N w ( 1 − w ) Nw(1 - w) N w ( 1 − w ) を 同じに すれば よいので、総人数は 1 / 4 0.1 ⋅ 0.9 = 2.78 \frac{1/4}{0.1 \cdot 0.9} = 2.78 0.1 ⋅ 0.9 1/4 = 2.78 倍必要で、実験期間も 約 2.8 倍に なる。リスクを 抑えたいなら、まず 少ない 割合で 重大な 不具合が ない ことを 確かめ、その 後 50:50 に 広げるのが 一般的である。ただし、割り付け比を 途中で 変えた 期間の データを 単純に 合算すると、時期に よって 購入率が 違う 場合に、時期が 交絡因子と なって シンプソンの パラドックスと 同じ 偏りが 生じる。期間ごとに 比べるか、比が 一定の 期間だけを 使う 必要が ある。
問題 8.3 ★ ★ (事前データに よる 分散の 削減)各ユーザーの 実験期間中の 売上を Y Y Y 、実験前の 同じ 長さの 期間の 売上を X X X とし、相関係数を ρ \rho ρ と する。(1) Var ( Y − θ X ) \operatorname{Var}(Y - \theta X) Var ( Y − θ X ) を 最小に する 定数 θ \theta θ と 最小値を 求めよ。(2) 無作為化した 実験で、両群に 共通の 定数 θ \theta θ を 使って Y − θ X Y - \theta X Y − θ X の 平均を 比べても、平均処置効果の 推定に 偏りが 生じない 理由を 説明せよ。(3) ρ = 0.6 \rho = 0.6 ρ = 0.6 の とき、例 8.8 の 売上の 実験の 必要人数は どうなるか。
解答
(1) Var ( Y − θ X ) = Var ( Y ) − 2 θ Cov ( X , Y ) + θ 2 Var ( X ) \operatorname{Var}(Y - \theta X) = \operatorname{Var}(Y) - 2\theta\operatorname{Cov}(X, Y) + \theta^2\operatorname{Var}(X) Var ( Y − θ X ) = Var ( Y ) − 2 θ Cov ( X , Y ) + θ 2 Var ( X ) は θ \theta θ の 2 次式で、θ ∗ = Cov ( X , Y ) / Var ( X ) \theta^{\ast} = \operatorname{Cov}(X, Y)/\operatorname{Var}(X) θ ∗ = Cov ( X , Y ) / Var ( X ) で 最小に なり、最小値は Var ( Y ) − Cov ( X , Y ) 2 / Var ( X ) = ( 1 − ρ 2 ) Var ( Y ) \operatorname{Var}(Y) - \operatorname{Cov}(X, Y)^2/\operatorname{Var}(X) = (1 - \rho^2)\operatorname{Var}(Y) Var ( Y ) − Cov ( X , Y ) 2 / Var ( X ) = ( 1 − ρ 2 ) Var ( Y ) である。
(2) X X X は 処置の 前に 決まっているので 処置の 影響を 受けず、無作為な 割り付け Z Z Z は X X X とも 独立である。よって E [ X ∣ Z = 1 ] = E [ X ∣ Z = 0 ] E[X \mid Z = 1] = E[X \mid Z = 0] E [ X ∣ Z = 1 ] = E [ X ∣ Z = 0 ] で、定理 8.4 より
E [ Y − θ X ∣ Z = 1 ] − E [ Y − θ X ∣ Z = 0 ] = E [ Y ∣ Z = 1 ] − E [ Y ∣ Z = 0 ] = τ A T E E[Y - \theta X \mid Z = 1] - E[Y - \theta X \mid Z = 0] = E[Y \mid Z = 1] - E[Y \mid Z = 0] = \tau_{\mathrm{ATE}} E [ Y − θ X ∣ Z = 1 ] − E [ Y − θ X ∣ Z = 0 ] = E [ Y ∣ Z = 1 ] − E [ Y ∣ Z = 0 ] = τ ATE
実際には θ \theta θ を 両群を 合わせた データから 推定する が、それに よる 偏りは 大標本では 無視できる。 X X X を 実験開始後に 測ると 処置の 影響を 受けうるので、必ず 処置前の 値を 使う。
(3) 必要な 人数は 分散に 比例するので、 14128 × ( 1 − 0.36 ) = 9042 14128 \times (1 - 0.36) = 9042 14128 × ( 1 − 0.36 ) = 9042 人に 減る(36% の 削減)。実験期間を 変えずに 検出力を 上げられるので、この 方法は 実務で 広く 使われている(CUPED と 呼ばれる)。
問題 8.4 ★ 8 個の 仮説の p p p 値が 0.0004 , 0.0021 , 0.0080 , 0.0130 , 0.0350 , 0.0360 , 0.2000 , 0.6000 0.0004, 0.0021, 0.0080, 0.0130, 0.0350, 0.0360, 0.2000, 0.6000 0.0004 , 0.0021 , 0.0080 , 0.0130 , 0.0350 , 0.0360 , 0.2000 , 0.6000 の とき、 α = 0.05 \alpha = 0.05 α = 0.05 で ボンフェローニ法・ ホルム法・ BH 法が 棄却する 仮説の 数を 求めよ。
解答
ボンフェローニ法: 閾値 0.05 / 8 = 0.00625 0.05/8 = 0.00625 0.05/8 = 0.00625 以下は 0.0004 , 0.0021 0.0004, 0.0021 0.0004 , 0.0021 の 2 個。
ホルム法: 閾値は 順に 0.05 / 8 = 0.00625 0.05/8 = 0.00625 0.05/8 = 0.00625 、0.05 / 7 = 0.00714 0.05/7 = 0.00714 0.05/7 = 0.00714 、0.05 / 6 = 0.00833 0.05/6 = 0.00833 0.05/6 = 0.00833 、0.05 / 5 = 0.0100 0.05/5 = 0.0100 0.05/5 = 0.0100 、…。0.0004 , 0.0021 , 0.0080 0.0004, 0.0021, 0.0080 0.0004 , 0.0021 , 0.0080 は 閾値以下で、 0.0130 > 0.0100 0.0130 > 0.0100 0.0130 > 0.0100 で 止まるので 3 個。
BH 法: 閾値は k ⋅ 0.00625 k \cdot 0.00625 k ⋅ 0.00625 (0.00625 , 0.0125 , 0.01875 , 0.025 , 0.03125 , 0.0375 , 0.04375 , 0.05 0.00625, 0.0125, 0.01875, 0.025, 0.03125, 0.0375, 0.04375, 0.05 0.00625 , 0.0125 , 0.01875 , 0.025 , 0.03125 , 0.0375 , 0.04375 , 0.05 )。p ( k ) p_{(k)} p ( k ) が 閾値以下と なる k k k は 1 , 2 , 3 , 4 , 6 1, 2, 3, 4, 6 1 , 2 , 3 , 4 , 6 で、最大は 6 6 6 なので 6 個を 棄却する。5 番目の 0.0350 0.0350 0.0350 は 自分の 閾値 0.03125 0.03125 0.03125 を 超えているが、6 番目が 条件を みたすので 一緒に 棄却される。BH 法は、条件を みたす 最大の k k k から 下を すべて 棄却する 方法である。
問題 8.5 ★ ★ (1) ホルム法が 棄却する 仮説は、BH 法でも すべて 棄却される ことを 示せ。(2) すべての 帰無仮説が 正しい( m 0 = m m_0 = m m 0 = m )とき、F D R = F W E R \mathrm{FDR} = \mathrm{FWER} FDR = FWER である ことを 示せ。(3) 「200 の 顧客セグメントの うち施策の 効果が ありそうな ものを 洗い 出し、次の 実験の 候補に する」場合と、「主要な 3 つの 指標の どれかが 改善したら 全ユーザーに 公開する」場合では、それぞれどちらの 誤りの 指標を 制御すべきか。
解答
(1) 1 ≤ k ≤ m 1 \leq k \leq m 1 ≤ k ≤ m に ついて k α m − α m − k + 1 = α ( k ( m − k + 1 ) − m ) m ( m − k + 1 ) = α ( k − 1 ) ( m − k ) m ( m − k + 1 ) ≥ 0 \frac{k\alpha}{m} - \frac{\alpha}{m - k + 1} = \frac{\alpha(k(m - k + 1) - m)}{m(m - k + 1)} = \frac{\alpha(k - 1)(m - k)}{m(m - k + 1)} \geq 0 m k α − m − k + 1 α = m ( m − k + 1 ) α ( k ( m − k + 1 ) − m ) = m ( m − k + 1 ) α ( k − 1 ) ( m − k ) ≥ 0 。ホルム法が K ≥ 1 K \geq 1 K ≥ 1 個を 棄却するなら p ( K ) ≤ α / ( m − K + 1 ) ≤ K α / m p_{(K)} \leq \alpha/(m - K + 1) \leq K\alpha/m p ( K ) ≤ α / ( m − K + 1 ) ≤ K α / m なので、BH 法の R R R は K K K 以上であり、BH 法は H ( 1 ) , … , H ( R ) H_{(1)}, \dots, H_{(R)} H ( 1 ) , … , H ( R ) 、したがって H ( 1 ) , … , H ( K ) H_{(1)}, \dots, H_{(K)} H ( 1 ) , … , H ( K ) を すべて 棄却する。
(2) m 0 = m m_0 = m m 0 = m なら 棄却は すべて 誤りなので V = R V = R V = R で、V / max ( R , 1 ) = 1 { R ≥ 1 } = 1 { V ≥ 1 } V/\max(R, 1) = \mathbf{1}_{\lbrace R \geq 1 \rbrace} = \mathbf{1}_{\lbrace V \geq 1 \rbrace} V / max ( R , 1 ) = 1 { R ≥ 1 } = 1 { V ≥ 1 } 。期待値を とれば F D R = F W E R \mathrm{FDR} = \mathrm{FWER} FDR = FWER 。特に、すべての 帰無仮説が 正しい ときには、BH 法も FWER を α \alpha α 以下に 保つ。
(3) 前者は 候補の 洗い 出しで、候補は 次の 実験で 確かめられるので、発見の うち一部が 誤りでも 許される。FDR を 制御する BH 法が 向いている。後者は 誤りが 一つでも あれば 誤った 公開に つながるので、FWER を 制御する ホルム法などを 使うべきである(そもそも 主要な 指標は 事前に 1 つに 決めて おくのが 望ましい)。
問題 8.6 ★ ★ 【この 分析の どこが 危ないか 】ある 担当者は A/B テストの 結果を 毎日 確認し、6 日目に p = 0.03 p = 0.03 p = 0.03 と なったので 実験を 止め、「5% 水準で 有意」と 報告した。(1) この 報告の 問題点を 説明せよ。(2) 最初から「最大 20 日、毎日の ぞく」と 決めていたなら、各日の 検定で どんな 棄却値を 使えば、全体の 第 1 種の 過誤を 5% に 抑えられるか。求め方を 説明せよ。
解答
(1) 止める 日を データを 見て 決めているので、報告された p p p 値は 名目どおりの 意味を もたない。効果が なくても、6 日間 毎日の ぞけば 一度でも 有意に なる 確率は 約 15%(正規近似で 計算機に より 求めた 値)、20 日まで 続ける つもりだったなら 約 25% である(8.5 節)。また、有意に なった 時点で 止めると、推定された 効果は 過大に なりやすい(勝者の 呪い)。
(2) 帰無仮説のもとで、毎日 同じ 人 数ずつ データが 増えるなら、 k k k 日目の z z z 統計量は 近似的に Z k = S k / k Z_k = S_k/\sqrt{k} Z k = S k / k (S k S_k S k は 独立な N ( 0 , 1 ) N(0, 1) N ( 0 , 1 ) の k k k 個の 和)と 表せる。この 正規分布の ランダムウォークを 計算機で 多数生成し、 M = max k ≤ 20 ∣ Z k ∣ M = \max_{k \leq 20}\lvert Z_k \rvert M = max k ≤ 20 ∣ Z k ∣ の 95% 点 c c c を 求めて、「 ∣ z ∣ > c \lvert z \rvert > c ∣ z ∣ > c と なった 最初の 日に 止めて 棄却する」と すればよい。計算すると c ≈ 2.67 c \approx 2.67 c ≈ 2.67 である(注意 8.16 の 群逐次デザイン)。あるいは、注意 8.16 の 尤度比の マルチンゲールを 使う。
問題 8.7 ★ ★ (シンプソンの パラドックスが 起きない 条件) 2 値の 結果 Y Y Y 、処置 Z Z Z 、層 S S S に ついて、層の 分布が 処置群と 対照群で 等しい(すべての s s s で P ( S = s ∣ Z = 1 ) = P ( S = s ∣ Z = 0 ) P(S = s \mid Z = 1) = P(S = s \mid Z = 0) P ( S = s ∣ Z = 1 ) = P ( S = s ∣ Z = 0 ) )と する。(1) P ( Y = 1 ∣ Z = 1 ) − P ( Y = 1 ∣ Z = 0 ) P(Y = 1 \mid Z = 1) - P(Y = 1 \mid Z = 0) P ( Y = 1 ∣ Z = 1 ) − P ( Y = 1 ∣ Z = 0 ) は、層ごとの 差 Δ s = P ( Y = 1 ∣ Z = 1 , S = s ) − P ( Y = 1 ∣ Z = 0 , S = s ) \Delta_s = P(Y = 1 \mid Z = 1, S = s) - P(Y = 1 \mid Z = 0, S = s) Δ s = P ( Y = 1 ∣ Z = 1 , S = s ) − P ( Y = 1 ∣ Z = 0 , S = s ) の 重み付き平均である ことを 示せ。(2) 無作為化実験では、母集団の 確率に ついて シンプソンの パラドックスが 起こらないのは なぜか。
解答
(1) w s = P ( S = s ∣ Z = 1 ) = P ( S = s ∣ Z = 0 ) w_s = P(S = s \mid Z = 1) = P(S = s \mid Z = 0) w s = P ( S = s ∣ Z = 1 ) = P ( S = s ∣ Z = 0 ) と おくと、条件付き確率の 性質より P ( Y = 1 ∣ Z = z ) = ∑ s P ( Y = 1 ∣ Z = z , S = s ) w s P(Y = 1 \mid Z = z) = \sum_s P(Y = 1 \mid Z = z, S = s)w_s P ( Y = 1 ∣ Z = z ) = ∑ s P ( Y = 1 ∣ Z = z , S = s ) w s (z = 0 , 1 z = 0, 1 z = 0 , 1 )なので、差は ∑ s w s Δ s \sum_s w_s\Delta_s ∑ s w s Δ s である。w s ≥ 0 w_s \geq 0 w s ≥ 0 、∑ s w s = 1 \sum_s w_s = 1 ∑ s w s = 1 だから、これは 重み付き平均である。特に、すべての Δ s \Delta_s Δ s が 正なら全体の 差も 正である。
(2) 層は 処置の 前に 決まっている 性質で、無作為な 割り付けは それと 独立なので、 P ( S = s ∣ Z = 1 ) = P ( S = s ) = P ( S = s ∣ Z = 0 ) P(S = s \mid Z = 1) = P(S = s) = P(S = s \mid Z = 0) P ( S = s ∣ Z = 1 ) = P ( S = s ) = P ( S = s ∣ Z = 0 ) と なり、(1) の 条件が みたされる。有限の 標本では 層の 割合が 偶然少しずれるので、小さな 逆転が 起こる ことは あるが、系統的には 起こらない。例 8.17 では、クーポンありの 1200 人の うち 1000 人が 新規顧客、クーポンなしでは 200 人で、この 条件が 大きく 崩れている。
問題 8.8 ★ ★ 例 8.17 の データで、傾向スコア e ( x ) e(x) e ( x ) を 層ごとの クーポンありの 割合で 推定し、定理 8.18 の 逆確率重み付けの 式(期待値を 標本平均で 置き換えた もの)で E [ Y ( 1 ) ] E[Y(1)] E [ Y ( 1 )] 、E [ Y ( 0 ) ] E[Y(0)] E [ Y ( 0 )] を 推定せよ。標準化に よる 推定値と 一致する ことを 確かめ、一般に 一致する 理由を 説明せよ。
解答
e ^ ( 新規 ) = 1000 / 1200 = 5 / 6 \hat{e}(\text{新規}) = 1000/1200 = 5/6 e ^ ( 新規 ) = 1000/1200 = 5/6 、e ^ ( 既存 ) = 200 / 1200 = 1 / 6 \hat{e}(\text{既存}) = 200/1200 = 1/6 e ^ ( 既存 ) = 200/1200 = 1/6 、総数 N = 2400 N = 2400 N = 2400 である。
E ^ [ Y ( 1 ) ] = 1 2400 ( 120 5 / 6 + 90 1 / 6 ) = 144 + 540 2400 = 0.285 , E ^ [ Y ( 0 ) ] = 1 2400 ( 20 1 / 6 + 400 5 / 6 ) = 120 + 480 2400 = 0.25 \hat{E}[Y(1)] = \frac{1}{2400}\left(\frac{120}{5/6} + \frac{90}{1/6}\right) = \frac{144 + 540}{2400} = 0.285, \qquad \hat{E}[Y(0)] = \frac{1}{2400}\left(\frac{20}{1/6} + \frac{400}{5/6}\right) = \frac{120 + 480}{2400} = 0.25 E ^ [ Y ( 1 )] = 2400 1 ( 5/6 120 + 1/6 90 ) = 2400 144 + 540 = 0.285 , E ^ [ Y ( 0 )] = 2400 1 ( 1/6 20 + 5/6 400 ) = 2400 120 + 480 = 0.25
で、標準化に よる 値 0.285 0.285 0.285 、0.25 0.25 0.25 と 一致し、効果の 推定値は 0.035 0.035 0.035 である。一般に、層 x x x の 人数を N x N_x N x 、そのうち処置群の 人数を N 1 x N_{1x} N 1 x 、処置群の 平均を Y ˉ 1 x \bar{Y}_{1x} Y ˉ 1 x と すると、 e ^ ( x ) = N 1 x / N x \hat{e}(x) = N_{1x}/N_x e ^ ( x ) = N 1 x / N x なので、層 x x x の 処置群の 重み付きの 和は 1 N ∑ Y i ⋅ N x N 1 x = N x N Y ˉ 1 x \frac{1}{N}\sum Y_i \cdot \frac{N_x}{N_{1x}} = \frac{N_x}{N}\bar{Y}_{1x} N 1 ∑ Y i ⋅ N 1 x N x = N N x Y ˉ 1 x と なる。これは 層 x x x の 割合 N x / N N_x/N N x / N で 処置群の 平均を 重み付けした 標準化の 項その ものである。対照群も 同様である。