Lemma

応用数理·目安:学部 2〜4 年

機械学習の数理

経験リスク最小化、線形モデルと正則化、主成分分析、カーネル法と SVM、ニューラルネットワークと誤差逆伝播、学習理論(VC 次元)、EM アルゴリズムと生成モデル

章
7
目安
60〜80 時間
演習
47 問

まだ始めていません

前提となる科目22統計学23最適化

目次

  1. 1学習の枠組み教師あり学習と教師なし学習、損失とリスク、ベイズ最適な予測(条件付き期待値とベイズ分類器)、経験リスク最小化と近似誤差・推定誤差、バイアス–バリアンス分解、過学習と正則化、訓練・検証・テストと交差検証、データ漏洩。8〜10 時間 · 演習 6 問
  2. 2線形モデル線形回帰の幾何(射影)と多重共線性、リッジ回帰と特異値分解による縮小、ラッソとソフト閾値、ロジスティック回帰とソフトマックス回帰(勾配・ヘッセ行列・凸性)、特徴量の標準化、混同行列・ROC 曲線と AUC の確率的解釈。9〜12 時間 · 演習 6 問
  3. 3主成分分析と次元削減分散最大化としての PCA(レイリー商)、特異値分解とエッカート–ヤングの定理、寄与率と次元の選び方、白色化、推薦システムと行列分解、kk 平均法、ジョンソン–リンデンシュトラウスの補題。8〜10 時間 · 演習 7 問
  4. 4カーネル法とサポートベクターマシンマージン最大化、ハードマージン・ソフトマージン SVM と双対問題、サポートベクトルと相補性条件、カーネルトリック、正定値カーネル、再生核ヒルベルト空間、表現定理、カーネルリッジ回帰、ガウスカーネル。7〜10 時間 · 演習 7 問
  5. 5ニューラルネットワーク多層パーセプトロンと活性化関数、誤差逆伝播法、計算グラフと自動微分(前向き・後ろ向きモード)、勾配消失・爆発、初期化と正規化、万能近似定理、畳み込みニューラルネットワーク、注意機構とトランスフォーマー。10〜13 時間 · 演習 6 問
  6. 6学習理論PAC 学習、ヘフディングの不等式、有限仮説集合の汎化誤差の上界、VC 次元とサウアーの補題、ラデマッハ複雑度、ノーフリーランチ定理、過剰パラメータ化と二重降下。9〜12 時間 · 演習 8 問
  7. 7確率モデルと生成モデル最尤推定と KL ダイバージェンス、エントロピーと交差エントロピー、混合ガウスモデルと EM アルゴリズム、変分推論と ELBO、隠れマルコフモデル、変分オートエンコーダ・拡散モデル・大規模言語モデルの確率モデルとしての見方。11〜14 時間 · 演習 7 問

科目の概要

迷惑メールの判定、需要の予測、画像の分類、文章の生成――機械学習は、データから予測の規則を作る技術として、仕事の多くの場面に入り込んでいる。ライブラリを使えば数行で学習ができる。しかし「このモデルはなぜ学習できるのか」「この評価は信用できるのか」「うまくいかないのはなぜか」に答えるには、モデルの式を読み、その背後にある数学を理解している必要がある。

この科目の目標は、モデルの式を自分で読み、なぜ学習できるのかを説明できるようになることである。扱うのは流行の手法の使い方ではなく、手法が入れ替わっても長く通用する数学である:損失とリスクによる問題の定式化、射影と特異値分解、凸性と双対性、正定値カーネルとヒルベルト空間、連鎖律と自動微分、確率の不等式による汎化誤差の評価、最尤推定と KL ダイバージェンス。新しい手法の多くは、これらの組み合わせとして読める。各章には、その数学が実際にどう使われ、どこで間違えやすいかを書いた「実務では」の囲みと、「この分析の結論は正しいか」を問う演習を置いている。

機械学習の数理は三つの科目の上に立つ。22 統計学 からは、データを確率変数の実現値とみる見方と、最尤推定・回帰の理論を受け継ぐ。統計学が主に「データを生んだしくみ(パラメータ)について何が言えるか」を問うのに対し、機械学習は「新しいデータをどれだけよく予測できるか」に重心を置くが、数学の道具はほぼ共通である。23 最適化 からは、学習を損失関数の最小化として解く方法(凸性・双対性・勾配法)を受け継ぐ。02 線形代数 はデータを行列として扱うための言葉であり、特異値分解はほとんどの章に現れる。

この科目では次の内容を学ぶ。

  • 学習の枠組み:損失・リスク・経験リスク最小化、ベイズ最適な予測、バイアス–バリアンス分解、交差検証とデータ漏洩(第1章)
  • 線形モデル:最小二乗法の幾何、リッジ回帰とラッソ、ロジスティック回帰とソフトマックス回帰、評価指標と AUC(第2章)
  • 主成分分析と次元削減:特異値分解とエッカート–ヤングの定理、行列分解、kk 平均法(第3章)
  • カーネル法とサポートベクターマシン:マージン最大化と双対問題、正定値カーネル、表現定理(第4章)
  • ニューラルネットワーク:誤差逆伝播法と自動微分、万能近似定理、畳み込みと注意機構(第5章)
  • 学習理論:PAC 学習、集中不等式、VC 次元、過剰パラメータ化と二重降下(第6章)
  • 確率モデルと生成モデル:KL ダイバージェンス、EM アルゴリズム、変分推論、生成モデルの確率モデルとしての見方(第7章)

測度論は前提にしない。確率は 22 統計学 と同じく離散分布と密度をもつ分布の範囲で扱い、測度論的な厳密さが必要な箇所(条件付き期待値の一般論など)では、11 確率論 で厳密に扱うと明記して先に進む。

前提知識

  • 線形代数:内積・直交射影・最小二乗法・スペクトル定理(02-linear-algebra 第7章)、正定値性・特異値分解・擬逆行列・エッカート–ヤングの定理(第8章)。ほぼすべての章で使う。
  • 微分積分:多変数の微分・連鎖律・ヘッセ行列(01-calculus 第7章)。第2章と第5章で特に使う。1 変数の凸関数(第4章 4.7 節)も使う。
  • 統計学:確率分布・期待値・条件付き分布・多変量正規分布(22-statistics 第1章)、最尤推定と推定量の偏り・分散(第3章)、線形回帰(第5章)。
  • 最適化:凸集合と凸関数・劣勾配(23-optimization 第2章)、KKT 条件と双対性(第4章。本科目の第4章で使う)、勾配法と近接勾配法(第5章)。
  • 測度論(06 測度と積分・11 確率論)は前提にしない。

この科目の記法

NOTATION.md と 22 統計学 の記法に加えて、次の記法を使う。

記号 意味
(X,Y)∼P(X, Y) \sim P 入力と出力の組(確率変数)とその分布(データ生成分布)
S=((x1,y1),…,(xn,yn))S = ((x_1, y_1), \dots, (x_n, y_n)) 訓練データ(nn は標本サイズ。入力が Rd\mathbb{R}^d のベクトルなら dd は特徴量の数)
ℓ(y,y^)\ell(y, \hat{y}) 損失関数(正解が yy のときに y^\hat{y} と予測した損失)
R(f)R(f), R^S(f)\hat{R}_S(f) リスク(汎化誤差)E[ℓ(Y,f(X))]E[\ell(Y, f(X))] と経験リスク(訓練誤差)1n∑iℓ(yi,f(xi))\frac{1}{n}\sum_i \ell(y_i, f(x_i))
F\mathcal{F} 仮説集合(モデル)
ESE_S 訓練データ SS についての期待値(どの確率変数について期待値をとるかを明示するとき)
計画行列 XX 第 ii 行が xi⊤x_i^{\top} の n×dn \times d 行列(確率変数の XX とは文脈で区別する)
∥w∥1\lVert w \rVert_1 ℓ1\ell^1 ノルム ∑j∣wj∣\sum_j \lvert w_j \rvert
σ(t)=1/(1+e−t)\sigma(t) = 1/(1 + e^{-t}) ロジスティック関数(シグモイド関数)
1{⋯ }\mathbf{1}\lbrace \cdots \rbrace 条件が成り立てば 11、成り立たなければ 00
1\mathbf{1} 成分がすべて 11 のベクトル
A⊤A^{\top} 転置(02 線形代数 の tA{}^tA と同じもの)

ベクトルは太字にせず列ベクトルとし、x∈Rdx \in \mathbb{R}^d のように書く。

到達目標

  • 損失・リスク・経験リスクを区別し、二乗損失では条件付き期待値が、0-1 損失では事後確率が最大のクラスを選ぶ分類器がベイズ最適であることを証明できる
  • バイアス–バリアンス分解を、どの期待値をとるかを明示して証明し、過学習と正則化を説明できる
  • 交差検証が何を推定しているかを説明し、データ漏洩を見つけて正しい評価の手順を組める
  • リッジ回帰の効果を特異値分解による縮小で、ラッソのスパース性をソフト閾値で説明できる
  • ロジスティック回帰・ソフトマックス回帰の損失の勾配とヘッセ行列を計算して凸性を証明し、AUC の確率的解釈を証明できる
  • 主成分分析を分散最大化と低ランク近似(エッカート–ヤングの定理)の両面から導き、kk 平均法の目的関数が単調に減少することを示せる
  • ソフトマージン SVM の双対問題を導いてサポートベクトルを相補性条件で説明し、正定値カーネルを構成して表現定理を証明できる
  • 誤差逆伝播法を連鎖律から導き、自動微分の前向きモードと後ろ向きモードの計算量の違いを説明できる。万能近似定理の主張と意味を説明できる
  • ヘフディングの不等式から有限仮説集合の汎化誤差の上界を導き、VC 次元を計算できる
  • 最尤推定と KL ダイバージェンスの関係を説明し、EM アルゴリズムで対数尤度が単調に増加することを証明し、ELBO を導ける

学習時間の目安と進め方

  • 全体で 60〜80 時間(1 章あたり演習を含めて 8〜12 時間)が目安である。前提とする 22・23 の章に慣れていれば短くなる。
  • 第1章と第2章が幹であり、最初に読む。第3章(主成分分析)・第4章(カーネル法)・第5章(ニューラルネットワーク)は第2章のあとならどの順でもよい。第6章(学習理論)は第1章の経験リスク最小化を数学的に深める章であり、第7章(確率モデル)は 22 第3章 の最尤推定を出発点にする。
  • 式を読んだら、小さな数値例で確かめる習慣をつける。各章の数値例や Python の例(NumPy だけを使う)を実際に動かし、数値を変えてみるとよい。勾配の公式は差分近似 (f(w+hek)−f(w−hek))/(2h)(f(w + he_k) - f(w - he_k))/(2h) と比べて確かめられる。乱数の種は numpy.random.default_rng(0) のように固定する。
  • 「実務では」の囲みと「この分析の結論は正しいか」を問う演習は、仕事でのつまずきを先回りするためのものである。機械学習の失敗の多くは、計算の誤りではなく、評価の手順(データ漏洩、テストデータの使い回し)や仮定(訓練時と運用時でデータの分布が同じであること)の見落としから生じる。
  • 近年の話題(二重降下、大規模言語モデル、拡散モデルなど)は、確立した事実と、経験的な観察や仮説とを区別して読む。本科目では確かなことだけを書き、その区別を明記している。

参考文献

日本語

  • 金森敬文『統計的学習理論』(講談社)— 汎化誤差の評価を中心に、統計的学習理論を日本語で体系的に扱う。第1・6章の先を学ぶために。
  • 福水健次『カーネル法入門』(朝倉書店)— 正定値カーネルと再生核ヒルベルト空間の理論から、カーネル法によるデータ解析までを扱う。第4章の参照先。
  • 岡谷貴之『深層学習』(講談社)— 深層学習の主要な手法と考え方を簡潔にまとめた教科書。第5章の参照先。

英語

  • T. Hastie, R. Tibshirani, J. Friedman, The Elements of Statistical Learning (Springer) — 統計学の立場から、線形回帰と正則化(リッジ・ラッソ)、モデルの評価と選択(バイアス–バリアンス、交差検証)、カーネル法、ブースティングなどを幅広く扱う。第1・2章の主な参照先。
  • C. M. Bishop, Pattern Recognition and Machine Learning (Springer)(邦訳『パターン認識と機械学習』丸善出版)— ベイズ的な見方を軸に、線形モデル・ニューラルネットワーク・カーネル法・混合モデルと EM アルゴリズム・変分推論・隠れマルコフモデルまでを体系的に扱う。第2・4・7章の参照先。
  • S. Shalev-Shwartz, S. Ben-David, Understanding Machine Learning: From Theory to Algorithms (Cambridge University Press) — PAC 学習・VC 次元・ノーフリーランチ定理から、凸学習・確率的勾配降下法・カーネル法・ニューラルネットワークまで、学習理論を証明つきで扱う。第1・6章の主な参照先。
  • M. Mohri, A. Rostamizadeh, A. Talwalkar, Foundations of Machine Learning (MIT Press) — ラデマッハ複雑度と VC 次元による汎化誤差の上界、カーネル法、ブースティングなどを理論的に扱う。第4・6章の参照先。
  • I. Goodfellow, Y. Bengio, A. Courville, Deep Learning (MIT Press) — 深層学習の標準的な教科書。前半に線形代数・確率・数値計算の準備がある。第5章の参照先。
  • K. P. Murphy, Probabilistic Machine Learning: An Introduction (MIT Press) — 確率モデルの立場から機械学習全体を見渡す教科書。第2・7章の参照先。
  • M. P. Deisenroth, A. A. Faisal, C. S. Ong, Mathematics for Machine Learning (Cambridge University Press) — 機械学習に必要な線形代数・解析・確率・最適化をまとめ、線形回帰・主成分分析・混合ガウスモデル・サポートベクターマシンに応用する。前提の復習に向く。

次に学ぶもの

  • 10 関数解析 — 第4章の再生核ヒルベルト空間は、各点での値をとる線形汎関数が連続であるような関数のヒルベルト空間であり、再生核はリースの表現定理(第2章 定理 2.10)から得られる。連続な正定値カーネルの固有関数展開(マーサーの定理)は、コンパクト自己共役作用素のスペクトル定理(第5章 定理 5.17)を積分作用素に使って得られる。
  • 11 確率論 — 第1章のベイズ最適な予測(二乗損失)は、条件付き期待値が L2L^2 の直交射影であること(第5章 定理 5.3)の特別な場合である。大数の法則(第2章)は経験リスクがリスクに近づくことの根拠であり、第6章の集中不等式はその定量版にあたる。
  • 18 偏微分方程式論 — 拡散モデル(第7章)の前向き過程(データに少しずつ雑音を加える過程)は、連続時間で見るとオルンシュタイン–ウーレンベック過程のような確率微分方程式で書ける(11 確率論 第7章 例 7.20)。その分布の密度の時間変化は、熱方程式にドリフトの項を加えた放物型の偏微分方程式(フォッカー–プランク方程式)に従う。熱方程式・放物型方程式と半群の理論は 18 第5章 で扱う。
  • 22 統計学 — 予測がよく当たることと、介入の効果がわかることは別である。予測モデルの結果を施策の判断に使うには、第8章 の因果推論(潜在結果モデル・無作為化)が必要になる。ベイズ統計とマルコフ連鎖モンテカルロ法(第7章)は、第7章の確率モデルを推論するもう一つの道具である。
  • 23 最適化 — ニュートン法と準ニュートン法(第6章)、確率的勾配降下法と Adam(第7章)は、大規模な学習の計算を支える。