科目の 概要
学習の 枠組み:損失・リスク・経験リスク最小化、ベイズ最適な 予測、バイアス–バリアンス分解、交差検証と データ漏洩(第1章) 線形モデル:最小二乗法の 幾何、リッジ回帰と ラッソ、ロジスティック回帰と ソフトマックス回帰、評価指標と AUC(第2章) 主成分分析と 平均法(第3章)次元削減: 特異値分解と エッカート–ヤングの 定理、行列分解、 カーネル法と サポートベクターマシン:マージン最大化と 双対問題、正定値カーネル、表現定理(第4章) ニューラルネットワーク:誤差逆伝播法と 自動微分、万能近似定理、畳み込みと 注意機構(第5章) 学習理論:PAC 学習、集中 不等式、VC 次元、過剰パラメータ化と 二重降下(第6章) 確率モデルと 生成モデル:KL ダイバージェンス、EM アルゴリズム、変分推論、生成モデルの 確率モデルと しての 見方(第7章)
前提知識
線形代数:内積・直交射影・ 02-linear-algebra 第7章最小二乗法・ スペクトル定理( )、正定値性・ 第8章特異値分解・擬逆行列・エッカート–ヤングの 定理( )。ほぼすべての 章で 使う。 微分 01-calculus 第7章積分:多変数の 微分・連鎖律・ヘッセ行列( )。第2章と 第4章第5章で 特に 使う。1 変数の 凸関数( 4.7 節)も 使う。 統計学:確率分布・期待値・条件付き分布・ 22-statistics 第1章多変量正規分布( )、最尤推定と 第3章)、線形回帰(第5章)。推定量の 偏り・分散( 最適化:凸集合と 23-optimization 第2章凸関数・劣勾配( )、KKT 条件と 第4章双対性( 。本科目の 第5章)。第4章で 使う)、勾配法と 近接勾配法( - 測度論(
06 測度と ・11 確率論積分 )は 前提に しない。
この 科目の 記法
NOTATION.md と 22 統計学
| 記号 | 意味 |
|---|---|
| 訓練データ( |
|
| 損失関数(正解が |
|
| , | リスク(汎化誤差) |
| 仮説集合(モデル) | |
| 訓練データ |
|
| 計画行列 | 第 行が の 行列(確率変数の |
| ノルム | |
| ロジスティック関数(シグモイド関数) | |
| 転置(02 線形代数 の |
到達目標
損失・リスク・経験リスクを 区別し、二乗損失では 条件付き期待値が、0-1 損失では 事後確率が 最大の クラスを 選ぶ分類器が ベイズ最適である ことを 証明できる バイアス–バリアンス分解を、どの 期待値を とるかを 明示して 証明し、過学習と 正則化を 説明できる 交差検証が 何を 推定しているかを 説明し、データ漏洩を 見つけて 正しい 評価の 手順を 組める リッジ回帰の 効果を 特異値分解に よる 縮小で、ラッソの スパース性を ソフト閾値で 説明できる ロジスティック回帰・ソフトマックス回帰の 損失の 勾配と ヘッセ行列を 計算して 凸性を 証明し、AUC の 確率的解釈を 証明できる 主成分分析を 分散最大化と 低ランク近似(エッカート–ヤングの 定理)の 両面から 導き、 平均法の 目的関数が 単調に 減少する ことを 示せる ソフトマージン SVM の 双対問題を 導いて サポートベクトルを 相補性条件で 説明し、正定値カーネルを 構成して 表現定理を 証明できる 誤差逆伝播法を 連鎖律から 導き、自動微分の 前向きモードと 後ろ 向きモードの 計算量の 違いを 説明できる。万能近似定理の 主張と 意味を 説明できる ヘフディングの 不等式から 有限仮説集合の 汎化誤差の 上界を 導き、VC 次元を 計算できる 最尤推定と KL ダイバージェンスの 関係を 説明し、EM アルゴリズムで 対数尤度が 単調に 増加する ことを 証明し、ELBO を 導ける
学習時間の 目安と 進め方
全体で 60〜80 時間(1 章あたり演習を 含めて 8〜12 時間)が 目安である。前提と する 22・23 の 章に 慣れていれば 短くなる。 第1章と 22 第3章第2章が 幹であり、最初に 読む。第3章(主成分分析)・第4章(カーネル法)・第5章(ニューラルネットワーク)は 第2章の あとならどの 順でも よい。第6章(学習理論)は 第1章の 経験リスク最小化を 数学的に 深める 章であり、第7章(確率モデル)は の 最尤推定を 出発点に する。 式を 読んだら、小さな 数値例で 確かめる 習慣を つける。各章の 数値例や Python の 例(NumPy だけを 使う)を 実際に 動かし、数値を 変えてみると よい。勾配の 公式は 差分近似 と 比べて 確かめられる。乱数の 種は numpy.random.default_rng(0)のように 固定する。 「実務では」の 囲みと「この 分析の 結論は 正しいか」を 問う 演習は、仕事での つまずきを 先回りする ための ものである。機械学習の 失敗の 多くは、計算の 誤りではなく、評価の 手順(データ漏洩、テストデータの 使い回し)や 仮定(訓練時と 運用時で データの 分布が 同じである こと)の 見落としから 生じる。 近年の 話題(二重降下、大規模言語モデル、拡散モデルなど)は、確立した 事実と、経験的な 観察や 仮説とを 区別して 読む。本科目では 確かな ことだけを 書き、その 区別を 明記している。
参考文献
日本語
金森敬文『統計的学習理論』(講談社)— 汎化誤差の 評価を 中心に、統計的学習理論を 日本語で 体系的に 扱う。第1・6章の 先を 学ぶために。 福水健次『カーネル法入門』(朝倉書店)— 正定値カーネルと 再生核ヒルベルト空間の 理論から、カーネル法に よる データ解析までを 扱う。第4章の 参照先。 岡谷貴之『深層学習』(講談社)— 深層学習の 主要な 手法と 考え方を 簡潔に まとめた 教科書。第5章の 参照先。
英語
- T. Hastie, R. Tibshirani, J. Friedman, The Elements of Statistical Learning
(Springer) — 統計学の 立場から、線形回帰と 正則化(リッジ・ラッソ)、モデルの 評価と 選択(バイアス–バリアンス、交差検証)、カーネル法、ブースティングなどを 幅広く 扱う。第1・2章の 主な 参照先。 - C. M. Bishop, Pattern Recognition and Machine Learning
(Springer)(邦訳『パターン認識と 機械学習』丸善出版)— ベイズ的な 見方を 軸に、線形モデル・ニューラルネットワーク・カーネル法・ 混合モデルと EM アルゴリズム・変分推論・隠れマルコフモデルまでを 体系的に 扱う。第2・4・7章の 参照先。 - S. Shalev-Shwartz, S. Ben-David, Understanding Machine Learning: From Theory to Algorithms
(Cambridge University Press) — PAC 学習・VC 次元・ノーフリーランチ定理から、凸学習・確率的勾配降下法・ カーネル法・ ニューラルネットワークまで、学習理論を 証明つきで 扱う。第1・6章の 主な 参照先。 - M. Mohri, A. Rostamizadeh, A. Talwalkar, Foundations of Machine Learning
(MIT Press) — ラデマッハ複雑度と VC 次元に よる 汎化誤差の 上界、カーネル法、ブースティングなどを 理論的に 扱う。第4・6章の 参照先。 - I. Goodfellow, Y. Bengio, A. Courville, Deep Learning
(MIT Press) — 深層学習の 標準的な 教科書。前半に 線形代数・確率・数値計算の 準備が ある。第5章の 参照先。 - K. P. Murphy, Probabilistic Machine Learning: An Introduction
(MIT Press) — 確率モデルの 立場から 機械学習全体を 見渡す教科書。第2・7章の 参照先。 - M. P. Deisenroth, A. A. Faisal, C. S. Ong, Mathematics for Machine Learning
(Cambridge University Press) — 機械学習に 必要な 線形代数・解析・確率・ 最適化を まとめ、線形回帰・主成分分析・混合ガウスモデル・サポートベクターマシンに 応用する。前提の 復習に 向く。
次に 学ぶもの
- 10 関数解析
— 第4章の 第2章再生核ヒルベルト空間は、各点での 値を とる 線形汎関数が 連続であるような 関数の ヒルベルト空間であり、再生核は リースの 表現定理( 定理 2.10)から 第5章得られる。連続な 正定値カーネルの 固有関数展開(マーサーの 定理)は、コンパクト自己共役作用素の スペクトル定理( 定理 5.17)を 積分作用素に 使って 得られる。 - 11 確率論
— 第1章の ベイズ最適な 予測(二乗損失)は、条件付き期待値が の 第5章直交射影である こと( 定理 5.3)の 第2章特別な 場合である。大数の 法則( )は 経験リスクが リスクに 近づく ことの 根拠であり、第6章の 集中 不等式は その 定量版に あたる。 - 18 偏微分方程式論
— 拡散モデル(第7章)の 11 確率論 第7章前向き過程(データに 少しずつ雑音を 加える 過程)は、連続時間で 見ると オルンシュタイン–ウーレンベック過程のような 確率微分方程式で 書ける( 例 7.20)。その 18 第5章分布の 密度の 時間変化は、熱方程式に ドリフトの 項を 加えた 放物型の 偏微分方程式(フォッカー–プランク方程式)に 従う。熱方程式・放物型方程式と 半群の 理論は で 扱う。 - 22 統計学
— 予測が 第8章よく 当たる ことと、介入の 効果が わかる ことは 別である。予測モデルの 結果を 施策の 判断に 使うには、 の 第7章因果推論(潜在結果 モデル・ 無作為化)が 必要に なる。ベイズ統計と マルコフ連鎖モンテカルロ法( )は、第7章の 確率モデルを 推論する もう 一つの 道具である。 - 23 最適化
— ニュートン法と 第6章)、確率的勾配降下法と Adam(第7章準ニュートン法( )は、大規模な 学習の 計算を 支える。