Lemma

第1章最適化問題とは

目安 7〜9 時間定理など 7演習 6 問
ここまでの道

この章の目標

  • 生産計画・輸送・ポートフォリオ・最小二乗・ロジスティック回帰・最短路を、決定変数・目的関数・制約の形に定式化できる
  • 最適値と最適解を区別し、最適値が有限でも最適解が存在しない例を挙げられる
  • ワイエルシュトラスの定理と強圧性から最小点の存在を証明し、連続性・閉集合・強圧性の仮定が外れると何が起こるかを説明できる
  • 局所最適と大域最適を区別し、制約なし問題の 1 次・2 次の必要条件と 2 次の十分条件を証明して使える(半正定値と正定値の違いを含めて)
  • 凸性が「局所最適なら大域最適」を保証することを知り、問題が凸かどうかを見分けられる

前提:01-calculus 第7章(勾配・ヘッセ行列・テイラーの定理・コンパクト集合)、02-linear-algebra 第8章(正定値性)。例 1.5・例 1.22 では 02-linear-algebra 第7章 の最小二乗法を使う。コンパクト性の一般論は 03-topology 第5章 にある。

利益を最大にするには、2 種類の製品をそれぞれ何個作ればよいか。輸送費を最小にするには、どの倉庫からどの店舗へどれだけ運べばよいか。「この顧客は買うか」を予測するモデルの係数は、どう決めればよいか。見かけは違うが、これらはすべて「制約 x∈Xx \in X のもとで、目的関数 f(x)f(x) を最小(または最大)にする xx を求めよ」という形に書ける。このような問題を最適化問題 (optimization problem) という。

数学が答えるべき問いは、(1) 最良の選択は存在するか、(2) 候補が最良であることをどう確かめるか、(3) どう計算するか、の三つである。本章では定式化と (1)・(2) の基本を扱う。(3) は第3章・第5章〜第7章、(2) を強める双対性は第3章・第4章で扱う。一般には、近くのどの点よりもよい点(局所最適解)が全体で最良(大域最適解)とは限らない。この溝を埋める性質が凸性で、第2章以降の中心になる。

ベクトルは縦ベクトルとし、転置を A⊤A^{\top} で表す(02-linear-algebra の tA{}^tA と同じ)。⟨x,y⟩=x⊤y\langle x, y \rangle = x^{\top}y は標準内積、∥x∥\lVert x \rVert はユークリッドノルムで、x≥0x \geq 0 は各成分が 00 以上であることを表す。

1.1 最適化問題の形

定義 1.1(最適化問題)集合 X⊂RnX \subset \mathbb{R}^n と関数 f ⁣:X→Rf\colon X \to \mathbb{R} について、ff を XX 上で最小にする問題を

minimizef(x)subject tox∈X\text{minimize} \quad f(x) \qquad \text{subject to} \quad x \in X

と書く。xx を決定変数 (decision variable)、ff を目的関数 (objective function)、XX を実行可能領域 (feasible region)、XX の元を実行可能解 (feasible solution) という。p∗=inf⁡x∈Xf(x)∈[−∞,+∞]p^{\ast} = \inf_{x \in X} f(x) \in [-\infty, +\infty] を最適値 (optimal value) といい(X=∅X = \emptyset なら p∗=+∞p^{\ast} = +\infty とする)、f(x∗)=p∗f(x^{\ast}) = p^{\ast} となる x∗∈Xx^{\ast} \in X を最適解 (optimal solution) または大域最小点という。最適解の全体を argmin⁡x∈Xf(x)\operatorname{argmin}_{x \in X} f(x) と書く。X=∅X = \emptyset のとき実行不能 (infeasible)、p∗=−∞p^{\ast} = -\infty のとき非有界 (unbounded) であるという。

subject to(s.t.)は「という条件のもとで」の意味である。XX は多くの場合、不等式制約 gi(x)≤0g_i(x) \leq 0 と等式制約 hj(x)=0h_j(x) = 0 で与えられる。X=RnX = \mathbb{R}^n(または開集合)のとき制約なし問題 (unconstrained problem) という。最大化は −f-f の最小化として扱う。最適値は常に定まるが、最適解は存在するとは限らない(X=RX = \mathbb{R}, f(x)=exf(x) = e^{x} なら p∗=0p^{\ast} = 0 だが、ex=0e^{x} = 0 となる xx はない)。

1.2 定式化の例

定式化とは、現実の問題から「何を決めるか(決定変数)」「何をよくしたいか(目的関数)」「何を守るべきか(制約)」を取り出して式にすることである。

例 1.2(生産計画)製品 A, B の 1 個あたりの利益は 4 万円、3 万円である。A を 1 個作るには機械 2 時間・作業員 1 時間、B には機械 1 時間・作業員 3 時間が必要で、1 日に使えるのは機械 10 時間、作業員 15 時間までとする。1 日の生産量を x1,x2x_1, x_2(分割できる量とみなす)とすると

maximize4x1+3x2subject to2x1+x2≤10,x1+3x2≤15,x1,x2≥0\text{maximize} \quad 4x_1 + 3x_2 \qquad \text{subject to} \quad 2x_1 + x_2 \leq 10, \quad x_1 + 3x_2 \leq 15, \quad x_1, x_2 \geq 0

である。目的関数も制約も一次式なので線形計画問題 (linear programming problem, LP) という。実行可能領域は頂点 (0,0)(0, 0), (5,0)(5, 0), (3,4)(3, 4), (0,5)(0, 5) の四角形で、頂点での値は 0,20,24,150, 20, 24, 15 である。(3,4)(3, 4) が最適であることは、次のように確かめられる:任意の実行可能解について

4x1+3x2=95(2x1+x2)+25(x1+3x2)≤95⋅10+25⋅15=244x_1 + 3x_2 = \frac{9}{5}(2x_1 + x_2) + \frac{2}{5}(x_1 + 3x_2) \leq \frac{9}{5} \cdot 10 + \frac{2}{5} \cdot 15 = 24

で、(3,4)(3, 4) で等号が成り立つ。係数 9/59/5, 2/52/5 は「機械・作業員の時間を 1 時間増やすと、(変化が小さい範囲で)最大利益がいくら増えるか」を表す。このような最適性の証明書を体系的に作るのが第3章の双対問題であり、係数はシャドウプライスと呼ばれる。

例 1.3(輸送問題)倉庫 i=1,…,mi = 1, \dots, m の在庫を sis_i、店舗 j=1,…,nj = 1, \dots, n の需要を djd_j、倉庫 ii から店舗 jj への 1 単位あたりの輸送費を cijc_{ij} とする。輸送量 xijx_{ij} を決定変数として

minimize∑i,jcijxijsubject to∑jxij≤si,∑ixij=dj,xij≥0\text{minimize} \quad \sum_{i, j} c_{ij}x_{ij} \qquad \text{subject to} \quad \sum_{j} x_{ij} \leq s_i, \quad \sum_{i} x_{ij} = d_j, \quad x_{ij} \geq 0

これも線形計画問題である。制約を足し合わせると ∑jdj=∑i,jxij≤∑isi\sum_j d_j = \sum_{i, j} x_{ij} \leq \sum_i s_i なので、全需要が全在庫を超えると実行不能になる。

例 1.4(ポートフォリオ選択)nn 個の資産の収益率を確率変数 R1,…,RnR_1, \dots, R_n、期待値を μi=E[Ri]\mu_i = E[R_i]、共分散行列を Σ=(Cov⁡(Ri,Rj))i,j\Sigma = (\operatorname{Cov}(R_i, R_j))_{i, j} とする。資金の配分の割合を w∈Rnw \in \mathbb{R}^n とすると、ポートフォリオの収益率 w⊤Rw^{\top}R の期待値は μ⊤w\mu^{\top}w、分散は ∑i,jwiwjCov⁡(Ri,Rj)=w⊤Σw\sum_{i, j} w_iw_j\operatorname{Cov}(R_i, R_j) = w^{\top}\Sigma w である。目標の期待収益率 rr を確保しつつ分散を最小にする問題

minimizew⊤Σwsubject toμ⊤w≥r,w1+⋯+wn=1,w≥0\text{minimize} \quad w^{\top}\Sigma w \qquad \text{subject to} \quad \mu^{\top}w \geq r, \quad w_1 + \cdots + w_n = 1, \quad w \geq 0

を平均分散モデル (mean-variance model) という(マーコウィッツ, 1952 年)。目的関数が二次式で制約が一次式の問題を二次計画問題 (quadratic programming problem) という。w≥0w \geq 0 は空売りの禁止で、外すと答えが変わる(問題 1.6)。分散は負にならないので Σ\Sigma は半正定値であり、第2章で見るように、このことがこの問題を「解きやすく」している。

例 1.5(最小二乗法)データ (ai,bi)(a_i, b_i)(ai∈Rna_i \in \mathbb{R}^n, bi∈Rb_i \in \mathbb{R}, i=1,…,mi = 1, \dots, m)に線形モデル b≈a⊤xb \approx a^{\top}x をあてはめる。ai⊤a_i^{\top} を第 ii 行とする行列を AA とすると、問題は制約なし問題

minimizef(x)=∥Ax−b∥2=∑i=1m(ai⊤x−bi)2(x∈Rn)\text{minimize} \quad f(x) = \lVert Ax - b \rVert^2 = \sum_{i=1}^{m}(a_i^{\top}x - b_i)^2 \qquad (x \in \mathbb{R}^n)

である。02-linear-algebra 第7章 の定理 7.19 では、解が正規方程式 A⊤Ax=A⊤bA^{\top}Ax = A^{\top}b の解であることを射影の幾何で示した。例 1.22 で最適性条件の立場から見直す。

例 1.6(ロジスティック回帰)特徴量 ai∈Rna_i \in \mathbb{R}^n とラベル yi∈{0,1}y_i \in \lbrace 0, 1 \rbrace(購入したかどうか、など)の組が mm 個ある。シグモイド関数 σ(t)=1/(1+e−t)\sigma(t) = 1/(1 + e^{-t}) により「y=1y = 1 となる確率は σ(a⊤x)\sigma(a^{\top}x)」というモデルを立て、パラメータ xx を最尤法で決める。負の対数尤度 −∑i(yilog⁡σ(ai⊤x)+(1−yi)log⁡(1−σ(ai⊤x)))-\sum_i \bigl(y_i\log\sigma(a_i^{\top}x) + (1 - y_i)\log(1 - \sigma(a_i^{\top}x))\bigr) は、log⁡σ(t)=t−log⁡(1+et)\log\sigma(t) = t - \log(1 + e^{t}), log⁡(1−σ(t))=−log⁡(1+et)\log(1 - \sigma(t)) = -\log(1 + e^{t}) を使って整理すると

ℓ(x)=∑i=1m(log⁡(1+eai⊤x)−yiai⊤x)\ell(x) = \sum_{i=1}^{m}\Bigl(\log\bigl(1 + e^{a_i^{\top}x}\bigr) - y_ia_i^{\top}x\Bigr)

となり、これを x∈Rnx \in \mathbb{R}^n で最小化する。解の公式はなく、第5章・第6章の反復法で解く。

例 1.7(最短路問題)道路網を有向グラフ G=(V,E)G = (V, E) で表し、道路 ee の所要時間を ce≥0c_e \geq 0 とする。地点 ss から tt(≠s\neq s)への経路で所要時間の和が最小のものを求める問題を最短路問題 (shortest path problem) という。道路 ee を使うとき xe=1x_e = 1、使わないとき xe=0x_e = 0 とし、vv から出る道路・vv に入る道路の集合を δ+(v)\delta^{+}(v), δ−(v)\delta^{-}(v) とすると

minimize∑e∈Ecexesubject to∑e∈δ+(v)xe−∑e∈δ−(v)xe={1(v=s)−1(v=t)0(それ以外),xe∈{0,1}\text{minimize} \quad \sum_{e \in E} c_ex_e \qquad \text{subject to} \quad \sum_{e \in \delta^{+}(v)} x_e - \sum_{e \in \delta^{-}(v)} x_e = \begin{cases} 1 & (v = s) \\ -1 & (v = t) \\ 0 & (\text{それ以外}) \end{cases}, \quad x_e \in \lbrace 0, 1 \rbrace

と書ける(実行可能解は経路に閉路が付いたものでもありうるが、ce≥0c_e \geq 0 なので閉路を除いても費用は増えない)。変数が 00 か 11 に限られる問題を 0-1 整数計画問題という。実行可能解は有限個なので最小値は存在する(空でなければ)が、経路の数は指数関数的に増えうるので全部は調べられない。第7章でダイクストラ法を扱う。

ヒント

実務では 最適化の仕事の大半は定式化にある。よくある失敗は、(1) 制約の書き忘れ(ソルバーが「非有界」と報告したら、まず制約の欠落を疑う)、(2) 「できれば守りたい」条件を厳格な制約にして実行不能になる(違反量に罰則を掛けて目的関数に入れる「ソフト制約」にできる)、(3) 整数であるべき変数(トラックの台数など)を連続変数で解いて四捨五入する(実行不能や大きな損失になりうる。第7章)、(4) 単位の不統一で係数の桁が大きく違い、数値計算が不安定になる(第2章の条件数)、である。

1.3 最小値の存在

最適解が存在しない問題に反復法を適用すると、答えらしきものが出力されても意味をもたない。

例 1.8(最適解が存在しない例)

  1. X=RX = \mathbb{R}, f(x)=exf(x) = e^{x}。x→−∞x \to -\infty で値が下限 00 に近づくが、達成されない。
  2. X=(0,1]X = (0, 1], f(x)=xf(x) = x。値を下限 00 に近づける点列は XX の外の点 00 に収束する(XX が閉でない)。
  3. X=[0,1]X = [0, 1] で、f(0)=1f(0) = 1、0<x≤10 < x \leq 1 では f(x)=xf(x) = x。下限 00 は達成されない(ff が 00 で連続でない)。
  4. X=R2X = \mathbb{R}^2, f(x,y)=(xy−1)2+x2f(x, y) = (xy - 1)^2 + x^2。f=0f = 0 なら x=0x = 0 かつ xy=1xy = 1 で矛盾するので f>0f > 0 だが、f(t,1/t)=t2→0f(t, 1/t) = t^2 \to 0(t→0t \to 0)なので下限 00 は達成されない。

定理 1.9(ワイエルシュトラスの定理, Weierstrass theorem)K⊂RnK \subset \mathbb{R}^n を空でないコンパクト集合(有界閉集合)、f ⁣:K→Rf\colon K \to \mathbb{R} を連続関数とする。このとき ff は KK 上で最小値と最大値をとる。

証明. 最小値について示す(最大値は −f-f に適用する)。m=inf⁡Kf∈[−∞,∞)m = \inf_K f \in [-\infty, \infty) とし、f(xk)→mf(x_k) \to m となる xk∈Kx_k \in K をとる(m=−∞m = -\infty なら f(xk)<−kf(x_k) < -k とする)。KK はコンパクトなので(01-calculus 第7章 定義 7.4・定理 7.5)、部分列 xkjx_{k_j} が KK の点 x∗x^{\ast} に収束する。ff の連続性より f(x∗)=lim⁡jf(xkj)=mf(x^{\ast}) = \lim_j f(x_{k_j}) = m。特に mm は有限で、x∗x^{\ast} で最小値をとる。□\square

これは 01-calculus 第7章 定理 7.7、03-topology 第5章 系 5.9 と同じ主張である。有界でない実行可能領域(例 1.5・1.6)のために、次の条件を導入する。

定義 1.10(強圧性, coercivity)X⊂RnX \subset \mathbb{R}^n とする。関数 f ⁣:X→Rf\colon X \to \mathbb{R} が

∀M∈R, ∃R>0, ∀x∈X, ∥x∥>R⇒f(x)>M\forall M \in \mathbb{R},\ \exists R > 0,\ \forall x \in X,\ \lVert x \rVert > R \Rightarrow f(x) > M

を満たす(「x∈Xx \in X, ∥x∥→∞\lVert x \rVert \to \infty のとき f(x)→+∞f(x) \to +\infty」)とき、ff は XX 上で強圧的 (coercive) であるという。XX が有界ならこの条件は自動的に成り立つ。

定理 1.11(強圧的な関数の最小値の存在)X⊂RnX \subset \mathbb{R}^n を空でない閉集合、f ⁣:X→Rf\colon X \to \mathbb{R} を連続かつ強圧的な関数とする。このとき ff は XX 上で最小値をとる。

証明. x0∈Xx_0 \in X をとり、下位集合 (sublevel set) S={x∈X∣f(x)≤f(x0)}S = \lbrace x \in X \mid f(x) \leq f(x_0) \rbrace を考える。x0∈Sx_0 \in S である。強圧性の定義で M=f(x0)M = f(x_0) とした RR をとると、∥x∥>R\lVert x \rVert > R の x∈Xx \in X は f(x)>f(x0)f(x) > f(x_0) を満たすので、SS は半径 RR の閉球に含まれ、有界である。SS は閉集合でもある:xk∈Sx_k \in S, xk→xx_k \to x なら、XX が閉なので x∈Xx \in X(01-calculus 第7章 命題 7.3)、連続性から f(x)=lim⁡kf(xk)≤f(x0)f(x) = \lim_k f(x_k) \leq f(x_0)。よって SS はコンパクトで、定理 1.9 より ff は SS 上のある点 x∗x^{\ast} で最小値をとる。x∈X∖Sx \in X \setminus S なら f(x)>f(x0)≥f(x∗)f(x) > f(x_0) \geq f(x^{\ast}) なので、x∗x^{\ast} は XX 全体での最小点である。□\square

例 1.8 では、1 と 4 は強圧性、2 は XX の閉性、3 は ff の連続性が欠けている。どの仮定も外せない。

補足

定理 1.9 の最小値の部分と定理 1.11 の証明では、連続性は「xk→xx_k \to x ならば f(x)≤lim inf⁡kf(xk)f(x) \leq \liminf_k f(x_k)」という不等式の形でしか使っていない(定理 1.9 では、f(x∗)≤lim inf⁡jf(xkj)=mf(x^{\ast}) \leq \liminf_j f(x_{k_j}) = m と f(x∗)≥mf(x^{\ast}) \geq m から f(x∗)=mf(x^{\ast}) = m が出る)。この性質を下半連続性 (lower semicontinuity) といい、最小値の存在を述べる部分は ff が下半連続なら成り立つ(最大値の存在には逆向きの不等式、上半連続性が要る)。例 1.8 の 3 で f(0)=−1f(0) = -1 と定め直すと、下半連続になり 00 で最小値をとる。無限次元の最適化では有界閉集合がコンパクトとは限らず、弱位相を使う直接法が必要になる(18-pde 第6章 定理 6.2)。

例 1.12(最小二乗法の解の存在)例 1.5 で rank⁡A=n\operatorname{rank} A = n なら、x≠0x \neq 0 で x⊤A⊤Ax=∥Ax∥2>0x^{\top}A^{\top}Ax = \lVert Ax \rVert^2 > 0 なので A⊤AA^{\top}A は正定値で、最小固有値を λ>0\lambda > 0 とすると ∥Ax∥≥λ∥x∥\lVert Ax \rVert \geq \sqrt{\lambda}\lVert x \rVert(02-linear-algebra 第8章 命題 8.29)。よって ∥Ax−b∥≥λ∥x∥−∥b∥\lVert Ax - b \rVert \geq \sqrt{\lambda}\lVert x \rVert - \lVert b \rVert で、ff は強圧的であり最小点をもつ。rank⁡A<n\operatorname{rank} A < n なら Az=0Az = 0 となる z≠0z \neq 0 の方向に ff は一定で強圧的でないが、それでも最小点は存在する(02-linear-algebra 第7章 定理 7.19)。強圧性は必要条件ではない。

例 1.13(ロジスティック回帰と完全分離)例 1.6 の ℓ\ell の各項 log⁡(1+et)−yt\log(1 + e^{t}) - yt は、y=1y = 1 なら log⁡(1+e−t)\log(1 + e^{-t})、y=0y = 0 なら log⁡(1+et)\log(1 + e^{t}) に等しく、正である。いま、yi=1y_i = 1 なら ai⊤v>0a_i^{\top}v > 0、yi=0y_i = 0 なら ai⊤v<0a_i^{\top}v < 0 となる vv がある(データが完全に分離できる)とする。s→∞s \to \infty のとき ℓ(sv)\ell(sv) の各項は log⁡(1+e−s∣ai⊤v∣)→0\log(1 + e^{-s\lvert a_i^{\top}v \rvert}) \to 0 となるので、最適値 00 は達成されず、最尤推定値は存在しない(統計学の側からの扱いは 22-statistics 第6章 定理 6.11)。一方、λ>0\lambda > 0 について

ℓλ(x)=ℓ(x)+λ2∥x∥2\ell_{\lambda}(x) = \ell(x) + \frac{\lambda}{2}\lVert x \rVert^2

は ℓλ(x)≥λ2∥x∥2\ell_{\lambda}(x) \geq \frac{\lambda}{2}\lVert x \rVert^2 より強圧的なので、データによらず最小点をもつ(リッジ正則化、L2L^2 正則化)。次のコードは、完全に分離できる 1 次元のデータに勾配法(第5章)を適用したものである。

import numpy as np

a = np.array([-2.0, -1.0, 1.0, 2.0])     # 特徴量
y = np.array([0.0, 0.0, 1.0, 1.0])       # ラベル(x > 0 で完全に分離できる)
obj = lambda x, lam: np.sum(np.log1p(np.exp(a * x)) - y * a * x) + lam / 2 * x**2
grad = lambda x, lam: np.sum((1 / (1 + np.exp(-a * x)) - y) * a) + lam * x

for lam in [0.0, 0.1]:
    x = 0.0
    for k in range(1, 100001):
        x -= 0.1 * grad(x, lam)          # 勾配法(学習率 0.1)
        if k in (100, 10000, 100000):
            print(f"lam={lam}: k={k:6d}  x={x:7.4f}  obj={obj(x, lam):.6f}")
lam=0.0: k=   100  x= 3.1751  obj=0.085373
lam=0.0: k= 10000  x= 7.6053  obj=0.000996
lam=0.0: k=100000  x= 9.9041  obj=0.000100
lam=0.1: k=   100  x= 2.2520  obj=0.475615
lam=0.1: k= 10000  x= 2.2772  obj=0.475503
lam=0.1: k=100000  x= 2.2772  obj=0.475503

正則化なしでは目的関数は 00 に近づくが、xx は log⁡k\log k 程度の速さで増え続けて収束しない。λ=0.1\lambda = 0.1 では x≈2.2772x \approx 2.2772 に収束する。

1.4 局所最適と大域最適

定義 1.14(局所最小点と大域最小点)X⊂RnX \subset \mathbb{R}^n、f ⁣:X→Rf\colon X \to \mathbb{R}、x∗∈Xx^{\ast} \in X とする。ある ε>0\varepsilon > 0 があって、∥x−x∗∥<ε\lVert x - x^{\ast} \rVert < \varepsilon を満たすすべての x∈Xx \in X で f(x∗)≤f(x)f(x^{\ast}) \leq f(x) となるとき、x∗x^{\ast} を局所最小点(局所最適解, local minimizer)という。さらに x≠x∗x \neq x^{\ast} なら f(x∗)<f(x)f(x^{\ast}) < f(x) となるとき狭義の局所最小点という。すべての x∈Xx \in X で f(x∗)≤f(x)f(x^{\ast}) \leq f(x) となるとき大域最小点(大域最適解, global minimizer)という。

例 1.15 f(x)=3x4−4x3−12x2f(x) = 3x^4 - 4x^3 - 12x^2 は f′(x)=12x(x+1)(x−2)f'(x) = 12x(x + 1)(x - 2) より停留点 −1,0,2-1, 0, 2 をもち、そこでの f′′(x)=36x2−24x−24f''(x) = 36x^2 - 24x - 24 の値は 36,−24,7236, -24, 72 である。よって x=−1,2x = -1, 2 は狭義の局所最小点(f(−1)=−5f(-1) = -5, f(2)=−32f(2) = -32)、x=0x = 0 は局所最大点である。ff は強圧的なので最小点が存在し、それは停留点のどれか(定理 1.17)だから、大域最小点は x=2x = 2 である。x=−1x = -1 は局所最小点だが大域最小点ではない。

勾配法(第5章)xk+1=xk−0.01f′(xk)x_{k+1} = x_k - 0.01f'(x_k) をこの ff に 200 回適用すると、x0=−2,−0.5x_0 = -2, -0.5 からは局所最小点 −1-1 に、x0=0.5,3x_0 = 0.5, 3 からは 22 に収束する(計算機で確かめられる)。勾配法は近くの情報しか使わないので、局所最小点に入ると抜け出せない。

ヒント

実務では 非凸な問題(ニューラルネットワークの学習、非線形な物理モデルのパラメータ推定など)では、ソルバーが「収束した」と報告しても、得られたのは局所最小点か 1.5 節の停留点にすぎないことが多い。出発点を変えて何度も解いて最良のものを採る(マルチスタート)、凸な問題で近似して最適値の下界を求め、得られた値との差を評価する、といった対策がとられる。問題が凸なら、局所最小点は大域最小点であり(第2章)、この心配はいらない。

1.5 制約なし問題の最適性条件

この節では U⊂RnU \subset \mathbb{R}^n を開集合、f ⁣:U→Rf\colon U \to \mathbb{R} とする(実行可能領域の内点にある局所最小点にも同じ議論が使える)。ヘッセ行列を ∇2f(x)=(∂i∂jf(x))i,j\nabla^2 f(x) = (\partial_i\partial_j f(x))_{i, j} と書く(01-calculus 第7章の Hf(x)H_f(x))。

補題 1.16(降下方向)ff が x∈Ux \in U で微分可能で、d∈Rnd \in \mathbb{R}^n が ⟨∇f(x),d⟩<0\langle \nabla f(x), d \rangle < 0 を満たすならば、ある tˉ>0\bar{t} > 0 があって、0<t<tˉ0 < t < \bar{t} のとき f(x+td)<f(x)f(x + td) < f(x) となる。このような dd を降下方向 (descent direction) という。

証明. 微分可能性より f(x+td)=f(x)+t⟨∇f(x),d⟩+o(t)f(x + td) = f(x) + t\langle \nabla f(x), d \rangle + o(t)(t→0t \to 0)。c=−⟨∇f(x),d⟩>0c = -\langle \nabla f(x), d \rangle > 0 とおくと、十分小さい t>0t > 0 で o(t)o(t) の項の絶対値は ct/2ct/2 以下なので、f(x+td)−f(x)≤−ct/2<0f(x + td) - f(x) \leq -ct/2 < 0。□\square

定理 1.17(1 次の必要条件)x∗∈Ux^{\ast} \in U が ff の局所最小点で、ff が x∗x^{\ast} で微分可能ならば、∇f(x∗)=0\nabla f(x^{\ast}) = 0 である。

証明. ∇f(x∗)≠0\nabla f(x^{\ast}) \neq 0 なら、d=−∇f(x∗)d = -\nabla f(x^{\ast}) は ⟨∇f(x∗),d⟩=−∥∇f(x∗)∥2<0\langle \nabla f(x^{\ast}), d \rangle = -\lVert \nabla f(x^{\ast}) \rVert^2 < 0 を満たすので、補題 1.16 より x∗x^{\ast} のいくらでも近くに値のより小さい点があり、局所最小性に反する。□\square

∇f(x)=0\nabla f(x) = 0 となる点を停留点 (stationary point) といい、停留点のうち局所最小点でも局所最大点でもないものを鞍点 (saddle point) という。

定理 1.18(2 次の必要条件)ff を UU 上の C2C^2 級関数とする。x∗∈Ux^{\ast} \in U が局所最小点ならば、∇f(x∗)=0\nabla f(x^{\ast}) = 0 であり、かつ ∇2f(x∗)\nabla^2 f(x^{\ast}) は半正定値である。

証明. ∇f(x∗)=0\nabla f(x^{\ast}) = 0 は定理 1.17 による。d∈Rnd \in \mathbb{R}^n を任意にとると、テイラーの定理(ペアノ剰余の形、01-calculus 第7章 7.6 節の (1) 式)より t→0t \to 0 のとき

f(x∗+td)=f(x∗)+t22d⊤∇2f(x∗)d+o(t2)f(x^{\ast} + td) = f(x^{\ast}) + \frac{t^2}{2}d^{\top}\nabla^2 f(x^{\ast})d + o(t^2)

十分小さい t≠0t \neq 0 で左辺は f(x∗)f(x^{\ast}) 以上なので、12d⊤∇2f(x∗)d+o(t2)/t2≥0\frac{1}{2}d^{\top}\nabla^2 f(x^{\ast})d + o(t^2)/t^2 \geq 0。t→0t \to 0 として d⊤∇2f(x∗)d≥0d^{\top}\nabla^2 f(x^{\ast})d \geq 0。□\square

定理 1.19(2 次の十分条件)ff を UU 上の C2C^2 級関数とし、x∗∈Ux^{\ast} \in U で ∇f(x∗)=0\nabla f(x^{\ast}) = 0 かつ ∇2f(x∗)\nabla^2 f(x^{\ast}) が正定値であるとする。このとき x∗x^{\ast} は狭義の局所最小点である。さらに、∇2f(x∗)\nabla^2 f(x^{\ast}) の最小固有値を λ\lambda とすると、ある ε>0\varepsilon > 0 について ∥x−x∗∥<ε\lVert x - x^{\ast} \rVert < \varepsilon ならば f(x)≥f(x∗)+λ4∥x−x∗∥2f(x) \geq f(x^{\ast}) + \frac{\lambda}{4}\lVert x - x^{\ast} \rVert^2 である。

証明. 正定値行列の固有値は正で(02-linear-algebra 第8章 定理 8.13)、すべての hh で h⊤∇2f(x∗)h≥λ∥h∥2h^{\top}\nabla^2 f(x^{\ast})h \geq \lambda\lVert h \rVert^2(同 命題 8.29)。テイラーの定理より f(x∗+h)=f(x∗)+12h⊤∇2f(x∗)h+r(h)f(x^{\ast} + h) = f(x^{\ast}) + \frac{1}{2}h^{\top}\nabla^2 f(x^{\ast})h + r(h), r(h)=o(∥h∥2)r(h) = o(\lVert h \rVert^2) と書ける。∥h∥<ε\lVert h \rVert < \varepsilon ならば x∗+h∈Ux^{\ast} + h \in U かつ ∣r(h)∣≤λ4∥h∥2\lvert r(h) \rvert \leq \frac{\lambda}{4}\lVert h \rVert^2 となる ε>0\varepsilon > 0 をとれば、f(x∗+h)≥f(x∗)+λ2∥h∥2−λ4∥h∥2=f(x∗)+λ4∥h∥2f(x^{\ast} + h) \geq f(x^{\ast}) + \frac{\lambda}{2}\lVert h \rVert^2 - \frac{\lambda}{4}\lVert h \rVert^2 = f(x^{\ast}) + \frac{\lambda}{4}\lVert h \rVert^2 であり、h≠0h \neq 0 なら右辺は f(x∗)f(x^{\ast}) より大きい。□\square

定理 1.19 の前半は 01-calculus 第7章 定理 7.24 (1) と同じである。必要条件は半正定値、十分条件は正定値で、その間にはすき間がある。ヘッセ行列が半正定値だが固有値に 00 を含む停留点は、2 次までの情報では判定できない。

例 1.20(2 次の条件で判定できない例)(1) x4x^4, x3x^3, −x4-x^4 はいずれも x=0x = 0 で f′=f′′=0f' = f'' = 0 で、2 次の必要条件を満たす。しかし x4x^4 は狭義の最小、x3x^3 は極値でなく、−x4-x^4 は狭義の最大である。(2) x2+y4x^2 + y^4, x2+y3x^2 + y^3, x2−y4x^2 - y^4 の原点でのヘッセ行列はどれも diag⁡(2,0)\operatorname{diag}(2, 0) だが、原点はそれぞれ狭義の最小点・鞍点・鞍点である(後の二つは f(0,y)f(0, y) が負の値をとる)。(3) x4x^4 の原点は狭義の局所最小点だが f′′=0f'' = 0 である。2 次の十分条件は必要条件ではない。

注意

「勾配が 00 でヘッセ行列が半正定値だから局所最小点」は誤りである(例 1.20 の x3x^3, −x4-x^4)。「勾配が 00 でヘッセ行列が正定値だから最小点」も、一般には局所最小点までしか言えない(例 1.15 の x=−1x = -1)。ソフトウェアの「勾配のノルムが許容誤差以下になった」という報告は、停留点の近くに来たことしか意味しない。

二次関数ではテイラー展開が 2 次で終わるので、最適性が完全に判定できる。

命題 1.21(二次関数の最小化)QQ を nn 次実対称行列、c∈Rnc \in \mathbb{R}^n、f(x)=12x⊤Qx−c⊤xf(x) = \frac{1}{2}x^{\top}Qx - c^{\top}x とする。

  1. QQ が半正定値で Qx∗=cQx^{\ast} = c ならば、x∗x^{\ast} は大域最小点であり、大域最小点の全体は {x∣Qx=c}\lbrace x \mid Qx = c \rbrace である。特に QQ が正定値なら、大域最小点は Q−1cQ^{-1}c ただ一つである。
  2. QQ が負の固有値をもつとき、または QQ が半正定値で c∉Im⁡Qc \notin \operatorname{Im} Q のとき、ff は下に有界でない。

したがって、ff が最小値をもつための必要十分条件は「QQ が半正定値かつ c∈Im⁡Qc \in \operatorname{Im} Q」である。

証明. QQ の対称性を使って展開すると、任意の x,hx, h について

f(x+h)=f(x)+(Qx−c)⊤h+12h⊤Qh(1.1)f(x + h) = f(x) + (Qx - c)^{\top}h + \frac{1}{2}h^{\top}Qh \tag{1.1}

特に ∇f(x)=Qx−c\nabla f(x) = Qx - c である。(1) Qx∗=cQx^{\ast} = c なら (1.1) より f(x∗+h)=f(x∗)+12h⊤Qh≥f(x∗)f(x^{\ast} + h) = f(x^{\ast}) + \frac{1}{2}h^{\top}Qh \geq f(x^{\ast})。逆に大域最小点 xx では定理 1.17 より Qx−c=0Qx - c = 0。QQ が正定値なら正則である。(2) Qv=μvQv = \mu v, μ<0\mu < 0, v≠0v \neq 0 なら f(tv)=−tc⊤v+μt22∥v∥2→−∞f(tv) = -tc^{\top}v + \frac{\mu t^2}{2}\lVert v \rVert^2 \to -\infty(t→∞t \to \infty)。c∉Im⁡Qc \notin \operatorname{Im} Q のとき:Qx=0Qx = 0 なら x⊤Qz=(Qx)⊤z=0x^{\top}Qz = (Qx)^{\top}z = 0 なので Ker⁡Q⊂(Im⁡Q)⊥\operatorname{Ker} Q \subset (\operatorname{Im} Q)^{\perp} で、次元を比べると等号が成り立ち、Rn=Im⁡Q⊕Ker⁡Q\mathbb{R}^n = \operatorname{Im} Q \oplus \operatorname{Ker} Q(直交直和)。c=c1+c0c = c_1 + c_0(c1∈Im⁡Qc_1 \in \operatorname{Im} Q, c0∈Ker⁡Qc_0 \in \operatorname{Ker} Q)と分けると c0≠0c_0 \neq 0 で、f(tc0)=−t∥c0∥2→−∞f(tc_0) = -t\lVert c_0 \rVert^2 \to -\infty。最後の主張は (1)・(2) から従う。□\square

例 1.22(最小二乗法、再訪)f(x)=∥Ax−b∥2f(x) = \lVert Ax - b \rVert^2 は、定数項 ∥b∥2\lVert b \rVert^2 を除いて Q=2A⊤AQ = 2A^{\top}A(半正定値)、c=2A⊤bc = 2A^{\top}b とした命題 1.21 の形である。A⊤Ax=0A^{\top}Ax = 0 なら ∥Ax∥2=x⊤A⊤Ax=0\lVert Ax \rVert^2 = x^{\top}A^{\top}Ax = 0 なので Ker⁡A⊤A=Ker⁡A\operatorname{Ker} A^{\top}A = \operatorname{Ker} A で、直交補空間をとると Im⁡A⊤A=Im⁡A⊤∋A⊤b\operatorname{Im} A^{\top}A = \operatorname{Im} A^{\top} \ni A^{\top}b。よって最小点が存在し、その全体は正規方程式 A⊤Ax=A⊤bA^{\top}Ax = A^{\top}b の解全体である。02-linear-algebra 第7章 定理 7.19 を、射影を使わずに導いたことになる。

例 1.23(存在・停留点・比較)f(x,y)=x4+y4−4xyf(x, y) = x^4 + y^4 - 4xy の最小値を求める。(i) x4+y4≥12(x2+y2)2x^4 + y^4 \geq \frac{1}{2}(x^2 + y^2)^2 と 4∣xy∣≤2(x2+y2)4\lvert xy \rvert \leq 2(x^2 + y^2) より、r=∥(x,y)∥r = \lVert (x, y) \rVert として f≥r42−2r2→∞f \geq \frac{r^4}{2} - 2r^2 \to \infty。ff は強圧的で、最小点が存在する。(ii) 最小点は停留点である。∇f=(4x3−4y,4y3−4x)=0\nabla f = (4x^3 - 4y, 4y^3 - 4x) = 0 より y=x3y = x^3, x=y3=x9x = y^3 = x^9 で x∈{0,±1}x \in \lbrace 0, \pm 1 \rbrace、停留点は (0,0)(0, 0), (1,1)(1, 1), (−1,−1)(-1, -1)。(iii) f(0,0)=0f(0, 0) = 0, f(±1,±1)=−2f(\pm 1, \pm 1) = -2(複号同順)なので、最小値は −2-2 で、最小点は 2 つある。ヘッセ行列

∇2f(x,y)=(12x2−4−412y2)\nabla^2 f(x, y) = \begin{pmatrix} 12x^2 & -4 \\ -4 & 12y^2 \end{pmatrix}

は (±1,±1)(\pm 1, \pm 1) で固有値 8,168, 16(正定値)、原点で ±4\pm 4(不定値、鞍点)であり、定理 1.18・1.19 と整合する。「存在を示す → 停留点を列挙する → 値を比べる」手順は、停留点を列挙できない大きな問題では使えない。

1.6 凸性への導入

例 1.15 や例 1.23 では、局所的な条件だけでは大域最小点を見分けられず、すべての停留点を比べる必要があった。この困難が起こらない問題のクラスがある。

定義 1.24(凸集合・凸関数)集合 C⊂RnC \subset \mathbb{R}^n が、任意の x,y∈Cx, y \in C と t∈[0,1]t \in [0, 1] について (1−t)x+ty∈C(1 - t)x + ty \in C を満たすとき、CC を凸集合 (convex set) という。凸集合 CC 上の関数 ff が、任意の x,y∈Cx, y \in C と t∈[0,1]t \in [0, 1] について f((1−t)x+ty)≤(1−t)f(x)+tf(y)f((1 - t)x + ty) \leq (1 - t)f(x) + tf(y) を満たすとき、ff を凸関数 (convex function) という。凸集合上で凸関数を最小化する問題を凸最適化問題 (convex optimization problem) という。

凸集合は「どの 2 点を結ぶ線分も含む」集合、凸関数は「グラフ上の 2 点を結ぶ弦がグラフより下に来ない」関数である(1 変数の場合は 01-calculus 第4章 定義 4.28)。第2章で証明するように、凸最適化問題では次が成り立つ。

  • 局所最小点は大域最小点である。f(y)<f(x∗)f(y) < f(x^{\ast}) となる yy があれば、凸性から線分上の点 x∗+t(y−x∗)x^{\ast} + t(y - x^{\ast})(0<t≤10 < t \leq 1)でも値は f(x∗)f(x^{\ast}) より小さく、t→0t \to 0 でそれらは x∗x^{\ast} にいくらでも近づくからである。
  • 開凸集合上の微分可能な凸関数では、∇f(x∗)=0\nabla f(x^{\ast}) = 0 が大域最小の十分条件にもなる。

例 1.2〜1.6 はいずれも凸最適化問題である(例 1.4 は Σ\Sigma が半正定値であることによる)。最短路問題(例 1.7)の実行可能領域は有限集合で凸ではないが、グラフの特別な構造のおかげで効率よく解ける。例 1.15 の 4 次関数は f′′(0)<0f''(0) < 0 なので凸でない。

大まかにいえば、凸最適化問題では局所的な情報だけで大域的な最適性が判定でき、線形計画や凸二次計画などには多項式時間のアルゴリズムが知られている。一方、非凸な問題や整数変数を含む問題は一般に難しく、0-1 整数計画は NP 困難な問題を含む(第7章)。問題を凸に定式化できるか、できないなら凸な問題でどう近似するかが、実際に最適化を使うときの最も重要な判断の一つである。

まとめ

  • 最適化問題は、決定変数・目的関数・制約(実行可能領域)で定式化する。最適値 p∗=inf⁡x∈Xf(x)p^{\ast} = \inf_{x \in X} f(x) は常に定まるが、最適解は存在するとは限らない。
  • 生産計画・輸送は線形計画、ポートフォリオ選択は二次計画、最小二乗とロジスティック回帰は制約なし問題、最短路は 0-1 整数計画として書ける。
  • コンパクト集合上の連続関数は最小値をとる(ワイエルシュトラスの定理)。閉集合上の連続で強圧的な関数も最小値をとる。連続性・閉性・強圧性のどれが欠けても反例がある。
  • 完全に分離できるデータではロジスティック回帰の最尤推定値は存在しないが、リッジ正則化を加えると最小点が存在する。
  • 局所最小点は大域最小点とは限らず、勾配法は出発点によって異なる局所最小点に収束しうる。
  • 1 次の必要条件 ∇f(x∗)=0\nabla f(x^{\ast}) = 0、2 次の必要条件「∇2f(x∗)\nabla^2 f(x^{\ast}) が半正定値」、2 次の十分条件「∇f(x∗)=0\nabla f(x^{\ast}) = 0 かつ ∇2f(x∗)\nabla^2 f(x^{\ast}) が正定値なら狭義の局所最小」。半正定値だが正定値でない場合は判定できない。
  • 二次関数 12x⊤Qx−c⊤x\frac{1}{2}x^{\top}Qx - c^{\top}x が最小値をもつのは QQ が半正定値かつ c∈Im⁡Qc \in \operatorname{Im} Q のときに限り、最小点は Qx=cQx = c の解である。
  • 凸最適化問題では局所最小点が大域最小点になり、∇f=0\nabla f = 0 が最適性の十分条件になる(第2章)。

演習問題

問題 1.1 ★ ジャム X, Y の 1 瓶あたりの利益は 500 円、400 円である。X 1 瓶には果物 1 kg と加工 2 時間、Y 1 瓶には果物 1 kg と加工 1 時間が必要で、1 日に使えるのは果物 6 kg、加工 10 時間までである。(1) 利益(百円単位)を最大にする問題を線形計画問題として定式化せよ(瓶の数は分割できるとする)。(2) 2 つの制約に適当な非負の数を掛けて足すことで、任意の実行可能解の利益が 28 百円以下であることを示せ。(3) 最適解を求めよ。

解答

(1) X, Y の瓶の数を x1,x2x_1, x_2 とすると、maximize 5x1+4x25x_1 + 4x_2 subject to x1+x2≤6x_1 + x_2 \leq 6, 2x1+x2≤102x_1 + x_2 \leq 10, x1,x2≥0x_1, x_2 \geq 0。

(2) 果物の制約に y1≥0y_1 \geq 0、加工の制約に y2≥0y_2 \geq 0 を掛けて足すと (y1+2y2)x1+(y1+y2)x2≤6y1+10y2(y_1 + 2y_2)x_1 + (y_1 + y_2)x_2 \leq 6y_1 + 10y_2。左辺の係数を目的関数に合わせるには y1+2y2=5y_1 + 2y_2 = 5, y1+y2=4y_1 + y_2 = 4、すなわち y1=3y_1 = 3, y2=1y_2 = 1 とすればよく、

5x1+4x2=3(x1+x2)+(2x1+x2)≤3⋅6+10=285x_1 + 4x_2 = 3(x_1 + x_2) + (2x_1 + x_2) \leq 3 \cdot 6 + 10 = 28

(3) 等号が成り立つのは x1+x2=6x_1 + x_2 = 6 かつ 2x1+x2=102x_1 + x_2 = 10、すなわち (x1,x2)=(4,2)(x_1, x_2) = (4, 2) のときで、これは実行可能である。よって最適解は X を 4 瓶、Y を 2 瓶で、最大利益は 2800 円。(頂点 (0,0)(0, 0), (5,0)(5, 0), (4,2)(4, 2), (0,6)(0, 6) での値 0,25,28,240, 25, 28, 24 を比べても確かめられる。)

問題 1.2 ★ 次の問題は最小値をもつか。もつならば求め、もたないならば最適値を答えよ。 (1) X=(0,∞)X = (0, \infty) で f(x)=x+1/xf(x) = x + 1/x (2) X=RX = \mathbb{R} で f(x)=e−x2f(x) = e^{-x^2} (3) X={(x,y)∣y≥x2−1}X = \lbrace (x, y) \mid y \geq x^2 - 1 \rbrace で f(x,y)=x2+yf(x, y) = x^2 + y (4) X=RX = \mathbb{R} で f(x)=log⁡(1+e−x)f(x) = \log(1 + e^{-x})

解答

(1) もつ。相加相乗平均の不等式より x+1/x≥2x + 1/x \geq 2 で、等号は x=1x = 1。最小値 22。XX は閉集合でないが最小値は存在する(定理 1.11 の条件は十分条件である)。

(2) もたない。f>0f > 0 で、∣x∣→∞\lvert x \rvert \to \infty のとき f→0f \to 0 なので、最適値 00 は達成されない。

(3) もつ。XX 上で f=x2+y≥2x2−1≥−1f = x^2 + y \geq 2x^2 - 1 \geq -1 であり、(0,−1)∈X(0, -1) \in X で等号が成り立つから、最小値は −1-1。(XX は閉集合で、XX 上 y≥−1y \geq -1 より f≥max⁡(2x2−1,y)f \geq \max(2x^2 - 1, y) なので、ff は強圧的でもある。)

(4) もたない。f>0f > 0 で、x→∞x \to \infty のとき f→0f \to 0 なので、最適値 00 は達成されない。ラベル y=1y = 1、特徴量 a=1a = 1 の 1 個のデータに対するロジスティック回帰の損失であり、例 1.13 の完全分離の最も簡単な場合である。

問題 1.3 ★ Q1Q_1, Q2Q_2 を

Q1=(1111),Q2=(100−1)Q_1 = \begin{pmatrix} 1 & 1 \\ 1 & 1 \end{pmatrix}, \qquad Q_2 = \begin{pmatrix} 1 & 0 \\ 0 & -1 \end{pmatrix}

とする。f(x)=12x⊤Qx−c⊤xf(x) = \frac{1}{2}x^{\top}Qx - c^{\top}x(x∈R2x \in \mathbb{R}^2)が最小値をもつかを判定し、もつならば最小点全体と最小値を求めよ。(1) Q=Q1Q = Q_1, c=(1,1)⊤c = (1, 1)^{\top} (2) Q=Q1Q = Q_1, c=(1,−1)⊤c = (1, -1)^{\top} (3) Q=Q2Q = Q_2, c=0c = 0

解答

Q1Q_1 の固有値は 22(固有ベクトル (1,1)⊤(1, 1)^{\top})と 00(固有ベクトル (1,−1)⊤(1, -1)^{\top})で半正定値、Im⁡Q1\operatorname{Im} Q_1 は (1,1)⊤(1, 1)^{\top} で張られる直線である。

(1) c∈Im⁡Q1c \in \operatorname{Im} Q_1 なので最小値をもつ(命題 1.21)。最小点全体は Q1x=cQ_1x = c、すなわち直線 x1+x2=1x_1 + x_2 = 1 で、その上では x⊤Q1x=(x1+x2)2=1x^{\top}Q_1x = (x_1 + x_2)^2 = 1, c⊤x=1c^{\top}x = 1 なので最小値は −12-\frac{1}{2}。

(2) c∉Im⁡Q1c \notin \operatorname{Im} Q_1 なので下に有界でない。実際 x=t(1,−1)⊤x = t(1, -1)^{\top} では Q1x=0Q_1x = 0 より f(x)=−2t→−∞f(x) = -2t \to -\infty。

(3) Q2Q_2 は負の固有値をもつので下に有界でない(f(0,t)=−t2/2f(0, t) = -t^2/2)。原点は停留点だが鞍点である。

問題 1.4 ★★ f(x,y)=x3−3x+y2f(x, y) = x^3 - 3x + y^2 の停留点をすべて求めて分類せよ。また、ff が最小値をもつかどうか答えよ。

解答

∇f=(3x2−3,2y)=0\nabla f = (3x^2 - 3, 2y) = 0 より停留点は (±1,0)(\pm 1, 0)。ヘッセ行列は diag⁡(6x,2)\operatorname{diag}(6x, 2) で、(1,0)(1, 0) では正定値なので狭義の局所最小点(定理 1.19、f=−2f = -2)、(−1,0)(-1, 0) では不定値なので鞍点(f=2f = 2)。しかし f(x,0)=x3−3x→−∞f(x, 0) = x^3 - 3x \to -\infty(x→−∞x \to -\infty)なので最小値はもたない。局所最小点がただ一つでも、大域最小点とは限らず、大域最小点が存在しないこともある。

問題 1.5 ★★ ある分析者が C2C^2 級関数 f ⁣:R2→Rf\colon \mathbb{R}^2 \to \mathbb{R} を勾配法で最小化した。ソルバーは点 x^\hat{x} で停止し、∇f(x^)≈0\nabla f(\hat{x}) \approx 0、ヘッセ行列の固有値は 3.13.1 と 0.00.0 と報告した。分析者は「ヘッセ行列が半正定値なので x^\hat{x} は局所最小点であり、勾配法で得た点なので ff の最小点である」と結論した。この推論の誤りを反例とともに指摘し、さらに何を調べるべきか述べよ。

解答

(a) 半正定値は局所最小の必要条件(定理 1.18)であって十分条件ではない。x2+y3x^2 + y^3 や x2−y4x^2 - y^4 の原点は勾配が 00、ヘッセ行列の固有値が 22 と 00 だが鞍点である(例 1.20)。(b) 局所最小点でも大域最小点とは限らない(例 1.15 の x=−1x = -1)。

調べるべきこと:固有値 00 の固有ベクトルの方向に ff を 1 変数関数として調べる(3 次以上の項の符号)、ff が凸かどうか(凸なら停留点は大域最小点。第2章)、出発点を変えて解き直すと同じ値になるか。表示が 0.00.0 の固有値が実は小さな負の値である可能性もある。

問題 1.6 ★★ 2 つの資産の収益率の共分散行列を

Σ=(2ρρ3)\Sigma = \begin{pmatrix} 2 & \rho \\ \rho & 3 \end{pmatrix}

(単位は %²)とし、w1+w2=1w_1 + w_2 = 1 のもとで分散 w⊤Σww^{\top}\Sigma w を最小にする。(1) ρ=1\rho = 1 のとき、最適な ww と最小分散を求めよ。(2) ρ=2.2\rho = 2.2 のとき、最適な ww と最小分散を求めて解釈せよ。(3) ρ=2.2\rho = 2.2 で空売りを禁止する(w≥0w \geq 0)と、答えはどう変わるか。

解答

det⁡Σ=6−ρ2\det\Sigma = 6 - \rho^2 は ρ=1,2.2\rho = 1, 2.2 で 55, 1.161.16 と正なので、どちらの Σ\Sigma も正定値である。w2=1−w1w_2 = 1 - w_1 を代入すると

φ(w1)=2w12+3(1−w1)2+2ρw1(1−w1)=(5−2ρ)w12−(6−2ρ)w1+3\varphi(w_1) = 2w_1^2 + 3(1 - w_1)^2 + 2\rho w_1(1 - w_1) = (5 - 2\rho)w_1^2 - (6 - 2\rho)w_1 + 3

ρ<2.5\rho < 2.5 なら φ\varphi は下に凸な放物線で、w1=3−ρ5−2ρw_1 = \frac{3 - \rho}{5 - 2\rho} で最小値 3−(3−ρ)25−2ρ3 - \frac{(3 - \rho)^2}{5 - 2\rho} をとる。

(1) w=(2/3,1/3)w = (2/3, 1/3)、最小分散 5/3≈1.675/3 \approx 1.67。単独の分散 22, 33 より小さい(分散投資の効果)。

(2) w=(4/3,−1/3)w = (4/3, -1/3)、最小分散 29/15≈1.9329/15 \approx 1.93。相関が強いので、資産 2 を 1/31/3 だけ空売りして共通の変動を打ち消すほうが分散が小さくなる。

(3) w1∈[0,1]w_1 \in [0, 1] に制限される。頂点 w1=4/3w_1 = 4/3 は区間の外にあるので φ\varphi は [0,1][0, 1] で減少し、最適解は w=(1,0)w = (1, 0)、最小分散は φ(1)=2\varphi(1) = 2 で、最適解は実行可能領域の境界に移る。実務では、推定誤差を含む Σ\Sigma で最適化すると (2) のような極端な配分が出やすく、制約や正則化で抑えることが多い。

この章を読み終えたら

「読了」にすると、学習記録と地図に反映されます。

この章の誤りを報告GitHub で見る