Lemma数学ロードマップ

01 微分積分学 · 第 8 章

逆関数定理と陰関数定理

目安 11〜15 時間定理など 6演習 9 問

この章の目標

  • Rn\mathbb{R}^n の閉集合上で縮小写像の原理を証明し、方程式の解の存在・一意性に使える
  • ベクトル値関数の平均値の不等式を証明できる
  • 逆関数定理を縮小写像の原理から証明し、陰関数定理を逆関数定理から導ける
  • 陰関数の導関数を計算できる
  • ラグランジュの未定乗数法を証明し、条件付き極値問題(相加相乗平均、対称行列の最大固有値など)に応用できる
  • 陰関数定理から、曲線・曲面(部分多様体)と接空間の概念を理解する

前提:第7章 多変数関数の微分、02-linear-algebra 第4章 行列式

8.1 局所的に解くということ

1 変数では、ff が C1C^1 級で f′(a)≠0f'(a) \neq 0 なら、aa の近くで f′f' は符号一定なので ff は狭義単調であり、逆関数が存在して微分可能である(定理 3.30、4.8)。多変数関数 f ⁣:Rn→Rnf\colon \mathbb{R}^n \to \mathbb{R}^n でも同じことが言えるだろうか。微分 Df(a)Df(a) は ff の一次近似なので、Df(a)Df(a) が可逆なら、ff 自身も aa の近くで可逆であることが期待される。これが逆関数定理である。

もう一つの問題は、方程式 F(x,y)=0F(x, y) = 0 を yy について「解く」ことである。例えば x2+y2−1=0x^2 + y^2 - 1 = 0 は、y>0y > 0 の部分では y=1−x2y = \sqrt{1 - x^2} と解けるが、点 (1,0)(1, 0) の近くでは yy を xx の関数として表せない(一つの xx に二つの yy が対応する)。どのような条件のもとで、F(x,y)=0F(x, y) = 0 が局所的に y=φ(x)y = \varphi(x) と解けるのか。これに答えるのが陰関数定理である。

どちらの定理も、式で具体的に解けない場合にも解の存在と滑らかさを保証する点に価値がある。その証明の鍵となるのが、反復によって方程式の解を作る縮小写像の原理である。

8.2 縮小写像の原理

定義 8.1(縮小写像, contraction)F⊂RnF \subset \mathbb{R}^n とする。写像 Φ ⁣:F→F\Phi\colon F \to F が、ある定数 0≤q<10 \leq q < 1 についてすべての x,y∈Fx, y \in F で

∥Φ(x)−Φ(y)∥≤q∥x−y∥\lVert \Phi(x) - \Phi(y) \rVert \leq q\lVert x - y \rVert

を満たすとき、Φ\Phi を縮小写像という。

定理 8.2(縮小写像の原理, contraction mapping principle)F⊂RnF \subset \mathbb{R}^n を空でない閉集合、Φ ⁣:F→F\Phi\colon F \to F を縮小写像とする。このとき Φ(x∗)=x∗\Phi(x^{\ast}) = x^{\ast} となる不動点 x∗∈Fx^{\ast} \in F がただ一つ存在する。さらに、任意の x0∈Fx_0 \in F から xk+1=Φ(xk)x_{k+1} = \Phi(x_k) で作った点列は x∗x^{\ast} に収束し、

∥xk−x∗∥≤qk1−q∥x1−x0∥\lVert x_k - x^{\ast} \rVert \leq \frac{q^k}{1 - q}\lVert x_1 - x_0 \rVert

証明. ∥xk+1−xk∥=∥Φ(xk)−Φ(xk−1)∥≤q∥xk−xk−1∥\lVert x_{k+1} - x_k \rVert = \lVert \Phi(x_k) - \Phi(x_{k-1}) \rVert \leq q\lVert x_k - x_{k-1} \rVert なので、帰納法で ∥xk+1−xk∥≤qkd\lVert x_{k+1} - x_k \rVert \leq q^k d(d=∥x1−x0∥d = \lVert x_1 - x_0 \rVert)。l>kl > k なら

∥xl−xk∥≤∑j=kl−1qjd≤qk1−qd(1)\lVert x_l - x_k \rVert \leq \sum_{j=k}^{l-1}q^jd \leq \frac{q^k}{1 - q}d \tag{1}

右辺は k→∞k \to \infty で 00 に収束するので (xk)(x_k) はコーシー列であり、Rn\mathbb{R}^n で収束する(成分ごとに系 1.35 (4))。極限を x∗x^{\ast} とすると、FF は閉なので x∗∈Fx^{\ast} \in F(命題 7.3)。Φ\Phi はリプシッツ連続なので、xk+1=Φ(xk)x_{k+1} = \Phi(x_k) で k→∞k \to \infty として x∗=Φ(x∗)x^{\ast} = \Phi(x^{\ast})。(1) で l→∞l \to \infty とすれば誤差評価を得る。一意性:Φ(y∗)=y∗\Phi(y^{\ast}) = y^{\ast} なら ∥x∗−y∗∥≤q∥x∗−y∗∥\lVert x^{\ast} - y^{\ast} \rVert \leq q\lVert x^{\ast} - y^{\ast} \rVert で、q<1q < 1 より x∗=y∗x^{\ast} = y^{\ast}。□\square

FF が閉であること(極限が外に逃げない)と Φ(F)⊂F\Phi(F) \subset F は、どちらも欠かせない仮定である。この定理は、より一般に完備距離空間で成り立ち(03-topology 第7章)、関数の空間に適用すると常微分方程式の解の存在定理が得られる(08-differential-equations 第2章)。

例 8.3 (1) 方程式 x=cos⁡xx = \cos x は [0,1][0, 1] にただ一つの解をもつ。cos⁡\cos は [0,1][0, 1] を [cos⁡1,1]⊂[0,1][\cos 1, 1] \subset [0, 1] に写し、平均値の定理より ∣cos⁡x−cos⁡y∣≤sin⁡1⋅∣x−y∣\lvert \cos x - \cos y \rvert \leq \sin 1 \cdot \lvert x - y \rvert(sin⁡1<1\sin 1 < 1)なので縮小写像である。解は 0.739085…0.739085\ldots。 (2) Φ(x)=x2+1x\Phi(x) = \frac{x}{2} + \frac{1}{x} は [1,2][1, 2] を [2,32]⊂[1,2][\sqrt{2}, \frac{3}{2}] \subset [1, 2] に写し、Φ′(x)=12−1x2∈[−12,14]\Phi'(x) = \frac{1}{2} - \frac{1}{x^2} \in [-\frac{1}{2}, \frac{1}{4}] なので q=12q = \frac{1}{2} の縮小写像である。不動点は x=x2+1xx = \frac{x}{2} + \frac{1}{x}、すなわち x=2x = \sqrt{2}。x0=1x_0 = 1 から 1.51.5, 1.41666…1.41666\ldots, 1.4142156…1.4142156\ldots と急速に収束する(これはニュートン法である)。

8.3 平均値の不等式

第7章で注意したように、Rm\mathbb{R}^m 値関数に対しては平均値の定理の等式版は成り立たない。しかし、不等式版は成り立つ。

定理 8.4(平均値の不等式, mean value inequality)U⊂RnU \subset \mathbb{R}^n を開集合、f ⁣:U→Rmf\colon U \to \mathbb{R}^m を微分可能、線分 [a,b]⊂U[a, b] \subset U とする。このとき

∥f(b)−f(a)∥≤sup⁡c∈[a,b]∥Df(c)∥⋅∥b−a∥\lVert f(b) - f(a) \rVert \leq \sup_{c \in [a, b]}\lVert Df(c) \rVert \cdot \lVert b - a \rVert

証明. v=f(b)−f(a)v = f(b) - f(a) とし、v≠0v \neq 0 としてよい。実数値関数 φ(t)=⟨v,f(a+t(b−a))⟩\varphi(t) = \langle v, f(a + t(b - a)) \rangle に 1 変数の平均値の定理と連鎖律を使うと、ある c∈[a,b]c \in [a, b] で

∥v∥2=φ(1)−φ(0)=⟨v,Df(c)(b−a)⟩≤∥v∥∥Df(c)∥∥b−a∥\lVert v \rVert^2 = \varphi(1) - \varphi(0) = \langle v, Df(c)(b - a) \rangle \leq \lVert v \rVert\lVert Df(c) \rVert\lVert b - a \rVert

(コーシー–シュワルツの不等式)。両辺を ∥v∥\lVert v \rVert で割ればよい。□\square

特に、凸な開集合 UU 上で ∥Df∥≤M\lVert Df \rVert \leq M なら、ff は UU 上でリプシッツ定数 MM のリプシッツ連続である。また、定理 8.4 を g(x)=f(x)−Axg(x) = f(x) - Ax(AA は定行列)に適用すると

∥f(b)−f(a)−A(b−a)∥≤sup⁡c∈[a,b]∥Df(c)−A∥⋅∥b−a∥(2)\lVert f(b) - f(a) - A(b - a) \rVert \leq \sup_{c \in [a,b]}\lVert Df(c) - A \rVert \cdot \lVert b - a \rVert \tag{2}

が得られる。逆関数定理の証明ではこの形を使う。

8.4 逆関数定理

定理 8.5(逆関数定理, inverse function theorem)U⊂RnU \subset \mathbb{R}^n を開集合、f ⁣:U→Rnf\colon U \to \mathbb{R}^n を C1C^1 級、a∈Ua \in U で Df(a)Df(a) が正則(det⁡Df(a)≠0\det Df(a) \neq 0)とする。このとき aa の開近傍 V⊂UV \subset U と f(a)f(a) の開近傍 WW が存在して、

  1. ff は VV から WW への全単射である。
  2. 逆写像 g=(f∣V)−1 ⁣:W→Vg = (f\vert_V)^{-1}\colon W \to V は C1C^1 級で、Dg(y)=Df(g(y))−1Dg(y) = Df(g(y))^{-1}(y∈Wy \in W)。

さらに ff が CkC^k 級なら gg も CkC^k 級である(問題 8.9)。

証明の方針. f(x)=yf(x) = y を解くことを、写像 Φy(x)=x+A−1(y−f(x))\Phi_y(x) = x + A^{-1}(y - f(x))(A=Df(a)A = Df(a))の不動点を求めることに言い換える。DΦy(x)=A−1(A−Df(x))D\Phi_y(x) = A^{-1}(A - Df(x)) は xx が aa に近ければ小さいので、Φy\Phi_y は縮小写像になる。

証明. A=Df(a)A = Df(a)、λ=12∥A−1∥\lambda = \frac{1}{2\lVert A^{-1} \rVert}、b=f(a)b = f(a) とおく。DfDf の連続性から、閉球 B‾(a,r)={x∣∥x−a∥≤r}⊂U\overline{B}(a, r) = \lbrace x \mid \lVert x - a \rVert \leq r \rbrace \subset U で

∥Df(x)−A∥≤λ(x∈B‾(a,r))(3)\lVert Df(x) - A \rVert \leq \lambda \quad (x \in \overline{B}(a, r)) \tag{3}

となる r>0r > 0 をとる。

第1段(単射性と下からの評価). x,x′∈B‾(a,r)x, x' \in \overline{B}(a, r) とする。(2) と (3) より ∥f(x)−f(x′)−A(x−x′)∥≤λ∥x−x′∥\lVert f(x) - f(x') - A(x - x') \rVert \leq \lambda\lVert x - x' \rVert。一方 ∥x−x′∥=∥A−1A(x−x′)∥≤∥A−1∥∥A(x−x′)∥\lVert x - x' \rVert = \lVert A^{-1}A(x - x') \rVert \leq \lVert A^{-1} \rVert\lVert A(x - x') \rVert より ∥A(x−x′)∥≥2λ∥x−x′∥\lVert A(x - x') \rVert \geq 2\lambda\lVert x - x' \rVert。したがって

∥f(x)−f(x′)∥≥∥A(x−x′)∥−λ∥x−x′∥≥λ∥x−x′∥(4)\lVert f(x) - f(x') \rVert \geq \lVert A(x - x') \rVert - \lambda\lVert x - x' \rVert \geq \lambda\lVert x - x' \rVert \tag{4}

特に ff は B‾(a,r)\overline{B}(a, r) 上で単射である。

第2段(全射性). W=B(b,λr)W = B(b, \lambda r) とし、y∈Wy \in W を固定する。Φy(x)=x+A−1(y−f(x))\Phi_y(x) = x + A^{-1}(y - f(x)) とおくと、Φy(x)=x⇔f(x)=y\Phi_y(x) = x \Leftrightarrow f(x) = y。DΦy(x)=A−1(A−Df(x))D\Phi_y(x) = A^{-1}(A - Df(x)) なので (3) より ∥DΦy(x)∥≤∥A−1∥λ=12\lVert D\Phi_y(x) \rVert \leq \lVert A^{-1} \rVert\lambda = \frac{1}{2} であり、平均値の不等式より Φy\Phi_y は B‾(a,r)\overline{B}(a, r) 上で q=12q = \frac{1}{2} の縮小写像である。さらに x∈B‾(a,r)x \in \overline{B}(a, r) なら

∥Φy(x)−a∥≤∥Φy(x)−Φy(a)∥+∥Φy(a)−a∥≤r2+∥A−1∥∥y−b∥<r2+∥A−1∥λr=r\lVert \Phi_y(x) - a \rVert \leq \lVert \Phi_y(x) - \Phi_y(a) \rVert + \lVert \Phi_y(a) - a \rVert \leq \frac{r}{2} + \lVert A^{-1} \rVert\lVert y - b \rVert < \frac{r}{2} + \lVert A^{-1} \rVert\lambda r = r

なので Φy(B‾(a,r))⊂B(a,r)\Phi_y(\overline{B}(a, r)) \subset B(a, r)。縮小写像の原理より Φy\Phi_y は不動点 x∈B‾(a,r)x \in \overline{B}(a,r) をもち、x=Φy(x)∈B(a,r)x = \Phi_y(x) \in B(a, r)。V=B(a,r)∩f−1(W)V = B(a, r) \cap f^{-1}(W) とおくと、VV は開集合(ff は連続)で a∈Va \in V であり、以上より f ⁣:V→Wf\colon V \to W は全射、第1段より単射である。

第3段(逆写像の連続性). g=(f∣V)−1g = (f\vert_V)^{-1} とする。(4) で x=g(y)x = g(y)、x′=g(y′)x' = g(y') とすれば ∥g(y)−g(y′)∥≤1λ∥y−y′∥\lVert g(y) - g(y') \rVert \leq \frac{1}{\lambda}\lVert y - y' \rVert。gg はリプシッツ連続である。

第4段(逆写像の微分可能性). y∈Wy \in W、x=g(y)x = g(y) とする。まず B=Df(x)B = Df(x) は正則である:Bv=0Bv = 0 なら ∥Av∥=∥(A−B)v∥≤λ∥v∥\lVert Av \rVert = \lVert (A - B)v \rVert \leq \lambda\lVert v \rVert だが、第1段と同様に ∥Av∥≥2λ∥v∥\lVert Av \rVert \geq 2\lambda\lVert v \rVert なので v=0v = 0。y+k∈Wy + k \in W に対し h=g(y+k)−g(y)h = g(y + k) - g(y) とおくと、ff の xx での微分可能性より

k=f(x+h)−f(x)=Bh+∥h∥ρ(h),ρ(h)→0 (h→0)k = f(x + h) - f(x) = Bh + \lVert h \rVert\rho(h), \quad \rho(h) \to 0 \ (h \to 0)

よって h=B−1k−∥h∥B−1ρ(h)h = B^{-1}k - \lVert h \rVert B^{-1}\rho(h)。第3段より ∥h∥≤1λ∥k∥\lVert h \rVert \leq \frac{1}{\lambda}\lVert k \rVert で、k→0k \to 0 なら h→0h \to 0 なので

∥g(y+k)−g(y)−B−1k∥∥k∥≤∥h∥∥k∥∥B−1∥∥ρ(h)∥≤∥B−1∥λ∥ρ(h)∥→0\frac{\lVert g(y + k) - g(y) - B^{-1}k \rVert}{\lVert k \rVert} \leq \frac{\lVert h \rVert}{\lVert k \rVert}\lVert B^{-1} \rVert\lVert \rho(h) \rVert \leq \frac{\lVert B^{-1} \rVert}{\lambda}\lVert \rho(h) \rVert \to 0

(h=0h = 0 のときは左辺の分子も 00)。したがって gg は yy で微分可能で Dg(y)=Df(g(y))−1Dg(y) = Df(g(y))^{-1}。

第5段(C1C^1 級であること). Dg(y)=ι(Df(g(y)))Dg(y) = \iota(Df(g(y)))、ただし ι\iota は逆行列をとる写像で、これは連続である(問題 7.9)。gg、DfDf、ι\iota の合成なので DgDg は連続である。□\square

注意

逆関数定理の結論は局所的である。DfDf がいたるところ正則でも、ff が大域的に単射とは限らない。例えば極座標 f(r,θ)=(rcos⁡θ,rsin⁡θ)f(r, \theta) = (r\cos\theta, r\sin\theta) は r>0r > 0 で det⁡Df=r≠0\det Df = r \neq 0 だが、θ\theta について周期 2π2\pi をもつので単射でない。1 変数では「f′f' がいたるところ 00 でない」なら ff は狭義単調で大域的に単射になる(ダルブーの定理)ので、これは多変数に特有の現象である。

例 8.6 f(x,y)=(x2−y2,2xy)f(x, y) = (x^2 - y^2, 2xy)(複素数の 2 乗 z↦z2z \mapsto z^2)は det⁡Df=4(x2+y2)\det Df = 4(x^2 + y^2) なので、原点以外の各点の近くで可逆だが、f(−x,−y)=f(x,y)f(-x, -y) = f(x, y) なので 2 対 1 である。原点では Df=0Df = 0 であり、どんな近傍でも単射でない。

逆関数定理の仮定 det⁡Df(a)≠0\det Df(a) \neq 0 は、C1C^1 級の逆写像が存在するための必要条件でもある(g∘f=idg \circ f = \mathrm{id} を微分すると Dg(f(a))Df(a)=IDg(f(a))Df(a) = I)。ただし連続な逆写像なら、det⁡Df(a)=0\det Df(a) = 0 でも存在しうる(f(x)=x3f(x) = x^3)。

8.5 陰関数定理

Rn×Rm\mathbb{R}^n \times \mathbb{R}^m の点を (x,y)(x, y)(x∈Rnx \in \mathbb{R}^n、y∈Rmy \in \mathbb{R}^m)と書く。F ⁣:U→RmF\colon U \to \mathbb{R}^m(U⊂Rn+mU \subset \mathbb{R}^{n+m} 開集合)に対して、DxFD_xF を xx についての偏微分を並べた m×nm \times n 行列、DyF=(∂Fi∂yj)D_yF = \left(\frac{\partial F_i}{\partial y_j}\right) を m×mm \times m 行列とする。DF=(DxF  DyF)DF = (D_xF \ \ D_yF) である。

方程式の個数(mm)と未知数 yy の個数(mm)が等しいことに注意する。一次方程式 Bx+Cy=0Bx + Cy = 0(CC は m×mm \times m 行列)が y=−C−1Bxy = -C^{-1}Bx と解けるための条件は CC が正則であることだった。陰関数定理は、この線形代数の事実の非線形版である。

定理 8.7(陰関数定理, implicit function theorem)U⊂Rn×RmU \subset \mathbb{R}^n \times \mathbb{R}^m を開集合、F ⁣:U→RmF\colon U \to \mathbb{R}^m を C1C^1 級とし、(a,b)∈U(a, b) \in U で F(a,b)=0F(a, b) = 0 かつ DyF(a,b)D_yF(a, b) が正則とする。このとき aa の開近傍 VV、bb の開近傍 WW(V×W⊂UV \times W \subset U)と C1C^1 級写像 φ ⁣:V→W\varphi\colon V \to W が存在して、(x,y)∈V×W(x, y) \in V \times W について

F(x,y)=0  ⟺  y=φ(x)F(x, y) = 0 \iff y = \varphi(x)

が成り立つ。さらに

Dφ(x)=−DyF(x,φ(x))−1DxF(x,φ(x))D\varphi(x) = -D_yF(x, \varphi(x))^{-1}D_xF(x, \varphi(x))

証明. Φ(x,y)=(x,F(x,y))\Phi(x, y) = (x, F(x, y)) とおくと、Φ ⁣:U→Rn+m\Phi\colon U \to \mathbb{R}^{n+m} は C1C^1 級で

DΦ(a,b)=(InODxF(a,b)DyF(a,b)),det⁡DΦ(a,b)=det⁡DyF(a,b)≠0D\Phi(a, b) = \begin{pmatrix} I_n & O \\ D_xF(a, b) & D_yF(a, b) \end{pmatrix}, \qquad \det D\Phi(a, b) = \det D_yF(a, b) \neq 0

逆関数定理より、(a,b)(a, b) の開近傍 Ω\Omega と (a,0)(a, 0) の開近傍 Ω′\Omega' があって Φ ⁣:Ω→Ω′\Phi\colon \Omega \to \Omega' は全単射で、逆写像 Ψ\Psi は C1C^1 級である。Φ\Phi は第 1 成分を変えないので、Ψ(x,z)=(x,ψ(x,z))\Psi(x, z) = (x, \psi(x, z)) の形である。Ω\Omega を小さくして、aa、bb の開近傍 V0V_0、WW の積 V0×W⊂ΩV_0 \times W \subset \Omega をとる。Φ(V0×W)=Ψ−1(V0×W)\Phi(V_0 \times W) = \Psi^{-1}(V_0 \times W) は (a,0)(a, 0) を含む開集合なので、aa の開近傍 V⊂V0V \subset V_0 を、x∈Vx \in V なら (x,0)∈Φ(V0×W)(x, 0) \in \Phi(V_0 \times W) となるようにとれる。φ(x)=ψ(x,0)\varphi(x) = \psi(x, 0)(x∈Vx \in V)と定める。

  • x∈Vx \in V なら Ψ(x,0)=(x,φ(x))∈V0×W\Psi(x, 0) = (x, \varphi(x)) \in V_0 \times W なので φ(x)∈W\varphi(x) \in W、また Φ(x,φ(x))=(x,0)\Phi(x, \varphi(x)) = (x, 0) より F(x,φ(x))=0F(x, \varphi(x)) = 0。
  • (x,y)∈V×W(x, y) \in V \times W が F(x,y)=0F(x, y) = 0 を満たせば、Φ(x,y)=(x,0)=Φ(x,φ(x))\Phi(x, y) = (x, 0) = \Phi(x, \varphi(x)) で、両点は Ω\Omega に属し Φ\Phi はそこで単射なので y=φ(x)y = \varphi(x)。

φ\varphi は C1C^1 級写像 Ψ\Psi の成分なので C1C^1 級である。最後に、恒等式 F(x,φ(x))=0F(x, \varphi(x)) = 0 を連鎖律で微分すると DxF+DyF Dφ=0D_xF + D_yF\ D\varphi = 0。DyF(x,φ(x))D_yF(x, \varphi(x)) は xx が aa に近ければ正則(det⁡\det の連続性。必要なら VV を小さくする)なので、公式を得る。□\square

例 8.8(円)F(x,y)=x2+y2−1F(x, y) = x^2 + y^2 - 1。Fy=2yF_y = 2y なので、y≠0y \neq 0 である円周上の点の近くでは y=φ(x)y = \varphi(x) と解け、φ′(x)=−FxFy=−xy\varphi'(x) = -\frac{F_x}{F_y} = -\frac{x}{y}。実際 y>0y > 0 なら φ(x)=1−x2\varphi(x) = \sqrt{1 - x^2}。(±1,0)(\pm 1, 0) では Fy=0F_y = 0 であり、yy を xx の関数として表せない。しかし Fx=±2≠0F_x = \pm 2 \neq 0 なので、xx を yy の関数として表せる。

例 8.9(デカルトの葉線)F(x,y)=x3+y3−3xy=0F(x, y) = x^3 + y^3 - 3xy = 0。Fy=3(y2−x)F_y = 3(y^2 - x) なので、y2≠xy^2 \neq x である曲線上の点の近くでは y=φ(x)y = \varphi(x) と解け、φ′=−x2−yy2−x\varphi' = -\frac{x^2 - y}{y^2 - x}。原点では Fx=Fy=0F_x = F_y = 0 となり、実際に曲線は原点で自分自身と交差していて、原点の近くではどちらの変数についても関数のグラフとして表せない。

例 8.10(2 階導関数)F(x,y)=0F(x, y) = 0 から y=φ(x)y = \varphi(x) が定まるとき、φ′′\varphi'' は恒等式を 2 回微分して求める。円の場合、x+yy′=0x + yy' = 0 をさらに微分して 1+y′2+yy′′=01 + y'^2 + yy'' = 0、よって y′′=−1+y′2y=−x2+y2y3=−1y3y'' = -\frac{1 + y'^2}{y} = -\frac{x^2 + y^2}{y^3} = -\frac{1}{y^3}。

8.6 ラグランジュの未定乗数法

条件 g(x)=0g(x) = 0 のもとで f(x)f(x) の極値を求める問題を考える。例えば「周の長さが一定の長方形のうち面積最大のもの」や「単位球面上での二次形式の最大値」である。条件を解いて変数を減らせればよいが、それができない場合でも、陰関数定理を使えば極値の必要条件が得られる。

定理 8.11(ラグランジュの未定乗数法, method of Lagrange multipliers)U⊂RnU \subset \mathbb{R}^n を開集合、f,g1,…,gm ⁣:U→Rf, g_1, \dots, g_m\colon U \to \mathbb{R} を C1C^1 級(m<nm < n)とし、g=(g1,…,gm)g = (g_1, \dots, g_m)、M={x∈U∣g(x)=0}M = \lbrace x \in U \mid g(x) = 0 \rbrace とおく。a∈Ma \in M で f∣Mf\vert_M が極値をとり、Dg(a)Dg(a) の階数が mm ならば、

∇f(a)=∑i=1mλi∇gi(a)\nabla f(a) = \sum_{i=1}^{m}\lambda_i\nabla g_i(a)

を満たす λ1,…,λm∈R\lambda_1, \dots, \lambda_m \in \mathbb{R}(ラグランジュ乗数)が存在する。

証明. Dg(a)Dg(a) は階数 mm なので、mm 個の列が線形独立である。座標を並べ替えて、x=(u,v)∈Rn−m×Rmx = (u, v) \in \mathbb{R}^{n-m} \times \mathbb{R}^m、a=(u0,v0)a = (u_0, v_0) と書いたとき Dvg(a)D_vg(a) が正則であるとしてよい。陰関数定理より、aa の近くで MM は v=φ(u)v = \varphi(u) のグラフであり、h(u)=f(u,φ(u))h(u) = f(u, \varphi(u)) は u0u_0 で極値をとる。命題 7.23 と連鎖律より

0=Dh(u0)=Duf(a)+Dvf(a)Dφ(u0)=Duf(a)−Dvf(a)Dvg(a)−1Dug(a)0 = Dh(u_0) = D_uf(a) + D_vf(a)D\varphi(u_0) = D_uf(a) - D_vf(a)D_vg(a)^{-1}D_ug(a)

横ベクトル λT=Dvf(a)Dvg(a)−1\lambda^T = D_vf(a)D_vg(a)^{-1}(1×m1 \times m)とおくと、Dvf(a)=λTDvg(a)D_vf(a) = \lambda^TD_vg(a) であり、上式より Duf(a)=λTDug(a)D_uf(a) = \lambda^TD_ug(a)。合わせて Df(a)=λTDg(a)Df(a) = \lambda^TDg(a)、すなわち ∇f(a)=∑λi∇gi(a)\nabla f(a) = \sum\lambda_i\nabla g_i(a)。□\square

実際には、L(x,λ)=f(x)−∑λigi(x)L(x, \lambda) = f(x) - \sum\lambda_ig_i(x) とおいて、n+mn + m 個の方程式 ∇xL=0\nabla_xL = 0、g=0g = 0 を解いて極値の候補を求める。幾何学的には、ker⁡Dg(a)\ker Dg(a)(MM の接空間、8.7 節)上で Df(a)Df(a) が 00 になる、つまり勾配 ∇f(a)\nabla f(a) が MM に直交することを意味する。定理は必要条件にすぎないので、候補の中から最大・最小を決めるには、コンパクト性による最大値の存在などを別に確かめる必要がある。

例 8.12(相加相乗平均の不等式)s>0s > 0 とし、K={x∈Rn∣xi≥0, ∑xi=s}K = \lbrace x \in \mathbb{R}^n \mid x_i \geq 0,\ \sum x_i = s \rbrace 上で f(x)=x1x2⋯xnf(x) = x_1x_2\cdots x_n の最大値を求める。KK は有界閉集合なので最大値が存在し、f(sn,…,sn)>0f\left(\frac{s}{n}, \dots, \frac{s}{n}\right) > 0 なので、最大値は KK の境界(ある xi=0x_i = 0 で f=0f = 0)ではなく、開集合 U=(0,∞)nU = (0, \infty)^n の点 aa でとられる。g(x)=∑xi−sg(x) = \sum x_i - s は ∇g=(1,…,1)≠0\nabla g = (1, \dots, 1) \neq 0 なので定理 8.11 が使え、∂if(a)=∏j≠iaj=λ\partial_if(a) = \prod_{j \neq i}a_j = \lambda。両辺に aia_i を掛けると f(a)=λaif(a) = \lambda a_i で、f(a)>0f(a) > 0 より λ≠0\lambda \neq 0、したがってすべての aia_i は等しく ai=sna_i = \frac{s}{n}。よって KK 上で x1⋯xn≤(sn)nx_1\cdots x_n \leq \left(\frac{s}{n}\right)^n、すなわち

x1x2⋯xnn≤x1+x2+⋯+xnn(xi≥0)\sqrt[n]{x_1x_2\cdots x_n} \leq \frac{x_1 + x_2 + \cdots + x_n}{n} \quad (x_i \geq 0)

例 8.13(対称行列の最大固有値)AA を nn 次実対称行列とし、単位球面 S={x∣∥x∥2=1}S = \lbrace x \mid \lVert x \rVert^2 = 1 \rbrace 上で f(x)=⟨Ax,x⟩f(x) = \langle Ax, x \rangle を考える。SS はコンパクトなので ff は最大値をとる。g(x)=∥x∥2−1g(x) = \lVert x \rVert^2 - 1 について ∇g=2x≠0\nabla g = 2x \neq 0(SS 上)、∇f=2Ax\nabla f = 2Ax(AA の対称性による)なので、最大値をとる点 aa で Aa=λaAa = \lambda a。よって aa は AA の固有ベクトルで、f(a)=⟨λa,a⟩=λf(a) = \langle \lambda a, a \rangle = \lambda。さらに任意の固有値 μ\mu(固有ベクトル w∈Sw \in S)について μ=f(w)≤f(a)=λ\mu = f(w) \leq f(a) = \lambda なので

max⁡∥x∥=1⟨Ax,x⟩=(A の最大固有値)\max_{\lVert x \rVert = 1}\langle Ax, x \rangle = (A \text{ の最大固有値})

特に、実対称行列は実数の固有値と実固有ベクトルをもつ。これを帰納的に使えば、実対称行列が直交行列で対角化できること(スペクトル定理)が示せる(問題 8.8、02-linear-algebra 第7章)。

注意

階数の条件は外せない。g(x,y)=y2−x3g(x, y) = y^2 - x^3 の零点集合(尖点のある曲線)上で f(x,y)=xf(x, y) = x を考えると、x3=y2≥0x^3 = y^2 \geq 0 より f≥0f \geq 0 で、原点で最小値 00 をとる。しかし原点では ∇g=(0,0)\nabla g = (0, 0) であり、∇f=(1,0)\nabla f = (1, 0) は ∇g\nabla g の定数倍でない。∇g=0\nabla g = 0 となる点は、ラグランジュの方法とは別に調べる必要がある。

8.7 曲線・曲面と接空間

陰関数定理は、方程式で定まる図形が「局所的に滑らかなグラフ」であることを保証する。

定義 8.14 U⊂RnU \subset \mathbb{R}^n を開集合、g ⁣:U→Rmg\colon U \to \mathbb{R}^m を C1C^1 級(m<nm < n)とする。M=g−1(0)M = g^{-1}(0) の各点 aa で Dg(a)Dg(a) の階数が mm(全射)であるとき、MM を Rn\mathbb{R}^n の (n−m)(n - m) 次元の正則な等位集合という。n−m=1n - m = 1 なら曲線、22 なら曲面である。

陰関数定理の証明で見たように、各点 a∈Ma \in M の近くで、適当な n−mn - m 個の座標 uu について MM は C1C^1 級関数のグラフ {(u,φ(u))}\lbrace (u, \varphi(u)) \rbrace(座標の並べ替えを除く)になっている。これが、07-manifolds で学ぶ部分多様体の原型である。

命題 8.15(接空間)MM を定義 8.14 の正則な等位集合、a∈Ma \in M とする。C1C^1 級曲線 γ ⁣:(−ε,ε)→Rn\gamma\colon (-\varepsilon, \varepsilon) \to \mathbb{R}^n で γ(t)∈M\gamma(t) \in M、γ(0)=a\gamma(0) = a を満たすものの速度ベクトル γ′(0)\gamma'(0) 全体は、線形部分空間 ker⁡Dg(a)\ker Dg(a) に一致する。これを MM の aa における接空間 (tangent space) といい TaMT_aM と書く。dim⁡TaM=n−m\dim T_aM = n - m である。

証明. g(γ(t))=0g(\gamma(t)) = 0 を t=0t = 0 で微分すると Dg(a)γ′(0)=0Dg(a)\gamma'(0) = 0 なので、速度ベクトルは ker⁡Dg(a)\ker Dg(a) に属する。逆に w∈ker⁡Dg(a)w \in \ker Dg(a) とし、陰関数定理の座標 x=(u,v)x = (u, v)、v=φ(u)v = \varphi(u) をとる。w=(wu,wv)w = (w_u, w_v) と分けると、γ(t)=(u0+twu,φ(u0+twu))\gamma(t) = (u_0 + tw_u, \varphi(u_0 + tw_u)) は MM 上の曲線で、γ′(0)=(wu,Dφ(u0)wu)\gamma'(0) = (w_u, D\varphi(u_0)w_u)。Dφ(u0)=−Dvg(a)−1Dug(a)D\varphi(u_0) = -D_vg(a)^{-1}D_ug(a) と Dug(a)wu+Dvg(a)wv=0D_ug(a)w_u + D_vg(a)w_v = 0 より Dφ(u0)wu=wvD\varphi(u_0)w_u = w_v、すなわち γ′(0)=w\gamma'(0) = w。次元は階数・核の次元定理による。□\square

m=1m = 1 のとき TaM={w∣⟨∇g(a),w⟩=0}T_aM = \lbrace w \mid \langle \nabla g(a), w \rangle = 0 \rbrace であり、勾配は等位面に直交する(法線ベクトルである)。ラグランジュの条件「∇f(a)\nabla f(a) は ∇gi(a)\nabla g_i(a) の線形結合」は、「∇f(a)\nabla f(a) が TaMT_aM に直交する」、すなわち「MM に沿ったどの方向にも ff の 1 次の変化がない」ことと同値である。

例 8.16 (1) 球面 Sn−1={x∣∥x∥2=1}S^{n-1} = \lbrace x \mid \lVert x \rVert^2 = 1 \rbrace は、g(x)=∥x∥2−1g(x) = \lVert x \rVert^2 - 1、∇g=2x≠0\nabla g = 2x \neq 0 なので (n−1)(n-1) 次元の正則な等位集合で、TaSn−1={w∣⟨a,w⟩=0}T_aS^{n-1} = \lbrace w \mid \langle a, w \rangle = 0 \rbrace。 (2)(直交群)nn 次正方行列全体 Rn2\mathbb{R}^{n^2} の中で O(n)={A∣ATA=I}O(n) = \lbrace A \mid A^TA = I \rbrace を考える。g(A)=ATA−Ig(A) = A^TA - I は対称行列の空間(次元 n(n+1)2\frac{n(n+1)}{2})に値をとり、Dg(A)H=HTA+ATHDg(A)H = H^TA + A^TH。A∈O(n)A \in O(n) と対称行列 SS に対して H=12ASH = \frac{1}{2}AS とおくと Dg(A)H=SDg(A)H = S なので Dg(A)Dg(A) は全射である。よって O(n)O(n) は n2−n(n+1)2=n(n−1)2n^2 - \frac{n(n+1)}{2} = \frac{n(n-1)}{2} 次元の正則な等位集合であり、単位行列での接空間は {H∣HT+H=0}\lbrace H \mid H^T + H = 0 \rbrace(交代行列全体)である。これはリー群とリー環の最初の例である(16-lie-groups-representations 第2章)。

まとめ

  • 縮小写像の原理:閉集合上の縮小写像はただ一つの不動点をもち、反復で求まる。誤差は幾何級数的に減少する。
  • ベクトル値関数では平均値の定理の等式は成り立たないが、不等式 ∥f(b)−f(a)∥≤sup⁡∥Df∥∥b−a∥\lVert f(b) - f(a) \rVert \leq \sup\lVert Df \rVert\lVert b - a \rVert は成り立つ。
  • 逆関数定理:C1C^1 級写像は、微分が正則な点の近くで C1C^1 級の逆写像をもち、Dg=(Df)−1Dg = (Df)^{-1}。証明は、方程式 f(x)=yf(x) = y を縮小写像の不動点問題に言い換えることによる。結論は局所的である。
  • 陰関数定理:F(a,b)=0F(a, b) = 0 で DyF(a,b)D_yF(a, b) が正則なら、F(x,y)=0F(x, y) = 0 は局所的に y=φ(x)y = \varphi(x) と一意に解け、Dφ=−(DyF)−1DxFD\varphi = -(D_yF)^{-1}D_xF。逆関数定理を (x,y)↦(x,F(x,y))(x, y) \mapsto (x, F(x, y)) に適用して証明する。
  • ラグランジュの未定乗数法:条件 g=0g = 0(DgDg が最大階数)のもとでの極値点では ∇f=∑λi∇gi\nabla f = \sum\lambda_i\nabla g_i。相加相乗平均の不等式や、対称行列の固有値の存在が導かれる。
  • 正則な等位集合は局所的に滑らかなグラフであり、接空間は ker⁡Dg(a)\ker Dg(a) で与えられる。これが多様体論の出発点である。

演習問題

問題 8.1 ★ 連立方程式 x=14sin⁡(x+y)x = \frac{1}{4}\sin(x + y)、y=1+14cos⁡(x−y)y = 1 + \frac{1}{4}\cos(x - y) は R2\mathbb{R}^2 でただ一つの解をもつことを示せ。

解答

Φ(x,y)=(14sin⁡(x+y),1+14cos⁡(x−y))\Phi(x, y) = \left(\frac{1}{4}\sin(x + y), 1 + \frac{1}{4}\cos(x - y)\right) とおくと

DΦ=14(cos⁡(x+y)cos⁡(x+y)−sin⁡(x−y)sin⁡(x−y))D\Phi = \frac{1}{4}\begin{pmatrix} \cos(x+y) & \cos(x+y) \\ -\sin(x-y) & \sin(x-y) \end{pmatrix}

作用素ノルムは成分の 2 乗和の平方根以下なので、∥DΦ∥≤142cos⁡2(x+y)+2sin⁡2(x−y)≤144=12<1\lVert D\Phi \rVert \leq \frac{1}{4}\sqrt{2\cos^2(x+y) + 2\sin^2(x-y)} \leq \frac{1}{4}\sqrt{4} = \frac{1}{2} < 1。平均値の不等式より Φ\Phi は R2\mathbb{R}^2(閉集合)上の縮小写像なので、縮小写像の原理によりただ一つの不動点をもつ。

問題 8.2 ★ x2+xy+y3=3x^2 + xy + y^3 = 3 は点 (1,1)(1, 1) の近くで y=φ(x)y = \varphi(x) と解けることを示し、φ′(1)\varphi'(1)、φ′′(1)\varphi''(1) を求めよ。

解答

F=x2+xy+y3−3F = x^2 + xy + y^3 - 3 は F(1,1)=0F(1,1) = 0、Fy=x+3y2=4≠0F_y = x + 3y^2 = 4 \neq 0 なので陰関数定理が使える。恒等式を微分して 2x+y+xy′+3y2y′=02x + y + xy' + 3y^2y' = 0、(1,1)(1,1) で 3+4y′=03 + 4y' = 0 より φ′(1)=−34\varphi'(1) = -\frac{3}{4}。さらに微分して 2+2y′+xy′′+6yy′2+3y2y′′=02 + 2y' + xy'' + 6yy'^2 + 3y^2y'' = 0、(1,1)(1, 1) で 2−32+278+4y′′=02 - \frac{3}{2} + \frac{27}{8} + 4y'' = 0 より φ′′(1)=−3132\varphi''(1) = -\frac{31}{32}。

問題 8.3 ★ 球面 x2+y2+z2=1x^2 + y^2 + z^2 = 1 上で f=x+2y+2zf = x + 2y + 2z の最大値・最小値を求めよ。

解答

球面はコンパクトなので最大値・最小値が存在し、∇g=2(x,y,z)≠0\nabla g = 2(x, y, z) \neq 0 なので定理 8.11 が使える。(1,2,2)=2λ(x,y,z)(1, 2, 2) = 2\lambda(x, y, z) より (x,y,z)=t(1,2,2)(x, y, z) = t(1, 2, 2)、球面上なので t=±13t = \pm\frac{1}{3}。f=±3f = \pm 3。最大値 33(点 13(1,2,2)\frac{1}{3}(1,2,2))、最小値 −3-3。(コーシー–シュワルツの不等式 ∣f∣≤∥(1,2,2)∥=3\lvert f \rvert \leq \lVert (1,2,2) \rVert = 3 とも一致する。)

問題 8.4 ★★ F(x,y)=(excos⁡y,exsin⁡y)F(x, y) = (e^x\cos y, e^x\sin y) は R2\mathbb{R}^2 の各点の近くで C1C^1 級の逆写像をもつが、単射でないことを示せ。点 F(0,0)=(1,0)F(0, 0) = (1, 0) での局所逆写像 GG の微分 DG(1,0)DG(1, 0) を求めよ。

解答

DFDF の第 1 行は (excos⁡y,−exsin⁡y)(e^x\cos y, -e^x\sin y)、第 2 行は (exsin⁡y,excos⁡y)(e^x\sin y, e^x\cos y) で、det⁡DF=e2x>0\det DF = e^{2x} > 0 なので逆関数定理が各点で使える。F(x,y+2π)=F(x,y)F(x, y + 2\pi) = F(x, y) なので単射でない。DF(0,0)=IDF(0, 0) = I なので DG(1,0)=IDG(1, 0) = I。(GG は複素対数 u+iv↦log⁡∣u+iv∣+iarg⁡(u+iv)u + iv \mapsto \log\lvert u + iv \rvert + i\arg(u + iv) の実部・虚部である。)

問題 8.5 ★★ 楕円体 x2a2+y2b2+z2c2=1\frac{x^2}{a^2} + \frac{y^2}{b^2} + \frac{z^2}{c^2} = 1 に内接し、各辺が座標軸に平行な直方体の体積の最大値を求めよ。

解答

頂点を (±x,±y,±z)(\pm x, \pm y, \pm z)(x,y,z≥0x, y, z \geq 0)とすると体積は 8xyz8xyz。楕円体の x,y,z≥0x, y, z \geq 0 の部分はコンパクトで、境界(どれかが 00)では体積 00 なので、最大値は x,y,z>0x, y, z > 0 でとられる。ラグランジュの条件 8yz=2λxa28yz = \frac{2\lambda x}{a^2} などに x,y,zx, y, z をそれぞれ掛けると 8xyz=2λx2a2=2λy2b2=2λz2c28xyz = \frac{2\lambda x^2}{a^2} = \frac{2\lambda y^2}{b^2} = \frac{2\lambda z^2}{c^2}。よって x2a2=y2b2=z2c2=13\frac{x^2}{a^2} = \frac{y^2}{b^2} = \frac{z^2}{c^2} = \frac{1}{3} で、最大値は 8⋅abc33=8abc338\cdot\frac{abc}{3\sqrt{3}} = \frac{8abc}{3\sqrt{3}}。

問題 8.6 ★★ 連立方程式 x+y+z+xyz=0x + y + z + xyz = 0、x−y+z3=0x - y + z^3 = 0 は原点の近くで (y,z)=(φ1(x),φ2(x))(y, z) = (\varphi_1(x), \varphi_2(x)) と解けることを示し、φ1′(0)\varphi_1'(0)、φ2′(0)\varphi_2'(0) を求めよ。

解答

F=(x+y+z+xyz, x−y+z3)F = (x + y + z + xyz,\ x - y + z^3) とすると原点で D(y,z)FD_{(y,z)}F の第 1 行は (1,1)(1, 1)、第 2 行は (−1,0)(-1, 0) で、行列式は 1≠01 \neq 0。陰関数定理より解ける。恒等式を xx で微分して原点で評価すると、1+φ1′+φ2′=01 + \varphi_1' + \varphi_2' = 0、1−φ1′=01 - \varphi_1' = 0。よって φ1′(0)=1\varphi_1'(0) = 1、φ2′(0)=−2\varphi_2'(0) = -2。

問題 8.7 ★★ a=(a1,…,an)≠0a = (a_1, \dots, a_n) \neq 0 とする。条件 ∑aixi=1\sum a_ix_i = 1 のもとで ∑xi2\sum x_i^2 の最小値を求めよ(最小値の存在も示せ)。

解答

存在:x0=a∥a∥2x_0 = \frac{a}{\lVert a \rVert^2} は条件を満たし ∥x0∥2=1∥a∥2\lVert x_0 \rVert^2 = \frac{1}{\lVert a \rVert^2}。最小値は、条件を満たし ∥x∥≤∥x0∥\lVert x \rVert \leq \lVert x_0 \rVert となる xx(有界閉集合)の中で探せばよく、そこでは連続関数の最小値が存在する。ラグランジュの条件 2x=λa2x = \lambda a より x=λ2ax = \frac{\lambda}{2}a、条件から λ2=1∥a∥2\frac{\lambda}{2} = \frac{1}{\lVert a \rVert^2}。よって最小値は 1∥a∥2\frac{1}{\lVert a \rVert^2}(原点から超平面までの距離の 2 乗)。

問題 8.8 ★★★ 例 8.13 を用いて、実対称行列 AA は直交行列 PP によって PTAPP^TAP が対角行列になるようにできることを、nn についての帰納法で示せ。

解答

n=1n = 1 は自明。例 8.13 より、単位固有ベクトル aa(Aa=λaAa = \lambda a)がある。W=a⊥={w∣⟨a,w⟩=0}W = a^\perp = \lbrace w \mid \langle a, w \rangle = 0 \rbrace とすると、w∈Ww \in W なら ⟨a,Aw⟩=⟨Aa,w⟩=λ⟨a,w⟩=0\langle a, Aw \rangle = \langle Aa, w \rangle = \lambda\langle a, w \rangle = 0 なので AW⊂WAW \subset W。WW の正規直交基底 q2,…,qnq_2, \dots, q_n をとり Q=(a,q2,…,qn)Q = (a, q_2, \dots, q_n) とすると QQ は直交行列で、QTAQQ^TAQ の第 1 列は QTAa=λQTa=λe1Q^TAa = \lambda Q^Ta = \lambda e_1、対称性から第 1 行も λe1T\lambda e_1^T なので

QTAQ=(λ00A′)(A′ は n−1 次対称行列)Q^TAQ = \begin{pmatrix} \lambda & 0 \\ 0 & A' \end{pmatrix} \quad (A' \text{ は } n-1 \text{ 次対称行列})

帰納法の仮定より P′TA′P′P'^TA'P' が対角となる n−1n-1 次直交行列 P′P' があり、

P=Q(100P′)P = Q\begin{pmatrix} 1 & 0 \\ 0 & P' \end{pmatrix}

とすれば PP は直交行列で PTAPP^TAP は対角行列である。

問題 8.9 ★★★ 逆関数定理において、ff が CkC^k 級(k≥2k \geq 2)なら逆写像 gg も CkC^k 級であることを示せ。

解答

まず「CjC^j 級写像の合成は CjC^j 級」であることを jj についての帰納法で示す:連鎖律より D(F∘G)=(DF∘G)⋅DGD(F \circ G) = (DF \circ G)\cdot DG であり、右辺の各成分は Cj−1C^{j-1} 級関数の合成と積なので帰納法の仮定より Cj−1C^{j-1} 級、よって F∘GF \circ G は CjC^j 級。次に逆行列をとる写像 ι\iota は、成分が行列の成分の有理式(分母は det⁡≠0\det \neq 0)なので C∞C^\infty 級。Dg=ι∘Df∘gDg = \iota \circ Df \circ g であり、gg が CjC^j 級(1≤j<k1 \leq j < k)なら、DfDf は Ck−1C^{k-1} 級なので CjC^j 級、右辺は CjC^j 級写像の合成で CjC^j 級、よって gg は Cj+1C^{j+1} 級。j=1j = 1(定理 8.5)から始めて gg は CkC^k 級となる。

この章を読み終えたら

「読了」にすると学習記録とロードマップに反映されます。演習の自己採点もお忘れなく。

この章の誤りを報告GitHub で見る