この章の目標
R n \mathbb{R}^n R n のノルム・開集合・閉集合・コンパクト集合を扱い、有界閉集合上の連続関数が最大値をとることを証明できる
多変数関数の極限・連続性を ε-δ 論法で扱い、「直線に沿った極限」では不十分であることを理解する
全微分(線形近似)を定義し、偏微分可能性・方向微分可能性との違いを反例で説明できる
C 1 C^1 C 1 級なら全微分可能であること、連鎖律、シュワルツの定理を証明できる
多変数のテイラーの定理を導き、ヘッセ行列の正定値性で極値を判定できる
前提 :第1章 〜第4章 、02-linear-algebra 第1章 、第8章 二次形式 (正定値性)
7.1 R n \mathbb{R}^n R n の距離と位相
1 変数の解析学は「∣ x − a ∣ \lvert x - a \rvert ∣ x − a ∣ が小さい」という概念の上に築かれていた。多変数では、これを点と点の距離に置き換える。
R n \mathbb{R}^n R n の元 x = ( x 1 , … , x n ) x = (x_1, \dots, x_n) x = ( x 1 , … , x n ) を縦ベクトルとも同一視する。標準内積 を ⟨ x , y ⟩ = ∑ i = 1 n x i y i \langle x, y \rangle = \sum_{i=1}^{n}x_iy_i ⟨ x , y ⟩ = ∑ i = 1 n x i y i 、ユークリッドノルム を ∥ x ∥ = ⟨ x , x ⟩ \lVert x \rVert = \sqrt{\langle x, x \rangle} ∥ x ∥ = ⟨ x , x ⟩ と定め、∥ x − y ∥ \lVert x - y \rVert ∥ x − y ∥ を x x x と y y y の距離とする。
命題 7.1 (1)(コーシー–シュワルツの不等式)∣ ⟨ x , y ⟩ ∣ ≤ ∥ x ∥ ∥ y ∥ \lvert \langle x, y \rangle \rvert \leq \lVert x \rVert\lVert y \rVert ∣⟨ x , y ⟩∣ ≤ ∥ x ∥ ∥ y ∥ 。
(2)(三角不等式)∥ x + y ∥ ≤ ∥ x ∥ + ∥ y ∥ \lVert x + y \rVert \leq \lVert x \rVert + \lVert y \rVert ∥ x + y ∥ ≤ ∥ x ∥ + ∥ y ∥ 。
(3) max i ∣ x i ∣ ≤ ∥ x ∥ ≤ n max i ∣ x i ∣ \max_i\lvert x_i \rvert \leq \lVert x \rVert \leq \sqrt{n}\max_i\lvert x_i \rvert max i ∣ x i ∣ ≤ ∥ x ∥ ≤ n max i ∣ x i ∣ 。
証明. (1) y = 0 y = 0 y = 0 なら自明。y ≠ 0 y \neq 0 y = 0 なら任意の t ∈ R t \in \mathbb{R} t ∈ R で 0 ≤ ∥ x − t y ∥ 2 = ∥ x ∥ 2 − 2 t ⟨ x , y ⟩ + t 2 ∥ y ∥ 2 0 \leq \lVert x - ty \rVert^2 = \lVert x \rVert^2 - 2t\langle x, y \rangle + t^2\lVert y \rVert^2 0 ≤ ∥ x − t y ∥ 2 = ∥ x ∥ 2 − 2 t ⟨ x , y ⟩ + t 2 ∥ y ∥ 2 。t = ⟨ x , y ⟩ ∥ y ∥ 2 t = \frac{\langle x, y \rangle}{\lVert y \rVert^2} t = ∥ y ∥ 2 ⟨ x , y ⟩ とすると 0 ≤ ∥ x ∥ 2 − ⟨ x , y ⟩ 2 ∥ y ∥ 2 0 \leq \lVert x \rVert^2 - \frac{\langle x, y \rangle^2}{\lVert y \rVert^2} 0 ≤ ∥ x ∥ 2 − ∥ y ∥ 2 ⟨ x , y ⟩ 2 。(2) ∥ x + y ∥ 2 = ∥ x ∥ 2 + 2 ⟨ x , y ⟩ + ∥ y ∥ 2 ≤ ( ∥ x ∥ + ∥ y ∥ ) 2 \lVert x + y \rVert^2 = \lVert x \rVert^2 + 2\langle x, y \rangle + \lVert y \rVert^2 \leq (\lVert x \rVert + \lVert y \rVert)^2 ∥ x + y ∥ 2 = ∥ x ∥ 2 + 2 ⟨ x , y ⟩ + ∥ y ∥ 2 ≤ (∥ x ∥ + ∥ y ∥ ) 2 。(3) x i 2 ≤ ∑ j x j 2 ≤ n max j x j 2 x_i^2 \leq \sum_j x_j^2 \leq n\max_j x_j^2 x i 2 ≤ ∑ j x j 2 ≤ n max j x j 2 。□ \square □
(3) より、「∥ x ( k ) − a ∥ → 0 \lVert x^{(k)} - a \rVert \to 0 ∥ x ( k ) − a ∥ → 0 」と「各成分が収束する」は同値である。点列 ( x ( k ) ) (x^{(k)}) ( x ( k ) ) が a a a に収束するとは ∥ x ( k ) − a ∥ → 0 \lVert x^{(k)} - a \rVert \to 0 ∥ x ( k ) − a ∥ → 0 のことであり、点列の収束は成分ごとの収束と同値 である。したがって、コーシー列の収束(各成分がコーシー列)やボルツァノ–ワイエルシュトラスの定理(成分ごとに順に部分列をとる)も R n \mathbb{R}^n R n で成り立つ。
定義 7.2 (開集合・閉集合)a ∈ R n a \in \mathbb{R}^n a ∈ R n 、r > 0 r > 0 r > 0 に対して B ( a , r ) = { x ∣ ∥ x − a ∥ < r } B(a, r) = \lbrace x \mid \lVert x - a \rVert < r \rbrace B ( a , r ) = { x ∣ ∥ x − a ∥ < r } を開球 (open ball) という。U ⊂ R n U \subset \mathbb{R}^n U ⊂ R n が開集合 (open set) であるとは、各 a ∈ U a \in U a ∈ U に対して B ( a , r ) ⊂ U B(a, r) \subset U B ( a , r ) ⊂ U となる r > 0 r > 0 r > 0 が存在することをいう。補集合が開集合である集合を閉集合 (closed set) という。A A A に含まれる最大の開集合を内部 A ∘ A^\circ A ∘ 、A A A を含む最小の閉集合を閉包 A ‾ \overline{A} A 、∂ A = A ‾ ∖ A ∘ \partial A = \overline{A} \setminus A^\circ ∂ A = A ∖ A ∘ を境界 という。
開球は開集合である(x ∈ B ( a , r ) x \in B(a, r) x ∈ B ( a , r ) なら三角不等式より B ( x , r − ∥ x − a ∥ ) ⊂ B ( a , r ) B(x, r - \lVert x - a \rVert) \subset B(a, r) B ( x , r − ∥ x − a ∥) ⊂ B ( a , r ) )。閉球 { x ∣ ∥ x − a ∥ ≤ r } \lbrace x \mid \lVert x - a \rVert \leq r \rbrace { x ∣ ∥ x − a ∥ ≤ r } は閉集合である。
命題 7.3 F ⊂ R n F \subset \mathbb{R}^n F ⊂ R n が閉集合であるための必要十分条件は、F F F の点列が収束するとき、その極限が常に F F F に属することである。
証明. (必要性) x ( k ) ∈ F x^{(k)} \in F x ( k ) ∈ F 、x ( k ) → a x^{(k)} \to a x ( k ) → a で a ∉ F a \notin F a ∈ / F とすると、補集合は開なので B ( a , r ) ∩ F = ∅ B(a, r) \cap F = \emptyset B ( a , r ) ∩ F = ∅ となる r r r があるが、十分大きな k k k で x ( k ) ∈ B ( a , r ) x^{(k)} \in B(a, r) x ( k ) ∈ B ( a , r ) となり矛盾。(十分性) 補集合が開でないとすると、ある a ∉ F a \notin F a ∈ / F があって各 k k k で B ( a , 1 k ) B(a, \frac{1}{k}) B ( a , k 1 ) が F F F の点 x ( k ) x^{(k)} x ( k ) を含む。x ( k ) → a ∉ F x^{(k)} \to a \notin F x ( k ) → a ∈ / F となり仮定に反する。□ \square □
定義 7.4 (コンパクト集合)K ⊂ R n K \subset \mathbb{R}^n K ⊂ R n の任意の点列が K K K の点に収束する部分列をもつとき、K K K はコンパクト (compact) であるという。
定理 7.5 K ⊂ R n K \subset \mathbb{R}^n K ⊂ R n がコンパクトであるための必要十分条件は、K K K が有界閉集合であることである。
証明. (十分性) K K K の点列は有界なので、ボルツァノ–ワイエルシュトラスの定理より収束部分列をもち、K K K は閉なのでその極限は K K K に属する(命題 7.3)。(必要性) 有界でなければ ∥ x ( k ) ∥ > k \lVert x^{(k)} \rVert > k ∥ x ( k ) ∥ > k となる点列がとれ、どの部分列も収束しない。閉でなければ、命題 7.3 より K K K の外に極限をもつ収束点列があり、その部分列もすべて同じ極限に収束するので K K K の点に収束しない。□ \square □
補足
位相空間論では、コンパクト性を「任意の開被覆が有限部分被覆をもつ」ことで定義する。R n \mathbb{R}^n R n (より一般に距離空間)ではこれは定義 7.4 と同値であり、R n \mathbb{R}^n R n では有界閉集合と同値である(ハイネ–ボレルの定理)。03-topology 第5章 を参照。
7.2 多変数関数の極限と連続性
D ⊂ R n D \subset \mathbb{R}^n D ⊂ R n 、f : D → R m f\colon D \to \mathbb{R}^m f : D → R m とする。1 変数の場合の ∣ ⋅ ∣ \lvert \cdot \rvert ∣ ⋅ ∣ をノルムに置き換えれば、極限・連続性の定義はそのまま移せる:a a a を D D D の集積点として
lim x → a f ( x ) = b ⟺ ∀ ε > 0 , ∃ δ > 0 , ∀ x ∈ D , 0 < ∥ x − a ∥ < δ ⇒ ∥ f ( x ) − b ∥ < ε \lim_{x \to a}f(x) = b \iff \forall \varepsilon > 0,\ \exists \delta > 0,\ \forall x \in D,\ 0 < \lVert x - a \rVert < \delta \Rightarrow \lVert f(x) - b \rVert < \varepsilon x → a lim f ( x ) = b ⟺ ∀ ε > 0 , ∃ δ > 0 , ∀ x ∈ D , 0 < ∥ x − a ∥ < δ ⇒ ∥ f ( x ) − b ∥ < ε
であり、a ∈ D a \in D a ∈ D で lim x → a f ( x ) = f ( a ) \lim_{x \to a} f(x) = f(a) lim x → a f ( x ) = f ( a ) (または a a a が孤立点)のとき f f f は a a a で連続という。第3章と同様に点列による特徴づけ(定理 3.6)が成り立ち、和・積・合成は連続性を保つ。f = ( f 1 , … , f m ) f = (f_1, \dots, f_m) f = ( f 1 , … , f m ) が連続であることと各成分 f i f_i f i が連続であることは同値である(命題 7.1 (3))。
1 変数と本質的に違うのは、x x x が a a a に近づく方向・経路が無数にある ことである。
例 7.6 (1) f ( x , y ) = x y x 2 + y 2 f(x, y) = \frac{xy}{x^2 + y^2} f ( x , y ) = x 2 + y 2 x y (( x , y ) ≠ 0 (x,y) \neq 0 ( x , y ) = 0 )は原点で極限をもたない。直線 y = k x y = kx y = k x に沿って近づくと f ( x , k x ) = k 1 + k 2 f(x, kx) = \frac{k}{1 + k^2} f ( x , k x ) = 1 + k 2 k で、値が k k k によって異なる。
(2) f ( x , y ) = x 2 y x 2 + y 2 f(x, y) = \frac{x^2y}{x^2 + y^2} f ( x , y ) = x 2 + y 2 x 2 y は原点で 0 0 0 に収束する。
下書き. x 2 x 2 + y 2 ≤ 1 \frac{x^2}{x^2 + y^2} \leq 1 x 2 + y 2 x 2 ≤ 1 なので ∣ f ( x , y ) ∣ ≤ ∣ y ∣ ≤ ∥ ( x , y ) ∥ \lvert f(x, y) \rvert \leq \lvert y \rvert \leq \lVert (x, y) \rVert ∣ f ( x , y )∣ ≤ ∣ y ∣ ≤ ∥( x , y )∥ 。よって δ = ε \delta = \varepsilon δ = ε でよい。
証明. ε > 0 \varepsilon > 0 ε > 0 に対し δ = ε \delta = \varepsilon δ = ε とする。0 < ∥ ( x , y ) ∥ < δ 0 < \lVert (x, y) \rVert < \delta 0 < ∥( x , y )∥ < δ なら ∣ f ( x , y ) − 0 ∣ ≤ ∣ y ∣ ≤ ∥ ( x , y ) ∥ < ε \lvert f(x, y) - 0 \rvert \leq \lvert y \rvert \leq \lVert (x, y) \rVert < \varepsilon ∣ f ( x , y ) − 0 ∣ ≤ ∣ y ∣ ≤ ∥( x , y )∥ < ε 。□ \square □
(3) f ( x , y ) = x 2 y x 4 + y 2 f(x, y) = \frac{x^2y}{x^4 + y^2} f ( x , y ) = x 4 + y 2 x 2 y は、原点を通るどの直線 に沿って近づいても 0 0 0 に近づく(y = k x y = kx y = k x なら f = k x x 2 + k 2 → 0 f = \frac{kx}{x^2 + k^2} \to 0 f = x 2 + k 2 k x → 0 、x = 0 x = 0 x = 0 なら f = 0 f = 0 f = 0 )。しかし放物線 y = x 2 y = x^2 y = x 2 に沿うと f = 1 2 f = \frac{1}{2} f = 2 1 なので、原点で極限をもたない。
注意
例 7.6 (3) が示すように、「すべての直線に沿った極限が一致する」ことは極限の存在を意味しない。極限が存在することを示すには、(2) のように ∣ f ( x ) − b ∣ \lvert f(x) - b \rvert ∣ f ( x ) − b ∣ を ∥ x − a ∥ \lVert x - a \rVert ∥ x − a ∥ だけの式で上から評価する必要がある。極座標 x = r cos θ x = r\cos\theta x = r cos θ 、y = r sin θ y = r\sin\theta y = r sin θ を使って、θ \theta θ によらない g ( r ) → 0 g(r) \to 0 g ( r ) → 0 で ∣ f − b ∣ ≤ g ( r ) \lvert f - b \rvert \leq g(r) ∣ f − b ∣ ≤ g ( r ) と評価するのが定石である。
第3章の最大値定理とハイネ–カントールの定理は、証明を一字一句変えずに(ボルツァノ–ワイエルシュトラスを R n \mathbb{R}^n R n 版にして)次のように一般化される。
定理 7.7 K ⊂ R n K \subset \mathbb{R}^n K ⊂ R n をコンパクト集合、f : K → R f\colon K \to \mathbb{R} f : K → R を連続とする。
f f f は有界であり、最大値と最小値をとる。
f f f は K K K 上一様連続である:∀ ε > 0 , ∃ δ > 0 , ∀ x , y ∈ K , ∥ x − y ∥ < δ ⇒ ∣ f ( x ) − f ( y ) ∣ < ε \forall \varepsilon > 0,\ \exists \delta > 0,\ \forall x, y \in K,\ \lVert x - y \rVert < \delta \Rightarrow \lvert f(x) - f(y) \rvert < \varepsilon ∀ ε > 0 , ∃ δ > 0 , ∀ x , y ∈ K , ∥ x − y ∥ < δ ⇒ ∣ f ( x ) − f ( y )∣ < ε 。
証明. (1) 定理 3.21 の証明で、[ a , b ] [a, b] [ a , b ] を K K K に、系 1.35 (3) を定義 7.4 に置き換えればよい。(2) 定理 3.25 の証明と同様。□ \square □
線形写像の大きさを測るために、行列のノルムを導入しておく。m × n m \times n m × n 行列 A A A に対し ∥ A ∥ = sup ∥ x ∥ ≤ 1 ∥ A x ∥ \lVert A \rVert = \sup_{\lVert x \rVert \leq 1}\lVert Ax \rVert ∥ A ∥ = sup ∥ x ∥ ≤ 1 ∥ A x ∥ を作用素ノルム (operator norm) という。A x Ax A x の第 i i i 成分にコーシー–シュワルツの不等式を使うと ∥ A x ∥ ≤ ( ∑ i , j a i j 2 ) 1 / 2 ∥ x ∥ \lVert Ax \rVert \leq \left(\sum_{i,j}a_{ij}^2\right)^{1/2}\lVert x \rVert ∥ A x ∥ ≤ ( ∑ i , j a ij 2 ) 1/2 ∥ x ∥ なので ∥ A ∥ < ∞ \lVert A \rVert < \infty ∥ A ∥ < ∞ であり、
∥ A x ∥ ≤ ∥ A ∥ ∥ x ∥ , ∥ A + B ∥ ≤ ∥ A ∥ + ∥ B ∥ , ∥ A B ∥ ≤ ∥ A ∥ ∥ B ∥ \lVert Ax \rVert \leq \lVert A \rVert\lVert x \rVert, \qquad \lVert A + B \rVert \leq \lVert A \rVert + \lVert B \rVert, \qquad \lVert AB \rVert \leq \lVert A \rVert\lVert B \rVert ∥ A x ∥ ≤ ∥ A ∥ ∥ x ∥ , ∥ A + B ∥ ≤ ∥ A ∥ + ∥ B ∥ , ∥ A B ∥ ≤ ∥ A ∥ ∥ B ∥
が成り立つ。特に線形写像はリプシッツ連続である。
7.3 偏微分と全微分
以下 U ⊂ R n U \subset \mathbb{R}^n U ⊂ R n は開集合とする。e j e_j e j を第 j j j 標準基底ベクトルとする。
定義 7.8 (偏微分, partial derivative)f : U → R f\colon U \to \mathbb{R} f : U → R 、a ∈ U a \in U a ∈ U に対して、極限
∂ f ∂ x j ( a ) = lim t → 0 f ( a + t e j ) − f ( a ) t \frac{\partial f}{\partial x_j}(a) = \lim_{t \to 0}\frac{f(a + te_j) - f(a)}{t} ∂ x j ∂ f ( a ) = t → 0 lim t f ( a + t e j ) − f ( a )
が存在するとき、f f f は a a a で x j x_j x j について偏微分可能 であるといい、これを偏微分係数 という。∂ j f ( a ) \partial_jf(a) ∂ j f ( a ) 、f x j ( a ) f_{x_j}(a) f x j ( a ) とも書く。
偏微分は「他の変数を固定して 1 変数関数として微分する」ことであり、計算は高校の微分と同じである。しかし、偏微分可能性は関数の振る舞いについてほとんど何も保証しない。
例 7.9 (偏微分可能だが連続でない)例 7.6 (1) の f ( x , y ) = x y x 2 + y 2 f(x, y) = \frac{xy}{x^2 + y^2} f ( x , y ) = x 2 + y 2 x y に f ( 0 , 0 ) = 0 f(0, 0) = 0 f ( 0 , 0 ) = 0 と定める。座標軸上で f = 0 f = 0 f = 0 なので f x ( 0 , 0 ) = f y ( 0 , 0 ) = 0 f_x(0, 0) = f_y(0, 0) = 0 f x ( 0 , 0 ) = f y ( 0 , 0 ) = 0 であり、原点で偏微分可能である。しかし原点で極限をもたないので連続ではない。
偏微分は座標軸方向の情報しか見ていない。1 変数の微分の本質が「一次式による近似」であったことを思い出すと、多変数での正しい定義は次のようになる。
定義 7.10 (全微分可能性, differentiability)f : U → R m f\colon U \to \mathbb{R}^m f : U → R m 、a ∈ U a \in U a ∈ U とする。m × n m \times n m × n 行列 A A A (すなわち線形写像 R n → R m \mathbb{R}^n \to \mathbb{R}^m R n → R m )が存在して
f ( a + h ) = f ( a ) + A h + o ( ∥ h ∥ ) ( h → 0 ) , すなわち lim h → 0 ∥ f ( a + h ) − f ( a ) − A h ∥ ∥ h ∥ = 0 f(a + h) = f(a) + Ah + o(\lVert h \rVert) \quad (h \to 0), \quad \text{すなわち} \quad \lim_{h \to 0}\frac{\lVert f(a + h) - f(a) - Ah \rVert}{\lVert h \rVert} = 0 f ( a + h ) = f ( a ) + A h + o (∥ h ∥) ( h → 0 ) , すなわち h → 0 lim ∥ h ∥ ∥ f ( a + h ) − f ( a ) − A h ∥ = 0
が成り立つとき、f f f は a a a で(全 )微分可能 であるといい、A A A を f f f の a a a における微分 (derivative) と呼んで D f ( a ) Df(a) D f ( a ) と書く。U U U の各点で微分可能なとき f f f は U U U で微分可能という。
A A A は存在すれば一意である:A , A ′ A, A' A , A ′ がともに条件を満たせば、∥ ( A − A ′ ) h ∥ ∥ h ∥ → 0 \frac{\lVert (A - A')h \rVert}{\lVert h \rVert} \to 0 ∥ h ∥ ∥( A − A ′ ) h ∥ → 0 であり、h = t e j h = te_j h = t e j (t → 0 t \to 0 t → 0 )とすると ( A − A ′ ) e j = 0 (A - A')e_j = 0 ( A − A ′ ) e j = 0 がすべての j j j で成り立つ。
命題 7.11 f : U → R m f\colon U \to \mathbb{R}^m f : U → R m が a a a で微分可能ならば、次が成り立つ。
f f f は a a a で連続である。
任意の v ∈ R n v \in \mathbb{R}^n v ∈ R n について、方向微分 D v f ( a ) = lim t → 0 f ( a + t v ) − f ( a ) t D_vf(a) = \lim_{t \to 0}\frac{f(a + tv) - f(a)}{t} D v f ( a ) = lim t → 0 t f ( a + t v ) − f ( a ) が存在し、D v f ( a ) = D f ( a ) v D_vf(a) = Df(a)v D v f ( a ) = D f ( a ) v 。
各成分は偏微分可能で、D f ( a ) Df(a) D f ( a ) はヤコビ行列 (Jacobian matrix) ( ∂ f i ∂ x j ( a ) ) i , j \left(\frac{\partial f_i}{\partial x_j}(a)\right)_{i,j} ( ∂ x j ∂ f i ( a ) ) i , j に等しい。
証明. (1) ∥ f ( a + h ) − f ( a ) ∥ ≤ ∥ D f ( a ) ∥ ∥ h ∥ + o ( ∥ h ∥ ) → 0 \lVert f(a + h) - f(a) \rVert \leq \lVert Df(a) \rVert\lVert h \rVert + o(\lVert h \rVert) \to 0 ∥ f ( a + h ) − f ( a )∥ ≤ ∥ D f ( a )∥ ∥ h ∥ + o (∥ h ∥) → 0 。(2) v ≠ 0 v \neq 0 v = 0 として h = t v h = tv h = t v を代入すると f ( a + t v ) − f ( a ) t = D f ( a ) v + o ( ∣ t ∣ ∥ v ∥ ) t → D f ( a ) v \frac{f(a + tv) - f(a)}{t} = Df(a)v + \frac{o(\lvert t \rvert\lVert v \rVert)}{t} \to Df(a)v t f ( a + t v ) − f ( a ) = D f ( a ) v + t o (∣ t ∣ ∥ v ∥) → D f ( a ) v 。(3) (2) で v = e j v = e_j v = e j とし、第 i i i 成分を見ればよい。□ \square □
m = 1 m = 1 m = 1 のとき、D f ( a ) Df(a) D f ( a ) は 1 × n 1 \times n 1 × n 行列であり、これを縦ベクトルにしたものを勾配 (gradient) ∇ f ( a ) = ( ∂ 1 f ( a ) , … , ∂ n f ( a ) ) \nabla f(a) = (\partial_1f(a), \dots, \partial_nf(a)) ∇ f ( a ) = ( ∂ 1 f ( a ) , … , ∂ n f ( a )) と書く。D f ( a ) h = ⟨ ∇ f ( a ) , h ⟩ Df(a)h = \langle \nabla f(a), h \rangle D f ( a ) h = ⟨ ∇ f ( a ) , h ⟩ である。
命題 7.11 の逆はどれも成り立たない。
例 7.12 (すべての方向微分が存在するが微分可能でない)例 7.6 (3) の f ( x , y ) = x 2 y x 4 + y 2 f(x, y) = \frac{x^2y}{x^4 + y^2} f ( x , y ) = x 4 + y 2 x 2 y 、f ( 0 , 0 ) = 0 f(0,0) = 0 f ( 0 , 0 ) = 0 を考える。v = ( v 1 , v 2 ) v = (v_1, v_2) v = ( v 1 , v 2 ) とすると、v 2 ≠ 0 v_2 \neq 0 v 2 = 0 なら
f ( t v ) − f ( 0 ) t = v 1 2 v 2 t 2 v 1 4 + v 2 2 → v 1 2 v 2 \frac{f(tv) - f(0)}{t} = \frac{v_1^2v_2}{t^2v_1^4 + v_2^2} \to \frac{v_1^2}{v_2} t f ( t v ) − f ( 0 ) = t 2 v 1 4 + v 2 2 v 1 2 v 2 → v 2 v 1 2
v 2 = 0 v_2 = 0 v 2 = 0 なら f ( t v ) = 0 f(tv) = 0 f ( t v ) = 0 なので D v f ( 0 ) = 0 D_vf(0) = 0 D v f ( 0 ) = 0 。すべての方向微分が存在するが、v ↦ D v f ( 0 ) v \mapsto D_vf(0) v ↦ D v f ( 0 ) は線形でなく、そもそも f f f は原点で連続でない。
では、どのような条件があれば全微分可能になるのか。実用上最も重要な十分条件が次である。
定理 7.13 (C 1 C^1 C 1 級なら微分可能)f : U → R f\colon U \to \mathbb{R} f : U → R のすべての偏導関数 ∂ j f \partial_jf ∂ j f が a a a の近くで存在し、a a a で連続ならば、f f f は a a a で微分可能である。
証明. 下書き. f ( a + h ) − f ( a ) f(a + h) - f(a) f ( a + h ) − f ( a ) を、座標軸に平行な線分をたどる n n n 個の差に分解し、それぞれに 1 変数の平均値の定理を使う。
清書. B ( a , r ) ⊂ U B(a, r) \subset U B ( a , r ) ⊂ U を偏導関数が存在する範囲とし、∥ h ∥ < r \lVert h \rVert < r ∥ h ∥ < r とする。p 0 = a p_0 = a p 0 = a 、p j = a + h 1 e 1 + ⋯ + h j e j p_j = a + h_1e_1 + \cdots + h_je_j p j = a + h 1 e 1 + ⋯ + h j e j (p n = a + h p_n = a + h p n = a + h )とおくと、p j − 1 p_{j-1} p j − 1 と p j p_j p j は第 j j j 座標だけが異なり、両者を結ぶ線分は B ( a , r ) B(a, r) B ( a , r ) に含まれる。1 変数関数 t ↦ f ( p j − 1 + t e j ) t \mapsto f(p_{j-1} + te_j) t ↦ f ( p j − 1 + t e j ) に平均値の定理を使うと
f ( p j ) − f ( p j − 1 ) = ∂ j f ( q j ) h j ( q j は p j − 1 と p j を結ぶ線分上の点 ) f(p_j) - f(p_{j-1}) = \partial_jf(q_j)h_j \quad (q_j \text{ は } p_{j-1} \text{ と } p_j \text{ を結ぶ線分上の点}) f ( p j ) − f ( p j − 1 ) = ∂ j f ( q j ) h j ( q j は p j − 1 と p j を結ぶ線分上の点 )
よって
∣ f ( a + h ) − f ( a ) − ∑ j = 1 n ∂ j f ( a ) h j ∣ = ∣ ∑ j = 1 n ( ∂ j f ( q j ) − ∂ j f ( a ) ) h j ∣ ≤ ∥ h ∥ ∑ j = 1 n ∣ ∂ j f ( q j ) − ∂ j f ( a ) ∣ \left\lvert f(a + h) - f(a) - \sum_{j=1}^{n}\partial_jf(a)h_j \right\rvert = \left\lvert \sum_{j=1}^{n}\bigl(\partial_jf(q_j) - \partial_jf(a)\bigr)h_j \right\rvert \leq \lVert h \rVert\sum_{j=1}^{n}\lvert \partial_jf(q_j) - \partial_jf(a) \rvert f ( a + h ) − f ( a ) − j = 1 ∑ n ∂ j f ( a ) h j = j = 1 ∑ n ( ∂ j f ( q j ) − ∂ j f ( a ) ) h j ≤ ∥ h ∥ j = 1 ∑ n ∣ ∂ j f ( q j ) − ∂ j f ( a )∣
∥ q j − a ∥ ≤ ∥ h ∥ \lVert q_j - a \rVert \leq \lVert h \rVert ∥ q j − a ∥ ≤ ∥ h ∥ なので、h → 0 h \to 0 h → 0 のとき偏導関数の a a a での連続性より右辺の和は 0 0 0 に収束する。□ \square □
すべての偏導関数が U U U 上で存在して連続なとき、f f f は C 1 C^1 C 1 級 であるという(R m \mathbb{R}^m R m 値なら各成分が C 1 C^1 C 1 級)。定理 7.13 より C 1 C^1 C 1 級関数は微分可能であり、実際の計算では「偏導関数が連続であることを確かめて、ヤコビ行列を計算する」のが標準的な手順になる。C 1 C^1 C 1 級は微分可能性の十分条件であって必要条件ではない(問題 7.5)。
勾配には幾何学的な意味がある。∥ v ∥ = 1 \lVert v \rVert = 1 ∥ v ∥ = 1 の方向への変化率 D v f ( a ) = ⟨ ∇ f ( a ) , v ⟩ D_vf(a) = \langle \nabla f(a), v \rangle D v f ( a ) = ⟨ ∇ f ( a ) , v ⟩ は、コーシー–シュワルツの不等式より v = ∇ f ( a ) ∥ ∇ f ( a ) ∥ v = \frac{\nabla f(a)}{\lVert \nabla f(a) \rVert} v = ∥ ∇ f ( a )∥ ∇ f ( a ) のとき最大値 ∥ ∇ f ( a ) ∥ \lVert \nabla f(a) \rVert ∥ ∇ f ( a )∥ をとる。つまり勾配は f f f が最も急に増加する方向を向き、その大きさは最大の増加率である 。また、第8章で見るように、勾配は等高面 { f = c } \lbrace f = c \rbrace { f = c } に直交する。
7.4 連鎖律
定理 7.14 (連鎖律, chain rule)U ⊂ R n U \subset \mathbb{R}^n U ⊂ R n 、V ⊂ R m V \subset \mathbb{R}^m V ⊂ R m を開集合、g : U → V g\colon U \to V g : U → V が a a a で微分可能、f : V → R l f\colon V \to \mathbb{R}^l f : V → R l が b = g ( a ) b = g(a) b = g ( a ) で微分可能ならば、f ∘ g f \circ g f ∘ g は a a a で微分可能で
D ( f ∘ g ) ( a ) = D f ( g ( a ) ) D g ( a ) ( 行列の積 ) D(f \circ g)(a) = Df(g(a))\,Dg(a) \quad (\text{行列の積}) D ( f ∘ g ) ( a ) = D f ( g ( a )) D g ( a ) ( 行列の積 )
証明. A = D g ( a ) A = Dg(a) A = D g ( a ) 、B = D f ( b ) B = Df(b) B = D f ( b ) とおく。微分可能性より
g ( a + h ) = g ( a ) + A h + ∥ h ∥ ρ 1 ( h ) , f ( b + k ) = f ( b ) + B k + ∥ k ∥ ρ 2 ( k ) g(a + h) = g(a) + Ah + \lVert h \rVert\rho_1(h), \qquad f(b + k) = f(b) + Bk + \lVert k \rVert\rho_2(k) g ( a + h ) = g ( a ) + A h + ∥ h ∥ ρ 1 ( h ) , f ( b + k ) = f ( b ) + B k + ∥ k ∥ ρ 2 ( k )
と書け、h → 0 h \to 0 h → 0 で ρ 1 ( h ) → 0 \rho_1(h) \to 0 ρ 1 ( h ) → 0 、k → 0 k \to 0 k → 0 で ρ 2 ( k ) → 0 \rho_2(k) \to 0 ρ 2 ( k ) → 0 である(ρ 2 ( 0 ) = 0 \rho_2(0) = 0 ρ 2 ( 0 ) = 0 と定める)。k = g ( a + h ) − g ( a ) = A h + ∥ h ∥ ρ 1 ( h ) k = g(a + h) - g(a) = Ah + \lVert h \rVert\rho_1(h) k = g ( a + h ) − g ( a ) = A h + ∥ h ∥ ρ 1 ( h ) とおくと ∥ k ∥ ≤ ( ∥ A ∥ + ∥ ρ 1 ( h ) ∥ ) ∥ h ∥ \lVert k \rVert \leq (\lVert A \rVert + \lVert \rho_1(h) \rVert)\lVert h \rVert ∥ k ∥ ≤ (∥ A ∥ + ∥ ρ 1 ( h )∥) ∥ h ∥ であり、
f ( g ( a + h ) ) − f ( g ( a ) ) − B A h = ∥ h ∥ B ρ 1 ( h ) + ∥ k ∥ ρ 2 ( k ) f(g(a + h)) - f(g(a)) - BAh = \lVert h \rVert B\rho_1(h) + \lVert k \rVert\rho_2(k) f ( g ( a + h )) − f ( g ( a )) − B A h = ∥ h ∥ B ρ 1 ( h ) + ∥ k ∥ ρ 2 ( k )
右辺を ∥ h ∥ \lVert h \rVert ∥ h ∥ で割ったものの大きさは ∥ B ∥ ∥ ρ 1 ( h ) ∥ + ( ∥ A ∥ + ∥ ρ 1 ( h ) ∥ ) ∥ ρ 2 ( k ) ∥ \lVert B \rVert\lVert \rho_1(h) \rVert + (\lVert A \rVert + \lVert \rho_1(h) \rVert)\lVert \rho_2(k) \rVert ∥ B ∥ ∥ ρ 1 ( h )∥ + (∥ A ∥ + ∥ ρ 1 ( h )∥) ∥ ρ 2 ( k )∥ 以下である。h → 0 h \to 0 h → 0 のとき k → 0 k \to 0 k → 0 (g g g は a a a で連続)なので ρ 2 ( k ) → 0 \rho_2(k) \to 0 ρ 2 ( k ) → 0 (k = 0 k = 0 k = 0 のときも ρ 2 ( 0 ) = 0 \rho_2(0) = 0 ρ 2 ( 0 ) = 0 で問題ない)、よってこれは 0 0 0 に収束する。□ \square □
成分で書くと、z = f ( y ) z = f(y) z = f ( y ) 、y = g ( x ) y = g(x) y = g ( x ) のとき
∂ z i ∂ x j = ∑ k = 1 m ∂ z i ∂ y k ∂ y k ∂ x j \frac{\partial z_i}{\partial x_j} = \sum_{k=1}^{m}\frac{\partial z_i}{\partial y_k}\frac{\partial y_k}{\partial x_j} ∂ x j ∂ z i = k = 1 ∑ m ∂ y k ∂ z i ∂ x j ∂ y k
である。高校の合成関数の微分 d z d x = d z d y d y d x \frac{dz}{dx} = \frac{dz}{dy}\frac{dy}{dx} d x d z = d y d z d x d y が、行列の積に置き換わった形である。
例 7.15 (極座標)f ( x , y ) f(x, y) f ( x , y ) を C 1 C^1 C 1 級とし、u ( r , θ ) = f ( r cos θ , r sin θ ) u(r, \theta) = f(r\cos\theta, r\sin\theta) u ( r , θ ) = f ( r cos θ , r sin θ ) とおくと
u r = f x cos θ + f y sin θ , u θ = − f x r sin θ + f y r cos θ u_r = f_x\cos\theta + f_y\sin\theta, \qquad u_\theta = -f_xr\sin\theta + f_yr\cos\theta u r = f x cos θ + f y sin θ , u θ = − f x r sin θ + f y r cos θ
特に u r 2 + 1 r 2 u θ 2 = f x 2 + f y 2 u_r^2 + \frac{1}{r^2}u_\theta^2 = f_x^2 + f_y^2 u r 2 + r 2 1 u θ 2 = f x 2 + f y 2 (r > 0 r > 0 r > 0 )。
例 7.16 (曲線に沿った微分)γ : ( α , β ) → U \gamma\colon (\alpha, \beta) \to U γ : ( α , β ) → U が微分可能な曲線、f : U → R f\colon U \to \mathbb{R} f : U → R が微分可能なら、d d t f ( γ ( t ) ) = ⟨ ∇ f ( γ ( t ) ) , γ ′ ( t ) ⟩ \frac{d}{dt}f(\gamma(t)) = \langle \nabla f(\gamma(t)), \gamma'(t) \rangle d t d f ( γ ( t )) = ⟨ ∇ f ( γ ( t )) , γ ′ ( t )⟩ 。γ \gamma γ が等高面 { f = c } \lbrace f = c \rbrace { f = c } 上の曲線なら左辺は 0 0 0 なので、∇ f \nabla f ∇ f は等高面上の曲線の速度ベクトルと直交する。
連鎖律から多変数の平均値の定理が得られる。a , b ∈ R n a, b \in \mathbb{R}^n a , b ∈ R n を結ぶ線分を [ a , b ] = { ( 1 − t ) a + t b ∣ 0 ≤ t ≤ 1 } [a, b] = \lbrace (1 - t)a + tb \mid 0 \leq t \leq 1 \rbrace [ a , b ] = {( 1 − t ) a + t b ∣ 0 ≤ t ≤ 1 } と書く。
定理 7.17 (平均値の定理)f : U → R f\colon U \to \mathbb{R} f : U → R が微分可能で [ a , b ] ⊂ U [a, b] \subset U [ a , b ] ⊂ U ならば、線分 [ a , b ] [a, b] [ a , b ] 上のある点 c c c で f ( b ) − f ( a ) = ⟨ ∇ f ( c ) , b − a ⟩ f(b) - f(a) = \langle \nabla f(c), b - a \rangle f ( b ) − f ( a ) = ⟨ ∇ f ( c ) , b − a ⟩ 。
証明. φ ( t ) = f ( a + t ( b − a ) ) \varphi(t) = f(a + t(b - a)) φ ( t ) = f ( a + t ( b − a )) に 1 変数の平均値の定理を使うと φ ( 1 ) − φ ( 0 ) = φ ′ ( θ ) \varphi(1) - \varphi(0) = \varphi'(\theta) φ ( 1 ) − φ ( 0 ) = φ ′ ( θ ) (0 < θ < 1 0 < \theta < 1 0 < θ < 1 )であり、連鎖律より φ ′ ( θ ) = ⟨ ∇ f ( a + θ ( b − a ) ) , b − a ⟩ \varphi'(\theta) = \langle \nabla f(a + \theta(b - a)), b - a \rangle φ ′ ( θ ) = ⟨ ∇ f ( a + θ ( b − a )) , b − a ⟩ 。□ \square □
系 7.18 U U U が凸な開集合(任意の 2 点を結ぶ線分を含む)で、U U U 上 ∇ f = 0 \nabla f = 0 ∇ f = 0 ならば、f f f は定数である。
U U U が凸でなくても連結 な開集合(弧状連結な開集合。任意の 2 点を座標軸に平行な線分をつないだ折れ線で結べる)なら、同じ結論が成り立つ。R m \mathbb{R}^m R m 値関数に対しては定理 7.17 の等式は一般に成り立たない(f ( t ) = ( cos t , sin t ) f(t) = (\cos t, \sin t) f ( t ) = ( cos t , sin t ) を [ 0 , 2 π ] [0, 2\pi] [ 0 , 2 π ] で考えよ)が、不等式版は成り立つ(第8章の定理 8.4)。
7.5 高階偏微分とシュワルツの定理
偏導関数 ∂ j f \partial_jf ∂ j f がさらに偏微分可能なとき、∂ i ∂ j f = ∂ 2 f ∂ x i ∂ x j \partial_i\partial_jf = \frac{\partial^2 f}{\partial x_i\partial x_j} ∂ i ∂ j f = ∂ x i ∂ x j ∂ 2 f などと書く。k k k 階までのすべての偏導関数が存在して連続なとき f f f は C k C^k C k 級 、すべての k k k で C k C^k C k 級なとき C ∞ C^\infty C ∞ 級 という。2 変数では f x y = ( f x ) y = ∂ 2 f ∂ y ∂ x f_{xy} = (f_x)_y = \frac{\partial^2 f}{\partial y\partial x} f x y = ( f x ) y = ∂ y ∂ x ∂ 2 f と書く(微分する順に添字を並べる)。
偏微分の順序は交換できるだろうか。一般にはできない 。
例 7.19 (順序交換できない例)
f ( x , y ) = { x y ( x 2 − y 2 ) x 2 + y 2 ( ( x , y ) ≠ ( 0 , 0 ) ) 0 ( ( x , y ) = ( 0 , 0 ) ) f(x, y) = \begin{cases} \dfrac{xy(x^2 - y^2)}{x^2 + y^2} & ((x,y) \neq (0,0)) \\ 0 & ((x,y) = (0,0)) \end{cases} f ( x , y ) = ⎩ ⎨ ⎧ x 2 + y 2 x y ( x 2 − y 2 ) 0 (( x , y ) = ( 0 , 0 )) (( x , y ) = ( 0 , 0 ))
y ≠ 0 y \neq 0 y = 0 なら f ( h , y ) − f ( 0 , y ) h = y ( h 2 − y 2 ) h 2 + y 2 → − y \frac{f(h, y) - f(0, y)}{h} = \frac{y(h^2 - y^2)}{h^2 + y^2} \to -y h f ( h , y ) − f ( 0 , y ) = h 2 + y 2 y ( h 2 − y 2 ) → − y なので f x ( 0 , y ) = − y f_x(0, y) = -y f x ( 0 , y ) = − y (y = 0 y = 0 y = 0 でも f ( h , 0 ) = 0 f(h, 0) = 0 f ( h , 0 ) = 0 より成り立つ)。同様に f ( x , k ) k = x ( x 2 − k 2 ) x 2 + k 2 → x \frac{f(x, k)}{k} = \frac{x(x^2 - k^2)}{x^2 + k^2} \to x k f ( x , k ) = x 2 + k 2 x ( x 2 − k 2 ) → x より f y ( x , 0 ) = x f_y(x, 0) = x f y ( x , 0 ) = x 。したがって
f x y ( 0 , 0 ) = d d y ( − y ) ∣ y = 0 = − 1 , f y x ( 0 , 0 ) = d d x ( x ) ∣ x = 0 = 1 f_{xy}(0, 0) = \frac{d}{dy}(-y)\Big|_{y=0} = -1, \qquad f_{yx}(0, 0) = \frac{d}{dx}(x)\Big|_{x=0} = 1 f x y ( 0 , 0 ) = d y d ( − y ) y = 0 = − 1 , f y x ( 0 , 0 ) = d x d ( x ) x = 0 = 1
であり、二つの 2 階偏微分係数は異なる。
定理 7.20 (シュワルツの定理, Schwarz's theorem)f : U → R f\colon U \to \mathbb{R} f : U → R (U ⊂ R 2 U \subset \mathbb{R}^2 U ⊂ R 2 開集合)について、( a , b ) ∈ U (a, b) \in U ( a , b ) ∈ U の近くで f x f_x f x 、f y f_y f y 、f x y f_{xy} f x y が存在し、f x y f_{xy} f x y が ( a , b ) (a, b) ( a , b ) で連続ならば、f y x ( a , b ) f_{yx}(a, b) f y x ( a , b ) も存在して f y x ( a , b ) = f x y ( a , b ) f_{yx}(a, b) = f_{xy}(a, b) f y x ( a , b ) = f x y ( a , b ) 。
証明. 小さな h , k ≠ 0 h, k \neq 0 h , k = 0 に対して、2 階差分
Δ ( h , k ) = f ( a + h , b + k ) − f ( a + h , b ) − f ( a , b + k ) + f ( a , b ) \Delta(h, k) = f(a + h, b + k) - f(a + h, b) - f(a, b + k) + f(a, b) Δ ( h , k ) = f ( a + h , b + k ) − f ( a + h , b ) − f ( a , b + k ) + f ( a , b )
を考える。ψ ( x ) = f ( x , b + k ) − f ( x , b ) \psi(x) = f(x, b + k) - f(x, b) ψ ( x ) = f ( x , b + k ) − f ( x , b ) とおくと Δ = ψ ( a + h ) − ψ ( a ) \Delta = \psi(a + h) - \psi(a) Δ = ψ ( a + h ) − ψ ( a ) なので、平均値の定理より
Δ ( h , k ) = h ψ ′ ( a + θ 1 h ) = h ( f x ( a + θ 1 h , b + k ) − f x ( a + θ 1 h , b ) ) \Delta(h, k) = h\psi'(a + \theta_1h) = h\bigl(f_x(a + \theta_1h, b + k) - f_x(a + \theta_1h, b)\bigr) Δ ( h , k ) = h ψ ′ ( a + θ 1 h ) = h ( f x ( a + θ 1 h , b + k ) − f x ( a + θ 1 h , b ) )
さらに y ↦ f x ( a + θ 1 h , y ) y \mapsto f_x(a + \theta_1h, y) y ↦ f x ( a + θ 1 h , y ) に平均値の定理を使うと Δ ( h , k ) = h k f x y ( a + θ 1 h , b + θ 2 k ) \Delta(h, k) = hk\ f_{xy}(a + \theta_1h, b + \theta_2k) Δ ( h , k ) = hk f x y ( a + θ 1 h , b + θ 2 k ) (0 < θ 1 , θ 2 < 1 0 < \theta_1, \theta_2 < 1 0 < θ 1 , θ 2 < 1 )。f x y f_{xy} f x y の連続性より、ε > 0 \varepsilon > 0 ε > 0 に対して δ > 0 \delta > 0 δ > 0 があり、0 < ∣ h ∣ , ∣ k ∣ < δ 0 < \lvert h \rvert, \lvert k \rvert < \delta 0 < ∣ h ∣ , ∣ k ∣ < δ なら
∣ Δ ( h , k ) h k − f x y ( a , b ) ∣ < ε \left\lvert \frac{\Delta(h, k)}{hk} - f_{xy}(a, b) \right\rvert < \varepsilon hk Δ ( h , k ) − f x y ( a , b ) < ε
一方、h h h を固定して k → 0 k \to 0 k → 0 とすると Δ ( h , k ) k → f y ( a + h , b ) − f y ( a , b ) \frac{\Delta(h, k)}{k} \to f_y(a + h, b) - f_y(a, b) k Δ ( h , k ) → f y ( a + h , b ) − f y ( a , b ) 。上の不等式で k → 0 k \to 0 k → 0 とすると、0 < ∣ h ∣ < δ 0 < \lvert h \rvert < \delta 0 < ∣ h ∣ < δ で
∣ f y ( a + h , b ) − f y ( a , b ) h − f x y ( a , b ) ∣ ≤ ε \left\lvert \frac{f_y(a + h, b) - f_y(a, b)}{h} - f_{xy}(a, b) \right\rvert \leq \varepsilon h f y ( a + h , b ) − f y ( a , b ) − f x y ( a , b ) ≤ ε
よって f y x ( a , b ) = lim h → 0 f y ( a + h , b ) − f y ( a , b ) h f_{yx}(a, b) = \lim_{h \to 0}\frac{f_y(a + h, b) - f_y(a, b)}{h} f y x ( a , b ) = lim h → 0 h f y ( a + h , b ) − f y ( a , b ) が存在して f x y ( a , b ) f_{xy}(a, b) f x y ( a , b ) に等しい。□ \square □
特に f f f が C 2 C^2 C 2 級なら ∂ i ∂ j f = ∂ j ∂ i f \partial_i\partial_jf = \partial_j\partial_if ∂ i ∂ j f = ∂ j ∂ i f であり、帰納法により、C k C^k C k 級関数の k k k 階以下の偏導関数は微分の順序によらない。例 7.19 では f x y f_{xy} f x y が原点で連続でない。
7.6 多変数のテイラーの定理
f f f を C k + 1 C^{k+1} C k + 1 級とし、線分 [ a , a + h ] ⊂ U [a, a + h] \subset U [ a , a + h ] ⊂ U とする。g ( t ) = f ( a + t h ) g(t) = f(a + th) g ( t ) = f ( a + t h ) とおくと、連鎖律を繰り返し使って
g ′ ( t ) = ∑ i = 1 n h i ∂ i f ( a + t h ) , g ′ ′ ( t ) = ∑ i , j = 1 n h i h j ∂ i ∂ j f ( a + t h ) , … g'(t) = \sum_{i=1}^{n}h_i\partial_if(a + th), \qquad g''(t) = \sum_{i,j=1}^{n}h_ih_j\partial_i\partial_jf(a + th), \quad \dots g ′ ( t ) = i = 1 ∑ n h i ∂ i f ( a + t h ) , g ′′ ( t ) = i , j = 1 ∑ n h i h j ∂ i ∂ j f ( a + t h ) , …
一般に g ( p ) ( t ) = ∑ i 1 , … , i p h i 1 ⋯ h i p ∂ i 1 ⋯ ∂ i p f ( a + t h ) g^{(p)}(t) = \sum_{i_1, \dots, i_p}h_{i_1}\cdots h_{i_p}\partial_{i_1}\cdots\partial_{i_p}f(a + th) g ( p ) ( t ) = ∑ i 1 , … , i p h i 1 ⋯ h i p ∂ i 1 ⋯ ∂ i p f ( a + t h ) であり、これを ( ( h ⋅ ∇ ) p f ) ( a + t h ) \bigl((h \cdot \nabla)^pf\bigr)(a + th) ( ( h ⋅ ∇ ) p f ) ( a + t h ) と略記する。1 変数のテイラーの定理を g g g に t = 1 t = 1 t = 1 で適用すると次を得る。
定理 7.21 (多変数のテイラーの定理)f : U → R f\colon U \to \mathbb{R} f : U → R が C k + 1 C^{k+1} C k + 1 級で、線分 [ a , a + h ] ⊂ U [a, a + h] \subset U [ a , a + h ] ⊂ U ならば、ある θ ∈ ( 0 , 1 ) \theta \in (0, 1) θ ∈ ( 0 , 1 ) について
f ( a + h ) = ∑ p = 0 k 1 p ! ( ( h ⋅ ∇ ) p f ) ( a ) + 1 ( k + 1 ) ! ( ( h ⋅ ∇ ) k + 1 f ) ( a + θ h ) f(a + h) = \sum_{p=0}^{k}\frac{1}{p!}\bigl((h \cdot \nabla)^pf\bigr)(a) + \frac{1}{(k+1)!}\bigl((h \cdot \nabla)^{k+1}f\bigr)(a + \theta h) f ( a + h ) = p = 0 ∑ k p ! 1 ( ( h ⋅ ∇ ) p f ) ( a ) + ( k + 1 )! 1 ( ( h ⋅ ∇ ) k + 1 f ) ( a + θ h )
特に 2 次までを書くと、ヘッセ行列 (Hessian matrix) H f ( a ) = ( ∂ i ∂ j f ( a ) ) i , j H_f(a) = \bigl(\partial_i\partial_jf(a)\bigr)_{i,j} H f ( a ) = ( ∂ i ∂ j f ( a ) ) i , j (シュワルツの定理より対称行列)を用いて
f ( a + h ) = f ( a ) + ⟨ ∇ f ( a ) , h ⟩ + 1 2 ⟨ H f ( a + θ h ) h , h ⟩ f(a + h) = f(a) + \langle \nabla f(a), h \rangle + \frac{1}{2}\langle H_f(a + \theta h)h, h \rangle f ( a + h ) = f ( a ) + ⟨ ∇ f ( a ) , h ⟩ + 2 1 ⟨ H f ( a + θ h ) h , h ⟩
となる。f f f が C 2 C^2 C 2 級なら、H f H_f H f の連続性より ∣ ⟨ ( H f ( a + θ h ) − H f ( a ) ) h , h ⟩ ∣ ≤ ∥ H f ( a + θ h ) − H f ( a ) ∥ ∥ h ∥ 2 = o ( ∥ h ∥ 2 ) \lvert \langle (H_f(a + \theta h) - H_f(a))h, h \rangle \rvert \leq \lVert H_f(a + \theta h) - H_f(a) \rVert\lVert h \rVert^2 = o(\lVert h \rVert^2) ∣⟨( H f ( a + θ h ) − H f ( a )) h , h ⟩∣ ≤ ∥ H f ( a + θ h ) − H f ( a )∥ ∥ h ∥ 2 = o (∥ h ∥ 2 ) なので
f ( a + h ) = f ( a ) + ⟨ ∇ f ( a ) , h ⟩ + 1 2 ⟨ H f ( a ) h , h ⟩ + o ( ∥ h ∥ 2 ) (1) f(a + h) = f(a) + \langle \nabla f(a), h \rangle + \frac{1}{2}\langle H_f(a)h, h \rangle + o(\lVert h \rVert^2) \tag{1} f ( a + h ) = f ( a ) + ⟨ ∇ f ( a ) , h ⟩ + 2 1 ⟨ H f ( a ) h , h ⟩ + o (∥ h ∥ 2 ) ( 1 )
が成り立つ(ペアノ剰余の形)。
例 7.22 f ( x , y ) = e x cos y f(x, y) = e^x\cos y f ( x , y ) = e x cos y の原点での 2 次までの展開:f x = e x cos y f_x = e^x\cos y f x = e x cos y 、f y = − e x sin y f_y = -e^x\sin y f y = − e x sin y 、f x x = e x cos y f_{xx} = e^x\cos y f xx = e x cos y 、f x y = − e x sin y f_{xy} = -e^x\sin y f x y = − e x sin y 、f y y = − e x cos y f_{yy} = -e^x\cos y f y y = − e x cos y より、原点で ∇ f = ( 1 , 0 ) \nabla f = (1, 0) ∇ f = ( 1 , 0 ) 、H f = diag ( 1 , − 1 ) H_f = \operatorname{diag}(1, -1) H f = diag ( 1 , − 1 ) (対角成分が 1 , − 1 1, -1 1 , − 1 の対角行列)。よって e x cos y = 1 + x + 1 2 ( x 2 − y 2 ) + o ( x 2 + y 2 ) e^x\cos y = 1 + x + \frac{1}{2}(x^2 - y^2) + o(x^2 + y^2) e x cos y = 1 + x + 2 1 ( x 2 − y 2 ) + o ( x 2 + y 2 ) 。1 変数の展開 ( 1 + x + x 2 2 ) ( 1 − y 2 2 ) (1 + x + \frac{x^2}{2})(1 - \frac{y^2}{2}) ( 1 + x + 2 x 2 ) ( 1 − 2 y 2 ) の 2 次までと一致する。
7.7 極値とヘッセ行列
命題 7.23 f : U → R f\colon U \to \mathbb{R} f : U → R が a ∈ U a \in U a ∈ U で極値をとり、a a a で微分可能ならば、∇ f ( a ) = 0 \nabla f(a) = 0 ∇ f ( a ) = 0 。
証明. 各 j j j について、1 変数関数 t ↦ f ( a + t e j ) t \mapsto f(a + te_j) t ↦ f ( a + t e j ) は t = 0 t = 0 t = 0 で極値をとるので、補題 4.10 より ∂ j f ( a ) = 0 \partial_jf(a) = 0 ∂ j f ( a ) = 0 。□ \square □
∇ f ( a ) = 0 \nabla f(a) = 0 ∇ f ( a ) = 0 となる点を臨界点 (critical point) という。臨界点での振る舞いは、(1) 式の 2 次の項、すなわち二次形式 h ↦ ⟨ H f ( a ) h , h ⟩ h \mapsto \langle H_f(a)h, h \rangle h ↦ ⟨ H f ( a ) h , h ⟩ で決まる。対称行列 H H H が正定値 (positive definite) であるとは、すべての h ≠ 0 h \neq 0 h = 0 で ⟨ H h , h ⟩ > 0 \langle Hh, h \rangle > 0 ⟨ H h , h ⟩ > 0 となることをいい、負定値 も同様に定める。正の値と負の値の両方をとるとき不定値 (indefinite) という(02-linear-algebra 第8章 。固有値がすべて正・すべて負・正負両方を含む、と同値)。
定理 7.24 (極値の判定)f : U → R f\colon U \to \mathbb{R} f : U → R を C 2 C^2 C 2 級、a a a を臨界点とする。
H f ( a ) H_f(a) H f ( a ) が正定値ならば、f f f は a a a で狭義の極小をとる。
H f ( a ) H_f(a) H f ( a ) が負定値ならば、f f f は a a a で狭義の極大をとる。
H f ( a ) H_f(a) H f ( a ) が不定値ならば、f f f は a a a で極値をとらない(a a a は鞍点 (saddle point) である)。
証明. (1) 単位球面 S = { h ∣ ∥ h ∥ = 1 } S = \lbrace h \mid \lVert h \rVert = 1 \rbrace S = { h ∣ ∥ h ∥ = 1 } は有界閉集合なのでコンパクトであり、連続関数 h ↦ ⟨ H f ( a ) h , h ⟩ h \mapsto \langle H_f(a)h, h \rangle h ↦ ⟨ H f ( a ) h , h ⟩ は S S S 上で最小値 λ \lambda λ をとる。正定値性より λ > 0 \lambda > 0 λ > 0 で、同次性から ⟨ H f ( a ) h , h ⟩ ≥ λ ∥ h ∥ 2 \langle H_f(a)h, h \rangle \geq \lambda\lVert h \rVert^2 ⟨ H f ( a ) h , h ⟩ ≥ λ ∥ h ∥ 2 がすべての h h h で成り立つ。(1) 式の o ( ∥ h ∥ 2 ) o(\lVert h \rVert^2) o (∥ h ∥ 2 ) の項が λ 4 ∥ h ∥ 2 \frac{\lambda}{4}\lVert h \rVert^2 4 λ ∥ h ∥ 2 以下となる範囲 0 < ∥ h ∥ < δ 0 < \lVert h \rVert < \delta 0 < ∥ h ∥ < δ では
f ( a + h ) − f ( a ) ≥ λ 2 ∥ h ∥ 2 − λ 4 ∥ h ∥ 2 > 0 f(a + h) - f(a) \geq \frac{\lambda}{2}\lVert h \rVert^2 - \frac{\lambda}{4}\lVert h \rVert^2 > 0 f ( a + h ) − f ( a ) ≥ 2 λ ∥ h ∥ 2 − 4 λ ∥ h ∥ 2 > 0
(2) は − f -f − f に (1) を適用する。(3) ⟨ H f ( a ) v , v ⟩ > 0 \langle H_f(a)v, v \rangle > 0 ⟨ H f ( a ) v , v ⟩ > 0 、⟨ H f ( a ) w , w ⟩ < 0 \langle H_f(a)w, w \rangle < 0 ⟨ H f ( a ) w , w ⟩ < 0 となる v , w v, w v , w をとる。(1) 式より f ( a + t v ) − f ( a ) = t 2 2 ⟨ H f ( a ) v , v ⟩ + o ( t 2 ) f(a + tv) - f(a) = \frac{t^2}{2}\langle H_f(a)v, v \rangle + o(t^2) f ( a + t v ) − f ( a ) = 2 t 2 ⟨ H f ( a ) v , v ⟩ + o ( t 2 ) は小さい t ≠ 0 t \neq 0 t = 0 で正、同様に f ( a + t w ) − f ( a ) f(a + tw) - f(a) f ( a + tw ) − f ( a ) は負である。□ \square □
H f ( a ) H_f(a) H f ( a ) が半定値(例えば固有値に 0 0 0 を含む)の場合は、この定理では判定できない。f = x 2 + y 4 f = x^2 + y^4 f = x 2 + y 4 (極小)と f = x 2 + y 3 f = x^2 + y^3 f = x 2 + y 3 (極値でない)は、どちらも原点で H f = diag ( 2 , 0 ) H_f = \operatorname{diag}(2, 0) H f = diag ( 2 , 0 ) である。
2 変数の場合は、判定を行列式で書ける。
系 7.25 n = 2 n = 2 n = 2 で、臨界点 a a a におけるヘッセ行列の成分を A = f x x ( a ) A = f_{xx}(a) A = f xx ( a ) 、B = f x y ( a ) = f y x ( a ) B = f_{xy}(a) = f_{yx}(a) B = f x y ( a ) = f y x ( a ) 、C = f y y ( a ) C = f_{yy}(a) C = f y y ( a ) とする。
A C − B 2 > 0 AC - B^2 > 0 A C − B 2 > 0 かつ A > 0 A > 0 A > 0 なら狭義の極小、A C − B 2 > 0 AC - B^2 > 0 A C − B 2 > 0 かつ A < 0 A < 0 A < 0 なら狭義の極大。
A C − B 2 < 0 AC - B^2 < 0 A C − B 2 < 0 なら鞍点。
証明. A ≠ 0 A \neq 0 A = 0 なら平方完成により A h 2 + 2 B h k + C k 2 = A ( h + B A k ) 2 + A C − B 2 A k 2 Ah^2 + 2Bhk + Ck^2 = A\left(h + \frac{B}{A}k\right)^2 + \frac{AC - B^2}{A}k^2 A h 2 + 2 B hk + C k 2 = A ( h + A B k ) 2 + A A C − B 2 k 2 。A C − B 2 > 0 AC - B^2 > 0 A C − B 2 > 0 なら二つの係数は A A A と同符号なので、A > 0 A > 0 A > 0 で正定値、A < 0 A < 0 A < 0 で負定値。A C − B 2 < 0 AC - B^2 < 0 A C − B 2 < 0 のとき、A ≠ 0 A \neq 0 A = 0 なら二つの係数が異符号で不定値、A = 0 A = 0 A = 0 なら B ≠ 0 B \neq 0 B = 0 で 2 B h k + C k 2 2Bhk + Ck^2 2 B hk + C k 2 は k ≠ 0 k \neq 0 k = 0 を固定して h h h を動かせば正負両方の値をとる。□ \square □
例 7.26 f ( x , y ) = x 3 + y 3 − 3 x y f(x, y) = x^3 + y^3 - 3xy f ( x , y ) = x 3 + y 3 − 3 x y 。∇ f = ( 3 x 2 − 3 y , 3 y 2 − 3 x ) = 0 \nabla f = (3x^2 - 3y, 3y^2 - 3x) = 0 ∇ f = ( 3 x 2 − 3 y , 3 y 2 − 3 x ) = 0 より y = x 2 y = x^2 y = x 2 、x = y 2 x = y^2 x = y 2 なので x 4 = x x^4 = x x 4 = x 、臨界点は ( 0 , 0 ) (0, 0) ( 0 , 0 ) と ( 1 , 1 ) (1, 1) ( 1 , 1 ) 。f x x = 6 x f_{xx} = 6x f xx = 6 x 、f x y = − 3 f_{xy} = -3 f x y = − 3 、f y y = 6 y f_{yy} = 6y f y y = 6 y であり、( 0 , 0 ) (0, 0) ( 0 , 0 ) では A C − B 2 = − 9 < 0 AC - B^2 = -9 < 0 A C − B 2 = − 9 < 0 で鞍点、( 1 , 1 ) (1, 1) ( 1 , 1 ) では A C − B 2 = 27 > 0 AC - B^2 = 27 > 0 A C − B 2 = 27 > 0 、A = 6 > 0 A = 6 > 0 A = 6 > 0 で狭義の極小(値 f ( 1 , 1 ) = − 1 f(1, 1) = -1 f ( 1 , 1 ) = − 1 )。f ( x , 0 ) = x 3 f(x, 0) = x^3 f ( x , 0 ) = x 3 は下に有界でないので、これは最小値ではない。
注意
1 変数では「臨界点がただ一つでそこが極小なら最小」が成り立つ(区間上の連続関数と中間値の定理による)が、2 変数以上では成り立たない。f ( x , y ) = x 2 + y 2 ( 1 − x ) 3 f(x, y) = x^2 + y^2(1 - x)^3 f ( x , y ) = x 2 + y 2 ( 1 − x ) 3 は原点だけが臨界点でそこで狭義の極小をとるが、f ( 4 , 1 ) = − 11 < 0 = f ( 0 , 0 ) f(4, 1) = -11 < 0 = f(0, 0) f ( 4 , 1 ) = − 11 < 0 = f ( 0 , 0 ) である(問題 7.8)。
有界閉集合 K K K 上の連続関数の最大値・最小値(定理 7.7 により存在する)を求めるには、内部の臨界点での値と、境界上での最大値・最小値を比べればよい。境界上の極値問題は、第8章のラグランジュの未定乗数法で扱う。
まとめ
R n \mathbb{R}^n R n の点列の収束は成分ごとの収束と同値であり、ボルツァノ–ワイエルシュトラスの定理が成り立つ。有界閉集合はコンパクトで、その上の連続関数は最大値・最小値をとり、一様連続である。
多変数関数の極限では近づき方が無数にあり、すべての直線に沿った極限が一致しても極限が存在するとは限らない。
微分可能性は線形近似 f ( a + h ) = f ( a ) + D f ( a ) h + o ( ∥ h ∥ ) f(a + h) = f(a) + Df(a)h + o(\lVert h \rVert) f ( a + h ) = f ( a ) + D f ( a ) h + o (∥ h ∥) で定義する。微分可能なら連続で、方向微分・偏微分が存在し、D f ( a ) Df(a) D f ( a ) はヤコビ行列である。逆はいずれも成り立たない。
偏導関数が連続(C 1 C^1 C 1 級)なら微分可能である。証明は座標軸方向の平均値の定理による。
連鎖律 D ( f ∘ g ) ( a ) = D f ( g ( a ) ) D g ( a ) D(f \circ g)(a) = Df(g(a))Dg(a) D ( f ∘ g ) ( a ) = D f ( g ( a )) D g ( a ) 。勾配は最も急な増加の方向を向き、等高面に直交する。
f x y f_{xy} f x y が連続なら f x y = f y x f_{xy} = f_{yx} f x y = f y x (シュワルツの定理)。連続性がないと順序交換は失敗しうる。
臨界点でヘッセ行列が正定値なら極小、負定値なら極大、不定値なら鞍点。2 変数では A C − B 2 AC - B^2 A C − B 2 と A A A の符号で判定できる。
演習問題
問題 7.1 ★ 次の極限が存在するか調べ、存在すれば求めよ(原点への極限)。
(1) x 2 y 2 x 2 + y 2 \frac{x^2y^2}{x^2 + y^2} x 2 + y 2 x 2 y 2 (2) x 3 + y 3 x 2 + y 2 \frac{x^3 + y^3}{x^2 + y^2} x 2 + y 2 x 3 + y 3 (3) x y 2 x 2 + y 4 \frac{xy^2}{x^2 + y^4} x 2 + y 4 x y 2
解答
(1) x 2 y 2 ≤ ( x 2 + y 2 ) 2 4 x^2y^2 \leq \frac{(x^2 + y^2)^2}{4} x 2 y 2 ≤ 4 ( x 2 + y 2 ) 2 より ∣ f ∣ ≤ x 2 + y 2 4 → 0 \lvert f \rvert \leq \frac{x^2 + y^2}{4} \to 0 ∣ f ∣ ≤ 4 x 2 + y 2 → 0 。極限は 0 0 0 。
(2) ∣ x 3 + y 3 ∣ ≤ ( ∣ x ∣ + ∣ y ∣ ) ( x 2 + y 2 ) \lvert x^3 + y^3 \rvert \leq (\lvert x \rvert + \lvert y \rvert)(x^2 + y^2) ∣ x 3 + y 3 ∣ ≤ (∣ x ∣ + ∣ y ∣) ( x 2 + y 2 ) より ∣ f ∣ ≤ ∣ x ∣ + ∣ y ∣ ≤ 2 ∥ ( x , y ) ∥ → 0 \lvert f \rvert \leq \lvert x \rvert + \lvert y \rvert \leq 2\lVert (x,y) \rVert \to 0 ∣ f ∣ ≤ ∣ x ∣ + ∣ y ∣ ≤ 2 ∥( x , y )∥ → 0 。極限は 0 0 0 。
(3) 直線 y = k x y = kx y = k x に沿うと k 2 x 1 + k 4 x 2 → 0 \frac{k^2x}{1 + k^4x^2} \to 0 1 + k 4 x 2 k 2 x → 0 だが、x = y 2 x = y^2 x = y 2 に沿うと y 4 2 y 4 = 1 2 \frac{y^4}{2y^4} = \frac{1}{2} 2 y 4 y 4 = 2 1 。極限は存在しない。
問題 7.2 ★ f ( x , y , z ) = x y z f(x, y, z) = xyz f ( x , y , z ) = x y z について、点 ( 1 , 2 , 3 ) (1, 2, 3) ( 1 , 2 , 3 ) で f f f が最も急に増加する方向とその増加率、および方向 1 3 ( 1 , 1 , 1 ) \frac{1}{\sqrt{3}}(1, 1, 1) 3 1 ( 1 , 1 , 1 ) への方向微分を求めよ。
解答
∇ f = ( y z , x z , x y ) = ( 6 , 3 , 2 ) \nabla f = (yz, xz, xy) = (6, 3, 2) ∇ f = ( y z , x z , x y ) = ( 6 , 3 , 2 ) 、∥ ∇ f ∥ = 7 \lVert \nabla f \rVert = 7 ∥ ∇ f ∥ = 7 。最も急に増加する方向は 1 7 ( 6 , 3 , 2 ) \frac{1}{7}(6, 3, 2) 7 1 ( 6 , 3 , 2 ) 、増加率は 7 7 7 。方向微分は ⟨ ( 6 , 3 , 2 ) , 1 3 ( 1 , 1 , 1 ) ⟩ = 11 3 \langle (6, 3, 2), \frac{1}{\sqrt{3}}(1,1,1) \rangle = \frac{11}{\sqrt{3}} ⟨( 6 , 3 , 2 ) , 3 1 ( 1 , 1 , 1 )⟩ = 3 11 。
問題 7.3 ★ f ( x , y ) = x 4 + y 4 − 4 x y f(x, y) = x^4 + y^4 - 4xy f ( x , y ) = x 4 + y 4 − 4 x y の臨界点をすべて求め、極値かどうかを判定せよ。
解答
∇ f = ( 4 x 3 − 4 y , 4 y 3 − 4 x ) = 0 \nabla f = (4x^3 - 4y, 4y^3 - 4x) = 0 ∇ f = ( 4 x 3 − 4 y , 4 y 3 − 4 x ) = 0 より y = x 3 y = x^3 y = x 3 、x = y 3 = x 9 x = y^3 = x^9 x = y 3 = x 9 。x = 0 , ± 1 x = 0, \pm 1 x = 0 , ± 1 なので臨界点は ( 0 , 0 ) (0,0) ( 0 , 0 ) 、( 1 , 1 ) (1,1) ( 1 , 1 ) 、( − 1 , − 1 ) (-1,-1) ( − 1 , − 1 ) 。f x x = 12 x 2 f_{xx} = 12x^2 f xx = 12 x 2 、f x y = − 4 f_{xy} = -4 f x y = − 4 、f y y = 12 y 2 f_{yy} = 12y^2 f y y = 12 y 2 。( 0 , 0 ) (0,0) ( 0 , 0 ) では A C − B 2 = − 16 < 0 AC - B^2 = -16 < 0 A C − B 2 = − 16 < 0 で鞍点。( ± 1 , ± 1 ) (\pm1, \pm1) ( ± 1 , ± 1 ) では A C − B 2 = 128 > 0 AC - B^2 = 128 > 0 A C − B 2 = 128 > 0 、A = 12 > 0 A = 12 > 0 A = 12 > 0 で狭義の極小、値は − 2 -2 − 2 。
問題 7.4 ★★ f ( x , y ) = ∣ x y ∣ f(x, y) = \sqrt{\lvert xy \rvert} f ( x , y ) = ∣ x y ∣ は原点で連続かつ偏微分可能だが、微分可能でないことを示せ。
解答
∣ f ∣ ≤ x 2 + y 2 2 → 0 \lvert f \rvert \leq \sqrt{\frac{x^2 + y^2}{2}} \to 0 ∣ f ∣ ≤ 2 x 2 + y 2 → 0 なので連続。座標軸上で f = 0 f = 0 f = 0 なので f x ( 0 , 0 ) = f y ( 0 , 0 ) = 0 f_x(0,0) = f_y(0,0) = 0 f x ( 0 , 0 ) = f y ( 0 , 0 ) = 0 。微分可能なら D f ( 0 ) = ( 0 , 0 ) Df(0) = (0, 0) D f ( 0 ) = ( 0 , 0 ) でなければならず、f ( h , k ) ∥ ( h , k ) ∥ → 0 \frac{f(h, k)}{\lVert (h,k) \rVert} \to 0 ∥( h , k )∥ f ( h , k ) → 0 が必要だが、h = k = t > 0 h = k = t > 0 h = k = t > 0 とすると t 2 t = 1 2 \frac{t}{\sqrt{2}t} = \frac{1}{\sqrt{2}} 2 t t = 2 1 で 0 0 0 に収束しない。
問題 7.5 ★★ f ( x , y ) = ( x 2 + y 2 ) sin 1 x 2 + y 2 f(x, y) = (x^2 + y^2)\sin\frac{1}{\sqrt{x^2 + y^2}} f ( x , y ) = ( x 2 + y 2 ) sin x 2 + y 2 1 (( x , y ) ≠ 0 (x,y) \neq 0 ( x , y ) = 0 )、f ( 0 , 0 ) = 0 f(0,0) = 0 f ( 0 , 0 ) = 0 は原点で微分可能だが、偏導関数は原点で連続でないことを示せ。
解答
∣ f ( h , k ) ∣ ≤ h 2 + k 2 = o ( ∥ ( h , k ) ∥ ) \lvert f(h, k) \rvert \leq h^2 + k^2 = o(\lVert (h,k) \rVert) ∣ f ( h , k )∣ ≤ h 2 + k 2 = o (∥( h , k )∥) なので、D f ( 0 ) = 0 Df(0) = 0 D f ( 0 ) = 0 として微分可能。( x , y ) ≠ 0 (x, y) \neq 0 ( x , y ) = 0 で r = x 2 + y 2 r = \sqrt{x^2 + y^2} r = x 2 + y 2 とすると f x = 2 x sin 1 r − x r cos 1 r f_x = 2x\sin\frac{1}{r} - \frac{x}{r}\cos\frac{1}{r} f x = 2 x sin r 1 − r x cos r 1 。x x x 軸上 x > 0 x > 0 x > 0 では f x ( x , 0 ) = 2 x sin 1 x − cos 1 x f_x(x, 0) = 2x\sin\frac{1}{x} - \cos\frac{1}{x} f x ( x , 0 ) = 2 x sin x 1 − cos x 1 で、x → + 0 x \to +0 x → + 0 の極限をもたない(第 2 項が振動する)。よって f x f_x f x は原点で連続でない(f y f_y f y も同様)。
問題 7.6 ★★ f ( x , y ) f(x, y) f ( x , y ) を C 2 C^2 C 2 級とし、u ( r , θ ) = f ( r cos θ , r sin θ ) u(r, \theta) = f(r\cos\theta, r\sin\theta) u ( r , θ ) = f ( r cos θ , r sin θ ) とする。r > 0 r > 0 r > 0 で次を示せ。
f x x + f y y = u r r + 1 r u r + 1 r 2 u θ θ f_{xx} + f_{yy} = u_{rr} + \frac{1}{r}u_r + \frac{1}{r^2}u_{\theta\theta} f xx + f y y = u r r + r 1 u r + r 2 1 u θ θ
解答
例 7.15 の u r = f x cos θ + f y sin θ u_r = f_x\cos\theta + f_y\sin\theta u r = f x cos θ + f y sin θ をさらに r r r で微分すると(f x , f y f_x, f_y f x , f y にも連鎖律を使い、f x y = f y x f_{xy} = f_{yx} f x y = f y x を用いる)
u r r = f x x cos 2 θ + 2 f x y sin θ cos θ + f y y sin 2 θ u_{rr} = f_{xx}\cos^2\theta + 2f_{xy}\sin\theta\cos\theta + f_{yy}\sin^2\theta u r r = f xx cos 2 θ + 2 f x y sin θ cos θ + f y y sin 2 θ
u θ = − r f x sin θ + r f y cos θ u_\theta = -rf_x\sin\theta + rf_y\cos\theta u θ = − r f x sin θ + r f y cos θ を θ \theta θ で微分すると
u θ θ = r 2 ( f x x sin 2 θ − 2 f x y sin θ cos θ + f y y cos 2 θ ) − r ( f x cos θ + f y sin θ ) u_{\theta\theta} = r^2\bigl(f_{xx}\sin^2\theta - 2f_{xy}\sin\theta\cos\theta + f_{yy}\cos^2\theta\bigr) - r(f_x\cos\theta + f_y\sin\theta) u θ θ = r 2 ( f xx sin 2 θ − 2 f x y sin θ cos θ + f y y cos 2 θ ) − r ( f x cos θ + f y sin θ )
よって 1 r 2 u θ θ = f x x sin 2 θ − 2 f x y sin θ cos θ + f y y cos 2 θ − 1 r u r \frac{1}{r^2}u_{\theta\theta} = f_{xx}\sin^2\theta - 2f_{xy}\sin\theta\cos\theta + f_{yy}\cos^2\theta - \frac{1}{r}u_r r 2 1 u θ θ = f xx sin 2 θ − 2 f x y sin θ cos θ + f y y cos 2 θ − r 1 u r 。u r r u_{rr} u r r と足すと f x x + f y y − 1 r u r f_{xx} + f_{yy} - \frac{1}{r}u_r f xx + f y y − r 1 u r となり、主張を得る。
問題 7.7 ★★ (オイラーの定理)f : R n ∖ { 0 } → R f\colon \mathbb{R}^n \setminus \lbrace 0 \rbrace \to \mathbb{R} f : R n ∖ { 0 } → R を C 1 C^1 C 1 級とする。すべての t > 0 t > 0 t > 0 、x ≠ 0 x \neq 0 x = 0 で f ( t x ) = t k f ( x ) f(tx) = t^kf(x) f ( t x ) = t k f ( x ) (k k k 次同次)であることと、∑ i = 1 n x i ∂ i f ( x ) = k f ( x ) \sum_{i=1}^{n}x_i\partial_if(x) = kf(x) ∑ i = 1 n x i ∂ i f ( x ) = k f ( x ) であることは同値であることを示せ。
解答
(⇒)f ( t x ) = t k f ( x ) f(tx) = t^kf(x) f ( t x ) = t k f ( x ) の両辺を t t t で微分すると、連鎖律より ∑ i x i ∂ i f ( t x ) = k t k − 1 f ( x ) \sum_i x_i\partial_if(tx) = kt^{k-1}f(x) ∑ i x i ∂ i f ( t x ) = k t k − 1 f ( x ) 。t = 1 t = 1 t = 1 とすればよい。(⇐)x x x を固定し φ ( t ) = t − k f ( t x ) \varphi(t) = t^{-k}f(tx) φ ( t ) = t − k f ( t x ) (t > 0 t > 0 t > 0 )とおくと
φ ′ ( t ) = − k t − k − 1 f ( t x ) + t − k ∑ i x i ∂ i f ( t x ) = t − k − 1 ( ∑ i ( t x i ) ∂ i f ( t x ) − k f ( t x ) ) = 0 \varphi'(t) = -kt^{-k-1}f(tx) + t^{-k}\sum_i x_i\partial_if(tx) = t^{-k-1}\left(\sum_i (tx_i)\partial_if(tx) - kf(tx)\right) = 0 φ ′ ( t ) = − k t − k − 1 f ( t x ) + t − k i ∑ x i ∂ i f ( t x ) = t − k − 1 ( i ∑ ( t x i ) ∂ i f ( t x ) − k f ( t x ) ) = 0
なので φ ( t ) = φ ( 1 ) = f ( x ) \varphi(t) = \varphi(1) = f(x) φ ( t ) = φ ( 1 ) = f ( x ) 。
問題 7.8 ★★ f ( x , y ) = x 2 + y 2 ( 1 − x ) 3 f(x, y) = x^2 + y^2(1 - x)^3 f ( x , y ) = x 2 + y 2 ( 1 − x ) 3 の臨界点は原点だけであり、そこで狭義の極小をとるが、f f f は最小値をもたないことを示せ。
解答
f x = 2 x − 3 y 2 ( 1 − x ) 2 f_x = 2x - 3y^2(1-x)^2 f x = 2 x − 3 y 2 ( 1 − x ) 2 、f y = 2 y ( 1 − x ) 3 f_y = 2y(1 - x)^3 f y = 2 y ( 1 − x ) 3 。f y = 0 f_y = 0 f y = 0 より y = 0 y = 0 y = 0 または x = 1 x = 1 x = 1 。y = 0 y = 0 y = 0 なら f x = 2 x = 0 f_x = 2x = 0 f x = 2 x = 0 で x = 0 x = 0 x = 0 。x = 1 x = 1 x = 1 なら f x = 2 ≠ 0 f_x = 2 \neq 0 f x = 2 = 0 。よって臨界点は原点のみ。原点で f x x = 2 f_{xx} = 2 f xx = 2 、f x y = 0 f_{xy} = 0 f x y = 0 、f y y = 2 f_{yy} = 2 f y y = 2 なので正定値で、狭義の極小(値 0 0 0 )。一方 f ( x , 1 ) = x 2 + ( 1 − x ) 3 → − ∞ f(x, 1) = x^2 + (1 - x)^3 \to -\infty f ( x , 1 ) = x 2 + ( 1 − x ) 3 → − ∞ (x → ∞ x \to \infty x → ∞ )なので最小値はない。
問題 7.9 ★★★ n n n 次正方行列全体を R n 2 \mathbb{R}^{n^2} R n 2 と同一視する。正則行列全体 GL n ( R ) \operatorname{GL}_n(\mathbb{R}) GL n ( R ) は開集合であり、ι ( A ) = A − 1 \iota(A) = A^{-1} ι ( A ) = A − 1 は GL n ( R ) \operatorname{GL}_n(\mathbb{R}) GL n ( R ) 上で微分可能で D ι ( A ) H = − A − 1 H A − 1 D\iota(A)H = -A^{-1}HA^{-1} D ι ( A ) H = − A − 1 H A − 1 であることを示せ。
解答
det \det det は成分の多項式なので連続であり、GL n ( R ) = det − 1 ( R ∖ { 0 } ) \operatorname{GL}_n(\mathbb{R}) = \det^{-1}(\mathbb{R} \setminus \lbrace 0 \rbrace) GL n ( R ) = det − 1 ( R ∖ { 0 }) は開集合(連続写像による開集合の逆像)。逆行列の成分は余因子を det \det det で割ったもの(クラメルの公式)なので、ι \iota ι は連続。A + H A + H A + H が正則のとき、直接計算で
( A + H ) − 1 − A − 1 + A − 1 H A − 1 = ( A + H ) − 1 H A − 1 H A − 1 (A + H)^{-1} - A^{-1} + A^{-1}HA^{-1} = (A + H)^{-1}HA^{-1}HA^{-1} ( A + H ) − 1 − A − 1 + A − 1 H A − 1 = ( A + H ) − 1 H A − 1 H A − 1
(右辺に左から A + H A + H A + H を掛けると H A − 1 H A − 1 HA^{-1}HA^{-1} H A − 1 H A − 1 、左辺に掛けると I − I − H A − 1 + H A − 1 + H A − 1 H A − 1 I - I - HA^{-1} + HA^{-1} + HA^{-1}HA^{-1} I − I − H A − 1 + H A − 1 + H A − 1 H A − 1 で一致する)。作用素ノルムで評価すると、右辺は ∥ ( A + H ) − 1 ∥ ∥ A − 1 ∥ 2 ∥ H ∥ 2 \lVert (A+H)^{-1} \rVert\lVert A^{-1} \rVert^2\lVert H \rVert^2 ∥( A + H ) − 1 ∥ ∥ A − 1 ∥ 2 ∥ H ∥ 2 以下であり、ι \iota ι の連続性より H → 0 H \to 0 H → 0 で ∥ ( A + H ) − 1 ∥ \lVert (A+H)^{-1} \rVert ∥( A + H ) − 1 ∥ は有界。行列の成分のユークリッドノルムと作用素ノルムは定数倍で比較できるので、右辺は o ( ∥ H ∥ ) o(\lVert H \rVert) o (∥ H ∥) である。よって D ι ( A ) H = − A − 1 H A − 1 D\iota(A)H = -A^{-1}HA^{-1} D ι ( A ) H = − A − 1 H A − 1 。n = 1 n = 1 n = 1 なら ( 1 / x ) ′ = − 1 / x 2 (1/x)' = -1/x^2 ( 1/ x ) ′ = − 1/ x 2 に一致する。