Lemma数学ロードマップ

02 線形代数 · 第 8 章

二次形式と特異値分解

目安 13〜17 時間定理など 17演習 10 問

この章の目標

  • 双線形形式・二次形式・エルミート形式を行列で表し、基底変換による合同変換を扱える
  • シルベスターの慣性法則を証明し、符号数を計算できる
  • 正定値性を固有値と主小行列式で判定でき、その証明ができる
  • 二次曲線・二次曲面を回転と平行移動で標準形に直し、分類できる
  • 特異値分解を証明・計算し、極分解・ムーア–ペンローズ擬逆行列・低ランク近似に応用できる
  • レイリー商とクーラント–フィッシャーのミニマックス原理を証明し、固有値の評価に使える

前提:第3章(双対空間)、第7章(スペクトル定理)

8.1 動機:同じ行列、異なる変換規則

q(x,y)=5x2+4xy+2y2q(x, y) = 5x^2 + 4xy + 2y^2 のような二次の同次多項式(二次形式)は、至るところに現れる。等高線 q=1q = 1 は二次曲線であり、多変数関数の極値はヘッセ行列の二次形式の符号で判定され、力学ではエネルギーが速度や変位の二次形式で表される。二次形式は対称行列で表せる:

q(x,y)=(xy)(5222)(xy)q(x, y) = \begin{pmatrix} x & y \end{pmatrix} \begin{pmatrix} 5 & 2 \\ 2 & 2 \end{pmatrix} \begin{pmatrix} x \\ y \end{pmatrix}

ここで注意すべきことがある。座標を x=Px′x = Px' と取り替えると、二次形式の行列は tPAP{}^t PAP に変わる。一方、同じ行列 AA を線形変換の表現行列とみれば、基底変換で P−1APP^{-1}AP に変わるのだった(第3章)。同じ正方行列でも、それが線形写像の座標表示なのか、双線形形式の座標表示なのかによって、変換規則が異なる。PP が直交行列(tP=P−1{}^t P = P^{-1})なら二つの規則は一致するので、スペクトル定理(第7章)はそのまま二次形式の理論にも使える。

本章の後半では、異なる二つの内積空間の間の線形写像 f ⁣:V→Wf\colon V \to W を考える。定義域と値域で正規直交基底を独立に選べるとき、表現行列はどこまで簡単になるか——その答えが特異値分解である。第3章の階数標準形(基底を自由に選べば IrI_r と OO だけのブロック行列になる)の「計量つき版」とみることができる。

8.2 双線形形式・二次形式・エルミート形式

以下、VV は体 KK 上の nn 次元ベクトル空間とする(8.4 節以降は K=RK = \mathbb{R} または C\mathbb{C})。

定義 8.1(双線形形式, bilinear form)写像 B ⁣:V×V→KB\colon V \times V \to K が各変数について線形であるとき、双線形形式という。B(u,v)=B(v,u)B(u, v) = B(v, u) を満たすとき対称、B(v,v)=0B(v, v) = 0 がすべての vv で成り立つとき交代的という。

定義 8.2(表現行列)VV の基底 B=(v1,…,vn)\mathcal{B} = (v_1, \dots, v_n) に対し、G=(B(vi,vj))i,jG = (B(v_i, v_j))_{i,j} を BB の表現行列(グラム行列)という。u,vu, v の座標を x=[u]Bx = [u]_{\mathcal{B}}、y=[v]By = [v]_{\mathcal{B}} とすると

B(u,v)=∑i,jxiyjB(vi,vj)=tx G yB(u, v) = \sum_{i,j} x_i y_j B(v_i, v_j) = {}^t x\, G\, y

BB が対称であることと GG が対称行列であることは同値である。逆に任意の G∈M⁡n(K)G \in \operatorname{M}_n(K) は txGy{}^t x G y により双線形形式を定める。

命題 8.3(基底変換)新しい基底 B′=(v1′,…,vn′)\mathcal{B}' = (v_1', \dots, v_n') を vj′=∑ipijviv_j' = \sum_i p_{ij} v_i、P=(pij)P = (p_{ij}) で与えると、BB の表現行列は G′=tPGPG' = {}^t P G P に変わる。

証明. B(vi′,vj′)=∑k,lpkipljB(vk,vl)=∑k,l(tP)ikgklplj=(tPGP)ijB(v_i', v_j') = \sum_{k,l} p_{ki} p_{lj} B(v_k, v_l) = \sum_{k,l} ({}^t P)_{ik} g_{kl} p_{lj} = ({}^t PGP)_{ij}。□\square

定義 8.4(合同)A,A′∈M⁡n(K)A, A' \in \operatorname{M}_n(K) について、A′=tPAPA' = {}^t PAP となる P∈GL⁡n(K)P \in \operatorname{GL}_n(K) が存在するとき、AA と A′A' は合同 (congruent) であるという。

合同な行列の階数は等しい(系 3.30)ので、BB の階数 rank⁡B:=rank⁡G\operatorname{rank} B := \operatorname{rank} G が定まる。GG が正則なとき BB は非退化であるという。これは、線形写像 V→V∗V \to V^{\ast}, v↦B(⋅,v)v \mapsto B(\cdot, v) が同型であることと同値である(B(⋅,vj)=∑iB(vi,vj)vi∗B(\cdot, v_j) = \sum_i B(v_i, v_j) v_i^{\ast} なので、この写像の基底 B\mathcal{B} と双対基底に関する表現行列は GG である)。

注意 8.5 線形変換の表現行列は P−1APP^{-1}AP と、双線形形式の表現行列は tPAP{}^t PAP と変換される。例えば「行列式」は相似では不変だが、合同では det⁡(tPAP)=(det⁡P)2det⁡A\det({}^t PAP) = (\det P)^2 \det A と変わる。逆に「符号数」(8.3 節)は合同で不変だが相似では意味をもたない。第9章の添字記法では、前者は AijA^i{}_j(上下一つずつの添字)、後者は gijg_{ij}(下の添字二つ)と書き分けられ、変換規則の違いが添字の位置で表される。

定義 8.6(二次形式)KK の標数が 2 でないとする。対称双線形形式 BB に対し q(v)=B(v,v)q(v) = B(v, v) を二次形式 (quadratic form) という。座標では、対称行列 AA を用いて

q(x)=txAx=∑iaiixi2+2∑i<jaijxixjq(x) = {}^t x A x = \sum_{i} a_{ii} x_i^2 + 2\sum_{i<j} a_{ij} x_i x_j

と書ける。

偏極:B(u,v)=12(q(u+v)−q(u)−q(v))B(u, v) = \frac{1}{2}\left(q(u + v) - q(u) - q(v)\right) なので、二次形式から対称双線形形式が復元できる。したがって、対称双線形形式・二次形式・対称行列は一対一に対応する。二次形式から行列を作るときは、xixjx_ix_j (i≠j)(i \neq j) の係数の半分を (i,j)(i, j) 成分と (j,i)(j, i) 成分に入れる。例えば

x2+4xy+2y2−6yz+z2⟷(12022−30−31)x^2 + 4xy + 2y^2 - 6yz + z^2 \longleftrightarrow \begin{pmatrix} 1 & 2 & 0 \\ 2 & 2 & -3 \\ 0 & -3 & 1 \end{pmatrix}

複素ベクトル空間では、内積と同様に第 2 変数について共役線形な形式を使う。

定義 8.7(エルミート形式)K=CK = \mathbb{C} とする。H ⁣:V×V→CH\colon V \times V \to \mathbb{C} が第 1 変数について線形で H(v,u)=H(u,v)‾H(v, u) = \overline{H(u, v)} を満たすとき、エルミート形式という。基底 (vi)(v_i) に対し aij=H(vj,vi)a_{ij} = H(v_j, v_i) とおくと、A=(aij)A = (a_{ij}) はエルミート行列で、座標 x,yx, y について

H(u,v)=y∗AxH(u, v) = y^{\ast} A x

となる。基底変換 vj′=∑ipijviv_j' = \sum_i p_{ij}v_i で AA は P∗APP^{\ast}AP に変わる。

添字の順序 aij=H(vj,vi)a_{ij} = H(v_j, v_i) は、第 1 変数について線形という本教材の約束に合わせたものである(計算は命題 8.3 と同様)。H(v,v)H(v, v) は常に実数である。内積とは正定値なエルミート形式(実なら正定値な対称双線形形式)にほかならない。

8.3 対角化とシルベスターの慣性法則

定理 8.8(直交基底の存在)KK の標数が 2 でないとする。VV 上の対称双線形形式 BB に対し、B(vi,vj)=0B(v_i, v_j) = 0 (i≠j)(i \neq j) を満たす基底(BB に関する直交基底)が存在する。すなわち、任意の対称行列は対角行列と合同である。

証明. nn に関する帰納法。B=0B = 0 なら任意の基底でよい。B≠0B \neq 0 なら、偏極の式から q(v)=B(v,v)≠0q(v) = B(v, v) \neq 0 となる vv がある(q≡0q \equiv 0 なら B≡0B \equiv 0 になる)。線形形式 u↦B(u,v)u \mapsto B(u, v) は vv で 0 でないので、その核 WW は n−1n - 1 次元で v∉Wv \notin W、よって V=Kv⊕WV = Kv \oplus W。BB を WW に制限したものに帰納法の仮定を適用して得られる直交基底に vv を加えればよい。□\square

実際の計算には、平方完成(ラグランジュの方法)が便利である。

例 8.9 q=x2+4xy+2y2−6yz+z2q = x^2 + 4xy + 2y^2 - 6yz + z^2 を平方完成する。

q=(x+2y)2−2y2−6yz+z2=(x+2y)2−2(y+32z)2+92z2+z2=(x+2y)2−2(y+32z)2+112z2\begin{aligned} q &= (x + 2y)^2 - 2y^2 - 6yz + z^2 = (x + 2y)^2 - 2\left(y + \tfrac{3}{2}z\right)^2 + \tfrac{9}{2}z^2 + z^2 \\ &= (x + 2y)^2 - 2\left(y + \tfrac{3}{2}z\right)^2 + \tfrac{11}{2}z^2 \end{aligned}

新しい座標 X=x+2yX = x + 2y、Y=y+32zY = y + \frac{3}{2}z、Z=zZ = z で q=X2−2Y2+112Z2q = X^2 - 2Y^2 + \frac{11}{2}Z^2 となる。(展開して検算せよ。)正の係数が 2 個、負の係数が 1 個である。座標変換の行列は対角成分 1 の上三角行列なので行列式は保たれ、1⋅(−2)⋅112=−111 \cdot (-2) \cdot \frac{11}{2} = -11 が上の対称行列の行列式 1⋅(2−9)−2⋅(2−0)=−111 \cdot (2 - 9) - 2 \cdot (2 - 0) = -11 と一致する。

実対称行列については、スペクトル定理により直交行列で対角化でき、対角成分は固有値である(定理 7.32、tQ=Q−1{}^t Q = Q^{-1} なので相似と合同が一致する)。さらに各基底ベクトルを ∣λi∣−1/2\lvert \lambda_i \rvert^{-1/2} 倍すれば、対角成分を 1,−1,01, -1, 0 にできる。

定理 8.10(シルベスターの慣性法則, Sylvester's law of inertia)実対称行列 AA(あるいは実ベクトル空間上の対称双線形形式)を合同変換で対角行列にしたとき、対角成分のうち正のものの個数 pp と負のものの個数 qq は、対角化の方法によらず一定である。(p,q)(p, q) を AA の符号数 (signature) という。p+q=rank⁡Ap + q = \operatorname{rank} A であり、pp は AA の正の固有値の個数、qq は負の固有値の個数に等しい(重複度込み)。

証明. 基底 v1,…,vnv_1, \dots, v_n に関して BB が対角形で、di=B(vi,vi)d_i = B(v_i, v_i) が i≤pi \leq p で正、p<i≤p+qp < i \leq p + q で負、それ以外で 0 とする。次を示す:

p=max⁡{dim⁡W∣W⊂V は部分空間で、B(w,w)>0 (w∈W∖{0})}p = \max\lbrace \dim W \mid W \subset V \text{ は部分空間で、} B(w, w) > 0 \ (w \in W \setminus \lbrace 0 \rbrace) \rbrace

右辺は対角化の方法によらないので、pp も一定である。W+=span⁡(v1,…,vp)W_+ = \operatorname{span}(v_1, \dots, v_p) 上では B(∑civi,∑civi)=∑i≤pdici2>0B(\sum c_iv_i, \sum c_iv_i) = \sum_{i \leq p} d_ic_i^2 > 0(c≠0c \neq 0)なので、右辺 ≥p\geq p。逆に WW が B(w,w)>0B(w, w) > 0 (w≠0)(w \neq 0) を満たす部分空間なら、U=span⁡(vp+1,…,vn)U = \operatorname{span}(v_{p+1}, \dots, v_n) 上では B(u,u)=∑i>pdici2≤0B(u, u) = \sum_{i > p} d_ic_i^2 \leq 0 なので W∩U={0}W \cap U = \lbrace 0 \rbrace であり、dim⁡W+(n−p)≤n\dim W + (n - p) \leq n、すなわち dim⁡W≤p\dim W \leq p。qq については −B-B に同じ議論を適用する。p+qp + q は対角行列の階数だから rank⁡A\operatorname{rank} A に等しい。最後の主張は、直交行列による対角化の対角成分が固有値であることから従う。□\square

エルミート行列についても、P∗APP^{\ast}AP による対角化で同じ主張が同じ証明で成り立つ。

系 8.11 二つの実対称行列が合同であるための必要十分条件は、階数と符号数が等しいこと、すなわち (p,q)(p, q) が等しいことである。符号数 (p,q)(p, q) の実対称行列は diag⁡(Ip,−Iq,O)\operatorname{diag}(I_p, -I_q, O) と合同である。

証明. 必要性は定理 8.10。十分性は、両者がともに diag⁡(Ip,−Iq,O)\operatorname{diag}(I_p, -I_q, O) と合同であることから。□\square

例 8.9 の二次形式の符号数は (2,1)(2, 1) である。なお、C\mathbb{C} 上の対称双線形形式(エルミート形式ではない)では、基底ベクトルを di−1/2d_i^{-1/2} 倍(C\mathbb{C} では常に平方根がとれる)すれば対角成分をすべて 1 か 0 にできるので、不変量は階数だけである。

8.4 正定値性

以下、K=RK = \mathbb{R} または C\mathbb{C} とし、エルミート行列(実対称行列を含む)A∈M⁡n(K)A \in \operatorname{M}_n(K) を考える。

定義 8.12(正定値)すべての x≠0x \neq 0 で x∗Ax>0x^{\ast}Ax > 0 のとき AA は正定値 (positive definite)、x∗Ax≥0x^{\ast}Ax \geq 0 のとき半正定値 (positive semidefinite) という。−A-A が正定値のとき負定値、正負両方の値をとるとき不定値という。

AA の左上の k×kk \times k 部分を AkA_k と書き、det⁡Ak\det A_k を首座小行列式(先頭主小行列式, leading principal minor)という。

定理 8.13(正定値性の判定)エルミート行列 A∈M⁡n(K)A \in \operatorname{M}_n(K) について、次は同値である。

  1. AA は正定値である。
  2. AA の固有値はすべて正である。
  3. det⁡Ak>0\det A_k > 0 (k=1,…,n)(k = 1, \dots, n)(シルベスターの判定法)。
  4. A=B∗BA = B^{\ast}B となる正則行列 BB が存在する。

証明. (1 ⇒ 2):Av=λvAv = \lambda v、v≠0v \neq 0 なら λ∥v∥2=v∗Av>0\lambda\lVert v \rVert^2 = v^{\ast}Av > 0。

(2 ⇒ 1):A=UDU∗A = UDU^{\ast}(UU はユニタリ、D=diag⁡(λi)D = \operatorname{diag}(\lambda_i)。K=RK = \mathbb{R} なら定理 7.32 により UU は実の直交行列にとれる)とすると、y=U∗xy = U^{\ast}x として x∗Ax=y∗Dy=∑iλi∣yi∣2x^{\ast}Ax = y^{\ast}Dy = \sum_i \lambda_i \lvert y_i \rvert^2。x≠0x \neq 0 なら y≠0y \neq 0 なので正。

(1 ⇒ 3):x′∈Kkx' \in K^k に対し x=t(x′,0,…,0)x = {}^t(x', 0, \dots, 0) とおくと x′∗Akx′=x∗Axx'^{\ast}A_kx' = x^{\ast}Ax なので AkA_k も正定値である。(1 ⇒ 2) より AkA_k の固有値は正で、det⁡Ak\det A_k はその積なので正。

(3 ⇒ 1):nn に関する帰納法。n=1n = 1 は明らか。An−1A_{n-1} の首座小行列式は AA のそれと同じなので、帰納法の仮定より An−1A_{n-1} は正定値であり、特に正則である。

A=(An−1bb∗c),P=(In−1−An−1−1b01)A = \begin{pmatrix} A_{n-1} & b \\ b^{\ast} & c \end{pmatrix}, \qquad P = \begin{pmatrix} I_{n-1} & -A_{n-1}^{-1}b \\ 0 & 1 \end{pmatrix}

と書くと、ブロック積により(An−1−1A_{n-1}^{-1} もエルミートであることに注意)

P∗AP=(An−100s),s=c−b∗An−1−1bP^{\ast}AP = \begin{pmatrix} A_{n-1} & 0 \\ 0 & s \end{pmatrix}, \qquad s = c - b^{\ast}A_{n-1}^{-1}b

となる。det⁡P=1\det P = 1 より det⁡A=det⁡An−1⋅s\det A = \det A_{n-1} \cdot s で、det⁡A>0\det A > 0、det⁡An−1>0\det A_{n-1} > 0 から s>0s > 0。y=P−1x=t(y′,yn)y = P^{-1}x = {}^t(y', y_n) とおくと x∗Ax=y∗(P∗AP)y=y′∗An−1y′+s∣yn∣2x^{\ast}Ax = y^{\ast}(P^{\ast}AP)y = y'^{\ast}A_{n-1}y' + s\lvert y_n \rvert^2 で、x≠0x \neq 0 なら y≠0y \neq 0 なので正である。

(1 ⇒ 4):A=UDU∗A = UDU^{\ast} で固有値は正((1 ⇒ 2))なので、D1/2=diag⁡(λi)D^{1/2} = \operatorname{diag}(\sqrt{\lambda_i}) として B=D1/2U∗B = D^{1/2}U^{\ast} とおけば B∗B=UDU∗=AB^{\ast}B = UDU^{\ast} = A、BB は正則。

(4 ⇒ 1):x∗B∗Bx=∥Bx∥2x^{\ast}B^{\ast}Bx = \lVert Bx \rVert^2 で、BB は正則なので x≠0x \neq 0 なら Bx≠0Bx \neq 0。□\square

4 の BB に QR 分解(定理 7.13)B=QRB = QR を施すと A=R∗Q∗QR=R∗RA = R^{\ast}Q^{\ast}QR = R^{\ast}R となる。つまり正定値行列は、対角成分が正の上三角行列 RR によって A=R∗RA = R^{\ast}R と分解できる(コレスキー分解)。

注意

半正定値性は首座小行列式では判定できない。A=diag⁡(0,−1)A = \operatorname{diag}(0, -1) は det⁡A1=0\det A_1 = 0、det⁡A2=0\det A_2 = 0 でいずれも 0 以上だが、e2∗Ae2=−1<0e_2^{\ast}Ae_2 = -1 < 0 なので半正定値ではない。半正定値の正しい判定条件は「固有値がすべて 0 以上」であり、主小行列式で述べるなら、先頭に限らないすべての主小行列式が 0 以上であることが必要十分である(本書では証明は省略する)。

例 8.14 次の行列は、首座小行列式が 22、4−1=34 - 1 = 3、2⋅3−(−1)(−2)=42 \cdot 3 - (-1)(-2) = 4 でいずれも正なので正定値である。

A=(2−10−12−10−12)A = \begin{pmatrix} 2 & -1 & 0 \\ -1 & 2 & -1 \\ 0 & -1 & 2 \end{pmatrix}

実際、固有値は 2−2,2,2+22 - \sqrt{2}, 2, 2 + \sqrt{2} で、すべて正である((A−2I)(A - 2I) の固有値を考えると確かめやすい)。この行列は、差分法で −d2/dx2-d^2/dx^2 を近似したときに現れる。

正定値性の応用として、2 回微分可能な関数の極値判定がある:勾配が 0 の点でヘッセ行列が正定値なら極小、負定値なら極大、不定値なら極値でない(微分積分学 第7章)。

命題 8.15(正の平方根)半正定値エルミート行列 AA に対し、B2=AB^2 = A を満たす半正定値エルミート行列 BB がただ一つ存在する。これを A\sqrt{A} あるいは A1/2A^{1/2} と書く。

証明. 存在:スペクトル分解 A=∑iλiPiA = \sum_i \lambda_i P_i(λi≥0\lambda_i \geq 0 は相異なる固有値、定理 7.34)に対し B=∑iλiPiB = \sum_i \sqrt{\lambda_i}P_i とおけばよい。一意性:BB を条件を満たす行列とすると、BB は B2=AB^2 = A と可換なので AA の固有空間 V(λi)V(\lambda_i) を保つ(Av=λivAv = \lambda_iv なら A(Bv)=BAv=λiBvA(Bv) = BAv = \lambda_iBv)。BB の V(λi)V(\lambda_i) への制限 BiB_i は自己随伴で固有値は 0 以上、かつ Bi2=λiidB_i^2 = \lambda_i \mathrm{id} なので、BiB_i の固有値 μ\mu は μ2=λi\mu^2 = \lambda_i、μ≥0\mu \geq 0 より μ=λi\mu = \sqrt{\lambda_i}。BiB_i は対角化可能なので Bi=λiidB_i = \sqrt{\lambda_i}\mathrm{id}。よって B=∑iλiPiB = \sum_i \sqrt{\lambda_i}P_i と一意に決まる。□\square

8.5 二次曲線と二次曲面

Rn\mathbb{R}^n の二次超曲面とは、対称行列 A≠OA \neq O、b∈Rnb \in \mathbb{R}^n、c∈Rc \in \mathbb{R} を用いて

txAx+2 tbx+c=0{}^t xAx + 2\ {}^t bx + c = 0

と表される図形である(n=2n = 2 なら二次曲線、n=3n = 3 なら二次曲面)。回転(直交変換)と平行移動で座標を取り替えて、式をできるだけ簡単にしたい。これらの変換は距離を保つので、図形の形(合同類)は変わらない。

定理 8.16(二次曲線の分類)平面の二次曲線は、回転と平行移動によって、次のいずれかの形に変換される(a,b>0a, b > 0)。

  • 楕円 x2a2+y2b2=1\dfrac{x^2}{a^2} + \dfrac{y^2}{b^2} = 1、双曲線 x2a2−y2b2=1\dfrac{x^2}{a^2} - \dfrac{y^2}{b^2} = 1、放物線 y=ax2y = ax^2
  • 退化した場合:空集合、1 点、交わる 2 直線、平行な 2 直線、1 直線

証明. 定理 7.32 により、回転行列 QQ(必要なら列の符号を変えて det⁡Q=1\det Q = 1 にする)で x=Qx′x = Qx' とすると tQAQ=diag⁡(λ1,λ2){}^t QAQ = \operatorname{diag}(\lambda_1, \lambda_2) となり、式は λ1x′2+λ2y′2+2b1′x′+2b2′y′+c=0\lambda_1x'^2 + \lambda_2y'^2 + 2b_1'x' + 2b_2'y' + c = 0 の形になる。

rank⁡A=2\operatorname{rank} A = 2(λ1λ2≠0\lambda_1\lambda_2 \neq 0)のとき:x′+b1′/λ1x' + b_1'/\lambda_1、y′+b2′/λ2y' + b_2'/\lambda_2 を新しい座標とする平行移動(平方完成)で λ1X2+λ2Y2=c′\lambda_1X^2 + \lambda_2Y^2 = c' となる。λ1,λ2\lambda_1, \lambda_2 が同符号なら、c′c' がそれと同符号のとき楕円、c′=0c' = 0 のとき 1 点、逆符号のとき空集合。異符号なら、c′≠0c' \neq 0 のとき双曲線(必要なら X,YX, Y の役割を入れ替える)、c′=0c' = 0 のとき交わる 2 直線。

rank⁡A=1\operatorname{rank} A = 1(λ1≠0=λ2\lambda_1 \neq 0 = \lambda_2 としてよい)のとき:x′x' について平方完成して λ1X2+2b2′y′+c′′=0\lambda_1X^2 + 2b_2'y' + c'' = 0。b2′≠0b_2' \neq 0 なら y′y' 方向の平行移動で定数項を消して放物線(必要なら 180° 回転で係数の符号を調整する)。b2′=0b_2' = 0 なら X2=−c′′/λ1X^2 = -c''/\lambda_1 で、平行な 2 直線、1 直線、空集合のいずれかである。□\square

例 8.17 5x2+4xy+2y2=15x^2 + 4xy + 2y^2 = 1 の行列は第 1 行 (5,2)(5, 2)、第 2 行 (2,2)(2, 2) で、Φ(t)=t2−7t+6=(t−6)(t−1)\Phi(t) = t^2 - 7t + 6 = (t - 6)(t - 1)。固有ベクトルは t(2,1){}^t(2, 1)(固有値 6)、t(1,−2){}^t(1, -2)(固有値 1)で、これらを正規化した座標軸で式は 6X2+Y2=16X^2 + Y^2 = 1 となる。これは半軸の長さ 1/61/\sqrt{6} と 11 の楕円で、長軸は t(1,−2){}^t(1, -2) 方向である。

例 8.18 x2−2xy+y2−2(x+y)=0x^2 - 2xy + y^2 - \sqrt{2}(x + y) = 0 で、45°45° の回転 u=(x−y)/2u = (x - y)/\sqrt{2}、v=(x+y)/2v = (x + y)/\sqrt{2} を行うと、x2−2xy+y2=(x−y)2=2u2x^2 - 2xy + y^2 = (x - y)^2 = 2u^2、2(x+y)=2v\sqrt{2}(x + y) = 2v より、式は v=u2v = u^2 となる。これは放物線である。

3 次元でも同じ手順により、二次曲面は次の標準形(とその退化した場合)に分類される(a,b,c>0a, b, c > 0)。

標準形 名称 二次の部分の符号数
x2/a2+y2/b2+z2/c2=1x^2/a^2 + y^2/b^2 + z^2/c^2 = 1 楕円面 (3,0)(3, 0)
x2/a2+y2/b2−z2/c2=1x^2/a^2 + y^2/b^2 - z^2/c^2 = 1 一葉双曲面 (2,1)(2, 1)
x2/a2−y2/b2−z2/c2=1x^2/a^2 - y^2/b^2 - z^2/c^2 = 1 二葉双曲面 (1,2)(1, 2)
x2/a2+y2/b2−z2/c2=0x^2/a^2 + y^2/b^2 - z^2/c^2 = 0 楕円錐面 (2,1)(2, 1)
z=x2/a2+y2/b2z = x^2/a^2 + y^2/b^2 楕円放物面 (2,0)(2, 0)
z=x2/a2−y2/b2z = x^2/a^2 - y^2/b^2 双曲放物面 (1,1)(1, 1)

このほか、柱面(楕円柱面・双曲柱面・放物柱面)や平面の組などの退化した場合がある。二次曲面は曲面の微分幾何の基本的な例である(多様体 第1章)。

8.6 特異値分解

以下 K=RK = \mathbb{R} または C\mathbb{C}、Km,KnK^m, K^n には標準内積を入れる。A∗AA^{\ast}A は半正定値エルミート行列で、rank⁡(A∗A)=rank⁡A\operatorname{rank}(A^{\ast}A) = \operatorname{rank} A である(問題 7.8)。

定理 8.19(特異値分解, singular value decomposition)A∈M⁡m,n(K)A \in \operatorname{M}_{m,n}(K)、r=rank⁡Ar = \operatorname{rank} A とする。ユニタリ行列(K=RK = \mathbb{R} なら直交行列)U∈M⁡m(K)U \in \operatorname{M}_m(K)、V∈M⁡n(K)V \in \operatorname{M}_n(K) と実数 σ1≥σ2≥⋯≥σr>0\sigma_1 \geq \sigma_2 \geq \cdots \geq \sigma_r > 0 が存在して

A=UΣV∗,Σ=(DOOO)∈M⁡m,n(R),D=diag⁡(σ1,…,σr)A = U\Sigma V^{\ast}, \qquad \Sigma = \begin{pmatrix} D & O \\ O & O \end{pmatrix} \in \operatorname{M}_{m,n}(\mathbb{R}), \quad D = \operatorname{diag}(\sigma_1, \dots, \sigma_r)

と書ける。σ12,…,σr2\sigma_1^2, \dots, \sigma_r^2 は A∗AA^{\ast}A の 0 でない固有値(重複度込み)なので、σi\sigma_i は AA から一意に定まる。σi\sigma_i を AA の特異値 (singular value) という。

証明. A∗AA^{\ast}A にスペクトル定理(系 7.31。K=RK = \mathbb{R} なら tAA{}^t AA は実対称なので定理 7.32)を適用し、固有ベクトルからなる KnK^n の正規直交基底 v1,…,vnv_1, \dots, v_n を、固有値が λ1≥⋯≥λn\lambda_1 \geq \cdots \geq \lambda_n となる順にとる。固有値は 0 以上で、0 でないものはちょうど rr 個(rank⁡A∗A=r\operatorname{rank} A^{\ast}A = r)なので、λ1≥⋯≥λr>0=λr+1=⋯=λn\lambda_1 \geq \cdots \geq \lambda_r > 0 = \lambda_{r+1} = \cdots = \lambda_n。σi=λi\sigma_i = \sqrt{\lambda_i}、ui=Avi/σiu_i = Av_i/\sigma_i (i≤r)(i \leq r) とおくと

⟨ui,uj⟩=⟨Avi,Avj⟩σiσj=⟨A∗Avi,vj⟩σiσj=λiδijσiσj=δij\langle u_i, u_j \rangle = \frac{\langle Av_i, Av_j \rangle}{\sigma_i\sigma_j} = \frac{\langle A^{\ast}Av_i, v_j \rangle}{\sigma_i\sigma_j} = \frac{\lambda_i\delta_{ij}}{\sigma_i\sigma_j} = \delta_{ij}

なので u1,…,uru_1, \dots, u_r は正規直交系であり、これを KmK^m の正規直交基底 u1,…,umu_1, \dots, u_m に延長する(系 7.10)。i>ri > r なら ∥Avi∥2=⟨A∗Avi,vi⟩=0\lVert Av_i \rVert^2 = \langle A^{\ast}Av_i, v_i \rangle = 0 より Avi=0Av_i = 0。よって Avi=σiuiAv_i = \sigma_iu_i (i≤r)(i \leq r)、Avi=0Av_i = 0 (i>r)(i > r) であり、U=(u1 ⋯ um)U = (u_1 \ \cdots \ u_m)、V=(v1 ⋯ vn)V = (v_1 \ \cdots \ v_n) とおくと AV=UΣAV = U\Sigma、すなわち A=UΣV∗A = U\Sigma V^{\ast}。一意性:A∗A=VΣ∗ΣV∗A^{\ast}A = V\Sigma^{\ast}\Sigma V^{\ast} なので、Σ∗Σ=diag⁡(σ12,…,σr2,0,… )\Sigma^{\ast}\Sigma = \operatorname{diag}(\sigma_1^2, \dots, \sigma_r^2, 0, \dots) の対角成分は A∗AA^{\ast}A の固有値である。□\square

特異値分解は次のようにも書ける:

A=∑i=1rσiuivi∗,Avi=σiui,A∗ui=σiviA = \sum_{i=1}^{r} \sigma_i u_iv_i^{\ast}, \qquad Av_i = \sigma_iu_i, \qquad A^{\ast}u_i = \sigma_iv_i

viv_i を右特異ベクトル、uiu_i を左特異ベクトルという。抽象的には:有限次元内積空間の間の線形写像 f ⁣:V→Wf\colon V \to W に対し、VV と WW の正規直交基底 (vj),(ui)(v_j), (u_i) をうまく選べば、f(vi)=σiuif(v_i) = \sigma_iu_i (i≤r)(i \leq r)、f(vi)=0f(v_i) = 0 (i>r)(i > r) となる。表現行列は「対角」行列 Σ\Sigma である。幾何学的には、LAL_A は span⁡(v1,…,vr)\operatorname{span}(v_1, \dots, v_r) の単位球面を、半軸が σ1u1,…,σrur\sigma_1u_1, \dots, \sigma_ru_r の楕円体に写す。

例 8.20 次の行列の特異値分解を求める。

A=(3045),tAA=(25202025)A = \begin{pmatrix} 3 & 0 \\ 4 & 5 \end{pmatrix}, \qquad {}^t AA = \begin{pmatrix} 25 & 20 \\ 20 & 25 \end{pmatrix}

tAA{}^t AA の固有値は 45,545, 5、固有ベクトルは v1=t(1,1)/2v_1 = {}^t(1, 1)/\sqrt{2}、v2=t(1,−1)/2v_2 = {}^t(1, -1)/\sqrt{2}。σ1=35\sigma_1 = 3\sqrt{5}、σ2=5\sigma_2 = \sqrt{5}。u1=Av1/σ1=t(3,9)/(2⋅35)=t(1,3)/10u_1 = Av_1/\sigma_1 = {}^t(3, 9)/(\sqrt{2} \cdot 3\sqrt{5}) = {}^t(1, 3)/\sqrt{10}、u2=Av2/σ2=t(3,−1)/10u_2 = Av_2/\sigma_2 = {}^t(3, -1)/\sqrt{10}。よって

A=110(133−1)(35005)12(111−1)A = \frac{1}{\sqrt{10}}\begin{pmatrix} 1 & 3 \\ 3 & -1 \end{pmatrix} \begin{pmatrix} 3\sqrt{5} & 0 \\ 0 & \sqrt{5} \end{pmatrix} \frac{1}{\sqrt{2}}\begin{pmatrix} 1 & 1 \\ 1 & -1 \end{pmatrix}

検算:左の二つの積は 12\frac{1}{\sqrt{2}} に第 1 行 (3,3)(3, 3)、第 2 行 (9,−1)(9, -1) を掛けたもので、右の行列を掛けると 12\frac{1}{2} に第 1 行 (6,0)(6, 0)、第 2 行 (8,10)(8, 10) を掛けたもの、すなわち AA に戻る。det⁡A=15=σ1σ2\det A = 15 = \sigma_1\sigma_2 も確かめられる。

命題 8.21(作用素ノルムとフロベニウスノルム)A∈M⁡m,n(K)A \in \operatorname{M}_{m,n}(K) の特異値を σ1≥⋯≥σr\sigma_1 \geq \cdots \geq \sigma_r とすると

∥A∥:=max⁡∥x∥=1∥Ax∥=σ1,∥A∥F:=tr⁡(A∗A)=∑i,j∣aij∣2=σ12+⋯+σr2\lVert A \rVert := \max_{\lVert x \rVert = 1} \lVert Ax \rVert = \sigma_1, \qquad \lVert A \rVert_F := \sqrt{\operatorname{tr}(A^{\ast}A)} = \sqrt{\sum_{i,j} \lvert a_{ij} \rvert^2} = \sqrt{\sigma_1^2 + \cdots + \sigma_r^2}

証明. UU はノルムを保つので ∥Ax∥=∥ΣV∗x∥\lVert Ax \rVert = \lVert \Sigma V^{\ast}x \rVert であり、y=V∗xy = V^{\ast}x は xx とともにすべての単位ベクトルを動く。∥Σy∥2=∑i≤rσi2∣yi∣2≤σ12∥y∥2\lVert \Sigma y \rVert^2 = \sum_{i \leq r} \sigma_i^2\lvert y_i \rvert^2 \leq \sigma_1^2\lVert y \rVert^2 で、y=e1y = e_1 で等号が成り立つので、最大値は存在して σ1\sigma_1 に等しい。後半は tr⁡(A∗A)=tr⁡(VΣ∗ΣV∗)=tr⁡(Σ∗Σ)=∑σi2\operatorname{tr}(A^{\ast}A) = \operatorname{tr}(V\Sigma^{\ast}\Sigma V^{\ast}) = \operatorname{tr}(\Sigma^{\ast}\Sigma) = \sum \sigma_i^2(トレースの相似不変性)。□\square

∥A∥\lVert A \rVert を作用素ノルム(スペクトルノルム)、∥A∥F\lVert A \rVert_F をフロベニウスノルムという。作用素ノルムについて ∥A+B∥≤∥A∥+∥B∥\lVert A + B \rVert \leq \lVert A \rVert + \lVert B \rVert(三角不等式)が成り立つことは定義から明らかである。

8.7 極分解

定理 8.22(極分解, polar decomposition)任意の A∈M⁡n(K)A \in \operatorname{M}_n(K) は、ユニタリ行列 WW と半正定値エルミート行列 PP を用いて A=WPA = WP と書ける。P=A∗AP = \sqrt{A^{\ast}A} は一意に定まり、AA が正則なら WW も一意に定まる。

証明. 特異値分解 A=UΣV∗A = U\Sigma V^{\ast}(正方なので Σ\Sigma は対角行列)から A=(UV∗)(VΣV∗)A = (UV^{\ast})(V\Sigma V^{\ast}) とし、W=UV∗W = UV^{\ast}、P=VΣV∗P = V\Sigma V^{\ast} とおく。WW はユニタリ、PP は固有値 σi≥0\sigma_i \geq 0 の半正定値エルミート行列である。A=WPA = WP なら A∗A=PW∗WP=P2A^{\ast}A = PW^{\ast}WP = P^2 なので、命題 8.15 より P=A∗AP = \sqrt{A^{\ast}A} は一意。AA が正則なら PP も正則で W=AP−1W = AP^{-1}。□\square

これは複素数の極形式 z=eiθ∣z∣z = e^{i\theta}\lvert z \rvert の類似である:ユニタリ行列 WW が「偏角」、PP が「絶対値」にあたる。幾何学的には、任意の線形変換は、直交する軸に沿った伸縮 PP に回転(または鏡映)WW を合成したものである。

例 8.23 例 8.20 の AA では

P=VΣ tV=5(2112),W=U tV=15(2−112)P = V\Sigma\ {}^t V = \sqrt{5}\begin{pmatrix} 2 & 1 \\ 1 & 2 \end{pmatrix}, \qquad W = U\ {}^t V = \frac{1}{\sqrt{5}}\begin{pmatrix} 2 & -1 \\ 1 & 2 \end{pmatrix}

であり、WW は回転行列(det⁡W=1\det W = 1)である。検算:WPWP は第 1 行 (4−1,2−2)(4 - 1, 2 - 2)、第 2 行 (2+2,1+4)(2 + 2, 1 + 4) で AA に一致する。また P2P^2 は第 1 行 (5,4)(5, 4)、第 2 行 (4,5)(4, 5) の行列の 5 倍であり、tAA{}^t AA に等しい。

8.8 ムーア–ペンローズ擬逆行列

正則でない行列や長方行列にも「逆行列の代わり」を定義したい。

定義 8.24(擬逆行列)A=UΣV∗A = U\Sigma V^{\ast} を特異値分解とし、Σ+∈M⁡n,m(R)\Sigma^{+} \in \operatorname{M}_{n,m}(\mathbb{R}) を、左上に D−1=diag⁡(σ1−1,…,σr−1)D^{-1} = \operatorname{diag}(\sigma_1^{-1}, \dots, \sigma_r^{-1}) を置き他を 0 とした行列とする。A+=VΣ+U∗A^{+} = V\Sigma^{+}U^{\ast} を AA のムーア–ペンローズ擬逆行列 (Moore–Penrose pseudoinverse) という。

定理 8.25(ペンローズの条件)A+A^{+} は、次の 4 条件を満たすただ一つの行列 X∈M⁡n,m(K)X \in \operatorname{M}_{n,m}(K) である。

AXA=A,XAX=X,(AX)∗=AX,(XA)∗=XAAXA = A, \qquad XAX = X, \qquad (AX)^{\ast} = AX, \qquad (XA)^{\ast} = XA

特に A+A^{+} は特異値分解の選び方によらない。AA が正則なら A+=A−1A^{+} = A^{-1} である。

証明. X=A+X = A^{+} が満たすこと:ΣΣ+Σ=Σ\Sigma\Sigma^{+}\Sigma = \Sigma、Σ+ΣΣ+=Σ+\Sigma^{+}\Sigma\Sigma^{+} = \Sigma^{+} で、ΣΣ+\Sigma\Sigma^{+}、Σ+Σ\Sigma^{+}\Sigma はそれぞれ左上が IrI_r で他が 0 の実対角行列である。例えば AA+=UΣΣ+U∗AA^{+} = U\Sigma\Sigma^{+}U^{\ast} はエルミートである。他も同様。

一意性:X,YX, Y がともに 4 条件を満たすとすると

X=XAX=X(AX)∗=XX∗A∗=XX∗(AYA)∗=XX∗A∗Y∗A∗=X(AX)∗(AY)∗=XAXAY=XAY,Y=YAY=(YA)∗Y=A∗Y∗Y=(AXA)∗Y∗Y=A∗X∗A∗Y∗Y=(XA)∗(YA)∗Y=XAYAY=XAY\begin{aligned} X &= XAX = X(AX)^{\ast} = XX^{\ast}A^{\ast} = XX^{\ast}(AYA)^{\ast} = XX^{\ast}A^{\ast}Y^{\ast}A^{\ast} = X(AX)^{\ast}(AY)^{\ast} = XAXAY = XAY, \\ Y &= YAY = (YA)^{\ast}Y = A^{\ast}Y^{\ast}Y = (AXA)^{\ast}Y^{\ast}Y = A^{\ast}X^{\ast}A^{\ast}Y^{\ast}Y = (XA)^{\ast}(YA)^{\ast}Y = XAYAY = XAY \end{aligned}

よって X=YX = Y。正則なら A−1A^{-1} が 4 条件を満たす。□\square

定理 8.26(最小ノルム最小二乗解)b∈Kmb \in K^m に対し、∥Ax−b∥\lVert Ax - b \rVert を最小にする xx のうち、ノルム ∥x∥\lVert x \rVert が最小のものがただ一つ存在し、それは A+bA^{+}b である。

証明. AA+=UΣΣ+U∗=∑i≤ruiui∗AA^{+} = U\Sigma\Sigma^{+}U^{\ast} = \sum_{i \leq r} u_iu_i^{\ast} は Im⁡A=span⁡(u1,…,ur)\operatorname{Im} A = \operatorname{span}(u_1, \dots, u_r) への直交射影なので、A(A+b)A(A^{+}b) は bb の Im⁡A\operatorname{Im} A への射影であり、A+bA^{+}b は最小二乗解である(定理 7.19 の証明)。最小二乗解の全体は A+b+Ker⁡AA^{+}b + \operatorname{Ker} A である。A+b∈span⁡(v1,…,vr)=(Ker⁡A)⊥A^{+}b \in \operatorname{span}(v_1, \dots, v_r) = (\operatorname{Ker} A)^{\perp}(Ker⁡A=span⁡(vr+1,…,vn)\operatorname{Ker} A = \operatorname{span}(v_{r+1}, \dots, v_n))なので、k∈Ker⁡Ak \in \operatorname{Ker} A について ∥A+b+k∥2=∥A+b∥2+∥k∥2\lVert A^{+}b + k \rVert^2 = \lVert A^{+}b \rVert^2 + \lVert k \rVert^2 であり、最小は k=0k = 0 のときに限る。□\square

rank⁡A=n\operatorname{rank} A = n(列が一次独立)なら、最小二乗解は一意で A+=(A∗A)−1A∗A^{+} = (A^{\ast}A)^{-1}A^{\ast} である(定理 7.19)。

8.9 低ランク近似

特異値分解 A=∑i=1rσiuivi∗A = \sum_{i=1}^r \sigma_iu_iv_i^{\ast} で、大きい特異値の項だけを残した

Ak=∑i=1kσiuivi∗(k<r)A_k = \sum_{i=1}^{k} \sigma_iu_iv_i^{\ast} \qquad (k < r)

は階数 kk の行列である。これが階数 kk 以下の行列の中で AA に最も近いことを示す。以下、特異値を σi(A)\sigma_i(A) と書き、i>rank⁡Ai > \operatorname{rank} A なら σi(A)=0\sigma_i(A) = 0 と約束する。

定理 8.27(エッカート–ヤングの定理, Eckart–Young theorem)rank⁡B≤k\operatorname{rank} B \leq k を満たす任意の B∈M⁡m,n(K)B \in \operatorname{M}_{m,n}(K) について

∥A−B∥≥σk+1(A)=∥A−Ak∥,∥A−B∥F2≥∑i>kσi(A)2=∥A−Ak∥F2\lVert A - B \rVert \geq \sigma_{k+1}(A) = \lVert A - A_k \rVert, \qquad \lVert A - B \rVert_F^2 \geq \sum_{i > k} \sigma_i(A)^2 = \lVert A - A_k \rVert_F^2

すなわち AkA_k は、作用素ノルムでもフロベニウスノルムでも、階数 kk 以下の行列による AA の最良近似である。

証明. 等号部分:A−Ak=∑i>kσiuivi∗A - A_k = \sum_{i > k} \sigma_iu_iv_i^{\ast} はそれ自体が特異値 σk+1,…,σr\sigma_{k+1}, \dots, \sigma_r をもつ特異値分解の形なので、命題 8.21 から従う。

作用素ノルムの不等式:dim⁡Ker⁡B≥n−k\dim \operatorname{Ker} B \geq n - k で、S=span⁡(v1,…,vk+1)S = \operatorname{span}(v_1, \dots, v_{k+1}) は k+1k + 1 次元なので、次元公式より Ker⁡B∩S\operatorname{Ker} B \cap S は 0 でない元を含む。その単位ベクトルを x=∑i≤k+1civix = \sum_{i \leq k+1} c_iv_i(∑∣ci∣2=1\sum \lvert c_i \rvert^2 = 1)とすると

∥(A−B)x∥2=∥Ax∥2=∑i=1k+1σi2∣ci∣2≥σk+12\lVert (A - B)x \rVert^2 = \lVert Ax \rVert^2 = \sum_{i=1}^{k+1} \sigma_i^2\lvert c_i \rvert^2 \geq \sigma_{k+1}^2

よって ∥A−B∥≥σk+1\lVert A - B \rVert \geq \sigma_{k+1}。以上で、任意の行列 XX と j≥0j \geq 0 について

σj+1(X)=min⁡rank⁡C≤j∥X−C∥(1)\sigma_{j+1}(X) = \min_{\operatorname{rank} C \leq j} \lVert X - C \rVert \tag{1}

が示された(j≥rank⁡Xj \geq \operatorname{rank} X なら両辺 0)。

フロベニウスノルムの不等式:まず (1) から、任意の X,YX, Y と i,j≥1i, j \geq 1 について σi+j−1(X+Y)≤σi(X)+σj(Y)\sigma_{i+j-1}(X + Y) \leq \sigma_i(X) + \sigma_j(Y)(ワイルの不等式)が従う。実際、Xi−1,Yj−1X_{i-1}, Y_{j-1} を (1) の最小を与える階数 i−1i - 1 以下、j−1j - 1 以下の行列とすると、rank⁡(Xi−1+Yj−1)≤i+j−2\operatorname{rank}(X_{i-1} + Y_{j-1}) \leq i + j - 2 なので

σi+j−1(X+Y)≤∥X+Y−Xi−1−Yj−1∥≤∥X−Xi−1∥+∥Y−Yj−1∥=σi(X)+σj(Y)\sigma_{i+j-1}(X + Y) \leq \lVert X + Y - X_{i-1} - Y_{j-1} \rVert \leq \lVert X - X_{i-1} \rVert + \lVert Y - Y_{j-1} \rVert = \sigma_i(X) + \sigma_j(Y)

これを X=A−BX = A - B、Y=BY = B、j=k+1j = k + 1 に適用すると、σk+1(B)=0\sigma_{k+1}(B) = 0 より σi+k(A)≤σi(A−B)\sigma_{i+k}(A) \leq \sigma_i(A - B) (i≥1)(i \geq 1)。よって

∥A−B∥F2=∑i≥1σi(A−B)2≥∑i≥1σi+k(A)2=∑l>kσl(A)2\lVert A - B \rVert_F^2 = \sum_{i \geq 1} \sigma_i(A - B)^2 \geq \sum_{i \geq 1} \sigma_{i+k}(A)^2 = \sum_{l > k} \sigma_l(A)^2

□\square

この定理は、画像や大きなデータ行列を少数の特異値・特異ベクトルで近似する(データ圧縮)、統計学の主成分分析(中心化したデータ行列の右特異ベクトルが主成分の方向)など、応用上きわめて重要である。

8.10 レイリー商とミニマックス原理

エルミート行列の固有値を、固有ベクトルを使わずに変分的に特徴づける。この節では A∈M⁡n(K)A \in \operatorname{M}_n(K) をエルミート行列とし、固有値を大きい順に λ1≥λ2≥⋯≥λn\lambda_1 \geq \lambda_2 \geq \cdots \geq \lambda_n と並べ、対応する固有ベクトルの正規直交基底を u1,…,unu_1, \dots, u_n とする。

定義 8.28(レイリー商)x≠0x \neq 0 に対し RA(x)=x∗Axx∗xR_A(x) = \dfrac{x^{\ast}Ax}{x^{\ast}x} をレイリー商 (Rayleigh quotient) という。

x=∑iciuix = \sum_i c_iu_i と展開すると

RA(x)=∑iλi∣ci∣2∑i∣ci∣2(2)R_A(x) = \frac{\sum_i \lambda_i\lvert c_i \rvert^2}{\sum_i \lvert c_i \rvert^2} \tag{2}

であり、RA(x)R_A(x) は固有値の重みつき平均である。

命題 8.29 λ1=max⁡x≠0RA(x)\lambda_1 = \max_{x \neq 0} R_A(x)、λn=min⁡x≠0RA(x)\lambda_n = \min_{x \neq 0} R_A(x) であり、最大値・最小値はそれぞれ u1,unu_1, u_n で達成される。

証明. (2) より λn≤RA(x)≤λ1\lambda_n \leq R_A(x) \leq \lambda_1 で、RA(u1)=λ1R_A(u_1) = \lambda_1、RA(un)=λnR_A(u_n) = \lambda_n。□\square

部分空間 WW(dim⁡W=k≥1\dim W = k \geq 1)の上での RAR_A の最小値も存在する:WW の正規直交基底 w1,…,wkw_1, \dots, w_k をとり M=(wi∗Awj)i,jM = (w_i^{\ast}Aw_j)_{i,j}(kk 次エルミート行列)とおくと、RA(∑jcjwj)=RM(c)R_A(\sum_j c_jw_j) = R_M(c) なので、命題 8.29 により最小値は MM の最小固有値として達成される。最大値も同様である。

定理 8.30(クーラント–フィッシャーのミニマックス原理, Courant–Fischer theorem)k=1,…,nk = 1, \dots, n について

λk=max⁡dim⁡W=k min⁡x∈W∖{0}RA(x)=min⁡dim⁡W=n−k+1 max⁡x∈W∖{0}RA(x)\lambda_k = \max_{\dim W = k}\ \min_{x \in W \setminus \lbrace 0 \rbrace} R_A(x) = \min_{\dim W = n-k+1}\ \max_{x \in W \setminus \lbrace 0 \rbrace} R_A(x)

ここで WW は KnK^n の部分空間を動く。

証明. 第 1 の等式を示す。(≥):W0=span⁡(u1,…,uk)W_0 = \operatorname{span}(u_1, \dots, u_k) の 00 でない元 x=∑i≤kciuix = \sum_{i \leq k} c_iu_i について、(2) より RA(x)≥λkR_A(x) \geq \lambda_k。よって min⁡W0RA≥λk\min_{W_0} R_A \geq \lambda_k で、右辺の最大値は λk\lambda_k 以上である。(≤):dim⁡W=k\dim W = k とし、U=span⁡(uk,…,un)U = \operatorname{span}(u_k, \dots, u_n)(n−k+1n - k + 1 次元)をとる。dim⁡W+dim⁡U=n+1>n\dim W + \dim U = n + 1 > n なので、次元公式より W∩UW \cap U は 0 でない元 x=∑i≥kciuix = \sum_{i \geq k} c_iu_i を含み、(2) より RA(x)≤λkR_A(x) \leq \lambda_k。よって min⁡WRA≤λk\min_W R_A \leq \lambda_k。以上から、min⁡WRA\min_W R_A の WW についての最大値は存在して(W0W_0 で達成され)λk\lambda_k に等しい。

第 2 の等式:−A-A の固有値を大きい順に並べると −λn≥⋯≥−λ1-\lambda_n \geq \cdots \geq -\lambda_1 で、その (n−k+1)(n - k + 1) 番目は −λk-\lambda_k である。R−A=−RAR_{-A} = -R_A に第 1 の等式を適用すると

−λk=max⁡dim⁡W=n−k+1min⁡x∈W∖{0}(−RA(x))=−min⁡dim⁡W=n−k+1max⁡x∈W∖{0}RA(x)-\lambda_k = \max_{\dim W = n-k+1} \min_{x \in W \setminus \lbrace 0 \rbrace} (-R_A(x)) = -\min_{\dim W = n-k+1} \max_{x \in W \setminus \lbrace 0 \rbrace} R_A(x)

□\square

ミニマックス原理の強みは、固有ベクトルを知らなくても、うまい部分空間を選べば固有値を上下から評価できることにある。

系 8.31(コーシーの交錯定理, Cauchy interlacing theorem)AA から最後の行と列を除いた (n−1)(n-1) 次エルミート行列を BB とし、その固有値を μ1≥⋯≥μn−1\mu_1 \geq \cdots \geq \mu_{n-1} とすると

λ1≥μ1≥λ2≥μ2≥⋯≥μn−1≥λn\lambda_1 \geq \mu_1 \geq \lambda_2 \geq \mu_2 \geq \cdots \geq \mu_{n-1} \geq \lambda_n

証明. H={x∈Kn∣xn=0}H = \lbrace x \in K^n \mid x_n = 0 \rbrace を Kn−1K^{n-1} と同一視すると、HH 上で RB=RAR_B = R_A である。定理 8.30 の第 1 式で、BB に対しては WW が HH の部分空間に制限されるので μk≤λk\mu_k \leq \lambda_k。第 2 式を BB に適用すると、W⊂HW \subset H で dim⁡W=(n−1)−k+1=n−k\dim W = (n-1) - k + 1 = n - k なので、μk=min⁡W⊂H, dim⁡W=n−kmax⁡RA≥min⁡dim⁡W=n−kmax⁡RA=λk+1\mu_k = \min_{W \subset H,\ \dim W = n-k} \max R_A \geq \min_{\dim W = n-k} \max R_A = \lambda_{k+1}(AA の第 2 式で n−(k+1)+1=n−kn - (k+1) + 1 = n - k)。□\square

系 8.32(ワイルの摂動評価)エルミート行列 A,EA, E について、A+EA + E の固有値を大きい順に λk(A+E)\lambda_k(A + E) とすると

∣λk(A+E)−λk(A)∣≤∥E∥(k=1,…,n)\lvert \lambda_k(A + E) - \lambda_k(A) \rvert \leq \lVert E \rVert \qquad (k = 1, \dots, n)

証明. 命題 8.29 と命題 8.21 より、すべての x≠0x \neq 0 で ∣RE(x)∣≤∥E∥\lvert R_E(x) \rvert \leq \lVert E \rVert(エルミート行列の特異値は固有値の絶対値、問題 8.6)。RA+E=RA+RE≤RA+∥E∥R_{A+E} = R_A + R_E \leq R_A + \lVert E \rVert を定理 8.30 の第 1 式に代入すると λk(A+E)≤λk(A)+∥E∥\lambda_k(A + E) \leq \lambda_k(A) + \lVert E \rVert。A=(A+E)+(−E)A = (A + E) + (-E) として逆向きも得られる。□\square

系 8.32 は、エルミート行列の固有値は摂動に対して安定である(行列の小さな誤差は固有値の小さな誤差しか生まない)ことを示している。これは一般の行列では成り立たない(例えば J(0,n)J(0, n) の左下の成分を ε\varepsilon に変えると、固有値は ε1/n\varepsilon^{1/n} の大きさで動く)。特異値についても σk(A)=max⁡dim⁡W=kmin⁡x∈W∖{0}∥Ax∥/∥x∥\sigma_k(A) = \max_{\dim W = k}\min_{x \in W \setminus \lbrace 0 \rbrace} \lVert Ax \rVert/\lVert x \rVert が成り立つ(A∗AA^{\ast}A に定理 8.30 を適用)。ミニマックス原理は、無限次元のコンパクト自己共役作用素や、微分作用素の固有値問題(関数解析 第5章、微分方程式 第5章)でも中心的な役割を果たす。

まとめ

  • 双線形形式の表現行列は基底変換で tPGP{}^t PGP(合同)と変わり、線形変換の P−1APP^{-1}AP(相似)とは規則が異なる。直交行列による変換では両者が一致する。
  • 二次形式は対称行列と一対一に対応し、平方完成や直交対角化で標準形 diag⁡(Ip,−Iq,O)\operatorname{diag}(I_p, -I_q, O) にできる。符号数 (p,q)(p, q) は対角化の方法によらない(シルベスターの慣性法則)。
  • エルミート行列が正定値   ⟺  \iff 固有値がすべて正   ⟺  \iff 首座小行列式がすべて正   ⟺  \iff A=B∗BA = B^{\ast}B(BB 正則)。半正定値は首座小行列式では判定できない。半正定値行列は一意な半正定値の平方根をもつ。
  • 二次曲線・二次曲面は、二次の部分を回転で対角化し平方完成で平行移動することにより標準形に分類される。
  • 特異値分解 A=UΣV∗A = U\Sigma V^{\ast}:定義域と値域の正規直交基底を独立に選べば、任意の行列は非負実数の「対角」行列になる。特異値は A∗AA^{\ast}A の固有値の平方根で、∥A∥=σ1\lVert A \rVert = \sigma_1。
  • 極分解 A=WPA = WP、ムーア–ペンローズ擬逆行列 A+A^{+}(最小ノルム最小二乗解を与える)、エッカート–ヤングの低ランク近似はいずれも特異値分解から従う。
  • エルミート行列の固有値はレイリー商の max-min で特徴づけられ(クーラント–フィッシャー)、交錯定理や摂動に対する安定性が導かれる。

演習問題

問題 8.1 ★ 二次形式 q=x2+2xy+4xz+y2+2yz+z2q = x^2 + 2xy + 4xz + y^2 + 2yz + z^2 の行列を書き、平方完成によって符号数を求めよ。

解答

行列の各行は (1,1,2)(1, 1, 2), (1,1,1)(1, 1, 1), (2,1,1)(2, 1, 1)。(x+y+2z)2=x2+y2+4z2+2xy+4xz+4yz(x + y + 2z)^2 = x^2 + y^2 + 4z^2 + 2xy + 4xz + 4yz を引くと q−(x+y+2z)2=−3z2−2yzq - (x + y + 2z)^2 = -3z^2 - 2yz。さらに −3z2−2yz=−3(z+y3)2+y23-3z^2 - 2yz = -3\left(z + \frac{y}{3}\right)^2 + \frac{y^2}{3} なので

q=(x+y+2z)2+13y2−3(z+13y)2q = (x + y + 2z)^2 + \frac{1}{3}y^2 - 3\left(z + \frac{1}{3}y\right)^2

符号数は (2,1)(2, 1)。検算:行列式は 1⋅0−1⋅(1−2)+2⋅(1−2)=−11 \cdot 0 - 1 \cdot (1 - 2) + 2 \cdot (1 - 2) = -1 で、係数の積 1⋅13⋅(−3)=−11 \cdot \frac{1}{3} \cdot (-3) = -1 と一致し、負の固有値が奇数個であることとも整合する。

問題 8.2 ★ 次の実対称行列が正定値となる aa の範囲を求めよ。

A=(1a0a1a0a1)A = \begin{pmatrix} 1 & a & 0 \\ a & 1 & a \\ 0 & a & 1 \end{pmatrix}
解答

首座小行列式は 11、1−a21 - a^2、det⁡A=(1−a2)−a⋅a=1−2a2\det A = (1 - a^2) - a \cdot a = 1 - 2a^2。すべて正となる条件は ∣a∣<1/2\lvert a \rvert < 1/\sqrt{2}(このとき 1−a2>01 - a^2 > 0 も成り立つ)。

問題 8.3 ★ 二次曲線 3x2+2xy+3y2=83x^2 + 2xy + 3y^2 = 8 の標準形と主軸の方向を求めよ。

解答

行列の各行は (3,1)(3, 1), (1,3)(1, 3) で、固有値 44(固有ベクトル t(1,1){}^t(1, 1))、22(固有ベクトル t(1,−1){}^t(1, -1))。それぞれの方向の単位ベクトルを軸とする座標 X,YX, Y で 4X2+2Y2=84X^2 + 2Y^2 = 8、すなわち X22+Y24=1\frac{X^2}{2} + \frac{Y^2}{4} = 1。短半径 2\sqrt{2} の軸が t(1,1){}^t(1, 1) 方向、長半径 22 の軸が t(1,−1){}^t(1, -1) 方向の楕円である。

問題 8.4 ★★ 次の行列の特異値分解を求めよ。

A=(101101)A = \begin{pmatrix} 1 & 0 \\ 1 & 1 \\ 0 & 1 \end{pmatrix}
解答

tAA{}^t AA の各行は (2,1)(2, 1), (1,2)(1, 2) で、固有値 3,13, 1、固有ベクトル v1=t(1,1)/2v_1 = {}^t(1, 1)/\sqrt{2}、v2=t(1,−1)/2v_2 = {}^t(1, -1)/\sqrt{2}。σ1=3\sigma_1 = \sqrt{3}、σ2=1\sigma_2 = 1。u1=Av1/3=t(1,2,1)/6u_1 = Av_1/\sqrt{3} = {}^t(1, 2, 1)/\sqrt{6}、u2=Av2=t(1,0,−1)/2u_2 = Av_2 = {}^t(1, 0, -1)/\sqrt{2}。u3u_3 は両者に直交する単位ベクトル t(1,−1,1)/3{}^t(1, -1, 1)/\sqrt{3}。

A=(1/61/21/32/60−1/31/6−1/21/3)(300100)(1/21/21/2−1/2)A = \begin{pmatrix} 1/\sqrt{6} & 1/\sqrt{2} & 1/\sqrt{3} \\ 2/\sqrt{6} & 0 & -1/\sqrt{3} \\ 1/\sqrt{6} & -1/\sqrt{2} & 1/\sqrt{3} \end{pmatrix} \begin{pmatrix} \sqrt{3} & 0 \\ 0 & 1 \\ 0 & 0 \end{pmatrix} \begin{pmatrix} 1/\sqrt{2} & 1/\sqrt{2} \\ 1/\sqrt{2} & -1/\sqrt{2} \end{pmatrix}

検算:

σ1u1tv1+σ2u2tv2=12(112211)+12(1−100−11)=(101101)\sigma_1u_1{}^t v_1 + \sigma_2u_2{}^t v_2 = \frac{1}{2}\begin{pmatrix} 1 & 1 \\ 2 & 2 \\ 1 & 1 \end{pmatrix} + \frac{1}{2}\begin{pmatrix} 1 & -1 \\ 0 & 0 \\ -1 & 1 \end{pmatrix} = \begin{pmatrix} 1 & 0 \\ 1 & 1 \\ 0 & 1 \end{pmatrix}

問題 8.5 ★★ u∈Kmu \in K^m、v∈Knv \in K^n を 0 でないベクトルとし、A=uv∗A = uv^{\ast} とする。A+=vu∗∥u∥2∥v∥2A^{+} = \dfrac{vu^{\ast}}{\lVert u \rVert^2\lVert v \rVert^2} を示せ。

解答

A=σ u^v^∗A = \sigma\ \hat{u}\hat{v}^{\ast}、σ=∥u∥∥v∥\sigma = \lVert u \rVert\lVert v \rVert、u^=u/∥u∥\hat{u} = u/\lVert u \rVert、v^=v/∥v∥\hat{v} = v/\lVert v \rVert は階数 1 の特異値分解(u^,v^\hat{u}, \hat{v} を正規直交基底に延長すればよい)なので、A+=σ−1v^u^∗=vu∗/(∥u∥2∥v∥2)A^{+} = \sigma^{-1}\hat{v}\hat{u}^{\ast} = vu^{\ast}/(\lVert u \rVert^2\lVert v \rVert^2)。(ペンローズの 4 条件を直接確かめてもよい。例えば AA+A=u(v∗v)(u∗u)v∗/(∥u∥2∥v∥2)=AAA^{+}A = u(v^{\ast}v)(u^{\ast}u)v^{\ast}/(\lVert u \rVert^2\lVert v \rVert^2) = A。)

問題 8.6 ★★ 正規行列 AA の特異値は、AA の固有値の絶対値(のうち 0 でないもの)に等しいことを示せ。正規でない行列では成り立たない例を挙げよ。

解答

A=UDU∗A = UDU^{\ast}(UU ユニタリ、D=diag⁡(λi)D = \operatorname{diag}(\lambda_i))なら A∗A=UDˉDU∗=Udiag⁡(∣λi∣2)U∗A^{\ast}A = U\bar{D}DU^{\ast} = U\operatorname{diag}(\lvert \lambda_i \rvert^2)U^{\ast} なので、A∗AA^{\ast}A の固有値は ∣λi∣2\lvert \lambda_i \rvert^2、特異値は ∣λi∣\lvert \lambda_i \rvert。反例:第 1 行 (0,1)(0, 1)、第 2 行 (0,0)(0, 0) の行列は固有値が 0 のみだが、tAA=E22{}^t AA = E_{22} なので特異値 1 をもつ。

問題 8.7 ★★ 次の行列の正の平方根をスペクトル分解で求めよ。

A=(5445)A = \begin{pmatrix} 5 & 4 \\ 4 & 5 \end{pmatrix}
解答

固有値は 99(固有ベクトル t(1,1){}^t(1, 1))と 11(t(1,−1){}^t(1, -1))。直交射影は P9P_9(各成分 1/21/2)、P1P_1(対角 1/21/2、非対角 −1/2-1/2)で、

A=3P9+P1=(2112)\sqrt{A} = 3P_9 + P_1 = \begin{pmatrix} 2 & 1 \\ 1 & 2 \end{pmatrix}

検算:この行列の 2 乗は第 1 行 (4+1,2+2)(4 + 1, 2 + 2)、第 2 行 (2+2,1+4)(2 + 2, 1 + 4) で AA に等しく、固有値 3,13, 1 は正である。

問題 8.8 ★★ エルミート行列 A,BA, B について λ1(A+B)≤λ1(A)+λ1(B)\lambda_1(A + B) \leq \lambda_1(A) + \lambda_1(B) と λn(A+B)≥λn(A)+λn(B)\lambda_n(A + B) \geq \lambda_n(A) + \lambda_n(B) を示せ(固有値は大きい順)。前者で等号が成り立たない例を挙げよ。

解答

命題 8.29 より λ1(A+B)=max⁡x(RA(x)+RB(x))≤max⁡xRA(x)+max⁡xRB(x)\lambda_1(A + B) = \max_x (R_A(x) + R_B(x)) \leq \max_x R_A(x) + \max_x R_B(x)。最小固有値も同様。例:A=E11A = E_{11}、B=E22B = E_{22} なら λ1(A+B)=1<2=λ1(A)+λ1(B)\lambda_1(A + B) = 1 < 2 = \lambda_1(A) + \lambda_1(B)(最大値を与える xx が異なるため)。

問題 8.9 ★★★(ワイルの不等式)エルミート行列 A,B∈M⁡n(K)A, B \in \operatorname{M}_n(K) と i+j−1≤ni + j - 1 \leq n について λi+j−1(A+B)≤λi(A)+λj(B)\lambda_{i+j-1}(A + B) \leq \lambda_i(A) + \lambda_j(B) を示せ。

解答

AA の固有値 λi(A),…,λn(A)\lambda_i(A), \dots, \lambda_n(A) の固有ベクトルが張る空間を UAU_A(n−i+1n - i + 1 次元)、BB について同様に UBU_B(n−j+1n - j + 1 次元)とする。次元公式より dim⁡(UA∩UB)≥n−i−j+2=n−(i+j−1)+1\dim(U_A \cap U_B) \geq n - i - j + 2 = n - (i + j - 1) + 1 なので、UA∩UBU_A \cap U_B は n−(i+j−1)+1n - (i+j-1) + 1 次元の部分空間 WW を含む。x∈W∖{0}x \in W \setminus \lbrace 0 \rbrace について、(2) より RA(x)≤λi(A)R_A(x) \leq \lambda_i(A)、RB(x)≤λj(B)R_B(x) \leq \lambda_j(B)。定理 8.30 の第 2 式より

λi+j−1(A+B)≤max⁡x∈W∖{0}RA+B(x)≤λi(A)+λj(B)\lambda_{i+j-1}(A + B) \leq \max_{x \in W \setminus \lbrace 0 \rbrace} R_{A+B}(x) \leq \lambda_i(A) + \lambda_j(B)

(j=1j = 1 とすると系 8.32 の証明で使った評価になる。)

問題 8.10 ★★★(ヤコビの符号定理)実対称行列 AA の首座小行列式 Δk=det⁡Ak\Delta_k = \det A_k がすべて 0 でないとする(Δ0=1\Delta_0 = 1)。AA は diag⁡(Δ1/Δ0,Δ2/Δ1,…,Δn/Δn−1)\operatorname{diag}(\Delta_1/\Delta_0, \Delta_2/\Delta_1, \dots, \Delta_n/\Delta_{n-1}) と合同であることを示し、AA の負の固有値の個数は数列 Δ0,Δ1,…,Δn\Delta_0, \Delta_1, \dots, \Delta_n の符号の変化の回数に等しいことを示せ。

解答

nn に関する帰納法。定理 8.13 の (3 ⇒ 1) の証明と同じ変形(An−1A_{n-1} は Δn−1≠0\Delta_{n-1} \neq 0 より正則)で、AA は diag⁡(An−1,s)\operatorname{diag}(A_{n-1}, s) と合同で、Δn=Δn−1s\Delta_n = \Delta_{n-1}s より s=Δn/Δn−1s = \Delta_n/\Delta_{n-1}。An−1A_{n-1} の首座小行列式は Δ1,…,Δn−1\Delta_1, \dots, \Delta_{n-1} なので、帰納法の仮定により An−1A_{n-1} は diag⁡(Δ1/Δ0,…,Δn−1/Δn−2)\operatorname{diag}(\Delta_1/\Delta_0, \dots, \Delta_{n-1}/\Delta_{n-2}) と合同であり、主張の前半が従う。シルベスターの慣性法則より、負の固有値の個数は Δk/Δk−1<0\Delta_k/\Delta_{k-1} < 0 となる kk の個数、すなわち Δk−1\Delta_{k-1} と Δk\Delta_k の符号が異なる kk の個数である。(特にすべての Δk>0\Delta_k > 0 なら正定値であり、定理 8.13 の再証明になる。)

この章を読み終えたら

「読了」にすると学習記録とロードマップに反映されます。演習の自己採点もお忘れなく。

この章の誤りを報告GitHub で見る