1 多変量正規分布に従う二つのベクトル
多変量正規分布に従う二つのベクトル変数を考えます。
\[\begin{align} a = \begin{pmatrix} a_1 \\ \vdots \\ a_p \end{pmatrix} &\sim \mathcal{N}(\mu_a, \Sigma_a) \ \mbox{where} \ a \in R^p \\ b = \begin{pmatrix} b_1 \\ \vdots \\ b_q \end{pmatrix} &\sim \mathcal{N}(\mu_b, \Sigma_b) \ \mbox{where} \ b \in R^q \end{align}\]
ベクトル\(a\)と\(b\)の期待値は、
\[ \mu_a = E[a] = \begin{pmatrix} E[a_1] \\ \vdots \\ E[a_p] \end{pmatrix}, \ \mu_b = E[b] = \begin{pmatrix} E[b_1] \\ \vdots \\ E[b_q] \end{pmatrix} \]
になり、ベクトル\(a\)と\(b\)の分散共分散行列は、
\[\begin{align} \Sigma_a &= E\big[ (a - E[a])\ {}^t\!(a - E[a]) \big]\\ &= \begin{pmatrix} E\big[ (a_1 - E[a_1])(a_1 - E[a_1]) \big] & \cdots & E\big[ (a_1 - E[a_1])(a_p - E[a_p]) \big] \\ \vdots & \ddots & \vdots \\ E\big[ (a_p - E[a_p])(a_1 - E[a_1]) \big] & \cdots & E\big[ (a_p - E[a_p])(a_p - E[a_p]) \big] \end{pmatrix} \\ \Sigma_b &= E\big[ (b - E[b])\ {}^t\!(b - E[b]) \big]\\ &= \begin{pmatrix} E\big[ (b_1 - E[b_1])(b_1 - E[b_1]) \big] & \cdots & E\big[ (b_1 - E[b_1])(b_q - E[b_q]) \big] \\ \vdots & \ddots & \vdots \\ E\big[ (b_q - E[b_q])(b_1 - E[b_1]) \big] & \cdots & E\big[ (b_q - E[b_q])(b_q - E[b_q]) \big] \end{pmatrix} \end{align}\]
になります。
2 二つのベクトルの同時分布
ベクトル\(a\)と\(b\)の二つを含むベクトル\(c\)を考えましょう。
\[\begin{align} c = \begin{pmatrix} a_1 \\ \vdots \\ a_p \\ b_1 \\ \vdots \\ b_q \end{pmatrix} &\sim \mathcal{N}(\mu_c, \Sigma_c) \ \mbox{where} \ c \in R^{p + q} \end{align}\]
ベクトル\(c\)の期待値と分散共分散行列は、
\[\begin{align} \mu_c &= E[c] = \begin{pmatrix} E[a] \\ E[b] \end{pmatrix} = \begin{pmatrix} \mu_a \\ \mu_b \end{pmatrix} \\ \Sigma_c &= E\big[ (c - E[c]) \ {}^t\! (c - E[c]) \big] \\ &= \begin{pmatrix} E\big[ (a - E[a]) \ {}^t\! (a - E[a]) \big] & E\big[ (a - E[a]) \ {}^t\! (b - E[b]) \big] \\ E\big[ (b - E[b]) \ {}^t\! (a - E[a]) \big] & E\big[ (b - E[b]) \ {}^t\! (b - E[b]) \big] \end{pmatrix} \\ &= \begin{pmatrix} \Sigma_{a} & \Sigma_{ab} \\ {}^t\!\Sigma_{ab} & \Sigma_{b} \\ \end{pmatrix} \end{align}\]
になります。\(E\big[ (a - E[a]) \ {}^t\! (b - E[b]) \big]\)が\(p\)行\(q\)列に、\(E\big[ (b - E[b]) \ {}^t\! (a - E[a]) \big]\)が\(q\)行\(p\)列になることに注意してください。
3 同時分布の条件付き確率密度
同時分布として定義した多変量正規分布の条件付き確率密度を導出します。
3.1 \(b\)の確率密度\(f(b)\)
\(b\)は\(q\)次元多変量正規分布(multivariate normal distribution)に従うので、確率密度関数は
\[\begin{align} f(b) &= \frac{1}{(2\pi)^\frac{q}{2}|\Sigma_{b}|^\frac{1}{2}} \exp \bigg\{ (*_b) \bigg\} \\ (*_b) &= -\frac{1}{2} {}^t\!(b - \mu_{b}) \Sigma_{b}^{-1} (b - \mu_{b}) \end{align}\]
となります。
3.2 \(c\)の確率密度\(f(c)\)
\(c\)は\(p+q\)次元多変量正規分布に従うので、確率密度関数は
\[\begin{align} f(c) &= \frac{1}{(2\pi)^\frac{p+q}{2}|\Sigma_c|^\frac{1}{2}} \exp \bigg\{ (*_c) \bigg\} \\ (*_c) &= -\frac{1}{2} {}^t\!(c - \mu_c) \Sigma_c^{-1} (c - \mu_c) \end{align}\]
となります。
同時分布の分散共分散行列の逆行列\(\Sigma_{c}^{-1}\)を、
\[ \Sigma_{c}^{-1} = \begin{pmatrix} \Omega_{aa} & \Omega_{ab} \\ {}^t\!\Omega_{ab} & \Omega_{bb} \end{pmatrix} \]
と書き直すと、\((*_c)\)は
\[\begin{align} (*_c) =& -\frac{1}{2} \big[ {}^t\!(a - \mu_a) \Omega_{aa} (a - \mu_a) + {}^t\!(b - \mu_b) {}^t\!\Omega_{ab} (a - \mu_a) \\ &+ {}^t\!(a - \mu_a) \Omega_{ab} (b - \mu_b) + {}^t\!(b - \mu_b) \Omega_{bb} (b - \mu_b) \big] \end{align}\]
となります。
3.3 \(a\)の条件付き確率密度\(f(a|b)\)
\(b\)を固定したときの\(a\)の条件付き確率密度関数\(f(a|b)\)は、\(f(a|b)\)の期待値を\(\mu_{a|b}\)、分散共分散行列を\(\Sigma_{a|b}\)と置くと
\[\begin{align} f(a|b) &= \frac{1}{(2\pi)^\frac{p}{2}|\Sigma_{a|b}|^\frac{1}{2}} \exp \bigg\{ (*_{a|b}) \bigg\} \\ (*_{a|b}) &= -\frac{1}{2} {}^t\!(a - \mu_{a|b}) \Sigma_{a|b}^{-1} (a - \mu_{a|b}) \end{align}\]
と書くことができます。
\[ f(a|b) = f(c|b) = \frac{f(c)}{f(b)} \]
になることから、\(\mu_{a|b}\)と\(\Sigma_{a|b}\)を求めていきましょう。
\[ \frac{f(c)}{f(b)} = \frac{1}{(2\pi)^\frac{p}{2}|\Sigma_c|^\frac{1}{2}|\Sigma_{b}|^{-\frac{1}{2}}} \exp \bigg\{ (*_c) - (*_b) \bigg\} \]
\[\begin{align} (*_c) - (*_b) =& -\frac{1}{2} \big[ {}^t\!(a - \mu_a) \Omega_{aa} (a - \mu_a) + {}^t\!(b - \mu_b) {}^t\!\Omega_{ab} (a - \mu_a) \\ &+ {}^t\!(a - \mu_a) \Omega_{ab} (b - \mu_b) \big] \end{align}\]
\((*_{a|b}) = (*_c) - (*_b)\)となるとすると、
\[\begin{align} {}^t\!a \Sigma_{a|b}^{-1} a &= {}^t\!a \Omega_{aa} a \\ - {}^t\!a \Sigma_{a|b}^{-1} \mu_{a|b} - {}^t\!\mu_{a|b} \Sigma_{a|b}^{-1} a &= - {}^t\!a \Omega_{aa} \mu_a - {}^t\! \mu_a \Omega_{aa} a + {}^t\!(b - \mu_b) {}^t\!\Omega_{ab} a + {}^t\! a \Omega_{ab} (b - \mu_b) \\ {}^t\!\mu_{a|b} \Sigma_{a|b}^{-1} \mu_{a|b} &= {}^t\!\mu_a \Omega_{aa} \mu_a - {}^t\!\mu_a \Omega_{ab} (b - \mu_b) - {}^t\! (b - \mu_b) {}^t\!\Omega_{ab} \mu_a \end{align}\]
\(\Sigma_{a|b}^{-1} = \Omega_{aa}\)となります。
また、1行1列の行列の転置は同じ値になることから\({}^t\!a \Sigma_{a|b}^{-1} \mu_{a|b} = {}^t\!( {}^t\!a \Sigma_{a|b}^{-1} \mu_{a|b} )\)なので、\({}^t\!a \Sigma_{a|b}^{-1} \mu_{a|b} = {}^t\!\mu_{a|b} \Sigma_{a|b}^{-1} a\)に、同様に、\({}^t\! a \Omega_{ab} (b - \mu_b) = {}^t\! (b - \mu_b) \Omega_{ab} a\)になります。これらに注意すると、
\[\begin{align} -2 {}^t\!a \Sigma_{a|b}^{-1} \mu_{a|b} &= -2 {}^t\!a \Omega_{aa} \mu_a + 2 {}^t\! a \Omega_{ab} (b - \mu_b) \\ \Sigma_{a|b}^{-1} \mu_{a|b} &= \Omega_{aa} \mu_a - \Omega_{ab} (b - \mu_b) \\ \mu_{a|b} &= \Sigma_{a|b} \Omega_{aa} \mu_a - \Sigma_{a|b} \Omega_{ab} (b - \mu_b) \\ &= \Omega_{aa}^{-1} \Omega_{aa} \mu_a - \Omega_{aa}^{-1} \Omega_{ab} (b - \mu_b) \\ &= \mu_a - \Omega_{aa}^{-1} \Omega_{ab} (b - \mu_b) \\ \end{align}\]
\(\Omega_{aa}\)と\(\Omega_{ab}\)はブロック行列の逆行列の公式から分かります。
\[\begin{align} \Omega_{aa} &= (\Sigma_{a} - \Sigma_{ab} \Sigma_{b}^{-1} {}^t\!\Sigma_{ab})^{-1} \\ \Omega_{ab} &= - (\Sigma_{a} - \Sigma_{ab} \Sigma_{b}^{-1} {}^t\!\Sigma_{ab})^{-1} \Sigma_{ab} \Sigma_{b}^{-1} \\ &= - \Omega_{aa} \Sigma_{ab} \Sigma_{b}^{-1} \end{align}\]
これを\(\mu_{a|b}\)と\(\Sigma_{a|b}\)の式に代入して整理します。
\[\begin{align} \mu_{a|b} &= \mu_a - \Omega_{aa}^{-1} \Omega_{ab} (b - \mu_b) \\ &= \mu_a - \Omega_{aa}^{-1} (- \Omega_{aa} \Sigma_{ab} \Sigma_{b}^{-1}) (b - \mu_b) \\ &= \mu_a + \Sigma_{ab} \Sigma_{b}^{-1} (b - \mu_b) \\ \Sigma_{a|b} &= \Sigma_{a} - \Sigma_{ab} \Sigma_{b}^{-1} {}^t\!\Sigma_{ab} \end{align}\]
\(\Sigma_{a|b}^{-1} = \Omega_{aa}\)と\(\mu_{a|b} = \mu_a - \Omega_{aa}^{-1} \Omega_{ab} (b - \mu_b)\)を\({}^t\!\mu_{a|b} \Sigma_{a|b}^{-1} \mu_{a|b}\)に代入すると、\({}^t\!\mu_a \Omega_{aa} \mu_a - {}^t\!\mu_a \Omega_{ab} (b - \mu_b) - {}^t\! (b - \mu_b) {}^t\!\Omega_{ab} \mu_a\)が得られ、\((*_{a|b}) = (*_c) - (*_b)\)となったことが確認できます。
4 行列式で検算
平均と分散共分散行列が定まったのですが、検算をしておきましょう。 \(\Sigma_{a|b}\)が正規分布の分散共分散行列であれば、\(\exp\)の外側の\(|\Sigma_c||\Sigma_b|^{-1}\)が\(|\Sigma_{a|b}|\)と一致します。
シューア補行列を\(\Sigma_c\)に乗じます。
\[\begin{pmatrix} I_p & -\Sigma_{ab}\Sigma_{b}^{-1} \\ O & I_q \end{pmatrix} \begin{pmatrix} \Sigma_{a} & \Sigma_{ab} \\ {}^t\!\Sigma_{ab} & \Sigma_{b} \end{pmatrix} = \begin{pmatrix} \Sigma_{a} - \Sigma_{ab} \Sigma_{b}^{-1} {}^t\!\Sigma_{ab} & 0 \\ {}^t\!\Sigma_{ab} & \Sigma_{b} \end{pmatrix}\]
両辺の行列式を計算します。
\[\begin{align} \det\begin{pmatrix} I_p & -\Sigma_{ab}\Sigma_{b}^{-1} \\ O & I_q \end{pmatrix} \det\begin{pmatrix} \Sigma_{a} & \Sigma_{ab} \\ {}^t\!\Sigma_{ab} & \Sigma_{b} \end{pmatrix} &= \det\begin{pmatrix} \Sigma_{a} - \Sigma_{ab} \Sigma_{b}^{-1} {}^t\!\Sigma_{ab} & 0 \\ {}^t\!\Sigma_{ab} & \Sigma_{b} \end{pmatrix}\\ 1 \cdot |\Sigma_c| &= |\Sigma_{a} - \Sigma_{ab} \Sigma_{b}^{-1} {}^t\!\Sigma_{ab}|\cdot|\Sigma_{b}| \end{align}\]
両辺を\(|\Sigma_b|\)で割ります。
\[\begin{align} |\Sigma_c| |\Sigma_b|^{-1} &= |\Sigma_a - \Sigma_{ab} \Sigma_b^{-1} \ {}^t\!\Sigma_{ab} | \\ &= |\Sigma_{a|b}| \end{align}\]
しっかり一致しました。
5 終わり
自明ですが多変量正規分布は必ず複数のベクトルで構成されているので、上の結果は一般的に言えます。
これで、
\[ a|b \sim \mathcal{N}(\mu_a + \Sigma_{ab} \Sigma_{b}^{-1} (b - \mu_b), \Sigma_{a} - \Sigma_{ab} \Sigma_{b}^{-1} {}^t\!\Sigma_{ab}) \]
と言えるようになりました。
