本記事は、筆者が独自に作成した解答・解説です。
統計検定の問題は、当サイトでは掲載していません。
統計検定の問題や公式の解説は、公式問題集をご参照ください。
『統計検定1級 公式問題集[2022~2024年]』をAmazonで見る
- 本記事は、統計検定の公式の解答・解説ではありません。
- 内容の正確性には配慮していますが、誤りが含まれている場合があります。
- 統計検定®は一般財団法人統計質保証推進協会の登録商標です。
解答
[1]
群\(G_1\)では\(\boldsymbol{\mu}_1=\boldsymbol{1}\), \(\Sigma_1=\boldsymbol{I}\)であるから、
\[ \begin{aligned} D_1^2 &=(\boldsymbol{0}-\boldsymbol{1})^{T}\boldsymbol{I}^{-1}(\boldsymbol{0}-\boldsymbol{1}) \\ &=\boldsymbol{1}^{T}\boldsymbol{1} \\ &=2 \end{aligned} \]
となる。
一方、群\(G_2\)では\(\boldsymbol{\mu}_2=-\boldsymbol{1}\), \(\Sigma_2=4\boldsymbol{I}\)であり、\(\Sigma_2^{-1}=\boldsymbol{I}/4\)である。したがって、
\[ \begin{aligned} D_2^2 &=(\boldsymbol{0}+\boldsymbol{1})^{T}\frac{1}{4}\boldsymbol{I}(\boldsymbol{0}+\boldsymbol{1}) \\ &=\frac{1}{4}\boldsymbol{1}^{T}\boldsymbol{1} \\ &=\frac{1}{2} \end{aligned} \]
となる。
[2]
一般の観測値\(\boldsymbol{x}\)に対して、
\[ \begin{aligned} D_1^2 &=(\boldsymbol{x}-\boldsymbol{1})^{T}(\boldsymbol{x}-\boldsymbol{1}) \\ &=\boldsymbol{x}^{T}\boldsymbol{x}-2\boldsymbol{1}^{T}\boldsymbol{x}+2 \end{aligned} \]
であり、
\[ \begin{aligned} D_2^2 &=(\boldsymbol{x}+\boldsymbol{1})^{T}\frac{1}{4}\boldsymbol{I}(\boldsymbol{x}+\boldsymbol{1}) \\ &=\frac{1}{4}\left(\boldsymbol{x}^{T}\boldsymbol{x}+2\boldsymbol{1}^{T}\boldsymbol{x}+2\right) \end{aligned} \]
である。これより、
\[ \begin{aligned} D_1^2 &=D_2^2 \\ \boldsymbol{x}^{T}\boldsymbol{x}-2\boldsymbol{1}^{T}\boldsymbol{x}+2 &=\frac{1}{4}\left(\boldsymbol{x}^{T}\boldsymbol{x}+2\boldsymbol{1}^{T}\boldsymbol{x}+2\right) \\ 4\boldsymbol{x}^{T}\boldsymbol{x}-8\boldsymbol{1}^{T}\boldsymbol{x}+8 &=\boldsymbol{x}^{T}\boldsymbol{x}+2\boldsymbol{1}^{T}\boldsymbol{x}+2 \\ 3\boldsymbol{x}^{T}\boldsymbol{x}-10 \boldsymbol{1}^{T}\boldsymbol{x}+6 &=0 \end{aligned} \]
を得る。したがって、
\[ f(\boldsymbol{x})=3\boldsymbol{x}^{T}\boldsymbol{x}+(-10 \boldsymbol{1})^{T}\boldsymbol{x}+6 \]
とすればよく、
\[ a=3, \qquad \boldsymbol{b}=-10 \boldsymbol{1}, \qquad c=6 \]
である。
[3]
[3-1]
\(\boldsymbol{a}=(1/\sqrt{2},1/\sqrt{2})^{T}\)とおくと、\(Y_1=\boldsymbol{a}^{T}\boldsymbol{X}\)である。一般に、多変量正規分布の線形結合\(Y=\boldsymbol{a}^{T}\boldsymbol{X}\)は正規分布に従い、その平均と分散はそれぞれ\(\boldsymbol{a}^{T}\boldsymbol{\mu}_j\), \(\boldsymbol{a}^{T}\Sigma_j\boldsymbol{a}\)となることが知られている。これより、群\(G_1\)では、
\[ \boldsymbol{a}^{T}\boldsymbol{1}=\sqrt{2}, \qquad \boldsymbol{a}^{T}\boldsymbol{I}\boldsymbol{a}=1 \]
なので、
\[ Y_1\,|\,G_1\sim N(\sqrt{2},1) \]
である。
群\(G_2\)では、
\[ \boldsymbol{a}^{T}(-\boldsymbol{1})=-\sqrt{2}, \qquad \boldsymbol{a}^{T}(4\boldsymbol{I})\boldsymbol{a}=4 \]
なので、
\[ Y_1\,|\,G_2\sim N(-\sqrt{2},4) \]
である。
[3-2]
ここで、\(Z\sim N(0,1)\)とし、標準正規分布の累積分布関数を\(\Phi\)とする。群\(G_1\)では、
\[ \begin{aligned} P(Y_1<0\,|\,G_1) &=P(Z<-\sqrt{2}) \\ &=\Phi(-\sqrt{2}) \\ &\approx \Phi(-1.41) \\ &=0.0793 \end{aligned} \]
となる。
群\(G_2\)では標準偏差が2であるから、
\[ \begin{aligned} P(Y_1\geq0\,|\,G_2) &=P\left(Z\geq\frac{\sqrt{2}}{2}\right) \\ &=1-\Phi\left(\frac{1}{\sqrt{2}}\right) \\ &\approx 1-\Phi(0.71) \\ &=0.2389 \end{aligned} \]
となる。
[4]
表1のデータは判別規則の作成に用いられており、同じデータに判別規則を適用すると、一般に誤判別率は実際より小さく推定されやすい。一方、表2は判別規則の作成に用いていない新しいデータであるため、このような過小評価がなくなり、表1より誤判別が多くなったと考えられる。
したがって、誤判別率を推定する際には、判別規則の作成に用いたデータだけで評価すると、誤判別率を過小評価する場合があることに注意する必要がある。これを避けるには、データを判別規則の作成に用いる学習用データと、誤判別率の推定に用いるテスト用データに分ける。データが限られる場合には、交差検証法を用いる方法もある。