本記事は、筆者が独自に作成した解答・解説です。
統計検定の問題は、当サイトでは掲載していません。
- 本記事は、統計検定の公式の解答・解説ではありません。
- 内容の正確性には配慮していますが、誤りが含まれている場合があります。
- 統計検定®は一般財団法人統計質保証推進協会の登録商標です。
解答
[1]
線形代数と微分積分の標準化得点は、それぞれ
\[ x_1=\frac{65-60}{20}=0.25,\qquad x_2=\frac{70-68}{10}=0.20 \]
である。 表の推定値を用いると、統計学の標準化得点の予測値は
\[ \hat{y}=-0.1323\times 0.25+0.8182\times 0.20=0.130565 \]
となる。 これを標準化前の尺度へ戻すと
\[ 70+15\times 0.130565=71.958475 \]
であるから、統計学の予測得点は約\(72\)点である。
[2]
標準化した各得点の平均は\(0\)、分母\(n\)の標本分散は\(1\)である。 平均と分散の定義から、\(j=1,2\)について
\[ \begin{aligned} \bar{x}_j &=\frac{1}{n}\sum_{i=1}^{n}x_{ij}=0 \\ s_{x_j}^2 &=\frac{1}{n}\sum_{i=1}^{n}(x_{ij}-\bar{x}_j)^2 \\ &=\frac{1}{n}\sum_{i=1}^{n}x_{ij}^2=1 \end{aligned} \]
となる。 したがって、\(\boldsymbol{x}_j^T\boldsymbol{x}_j=\sum_{i=1}^{n}x_{ij}^2=n\)である。 \(\boldsymbol{y}\)についても同様に、\(\bar{y}=0\)、\(s_y^2=1\)より\(\boldsymbol{y}^T\boldsymbol{y}=n\)となる。 また、標本相関係数の定義より
\[ \begin{aligned} r_{12} &=\frac{\frac{1}{n}\sum_{i=1}^{n}(x_{i1}-\bar{x}_1)(x_{i2}-\bar{x}_2)}{\sqrt{s_{x_1}^2}\sqrt{s_{x_2}^2}} \\ &=\frac{1}{n}\sum_{i=1}^{n}x_{i1}x_{i2} \\ &=\frac{\boldsymbol{x}_1^T\boldsymbol{x}_2}{n} \end{aligned} \]
である。 \(\boldsymbol{y}\)と\(\boldsymbol{x}_j\)の相関も同様に\(r_{yj}=\boldsymbol{x}_j^T\boldsymbol{y}/n\)となるので、内積は
\[ \begin{aligned} \boldsymbol{x}_1^{T}\boldsymbol{x}_1&=\boldsymbol{x}_2^{T}\boldsymbol{x}_2=n \\ \boldsymbol{x}_1^{T}\boldsymbol{x}_2&=nr_{12} \\ \boldsymbol{x}_1^{T}\boldsymbol{y}&=nr_{y1},\qquad \boldsymbol{x}_2^{T}\boldsymbol{y}=nr_{y2} \end{aligned} \]
である。 残差平方和\(\|\boldsymbol{y}-\beta_1\boldsymbol{x}_1-\beta_2\boldsymbol{x}_2\|^2\)を最小にする正規方程式は
\[ \begin{aligned} \boldsymbol{x}_1^{T}(\boldsymbol{y}-\hat{\beta}_1\boldsymbol{x}_1-\hat{\beta}_2\boldsymbol{x}_2)&=0 \\ \boldsymbol{x}_2^{T}(\boldsymbol{y}-\hat{\beta}_1\boldsymbol{x}_1-\hat{\beta}_2\boldsymbol{x}_2)&=0 \end{aligned} \]
であり、上の内積を代入して\(n\)で割ると
\[ \begin{aligned} \hat{\beta}_1+r_{12}\hat{\beta}_2&=r_{y1} \\ r_{12}\hat{\beta}_1+\hat{\beta}_2&=r_{y2} \end{aligned} \]
となる。 第1式から第2式の\(r_{12}\)倍を引くと、
\[ (1-r_{12}^2)\hat{\beta}_1=r_{y1}-r_{12}r_{y2} \]
を得る。 本問では\(|r_{12}|<1\)なので、
\[ \hat{\beta}_1=\frac{r_{y1}-r_{12}r_{y2}}{1-r_{12}^2} \]
である。 表示された相関係数では\(r_{y1}-r_{12}r_{y2}=-0.0258914<0\)となり、\(r_{y1}>0\)でも偏回帰係数の推定値は負になる。
別解として、説明変数行列\(X=(\boldsymbol{x}_1,\boldsymbol{x}_2)\)と係数ベクトル\(\boldsymbol{\beta}=(\beta_1,\beta_2)^T\)を用いる。 最小二乗推定値は
\[ \hat{\boldsymbol{\beta}}=(X^TX)^{-1}X^T\boldsymbol{y} \]
であり、上の内積を代入すると
\[ X^TX=n \begin{pmatrix} 1 & r_{12}\\ r_{12} & 1 \end{pmatrix},\qquad X^T\boldsymbol{y}=n \begin{pmatrix} r_{y1}\\ r_{y2} \end{pmatrix} \]
となる。 \(1-r_{12}^2>0\)より、
\[ (X^TX)^{-1} =\frac{1}{n(1-r_{12}^2)} \begin{pmatrix} 1 & -r_{12}\\ -r_{12} & 1 \end{pmatrix} \]
であるから、
\[ \begin{aligned} \hat{\boldsymbol{\beta}} &=\frac{1}{n(1-r_{12}^2)} \begin{pmatrix} 1 & -r_{12}\\ -r_{12} & 1 \end{pmatrix} n \begin{pmatrix} r_{y1}\\ r_{y2} \end{pmatrix} \\ &=\frac{1}{1-r_{12}^2} \begin{pmatrix} r_{y1}-r_{12}r_{y2}\\ r_{y2}-r_{12}r_{y1} \end{pmatrix} \end{aligned} \]
となる。 第1成分を取れば、上と同じ\(\hat{\beta}_1\)の式を得る。
[3]
一般に、\(u\)を説明変数、\(v\)を目的変数とする切片ありの単回帰では、傾きの最小二乗推定値は\(S_{uv}/S_{uu}\)である。 ここで、偏差の積和を
\[ S_{uv}=\sum_{i=1}^{n}(u_i-\bar{u})(v_i-\bar{v}) \]
と書く。 本問では\(\boldsymbol{x}_1\), \(\boldsymbol{x}_2\)の平均がともに\(0\)なので、切片の推定値は\(0\)であり、傾きの推定値は切片のない単回帰の場合と一致する。 その係数を\(\gamma\)とすると、
\[ \begin{aligned} \hat{\gamma} &=\frac{S_{x_2x_1}}{S_{x_2x_2}} \\ &=\frac{\boldsymbol{x}_2^{T}\boldsymbol{x}_1}{\boldsymbol{x}_2^{T}\boldsymbol{x}_2} \\ &=\frac{nr_{12}}{n}=r_{12} \end{aligned} \]
となるから、残差ベクトルは
\[ \boldsymbol{z}=\boldsymbol{x}_1-r_{12}\boldsymbol{x}_2 \]
となる。 \(\boldsymbol{x}_1\), \(\boldsymbol{x}_2\)はともに平均\(0\)なので、\(\boldsymbol{z}\)の平均も\(0\)である。 したがって、分母\(n\)の標本分散は
\[ \begin{aligned} s_z^2 &=\frac{1}{n}\boldsymbol{z}^{T}\boldsymbol{z} \\ &=\frac{1}{n}\left( \boldsymbol{x}_1^{T}\boldsymbol{x}_1 -2r_{12}\boldsymbol{x}_1^{T}\boldsymbol{x}_2 +r_{12}^2\boldsymbol{x}_2^{T}\boldsymbol{x}_2\right) \\ &=\frac{n-2nr_{12}^2+nr_{12}^2}{n} \\ &=1-r_{12}^2 \end{aligned} \]
である。 \(\boldsymbol{y}\)の平均も\(0\)なので、標本共分散は
\[ \begin{aligned} s_{yz} &=\frac{1}{n}\boldsymbol{y}^{T}\boldsymbol{z} \\ &=\frac{1}{n}\left( \boldsymbol{y}^{T}\boldsymbol{x}_1-r_{12}\boldsymbol{y}^{T}\boldsymbol{x}_2\right) \\ &=\frac{nr_{y1}-nr_{12}r_{y2}}{n} \\ &=r_{y1}-r_{12}r_{y2} \end{aligned} \]
となる。
[4]
残差平方和\(\|\boldsymbol{y}-\alpha\boldsymbol{z}\|^2\)を\(\alpha\)で微分して\(0\)とおくと、
\[ \boldsymbol{z}^{T}\boldsymbol{y}=\hat{\alpha}\boldsymbol{z}^{T}\boldsymbol{z} \]
を得る。 \(\boldsymbol{z}^{T}\boldsymbol{z}=ns_z^2>0\)であるから、
\[ \hat{\alpha} =\frac{\boldsymbol{z}^{T}\boldsymbol{y}}{\boldsymbol{z}^{T}\boldsymbol{z}} =\frac{ns_{yz}}{ns_z^2} =\frac{s_{yz}}{s_z^2} \]
となる。 [3]の結果を代入すると
\[ \hat{\alpha} =\frac{r_{y1}-r_{12}r_{y2}}{1-r_{12}^2} =\hat{\beta}_1 \]
であり、[2]で求めた偏回帰係数の推定値と一致する。
[5]
標準誤差の計算式を、一般の線形回帰モデル
\[ \boldsymbol{y}=X\boldsymbol{\beta}+\boldsymbol{\varepsilon} \]
で確認する。 \(X\)を固定された列フルランクの\(n\times q\)行列とし、\(n>q\)とする。 誤差ベクトルについて
\[ \operatorname{E}[\boldsymbol{\varepsilon}]=\boldsymbol{0},\qquad \operatorname{Var}(\boldsymbol{\varepsilon})=\sigma^2 I_n \]
を仮定すると、\(\operatorname{Var}(\boldsymbol{y})=\sigma^2 I_n\)である。 ここで、ベクトルの\(\operatorname{Var}\)は分散共分散行列を表す。 最小二乗推定値\(\hat{\boldsymbol{\beta}}=(X^TX)^{-1}X^T\boldsymbol{y}\)の分散共分散行列は
\[ \begin{aligned} \operatorname{Var}(\hat{\boldsymbol{\beta}}) &=\operatorname{Var}\bigl((X^TX)^{-1}X^T\boldsymbol{y}\bigr) \\ &=(X^TX)^{-1}X^T\operatorname{Var}(\boldsymbol{y})X(X^TX)^{-1} \\ &=\sigma^2(X^TX)^{-1}X^TX(X^TX)^{-1} \\ &=\sigma^2(X^TX)^{-1} \end{aligned} \]
となる。 このモデルの誤差分散は、残差自由度\(n-q\)で残差平方和を割った
\[ \hat{\sigma}^2 =\frac{\|\boldsymbol{y}-X\hat{\boldsymbol{\beta}}\|^2}{n-q} \]
で推定する。 \(k\)個の説明変数に切片を加えた回帰では\(q=k+1\)なので、
\[ \hat{\sigma}^2 =\frac{1}{n-(k+1)} \sum_{i=1}^{n}(y_i-\hat{y}_i)^2 \]
となる。 切片がない場合は、その分を数えず、推定する係数の個数を\(q\)とする。 各係数の標準誤差は、分散共分散行列の対応する対角成分について、\(\sigma^2\)を\(\hat{\sigma}^2\)で置き換えた値の平方根である。
以下では、この式を用いて、\(\boldsymbol{y}\)を\(\boldsymbol{z}\)だけに回帰したときにソフトウェアが出力する通常の標準誤差を計算する。 本問の切片のない単回帰\(\boldsymbol{y}=\alpha\boldsymbol{z}\)では、\(X\)は1列の\(\boldsymbol{z}\)に当たり、推定する回帰係数は\(1\)個なので\(q=1\)である。 したがって、
\[ (X^TX)^{-1}=\frac{1}{\boldsymbol{z}^T\boldsymbol{z}},\qquad \hat{\sigma}_{\alpha}^2 =\frac{\|\boldsymbol{y}-\hat{\alpha}\boldsymbol{z}\|^2}{n-1} \]
より、
\[ \operatorname{SE}(\hat{\alpha}) =\sqrt{\frac{\|\boldsymbol{y}-\hat{\alpha}\boldsymbol{z}\|^2}{(n-1)\boldsymbol{z}^{T}\boldsymbol{z}}} \]
と表される。 [4]の正規方程式と\(\boldsymbol{y}^{T}\boldsymbol{y}=n\)から、残差平方和は
\[ \begin{aligned} \|\boldsymbol{y}-\hat{\alpha}\boldsymbol{z}\|^2 &=\boldsymbol{y}^{T}\boldsymbol{y} -2\hat{\alpha}\boldsymbol{z}^{T}\boldsymbol{y} +\hat{\alpha}^2\boldsymbol{z}^{T}\boldsymbol{z} \\ &=\boldsymbol{y}^{T}\boldsymbol{y}-\hat{\alpha}^2\boldsymbol{z}^{T}\boldsymbol{z} \\ &=n-n\left(\frac{s_{yz}}{s_z^2}\right)^2s_z^2 \\ &=n\left(1-\frac{s_{yz}^2}{s_z^2}\right) \end{aligned} \]
となる。 よって、
\[ \begin{aligned} \operatorname{SE}(\hat{\alpha}) &=\sqrt{\frac{1-\frac{s_{yz}^2}{s_z^2}}{(n-1)s_z^2}} \\ &=\frac{1}{s_z^2}\sqrt{\frac{s_z^2-s_{yz}^2}{n-1}} \\ &=\frac{1}{1-r_{12}^2} \sqrt{\frac{1-r_{12}^2-(r_{y1}-r_{12}r_{y2})^2}{n-1}} \end{aligned} \]
である。 表示された相関係数と\(n=30\)を代入すると\(\operatorname{SE}(\hat{\alpha})\approx 0.4184\)となり、ソフトウェア出力の\(0.4185\)とほぼ一致する。
推定値が同じでも標準誤差が異なる理由は、\(\boldsymbol{y}\)を\(\boldsymbol{z}\)だけで回帰する場合と、重回帰の場合とで残差平方和と残差自由度が異なるためである。 重回帰の予測ベクトルを\(\hat{\boldsymbol{y}}\)とし、その残差を\(\boldsymbol{e}\)とすると、
\[ \begin{aligned} \hat{\boldsymbol{y}} &=\hat{\beta}_1\boldsymbol{x}_1+\hat{\beta}_2\boldsymbol{x}_2 \\ \boldsymbol{e} &=\boldsymbol{y}-\hat{\boldsymbol{y}} \\ &=\boldsymbol{y}-\hat{\beta}_1\boldsymbol{x}_1-\hat{\beta}_2\boldsymbol{x}_2 \end{aligned} \]
である。 また、\(\boldsymbol{x}_1=\boldsymbol{z}+r_{12}\boldsymbol{x}_2\)と[2]の第2式を用いると、
\[ \begin{aligned} \hat{\boldsymbol{y}} &=\hat{\beta}_1\boldsymbol{z} +(r_{12}\hat{\beta}_1+\hat{\beta}_2)\boldsymbol{x}_2 \\ &=\hat{\alpha}\boldsymbol{z}+r_{y2}\boldsymbol{x}_2 \end{aligned} \]
と書ける。 したがって、残差の定義から
\[ \begin{aligned} \boldsymbol{e} &=\boldsymbol{y}-\hat{\alpha}\boldsymbol{z}-r_{y2}\boldsymbol{x}_2 \\ \boldsymbol{y}-\hat{\alpha}\boldsymbol{z} &=\boldsymbol{e}+r_{y2}\boldsymbol{x}_2 \end{aligned} \]
となる。 正規方程式より
\[ \begin{aligned} \boldsymbol{x}_2^T\boldsymbol{e} &=\boldsymbol{x}_2^T\boldsymbol{y} -\hat{\beta}_1\boldsymbol{x}_2^T\boldsymbol{x}_1 -\hat{\beta}_2\boldsymbol{x}_2^T\boldsymbol{x}_2 \\ &=n(r_{y2}-r_{12}\hat{\beta}_1-\hat{\beta}_2) \\ &=0 \end{aligned} \]
であるから、残差平方和を展開すると
\[ \begin{aligned} \|\boldsymbol{y}-\hat{\alpha}\boldsymbol{z}\|^2 &=\|\boldsymbol{e}+r_{y2}\boldsymbol{x}_2\|^2 \\ &=\boldsymbol{e}^T\boldsymbol{e} +2r_{y2}\boldsymbol{e}^T\boldsymbol{x}_2 +r_{y2}^2\boldsymbol{x}_2^T\boldsymbol{x}_2 \\ &=\|\boldsymbol{e}\|^2+nr_{y2}^2 \end{aligned} \]
となる。 単回帰では\(\boldsymbol{x}_2\)によって説明される変動が残差に残り、残差自由度も重回帰の\(n-2\)とは異なる\(n-1\)である。 そのため、係数の推定値が一致しても、標準誤差や\(t\)値は一致しない。