上一節目錄下一節

共變異數及相關係數 

   兩個隨機變數可能獨立也可能不獨立。所謂獨立, 是隨機式的獨立, 表知其中之一的值, 對另一變數的值毫無影響。如果二隨機變數不獨立, 則二變數間便有關係。此關係可能強可能弱, 本節便要介紹兩種度量兩隨機變數關係強弱的方式。

  隨機變數之關係的確是有強弱的。如果是獨立, 則關係當然是最弱的。 若樣本為水, 令$X$表其體積, $Y$表其重量。 顯然$X$$Y$之關係很強。如果取樣多次, 將所得的$(X,Y)$數據畫在座標平面上, 則所有的點很可能落在一直線上或直線的附近。 這是因為水的重量與體積有線性關係。有些數據不在直線上, 可能是因量測的誤差, 或水質不純所致。其次, 若以$X$表某人之身高, $Y$表其體重, $X$$Y$顯然亦有關係, 但可能不是那麼強。 量測一些不同的人所得之$(X,Y)$, 大約不會形成一直線, 雖然我們仍會預期圖形是向上增長, 即較大的$X$有較大的$Y$之傾向。 共變異數相關係數, 都可用來度量兩隨機變數關係(特別是線性關係)的強弱。

  在本節中, 令 $\mu_X=E(X),\mu_Y=E(Y),\sigma_X^2=\mbox{Var}(X),\sigma_Y^2=\mbox{Var}(Y)$,
如果存在的話。

 

  定義 1.二隨機變數$X,Y$共變異數

(5.1)

$0<\sigma_X^2,\sigma_Y^2<\infty$。則$X,Y$相關係數為     

(5.2)

$\mbox{Cov}(X,Y)$可以$\sigma_{XY}$表之, $\rho(X,Y)$有時以$\rho_{XY}$表之。

  當$\sigma_X$$\sigma_Y=0$, 此時 $\mbox{Cov}(X,Y)=0$, 至於$\rho(X,Y)$則不定義。由定義 1知, 只要我們提到相關係數, 皆隱含二隨機變數之期望值及變異數皆存在, 且變異數皆不為0。

  顧名思義, 共變異數量測兩個變數同時變化的情況。 正如變異數乃量測一隨機變數變化的大小( $\mbox{Cov}(X,X)=\mbox{Var}(X)$)。 如果較大的$X$傾向於伴隨較大的$Y$, 且較小的$X$傾向於伴隨較小的$Y$, 則 $\mbox{Cov}(X,Y)$將是正的。因此若$X>\mu_X$時, 較可能有$Y>\mu_Y$, 則 $(X-\mu_X)(Y-\mu_Y)$較可能為正; 若$X<\mu_X$時, 亦較可能有$Y<\mu_Y$, 則 $(X-\mu_X)(Y-\mu_Y)$也將較可能為正。如此一來, $\mbox{Cov}(X,Y)=E((X-\mu_X)(Y-\mu_Y))>0$。 但若較大的$X$傾向於伴隨較小的$Y$, 且較小的$X$傾向於伴隨較大的$Y$, 則 $(X-\mu_X)(Y-\mu_Y)$較可能為負, 如此一來, $\mbox{Cov}(X,Y)<0$。 故 $\mbox{Cov}(X,Y)$之正負, 反映$X,Y$增長方向之相同或相反。 若以$X,Y$分別表父親的身高及兒子的身高, 我們會預期 $\mbox{Cov}(X,Y)$為正。 若以$X,Y$分別表成人的體重及跳高的高度, 我們會預期 $\mbox{Cov}(X,Y)$為負。

  較大且為正的共變異數, 顯示兩個變數, 大致以線性的方式同時增大或減小; 較大且為負的共變異數, 顯示兩個變數, 大致以線性的方式一增大時另一減小。 共變異數很接近$0$時, 表示$X$$Y$的線性關係很弱。特別地, 當$X$$Y$獨立時, $\mbox{Cov}(X,Y)=0$。 不過 $\mbox{Cov}(X,Y)=0$時, $X$$Y$卻不一定獨立。另外, $\rho(X,Y)$ $\mbox{Cov}(X,Y)$之符號相同, 且當$\mbox{Var}(X)$$\mbox{Var}(Y)$皆存在時, $\rho(X,Y)=0$, 若且唯若 $\mbox{Cov}(X,Y)=0$。當$\rho(X,Y)=0$則稱$X$$Y$無相關

  做為量測二隨機變數$X$$Y$之變化情況, 共變異數有一缺點, 就是其值與量測$X,Y$之尺度有關。例如, $X$以公升為單位, $Y$以公斤為單位, 跟$X$以公撮(立方公分)為單位, $Y$以公克為單位, 則前者求出之共變數為後者之${10}^{-6}$倍。 相關係數便可消除這種困擾, 它永遠取值在區間$[-1,1]$。 而相關係數等於$1$$-1$時, 表$X$$Y$有完美的線性關係。 我們先給一定理以簡化共變異數之計算。

  定理 1.對二隨機變數$X,Y$,                   證明

(5.3)

 

  系理 1.$X$$Y$為二獨立的隨機變數, 則 $\mbox{Cov}(X,Y)=0$$\rho(X,Y)=0$

證明

  底下的推論也是很顯然的。

  系理 2.對二隨機變數 $X,Y$,

\begin{eqnarray*}
\rho (X,Y)=\mbox{Cov}(\frac{X-\mu _{X}}{\sigma _{X}},\frac{Y-\...
..._{X})(Y-\mu _{Y})}{\sigma
_{X}\sigma _{Y}})\raisebox{-1.2mm}{。}
\end{eqnarray*}

  我們知道, 對一隨機變數$X$, 減去期望值, 再除以標準差, 所得之 $(X-\linebreak\mu_X)/\sigma_X$, 就是將其標準化。由系理 2知, 相關係數即二標準化後的隨機變數之共變異數。標準化後的隨機變數, 稱為無維數的

  下述定理的證明不難。

 

  定理 2.對任二隨機變數$X,Y$, 及常數$a,b,c,d$,

$\displaystyle \mbox{Cov}(aX+b, cY+d)=ac\mbox{Cov}(X,Y),$

(5.4)

$\displaystyle \rho(aX+b, cY+d)=\frac{ac}{\vert ac\vert}\rho(X,Y),ac\neq 0\raisebox{-1.2mm}{。}$

(5.5)


  (5.4)式印證我們前面所說的共變異數與所取的尺度(指$a,c$的效應) 有關。不過與座標的平移(指$b,d$的效應) 無關。(5.5)式指出, 只要尺度之改變, 並未使$X,Y$之值的方向變成相反(即$ac>0$), 則相關係數不變。


例 1. 假設$X$表某電腦廠商拜訪客戶之次數, $Y$表客戶買的電腦數目,且$(X,Y)$之聯合p.d.f.$f(x,y)$

$(X,Y)$之共變異數。   提示


例 2.$(X,Y)$之聯合p.d.f.為

$(X,Y)$之相關係數為何?  提示

 

  相關係數作為一個指標, 主要是反映二隨機變數之分佈的線性關係之強度及符號。 因此相關係數為$0$, 僅表示二隨機變數之線性關係很低, 而非表示二變數機率上無關(即獨立)。見下例。

例 3.$(X,Y)$為離散型之隨機向量, 以$f(x,y)$為其聯合p.d.f., 且  

$(X,Y)$之相關係數為零,但$X$$Y$並不獨立。  提示

  另一方面, $X$$Y$之間有一很強的非線性關係。因對$\forall
(x,y)$, 只要$P(X\linebreak =x, Y=y)\neq 0$, 則$y=x^2$, 即

亦即雖由$\rho(X,Y)=0$, 得知$X$$Y$缺乏機率上的線性關係。 但並未排除$X$$Y$間, 有非線性的關係。換句話說, “無相關”並非“不相關”。

例 4.$(X,Y)$之聯合p.d.f.為

試求 $\mbox{Cov}(X,Y)$$\rho(X,Y)$。  提示

  再給一例。

例 5.$X$$Z$為二獨立的隨機變數, 且$X$${\cal U}(0,1)$分佈, $Z$ ${\cal U}(0,1/10)$分佈。 令$Y=X+Z$,求 $\mbox{Cov}(X,Y)$$\rho(X,Y)$。   提示

  

  與例 2比較, 在例 5中, $X$$Y$的相關係數很接近$1$。 我們將兩例中使$f(x,y)$為正之$(x,y)$的圖形繪出, 見圖5.1。

圖5.1  圖$a$為例 2中使$f(x,y)>0$之區域, 圖$b$為例 5中使$f(x,y)>0$之區
           域。

  圖5.1.$a$及5.1.$b$, 顯示$X$$Y$大致有線性的關係, 但在圖5.1.$b$中線性關係較強(區域較窄)。 也可以另一方式來看此線性關係的強弱。在例 5中, 因$Y=X+Z$, 故給定$X=x$, $Y$ ${\cal U}(x,x+1/10)$分佈。而在例 2中, 也可驗證給定$X=x$, $Y$ ${\cal U}(x,x+1)$分佈。故知道$X=x$, 在例 5中, 較在例 2中,提供較多關於$Y$之資訊(前者誤差不超過$0.1$, 後者誤差不超過$1$)。因此在例 5中, $X$$Y$的相關係數較大。

  底下的例子, 為一連續型隨機向量$(X,Y)$, $X$$Y$之間有強烈的關係, 但因該關係並非線性, 所以相關係數很小, 可與例 5比較。


例 6.$X$$Z$為二獨立的隨機變數, 且$X$ ${\cal U}(-1,1)$分佈, $Z$ ${\cal U}(0,1/10)$
分佈。令$Y=X^2+Z$, 則$\rho(X,Y)=0$。  提示

  再提醒一次, 相關係數是量測線性關係的強弱, 而非量測其他非線性關係之強弱。


例 7.$X$ $\mathcal{U}(-1,1)$分佈。令$Y=X^2$, $Z=2X+3$, $W=-2X+3$。則$X$$Y$,$Z$,$W$之相關係數各為何?   提示

 

  共變異數對了解隨機變數和之變異有很大的幫助。 底下定理為第一章定理6.3之推廣。一般在這類定理中, $\mbox{Var}(X)$$\mbox{Var}(Y)$皆須假設存在, 但常略去陳述此條件。

  定理 3.$X,Y$為二隨機變數。則對任二常數$a,b$,                                證明

$\displaystyle \mbox{Var}(aX+bY)=a^2\mbox{Var}(X)+b^2\mbox{Var}(Y)+2ab\mbox{Cov}(X,Y)\raisebox{-1.2mm}{。}$

(5.6)

特別地, 若$X$$Y$獨立, 則

$\displaystyle \mbox{Var}(aX+bY)=a^2\mbox{Var}(X)+b^2\mbox{Var}(Y)\raisebox{-1.2mm}{。}$

(5.7)


  由定理 3得

(5.8)

因此若$X$$Y$正相關, 即$\rho(X,Y)>0$(因此 $\mbox{Cov}(X,\linebreak Y)>0$), 則$X+Y$之變異數, 比$X,Y$變異數之和還大。反之, 若$X$$Y$負相關, 則$X+Y$之變異數, 比$X,Y$變異數之和還小。當負相關時, $X$$Y$一個值較大, 另一值傾向於較小, 而其和就不至於那麼極端, 因此$X+Y$之變異減小。同理可對 $\mbox{Var}(X-Y)$做討論。

  底下我們證明對任二隨機變數$X,Y$, $\vert\rho(X,Y)\vert\leq 1$, 且$\vert\rho(X,Y)\vert=1$, 若且唯若$P(Y=aX+b)=1$, 其中$a,b$為二常數, 且$a\neq 0$。由於相關係數的值介於正負1之間, 且當其值等於$+1$$-1$時, 二變數有一線性關係之機率為$1$, 這便說明了如前所述, 相關係數是用來量測二變數之線性相依情形。 當$\vert\rho(X,Y)\vert=1$時, 我們稱$X$$Y$完全相關 。

  我們先證明底下著名的史瓦茲不等式, 又稱柯西-史瓦茲不等式, 此不等式出現於數學中很多不同的地方。 

  定理 4.$X,Y$為二隨機變數, 且 $E(X^2), E(Y^2)<\infty$。則

\begin{displaymath}
(E(XY))^2 \leq E(X^2)E(Y^2)\raisebox{-1.2mm}{。}
\end{displaymath}

(5.9)

又(5.9)式中等式成立, 若且唯若$P(X=0)=1$, 或存在一常數$a$, 使得$P(Y=aX)=1$。                                                                                         證明


  將史瓦茲不等式應用至隨機變數$X-\mu_X$$Y-\mu_Y$, 得

\begin{eqnarray*}
(E((X-\mu_X)(Y-\mu_Y)))^2\leq E((X-\mu_X)^2)E((Y-\mu_Y)^2),
\end{eqnarray*}

上式即為

\begin{displaymath}
(\mbox{Cov}(X,Y))^2 \leq \mbox{Var}(X)\mbox{Var}(Y) \mbox{\raisebox{-1.2mm}{。}}
\end{displaymath}

(5.11)

因此下述結果便得證了。

 

  理 3.對任二隨機變數$X,Y$, 只要 $E(X^2), E(Y^2)<\infty$, 便有

(5.12)

  我們又有下述重要的推論。

  理 4.$X,Y$為二隨機變數, 且 $E(X^2), E(Y^2)<\infty$。則$\vert\rho(X,Y)\vert=1$, 若且唯若存在二常數$a,b$, 且$a\neq 0$, 使得$P(Y=aX+b)=1$。             證明


在系理 4中, 若$a>0$, 則$\rho(X,Y)=1$; 若$a<0$, 則$\rho(X,Y)=-1$。又$a$ , $b$也可以$X,Y$之期望值及標準差表示, 見下系理, 證明則留在習題中。

  系理 5.$X,Y$為二隨機變數, 且 $E(X^2), E(Y^2)<\infty$。 則當$\rho(X,Y)=1$,

$\displaystyle P(Y=\mu_Y+(\sigma_Y/\sigma_X)(X-\mu_X))=1;$

(5.13)

$\rho(X,Y)=-1$,

(5.14)

  當$E(X^2)<\infty$, 我們注意到$\rho(X,X)=1$。 自己與自己的相關係數為1, 自然是合理的。 而這也與系理 4及 5之推論吻合。事實上, 對任二常數$a,b$, 且$a\neq 0$, $\rho(X,aX+b)=1$(此亦為系理 4之推論)。

  二隨機變數即使相關係數很高, 只是其分佈上所顯示的現象, 並不表二隨機現象間一定有因果關係。例如, 令$X$表某地可樂之月銷售量, $Y$表該地每月至醫院腸胃科就診的人數。 則$X$$Y$之相關係數可能很大。但這並不是說喝可樂後易拉肚子, 而很可能是夏天天氣炎熱, 可樂需求量因而增大, 而天氣炎熱時病蟲又易滋長, 因此腸胃有問題的人也變多。 如此導致$X$$Y$之相關係數很高。 至於喝可樂與拉肚子間倒不見得有因果關係。

  現以$\rho$表二隨機變數$X,Y$之相關係數, 則$\rho$介於$-1$$1$之間。我們已指出, 由相關係數之定義, 正相關($\rho>0$), 顯示較大的$X$傾向於對應較大的$Y$, 且較小的$X$傾向於對應較小的$Y$; 負相關$(\rho<0)$, 則顯示較大的$X$傾向於對應於較小的$Y$, 且較小的$X$傾向於對應於較大的$Y$; $\rho$接近$0$時, 顯示前述兩種傾向皆很弱。雖然由系理 4知, $\vert\rho\vert$接近$1$時, $X$$Y$應有較強的線性關係。比較例 2與例 5, 似乎較強的線性關係, $\vert\rho\vert$值亦應較大。 但這些並未能完全解釋本節一開始所說的, 相關係數是用來度量兩隨機變數線性關係之強度。

  底下我們引用Roussas(1997)pp.130-131所提供的說明, 應有助於了解為何採用相關係數來量測二隨機變數的共線性。為了簡便, 以$\mu_1$$\mu_X$, $\mu_2$$\mu_Y$, $\sigma_1$$\sigma_X$, $\sigma_2$$\sigma_Y$

  先考慮$xy$平面上的直線

$\displaystyle y=\mu_2+(\sigma_2/\sigma_1)(x-\mu_1)\raisebox{-1.2mm}{。}$

(5.15)

$D_1$表一隨機的點$(X,Y)$與上述直線之距離。在高中數學裡, 大家學過平面上一點$(x_0,y_0)$與直線$ax+by+c=0$之距離為 $\vert ax_0+by_0+c\vert/\sqrt{a^2+b^2}$。因此(注意 $a=\sigma_2/\sigma_1$, $b=-1$, $c=\mu_2-(\sigma_2/\sigma_1)\mu_1$)

$\displaystyle \qquad
D_1=\vert(\sigma_2/\sigma_1)X-Y+(\mu_2-(\sigma_2/\sigma_1)\mu_1)\vert/\sqrt{\sigma_2^2/\sigma_1^2+1},$

(5.16)

且     

$\displaystyle \qquad
D_1^2=((\sigma_2/\sigma_1)X-Y+(\mu_2-(\sigma_2/\sigma_1)\mu_1))^2/(\sigma_2^2/\sigma_1^2+1)\raisebox{-1.2mm}{。}$

(5.17)

由(5.17)式得

$\displaystyle \qquad (\sigma_{1}^{2}+\sigma _{2}^{2})D_1^{2}$

$\textstyle =$

$\displaystyle \sigma
_{2}^{2}X^{2}+\sigma _{1}^{2}Y^2-2\sigma _{1}\sigma _{2}XY$

(5.18)

$\displaystyle \qquad$

$\textstyle +$

$\displaystyle 2\sigma _{2}(\sigma _{1}\mu
_{2}-\sigma _{2}\mu _{1})X-2\sigma _{1}(\sigma _{1}\mu _{2}-\sigma _{2}\mu _{1})Y$

 

$\displaystyle \qquad$

$\textstyle +$

$\displaystyle (\sigma _{1}\mu _{2}-\sigma _{2}\mu _{1})^{2}\raisebox{-1.2mm}{。}$

 

對上式兩側取期望值, 且利用

\begin{eqnarray*}
&&E(X^2)=\sigma_1^2+\mu_1^2,\quad E(Y^2)=\sigma_2^2+\mu_2^2,\\
&&E(XY)=\rho\sigma_1\sigma_2+\mu_1\mu_2,
\end{eqnarray*}

經化簡後,得

$\displaystyle E(D_1^2)=\frac{2\sigma_1^2\sigma_2^2}{\sigma_1^2+
\sigma_2^2}(1-\rho)\raisebox{-1.2mm}{。}$

(5.19)

其次考慮$xy$平面上的直線

$\displaystyle y=\mu_2-(\sigma_2/\sigma_1)(x-\mu_1),$

(5.20)

同理可得點$(X,Y)$與此直線距離平方的期望值為

$\displaystyle E(D_2^2)=\frac{2\sigma_1^2\sigma_2^2}{\sigma_1^2+
\sigma_2^2}(1+\rho)\raisebox{-1.2mm}{。}$

(5.21)

  我們為什麼會想到考慮這二條直線呢? 由系理 5, $\rho=1$時, $(X,Y)$落在直線 $y=\mu_2+(\sigma_2/\sigma_1)(x-\mu_1)$上的機率為1; $\rho=-1$時, $(X,Y)$落在直線 $y=\mu_2-(\sigma_2/\sigma_1)(x
-\mu_1)$上的機率為1。所以此二直線與$(X,Y)$是有密切關係的。 此二直線前者斜率為正, 後者為負, 二直線相交於點$(\mu_1,\mu_2)$, 對稱於直線$y=\mu_2$, 也對稱於直線$x=\mu_1$。 由於期望值有平均的意味, (5.19)及(5.21)式顯示:

  若$\rho>0$(正相關), 比較與二直線的距離平方的期望值$E(D_1^2)$$E(D_2^2)$, 可看出點$(X,Y)$較有沿著直線 $y=\mu_2+(\sigma_2/\sigma_1)(x-\mu_1)$的傾向。 且當$\rho$愈來愈接近1時, $E(D_1^2)$愈來愈接近0, 亦即$(X,Y)$愈來愈接近此直線。$\rho=1$時, 則$(X,Y)$恰巧落在此直線(機率為1)。


圖5.2 相關係數$\rho=\pm 1$時, $(X,Y)$所落在的直線

  若$\rho<0$(負相關), 同理點$(X,Y)$較有沿著直線$y=\mu_2-(\sigma_2/\sigma_1)(x
-\mu_1)$的傾向。 且當$\rho$愈來愈接近$-1$時, $E(D_2^2)$愈來愈接近0, 亦即$(X,Y)$愈來愈接近此直線。$\rho=-1$時, 則$(X,Y)$恰巧落在此直線(機率為1)。

  若$\rho=0$, 點$(X,Y)$與前述兩直線任一之距離平方的期望值皆為$2\sigma_1^2\linebreak\sigma_2^2 / (\sigma_1^2+\sigma_2^2)$。 所以點$(X,Y)$並無較有沿著此二直線之任一的傾向。點 $(X,\linebreak Y)$就只是散佈在$xy$平面上。

  相關係數$\rho$用來量測隨機變數$X$$Y$之共線性, 就是基於以上的涵意。

  下述定理顯示相關係數與條件期望值關係密切。 此定理亦可視為系理 5之推廣。

  定理 5.設隨機變數$X,Y$之相關係數$\rho$存在。 若$E(Y\vert X=x)$為一$x$之線性函數, 則

$\displaystyle E(Y\vert X=x)=\mu_2+\rho(\sigma_2/\sigma_1)(x-\mu_1),$

(5.22)

$\displaystyle E(\mbox{Var}(Y\vert X))=\sigma_2^2(1-\rho^2)\raisebox{-1.2mm}{。}$

(5.23)

提示

  本節最後我們給一定理 3之推廣, 其證明留在習題中(第18題)。

  定理 6.對二隨機變數$X,Y$, 及常數 $a_1, b_1, c_1, a_2, b_2,
c_2$,

$\displaystyle \mbox{Cov}(a_1X+b_1Y+c_1, a_2X+b_2Y+c_2)$

(5.25)

$\displaystyle =a_1 a_2 \mbox{Var}(X)+ b_1 b_2
\mbox{Var}(Y)+(a_1b_2+a_2b_1)\mbox{Cov}(X,Y)\raisebox{-1.2mm}{。}$

 


  只要知道$\mbox{Var}(X)$, $\mbox{Var}(Y)$ $\mbox{Cov}(X,Y)$, 則任二$X,Y$之線性函數的共變異數皆可求出。又當$a_1=a_2=a$, $b_1=b_2=b$, $c_1=c_2=0$, 則(5.25)式成為(5.6)式。

例 8. 對二隨機變數$X,Y$, 試決定$X+Y$$X-Y$無相關之條件。  提示
 

進一步閱讀資料:黃文璋 (2003) . 共變異數及相關係數數理統計講義第三章。國立高雄大學應用數學系。

上一節目錄下一節