上一節目錄下一節

收斂概念 

        在數學裡極限為一重要的概念。在機率論裡也是一樣, 當樣本數無止盡的增大, 一些關於樣本的量會有什麼極限的結果? 雖然無限的樣本數, 只是一理論上的假設, 但極限之下的結果, 常可做為有限樣本數之下很好的近似值。

  本節只簡單地介紹兩種收斂的型式。詳細有關收斂的討論, 可見一般較高等機率論的書, 如Chung(1974)。

  我們先看上一章柴比雪夫不等式之一些應用。


例 1. 某市長候選人欲估計選民對他的支持度$p$, 也就是隨機地取一位選民會支持他之機率。 現希望誤差不超過 $\varepsilon=0.05$之機率至少是0.9。 若利用柴比雪夫不等式, 則至少要訪問多少選民? 提示

  在給柴比雪夫不等式之另一應用前, 我們先給一定義。

  定義 . $X_1, \cdots , X_n$為一組隨機樣本, 以$F$為共同分佈函數。令

$\displaystyle F_n(x)=\frac {X_i\leq x\mbox{之個數}}{n}, x\in R\raisebox{-1.2mm}{。}$

(2.4)

$F_n(x)$稱為此組樣本之經驗分佈函數, 為一階梯函數。

  這是一種用來估計分佈函數$F$的方法。

例 2. $X_1,\cdots,X_5$為一組隨機樣本。 又設得到觀測值$3,6,5.5,3,4$。給出此組此樣本之經驗分佈函數。  提示

例 3.$F(x)$, $F_n(x)$分別為隨機樣本 $X_1, \cdots , X_n$之分佈函數及經驗分佈函數。 試證對 $\forall x\in R$, 及$\varepsilon>0$,

(2.5)

提示

  對同一分佈函數$F$, 雖每次會有不同的觀測值, 因此會得到不同的$F_n(x)$。但上例顯示只要$n$夠大, $F_n(x)$$F(x)$之一很好的估計。又對 $\forall \varepsilon>0$, 當 $n\rightarrow \infty$時, 因 $4n\varepsilon^2\rightarrow \infty$, 故得

$\displaystyle \lim_{n\rightarrow \infty}P(\vert F_n(x)-F(x)\vert<\varepsilon)=1\raisebox{-1.2mm}{。}$

(2.6)

  根據墨菲定律, 該錯的總是會錯。 有人認為這是於西元1917年出生在美國, 而服務於海軍的Edward A.Murphy最先說的。時至今日已有成千上萬則墨菲定律了, 有些甚至還有系理呢。多半是一些人們的經驗法則, 或平常自我解嘲、諷刺或無可奈何時脫口說出的。 如排隊時可能會覺得“另一條線總是較快”; 欲借款時可能會認為“要獲得貸款須先證明自己不需要它”。其他有趣的尚有“笑一下吧, 明天會更糟”。 讀者也可有自己的墨菲定律。如勸人照相時可說“現在照永遠比以後照好看”。就“該錯的總是會錯”此則而言, 從機率的角度看是對的。若實驗中某事件發生的機率為正, 則持續重複此實驗, 該事件遲早會發生。事實上不僅於此, 設某事件發生之機率為$p$, 若持續重複實驗, 則該事件發生之相對頻率將接近$p$。此性質為機率中之一極重要的定理$-$大數法則之一特例。

  大數法則是說當樣本數夠多, 樣本平均會收斂至母體期望值。 這個法則可讓大家心理舒服一點。也許人生運氣有好有壞, 但長期下來, 平均的表現, 與真正該有之表現(指期望值), 差異便不大。 在伯努力試驗的情況下, 樣本平均即為事件發生之相對頻率, 而母體期望值即事件發生之機率。 印證之前所述大數法則可應用至事件發生之相對頻率。

  在例 1中, 我們有一數列之i.i.d.的伯努力隨機變數, 成功機率為$p$。 令 $\overline{X}_n$表首$n$項之平均, 此亦為首$n$次試驗成功數之比率。即


(2.3)式指出, 只要取夠大的$n$, 便可使 $\overline{X}_n$$p$之差異不超過一很小的正數$\varepsilon$之機率任意接近1。 要注意的是, 一般而言, $\overline{X}_n$並未剛好等於$p$, 而且我們只是很有信心(而非絕對有把握)$n$很大時, $\overline{X}_n$$p$之差不超過一給定的值。

  以上討論便引出了下述定義。

 

  定義 1. $X_1,X_2, \cdots$為一數列之隨機變數, 若存在一隨機變數 $X$, 使得

$\displaystyle \lim_{n \rightarrow \infty} P(\vert X_n-X\vert < \varepsilon)=1,
\forall \varepsilon >0,$

(2.7)

則稱 $\{X_n, n \geq 1 \}$機率收斂$X$, 以 表之。

  (2.7)式等價於

 

$\displaystyle \lim_{n \rightarrow \infty} P(\vert X_n-X\vert \geq \varepsilon)=0,
\forall \varepsilon>0$

(2.8)

$\textstyle \Leftrightarrow$

$\displaystyle \lim_{n\rightarrow \infty}P(\vert X_n-X\vert>\varepsilon)=0, \forall \varepsilon >0$

 

$\textstyle \Leftrightarrow$

$\displaystyle \lim_{n\rightarrow \infty}P(\vert X_n-X\vert\leq \varepsilon)=1, \forall \varepsilon >0\raisebox{-1.2mm}{。}$

 

  注意在定義 1中的隨機變數 $X_1,X_2, \cdots$不一定要i.i.d.。 又由例 3知, 對 $\forall x\in R$, 隨機樣本之經驗分佈函數 $\{F_n
(x), n\geq 1\}$, 機率收斂至$F(x)$

 

  定理 1.弱大數法則. $X_1,X_2, \cdots$為i.i.d.之隨機變數, 且$E(X)=\mu$存在。則樣本平均 。                                                                  證明

  

  弱大數法則是一優美的結果, 而只要變異數存在, 證明便很簡單。此結果指出, 在很一般的條件下 (期望值存在), 隨機樣本的樣本平均機率收斂至期望值。 所以樣本平均當樣本數很大時, 在“某種意義下”與期望值很接近。 更明確地說, 當$n$很大時, $\overline{X}_n$很接近$\mu$的機率會很大。如果$X$的變異數存在, 那就看得更清楚:

但若期望值不存在, 則樣本平均的變異, 就不見得會隨著樣本數之增大而變得很小。

  有弱大數法則, 顯然也應有強大數法則。的確有, 不過本書不擬討論。另外, 定理 1的條件尚可再弱些, 而 $\{X_n, n \geq 1 \}$也可以不用假設獨立, 此處我們也不多討論。


例 4. $X_1,X_2, \cdots$為i.i.d., 以 $\mathcal{C}(\theta,a)$為共同分佈。 由第二章(3.39)式, $E(\linebreak e^{itX})=e^{-a\vert t\vert+it\theta}$, $t\in R$。試證對 $\forall n\geq 1$, $\overline{X}_n \stackrel {d}{=} X$提示
 

  例 4是一特殊的現象, 樣本平均與任一樣本的分佈仍相同! 這是柯西分佈之一特性: 採用樣本平均 $\overline{X}_n$與單一樣本$X$的“效果”一模一樣, 不論樣本數為何。

例 5. $X_1,X_2, \cdots$為i.i.d.之隨機變數, 且$E(X)=\mu$, $\mbox{Var} (X)=\sigma^2$皆存在。則樣本變異數 $S^2_n$是否會機率收斂至$\sigma^2$?  提示

  大數法則告訴我們, 對一組隨機樣本 $X_1, \cdots , X_n$, 母體之期望值及變異數分別以$\mu$$\sigma^2$表之, 則不論母體之分佈為何, 當 $n\rightarrow \infty$時, 樣本平均 $\overline{X}_n$皆機率收斂至$\mu$。還有沒有其他結果呢? 當$n$很大時, 不論母體之分佈為何, $\overline{X}_n$的分佈是否會收斂至某分佈?

  我們先給底下定義。這是我們要介紹的另一種收斂方式。 如同定義 1, 其中 $X_1, \cdots , X_n$亦不須假設為i.i.d.。

 

  定義 . $X_1,X_2, \cdots$為一數列之隨機變數,$X_n$之分佈函數以 $F_{X_n}(x)$表之。若存在一隨機變數$X$, 以$F(x)$為分佈函數, 使得

$\displaystyle \lim_{n \rightarrow \infty} F_{X_n}(x)=F(x),$

(2.9)

對函數$F(\cdot)$之每個連續點$x$成立, 則稱 $\{X_n, n \geq 1 \}$分佈收斂$X$, 以 表之; 或說 $\{X_n, n \geq 1 \}$分佈收斂至以$F$為分佈函數之分佈。 $F$又稱為 $\{X_n, n \geq 1 \}$極限分佈

 

  要注意的是, 分佈收斂其實是分佈函數的收斂, 而非隨機變數的收斂。 此因可以有無限多個隨機變數有同一分佈函數$F(x)$。所以在定義 2 中, 當 , 並不是說$X_n$$X$有多接近, 而是說它們的分佈函數會接近 (隨著$n$之增大)。 此點我們稍後會再說明。因此也常有下述這類寫法:

附帶一提, 類似地, 有時會以 $P(\mathcal{N}(0,1)\leq
x)$ $\mathcal{N}(0,1)$分佈之分佈函數。其他分佈也一樣。


例 6.$X_n$ $\mathcal{B}(n,p_n)$分佈, $n\geq 1$, 且 $\lim_{n\rightarrow \infty}
np_n=\lambda$, $0<\lambda<\infty$。則。 提示


例 7.$X_1$ $\mathcal{N}(0,1)$分佈, $X_2=-X_1, \, X_3=X_1, \,
X_4=-X_1, \cdots$, 即 $X_{2n}\linebreak =-X_1, \, X_{2n+1}=X_1, \,
\forall n
\geq 1$。顯然$X_n$皆有 $\mathcal{N}(0,1)$分佈。取$X=X_1$, 仍有 $\mathcal{N}(0,1)$分佈。因 $\forall n\geq 1$, $F_{X_n} (x) =
\Phi(x)$, 故 。但$n$再大時, $X_n$的值與$X$都不會接近: 當$X$的值為5時, $X_n$交替地取5及$-5$


  對期望值為$\mu$, 變異數為$\sigma^2$之隨機樣本, 令$Z_n$4.1節(1.5)式, 則由例 3, 當母體有常態分佈, $Z_n$ $\mathcal{N}(0,1)$分佈, 故若$Z_n$有一共同的極限分佈存在, 此分佈必為常態。 這就是著名的中央極限定理。

 

  定理 2.(中央極限定理). $X_1,X_2, \cdots$為i.i.d.之隨機變數, 且 $E(X)=\mu,\linebreak\mbox{Var} (X)=\sigma^2$皆存在。令 $F_n(x)$ $\sqrt{n}(\overline{X}_n-\mu)/\sigma$之分佈函數。則

$\displaystyle \lim_{n \rightarrow \infty} F_n (x)= \Phi(x)=\int^x_{-\infty} \frac
1{\sqrt {2 \pi}} e^{-u^2/2} du, x\in R\raisebox{-1.2mm}{。}$

(2.10)

$\sqrt{n}(\overline{X}_n-\mu)/\sigma$分佈收斂至 $\mathcal{N}(0,1)$分佈, 亦可以表之。

 

  中央極限定理的證明我們略去。此定理指出適當地常態化後, i.i.d.隨機變數的和, 即

$\displaystyle \frac {\sqrt{n}(\overline{X}_n-\mu)}{\sigma}=\sum_{i=1}^n \frac
{X_i-\mu}{\sigma\sqrt{n}},$

(2.11)

會趨近至標準常態分佈。在很多實際的情況中, 通常樣本數$n\geq 30$, 就已適用, 即誤差已不會太大。甚至可以有更一般的結果: 在較高等的機率論中, 有$X_1,X_2, \cdots$之分佈不一定要相同之中央極限定理的版本。

  中央極限定理解釋了為什麼常態分佈可用來作為很多實際現象的模式。 諸如身高、智商、量測的誤差, 都是很多(假設有$n$個)微小的獨立的量之和, 因此其總和$S_n$, “ 差不多”可以常態分佈 $\mathcal{N}(n\mu,n\sigma^2)$當作近似分佈, 其中$\mu,
\sigma^2$分別為每一微小的量之期望值及變異數。

  由於

$\displaystyle \frac {\sqrt n(\overline{X}_n-\mu)}{\sigma}=\frac
{\overline{X}_n-\mu}{\sigma/\sqrt n}=\frac {S_n-n \mu}{\sigma
\sqrt n},$

(2.12)

所以在定理 2, 我們亦可說

(2.13)

(2.14)

例 8. $X_1,X_2, \cdots$為i.i.d.以 $\mathcal{P}(\lambda)$為其共同分佈。 因 $E(X)=\mbox{Var} (X)=\lambda$, 故

  下例可與上例相對應。


例1.9$X_n$$\chi_{n}^2$分佈。底下我們證明

(2.15)

(2.16)

此為$\chi_n^2$分佈之性質。  提示

  對$\forall 0<p<1$, 令$\chi_{p,n}^2$$\chi_{n}^2$分佈之第$p$分位數。 即$\chi_{p,n}^2$滿足$P(\chi_n^2\leq \chi_{p,n}^2)=p$。 則由(2.16)式得, 對$\forall x>0$,

$\displaystyle P(\chi_{n}^2\leq x)$

$\textstyle =$

$\displaystyle P(\frac {\chi_{n}^2-n}{\sqrt{2n}}\leq \frac
{x-n}{\sqrt{2n}})$

(2.17)

 

$\textstyle \doteq$

$\displaystyle P(\mathcal{N}(0,1)\leq \frac
{x-n}{\sqrt{2n}})=\Phi(\frac {x-n}{\sqrt{2n}})\raisebox{-1.2mm}{。}$

 

其次如前令$z_p$ $\mathcal{N}(0,1)$分佈之第$p$分位數。 則上式導致$n$很大時,

$\displaystyle \chi_{p,n}^2\doteq n+z_p\sqrt{2n}\raisebox{-1.2mm}{。}$

(2.18)

  $\chi_n^2$分佈之機率值即可藉助(2.17)或(2.18)式得到。例如,

\begin{eqnarray*}
P(\chi_{30}^2\leq 40)\doteq \Phi(\frac {40-30}{\sqrt{2\cdot
30}})\doteq \Phi(1.291)\doteq 0.9017\raisebox{-1.2mm}{。}
\end{eqnarray*}

\begin{eqnarray*}
\chi_{30,0.95}^2\doteq 30+z_{0.95}\sqrt{2\cdot 30}\doteq
30+1.645\sqrt{60}\doteq 42.74\raisebox{-1.2mm}{。}
\end{eqnarray*}

由附表5, 此二值分別約為$0.89$$43.77$, 差異不太大。

 

例 10. $X_1,X_2, \cdots$為i.i.d.以 $\mathcal{B}er(p)$為其共同分佈, $0<p<1$。因 $E(X)=p, \mbox{Var}(X)=p(1-p)$, 故

(2.19)

由於 $\sum_{i=1}^n X_i$ $\mathcal{B}(n,p)$分佈, 上式指出當樣本數$n$夠大時, 二項分佈可以常態分佈作為近似分佈。 此結果又稱棣美弗-拉普拉斯定理, 這可說是機率論裡, 第一個關於極限的定理, 當然也是中央極限定理的一個特例。通常只要$np$$n(1-p)$皆大於5, 此近似便夠精確。若$np$$n(1-p)$太小, 便不太適合以常態分佈來當做二項分佈之近似, 產生的誤差可能過大。 實際應用時, 若採用連續性的更正會更精確。 即對任二非負整數$k$$j$,

$\displaystyle P(j\leq S_n\leq k)=P(j-\frac 12\leq S_n\leq k+\frac 12)$                 

(2.20)

$\displaystyle =P(\frac {j-np-1/2}{\sqrt{np(1-p)}}\leq \frac
{S_n-np}{\sqrt{np(1-p)}}\leq \frac {k-np+1/2}{\sqrt{np(1-p)}})$

 

                      

 

當然如果$1/2$ $\sqrt{np(1-p)}$相比很小, 忽略1/2便不致造成太大的影響。

  例如, $n=400, p=1/2$, 則 $np=200$, $\sqrt{np(1-p)}=10$, 故得

\begin{eqnarray*}
& & P(190 \leq \sum_{i=1}^{400} X_i \leq 210) \\
& & =P(\fr...
...(1.01)- \Phi (-1.01) \\
& & \doteq 0.6876\raisebox{-1.2mm}{。}
\end{eqnarray*}

上述推導顯示, 投擲一公正的銅板 400次, 則中央極限定理告訴我們, 所得之正面數與期望次數 200之差距, 不超出 10之機率約為 $0.6826$。 但若想以二項分佈求

\begin{displaymath}\sum^{210}_{i=190} {400 \choose i} \left(\frac 12 \right)^{400},
\end{displaymath}

明顯地困難不少。

  讀者也可自行計算, 投擲一公正的銅板, 要得到正面數有65個以上, 是很難發生的(機率約0.0013), 更不要說是得到95個正面了。

  有時佐以其他極限的定理, 會使中央極限定理更有用。 底下即著名的史拉斯基定理, 證明在此略去。

 

  定理 3. , $a$為一常數。則
(i) ;
(ii) ;
(iii) ;
(iv) , 只要$a\neq 0$


例 11. 北銀樂透彩之中獎機率(指中頭獎至普獎)約為$p=0.02906$(見第二章例2.13)。 不過因投注者可自由選號, 所以每期實際中獎率均有波動。 令$N$表某期賣出的張數, 則該期總共中獎數$X$ $\mathcal{B}(N,p)$分佈。一般而言$N$均很大, $Np$$N(1-p)$皆大於5也不成問題, 因此由例 10,

\begin{eqnarray*}
Z=\frac {X-Np}{\sqrt{Np(1-p)}}
\end{eqnarray*}

有近似的 $\mathcal{N}(0,1)$分佈。因此

\begin{eqnarray*}
P(\vert Z\vert\leq 2)=P(\left\vert\frac {X-Np}{\sqrt{Np(1-p)}}\right\vert\leq
2)\doteq 0.9544\raisebox{-1.2mm}{。}
\end{eqnarray*}

同理

\begin{eqnarray*}
P(\vert Z\vert\leq 3)\doteq 0.9974\raisebox{-1.2mm}{。}
\end{eqnarray*}

$\vert Z\vert$值要超過3之機率可說相當小, 更不要說$\vert Z\vert$值超過10了。 現以第30期為例, 該期 $N=13,\!210,\!954$。而

\begin{eqnarray*}
&& \left\vert\frac {X-13,\!210,\!954\cdot
0.02906}{\sqrt{13,\!...
...htarrow 382,\!689.25\leq X\leq 385,\!131.39\raisebox{-1.2mm}{。}
\end{eqnarray*}

即約有0.9544之機率, 該期中獎數應介於$382,\!689$$385,\!131$間。 我們將該期各獎之實際中獎數列於表2.1, 相加後得總中獎數為$365,568$, 明顯地偏低。對應的$Z$值約為

\begin{eqnarray*}
Z &=& \frac {365,\!568-13,\!210,\!954\cdot
0.02906}{\sqrt{13,\...
... 0.02906\cdot 0.97094}}\\
&\doteq& -30.042\raisebox{-1.2mm}{。}
\end{eqnarray*}

$\mathcal{N}(0,1)$分佈, 會得到如此小的$Z$值, 其機率是很低的。 這顯示該期樂透彩填注之號碼不夠隨機(前30期$Z$值最大約為298, 最小約為$-238$, 但無一介於$\pm 3$之間)。 若是電腦選號較不會有此現象, 但人腦“隨意 ” 選號, 則常有這種現象發生。

表2.1 第30期樂透彩各獎中獎數

頭獎

貳獎

參獎

肆獎

普獎

0

13

389

21,455

343,711


例 12. 假設進行某項化學實驗的量測, 而得到30筆觀測值 $X_1,\cdots,X_{30}$
$X_1,\cdots,X_{30}$為i.i.d., 期望值$\mu$, 且依過去經驗, 變異數$\sigma^2=6$。欲以樣本平均 $\overline{X}_{30}$來估計$\mu$, 試給出誤差超過1之機率的近似值。  提示

 

例 13. 由定理 3-(iii)(取$Y_n\equiv a$)知, 在定理 2中,

 

  必須一提的定理還有不少。如機率收斂會導致分佈收斂, 即

(2.21)

但若存在一常數$a$, 使得$P(X=a)=1$, 則二者等價。即

(2.22)

又設$g$為一連續函數, 則若 , 便有 ; 若 , 便有。底下定理也常會用到。

 

  定理 4.$b$為一常數, 而 $n\rightarrow \infty$時, $a_n
\rightarrow \infty$, 且 $a_n (Z_n-b) \stackrel{d}{\hbox to 20pt{\rightarrowfill}}X$。又設 $g$為一可微的實函數, 且$g'$$b$連續。則

(2.23)


例 14.在例 5我們曾指出: 若 $\mbox{Var} (S^2_n) \rightarrow
0$, 則 。因此 。在中央極限定理裡, 若只知期望值$\mu$, 而不知變異數$\sigma^2$之值, 則可以$S_n$取代$\sigma$:

  弱大數法則是說$n$很大時, $\overline{X}_n-\mu$會機率收斂至0。 但若將 $\overline{X}_n-\mu$放大, 即乘上$\sqrt{n}$, 便趨近至常態分佈。$\sqrt{n}$是一適當的倍數, 若乘上位階小於$\sqrt{n}$者, 仍很小, 若乘上位階大於$\sqrt{n}$者, 會使其過大(趨近至無限大)。 如果以(2.14)式來看, $S_n-n\mu$除以$n$會機率收斂至0, 不再隨機了。 但若除以$\sqrt{n}$, 即得 $(S_n-n\mu)/\sqrt{n}$, 便分佈收斂至一仍為隨機的變數。 

  大數法則可用來支持頻率對機率的解釋。某事件發生的機率為$p$是什麼意思? 假設此事件是可以重複的觀測(見例 1), 如反覆地投擲一銅板, 令

又設 $X_1, \cdots , X_n$為i.i.d.之隨機變數, 令$p=E(X)$。則

\begin{eqnarray*}
\overline{X}_n=\frac {X_1+\cdots+X_n}{n}
\end{eqnarray*}

表出現正面的相對頻率。弱大數法則指出, $n$很大時, 此相對頻率有相當大的機率會接近$p$。換句話說, 若投擲數夠多, $\overline{X}_n$“差不多”可當做$p$之一很好的近似值。 以這種頻率的觀點來解釋機率是很自然的。當然對不能重複觀測的事件, 如氣象局宣佈: 明日降雨機率為0.3, 就很難清楚解釋機率為0.3的意義了。

  

進一步閱讀資料:黃文璋 (2003) . 收斂概念數理統計講義第四章。國立高雄大學應用數學系。

上一節目錄下一節