上一節目錄下一節

前言         

  前面幾章我們主要討論機率論, 自本章開始要討論一些關於統計的題材。

  機率論與統計學裡所探討的問題是不太一樣的。在機率論裡, 可以假設 $X_1,\cdots,X_n$為i.i.d.以 $\mathcal{N}(1,2)$為共同分佈。 然後求諸如機率 $P(\sum_{i=1}^n X_i\linebreak >3)$, 或 $\sum_{i=1}^k
(X_i-1)^2/\sum_{i=k+1}^n (X_i-1)^2$之分佈, 其中 $1\leq k\leq
n-1$。在這些過程中, 一直是將 $X_1,\cdots,X_n$當做已知分佈的隨機變數。 當然此分佈的產生也可依過去的經驗, 或所涉及之隨機現象的性質。 如人的智商、身高等, 常有常態分佈; 另外, 若相信一銅板為公正, 則投擲10次後, 所得正面數便有 $\mathcal{B}(10,1/2)$分佈等。

  統計學裡, 則是由觀測到的資料(或說數據、樣本), 以對模型做一些推估。例如, 就算相信人的身高可以常態分佈當模型, 但其中的參數為何? 或即使認為每次投擲銅板的結果為i.i.d., 但銅板出現正面的機率是否真如一般人以為的$1/2$? 由於是隨機的現象, 所以每次的觀測是不盡相同的。例如, 設一盒子中放有8個白球, 2個紅球(但未透露)。如果隨機地取10個球(每次取出後放回)皆得到紅球 , 則很可能會判定盒中是紅球多。這個判定算是合理的。 機率理論(如大數法則)告訴我們, 若取樣夠多, 所得紅球數之相對頻率, 接近0.2的機率會很大。但卻不是百分之百保證有多接近0.2。 所以錯誤的判定, 在統計學裡是無法避免的。而這並非統計的錯, 只有對非隨機現象, 判斷才不會有錯誤。統計學裡所追求的, 便是要發展好的統計方法, 以有效地做決策, 並減少誤判的機率。

  如前所述, 一旦我們建立(或接受)了一統計模式, 便想對其中未知的參數做一些推估, 於是我們會重複地觀察, 因而得到樣本 $X_1,\cdots,X_n$。如果 $X_1,\cdots,X_n$為獨立, 並以函數$f$為其共同的p.d.f., 則我們便有一由母體$f$所產生之樣本數為$n$之隨機樣本。 一般所謂“隨機樣本”, 便表這些樣本為i.i.d.(見上一章定義1.1)。

  我們常說收集資料(或說數據, data), 現在就是有了資料 $X_1,\cdots,X_n$。利用這些資料要估計某未知的參數$\theta$($\theta$也可以是一向量)。 估計要準確, 樣本數$n$往往便不會太小。但如此一來資料便有不少。 如何對資料作一些減縮呢? 這是本章主要想討論的。

充分統計量

  在上一章我們介紹一些將資料做初步整理的圖示法。 那些是屬於敘述統計的範疇, 並非本書主要探討的。 本節我們以數理統計的觀點來討論關於資料的處理。

  對所收集到的資料, 有沒有必要一直全部攜帶(或展示)著? 有時對如此多的資料, 也很難理解其內涵。 是否可扼要地掌握資料的一些特性即可? 通常我們是藉由計算統計量來達到此目的。

  設有一組隨機樣本 $X_1,\cdots,X_n$。若令 $\mbox{\mathversion{bold}{$X$}}=(X_1,\cdots,X_n)$, 則 $\mbox{\mathversion{bold}{$X$}}$的一實值函數(也可以是向量值) $T(\mbox{\mathversion{bold}{$X$}})=T(X_1,\cdots,X_n)$, 便稱為 $\mbox{\mathversion{bold}{$X$}}$之一統計量。統計量仍為一隨機變數(或隨機向量), 它的定義可說是非常寬鬆, 唯一的限制是函數$T$要與參數$\theta$無關。 諸如樣本平均

\begin{eqnarray*}
\overline{X}_n=\frac 1n \sum_{i=1}^{n} X_i,
\end{eqnarray*}

樣本變異數

\begin{eqnarray*}
S_n^2=\frac {1}{n-1}\sum_{i=1}^{n} (X_i-\overline{X}_n)^2,
\end{eqnarray*}

最小的順序統計量$X_{(1)}$, 最大的順序統計量$X_{(n)}$, 中位數$\mbox{med} X$, 第一個樣本$X_1$, 常數5, $S(\mbox{\mathversion{bold}{$X$}})=(X_{(1)},X_{(n)})$, 甚至 $T(\mbox{\mathversion{bold}{$X$}})=(X_1,
\cdots,X_n)$, 皆為統計量。但 $\overline{X}_n+\theta$則非統計量。 在較一般的情況, 即使 $X_1,\cdots,X_n$不為i.i.d., 它們的一個函數, 我們仍稱為統計量。

  某些統計量可保留資料中有用的資訊, 而去掉的都是不相干的, 不影響對參數的推估。我們常說統計的工作, 就是要收集資料、 整理資料等。這種統計量可以達到資料減縮的目的, 並使資訊毫無損失, 是一種高層次的整理資料, 自然是我們所喜愛的。我們稱之為充分統計量

  在給充分統計量的定義前, 我們先藉下例來說明此概念之內涵。

例 1. 我們有時會想估計一銅板出現正面的機率, 或某種新藥的治癒率。 對這類的問題, 若以1表成功, 0表失敗, 每次成功的機率以$\theta$表之, 則經$n$次試驗後, 可得一組i.i.d.之 $\mathcal{B}er(\theta)$ 隨機變數 $X_1,\cdots,X_n$。基於所觀察到的$X_1=x_1,
\cdots, X_n=x_n$, 我們想對$\theta$做一些推估。  提示

 

  在上例中, $\mbox{\mathversion{bold}{$X$}}$之p.d.f.

\begin{eqnarray*}
\theta^{\sum_{i=1}^n x_i}
(1-\theta)^{n-\sum_{i=1}^{n}x_i},
\end{eqnarray*}

可分解成兩部分: 其一為給定$T=t$之下, $\mbox{\mathversion{bold}{$X$}}$之條件機率

其二為$T=t$之機率

前者與$\theta$無關, 所以未能提供對$\theta$之任何資訊, 而後者包含資料中所有對$\theta$之資訊。所以若要對$\theta$做推估, 合理地說, 只要知道 $T(\mbox{\mathversion{bold}{$X$}})=\sum_{i=1}^{n} X_i$就夠了。 而此 $T(\mbox{\mathversion{bold}{$X$}})$當然比全部資訊 $\mbox{\mathversion{bold}{$X$}}=(X_1,\cdots,X_n)$輕便多了。
  

  定義 1. $\mbox{\mathversion{bold}{$X$}}$之分佈與參數$\theta$有關。對一統計量 $T(\mbox{\mathversion{bold}{$X$}})$, 若給定 $T(\mbox{\mathversion{bold}{$X$}})$, $\mbox{\mathversion{bold}{$X$}}$之條件分佈 “ 與$\theta$ 無關”' , 則 $T(\mbox{\mathversion{bold}{$X$}})$稱為$\theta$之一充分統計量

  若$T$$\theta$之一充分統計量, 則知道$T$之後, 便掌握對$\theta$之所有資訊(即知道$T$之後, $\mbox{\mathversion{bold}{$X$}}$之變化已不再仰賴$\theta$), 也就是樣本中已不再含有更多關於$\theta$之資訊。 知道樣本的其他資訊, 對$\theta$的了解不再有幫助。在例 1中, 知道 $\sum_{i=1}^{n} X_i=t$, 則可決定任一 $X_1=x_1,
\cdots, X_n=x_n$事件之機率(不再仰賴$\theta$), 不須再多知道諸如$X_1$之值。可以這麼說, 剩餘的資訊中, 對了解$\theta$已不具任何價值了。 這是“充分”此一名稱的由來。投擲一銅板$n$次, 我們只要知道共得幾個正面, 而不須知道各次的結果, 便已掌握所有推估出現正面機率之資訊, 資料明顯大幅度地減縮。

  費雪在他於西元1922年的論文中, 首度提出充分統計量的概念。隨後費雪並認為, 就估計的目的而言, 充分統計量等價於原始的資料, 因此好的估計量只須基於充分統計量(good estimators should depend on the original observations only through sufficient statistics)。後來此原則被擴大, 大部分的統計學家都接受, 不論是估計檢定信賴區間等對參數的推論, 均只須基於充分統計量。這就是所謂充分性原則。 亦即若 $T(\mbox{\mathversion{bold}{$X$}})$$\theta$之一充分統計量, 則對任兩組觀察值 $\mbox{\mathversion{bold}{$x$}}$ $\mbox{\mathversion{bold}{$y$}}$, 只要 $T(\mbox{\mathversion{bold}{$x$}})=T(\mbox{\mathversion{bold}{$y$}})$, 則不論觀察到 $\mbox{\mathversion{bold}{$X$}}=\mbox{\mathversion{bold}{$x$}}$ $\mbox{\mathversion{bold}{$X$}}=\mbox{\mathversion{bold}{$y$}}$, 對$\theta$之推論均須相同。 不過必須一提的是, 還是難免有些“好的”的統計量並不基於充分統計量, 見Moore(1971)及 Levy(1985)。

  充分統計量一定存在。明顯可看出, 對一組隨機變數 $X_1,\cdots,X_n$, 且其分佈與參數$\theta$有關, 統計量 $T=(X_1,
\cdots, X_n)$, 必為$\theta$之一充分統計量。此因

\begin{eqnarray*}
P(X_1=x_1,\cdots,X_n=x_n\vert T=(x_1,\cdots,x_n))=1,
\end{eqnarray*}

且對 $(a_1,\cdots,a_n)\neq (x_1,\cdots,x_n)$,

\begin{eqnarray*}
P(X_1=a_1,\cdots,X_n=a_n\vert T=(x_1,\cdots,x_n))=0\raisebox{-1.2mm}{。}
\end{eqnarray*}

故給定$T$之後, $X_1,\cdots,X_n$之條件分佈與$\theta$無關。 由於充分統計量是為了減縮資料(但不減少對參數$\theta$之資訊), 此組天然的充分統計量顯然並不好, 並未真正減縮資料。 但順序統計量 $(X_{(1)},\cdots,X_{(n)})$必為$\theta$之一充分統計量。 而$(X_{(1)},\cdots,X_{(n)})$當然較 $(X_1,\cdots,X_n)$更能減縮資料。 此因有$n!$ $(X_1,\cdots,X_n)$皆對應同一組 $(X_{(1)},\cdots,X_{(n)})$。 所以的確存在真正能減縮資料的充分統計量。 由此看來似乎充分統計量還可以比好壞: 最能減縮資料的充分統計量應視為“最佳的”。我們給下述定義。
  

  定義 2.設有一充分統計量 $T(\mbox{\mathversion{bold}{$X$}})$, 若對每一充分統計量 $T_1(\mbox{\mathversion{bold}{$X$}})$, $T(\mbox{\mathversion{bold}{$X$}})$
$T_1(\mbox{\mathversion{bold}{$X$}})$之函數, 則稱 $T(\mbox{\mathversion{bold}{$X$}})$最小充分統計量

  當$T$為一最小充分統計量, 表示資料無法再縮減, 而不會失去充分性。 底下定理可用來判別一函數是否為另一函數之函數。 只要由函數之定義立即可得知其證法, 因此我們略去證明。

 

  定理 1.$f,g$為二有相同定義域$D$之函數。則$f$$g$之函數, 若且唯若下述條件成立: 若$g(x_1)=g(x_2)$, 則$f(x_1)=f(x_2)$, $ x_1,x_2\in D$

  由定理 1知, 若函數$f$$g$有相同定義域, 且$g$為嚴格單調, 則$f$$g$之函數。


2.$f(x)=x^3$, $g(x)=x^2$, $x\in R$, 則$f$$g$之函數,但$g$$f$之函數。  

  提示

 

  不過有時並非那麼容易看出$f$是否為$g$之函數。 如 $f(x)=x^3+3x^2+1$, $g(x)=x^4-2x^2+1$, $x\geq 0$。 事實上此時$f$並非$g$之函數。

  一統計量為樣本之一函數(可能是多維), 既然是函數就有資料減縮的功能。除非是樣本的$1-1$函數, 沒有達到資料減縮的目的。譬如說有樣本$\mbox{\mathversion{bold}{$X$}}=(X_1,\cdots,X_n)$, 則諸如 $T_1(\mbox{\mathversion{bold}{$X$}})=(X_1+1,\cdots,X_n+1)$, $T_2(\mbox{\mathversion{bold}{$X$}})=(X_1^3,\cdots,X_n^3)$, $T_3(\mbox{\mathversion{bold}{$X$}})=(e^{X_1},\cdots,e^{X_n})$, 皆為與樣本$1-1$對應之統計量。此三統計量所攜帶資料的“厚重”程度, 與樣本 $\mbox{\mathversion{bold}{$X$}}$當然是一樣的。除此之外, 不為樣本之$1-1$函數的統計量, 皆會減縮資料。譬如說 $T_4(\mbox{\mathversion{bold}{$X$}})=(X_1^2,\cdots,X_n^2)$, 且$X_i$取值在$R$上, 則$T_4$將資料減縮了: $(1,\cdots,1)$ $(-1,\cdots,-1)$對應到相同的$(1,\cdots,1)$

  上述討論指出, 若有$U,T$二統計量, 其中$T$為一充分統計量, 且$T=H(U)$, 即$T$$U$之一函數, 則$U$亦為一充分統計量: 給定$U$便給定$T$, 而給定$T$, $\mbox{\mathversion{bold}{$X$}}$之條件分佈與參數$\theta$無關。尤有進者, 除非$H$$U$$1-1$函數, 否則$T$$U$更能減縮資料。

  二統計量$T_1, T_2$, 若$T_2$$T_1$$1-1$函數, 便稱$T_1$$T_2$等價。此時知道$T_1$便可唯一決定$T_2$, 知道$T_2$也可唯一決定$T_1$。 二等價統計量本質上是沒有差別的。也可以定理 1的想法來判定等價: 二統計量$T_1, T_2$, 若滿足“ $T_1(\mbox{\mathversion{bold}{$x$}})=T_1(\mbox{\mathversion{bold}{$y$}})$, 若且唯若 $T_2(\mbox{\mathversion{bold}{$x$}})=T_2(\mbox{\mathversion{bold}{$y$}})$”, 便為等價。 等價的統計量對參數提供同樣多的資訊, 且達到相同程度的資料減縮效果。 因此二等價統計量必同時為充分統計量或同時不是, 也必同時為最小充分統計量或同時不是。 由此可知最小充分統計量若存在, 便不唯一。 又等價統計量也是一種等價關係, 也就是有反身性、 對稱性及遞移性。 即設有三個統計量$T_1, T_2$$T_3$。則$T_1$$T_1$等價; 若$T_1$$T_2$等價, 則$T_2$$T_1$等價; 若$T_1$$T_2$等價, 且$T_2$$T_3$等價, 則$T_1$$T_3$等價。

  一般而言, 資料減縮有兩方面的意義。一個是維數減少, 如由 $(X_1,
\cdots,\linebreak X_n)$ $\sum_{i=1}^n X_i$, 維數由$n$維減至1維; 一個是經由非$1-1$的變換(或說函數對應), 如取值在實數, 且由 $(X_1,\cdots,X_n)$ $(X_1^2,\cdots,X_n^2)$。 當然第一種意義也屬於非$1-1$的變換。簡言之, 二等價統計量, 減縮資料的效果是一樣的(由此也可知最小充分統計量不唯一); 而一統計量之非$1-1$的函數, 有更佳的減縮資料的效果。 最小充分統計量, 由於要達到最大資料減縮的效果, 因此它是任一充分統計量的函數。


例 3. 設有統計量 $T_1=\sum_{i=1}^n X_i$, $T_2=\sum_{i=1}^n X_i^2$, $T_3=\sum_{i=1}^n X_i^3$。是否有那二統計量等價? 提示

  為了減縮資料, 我們有各種統計量, 但又不能過度減縮, 否則留下來的資訊便不夠多了。例如, 若 $T(\mbox{\mathversion{bold}{$X$}})=3$, 當然是非常精簡了, 但此統計量可說是毫無用途。為了參數推估的目的, 我們將統計量減至充分統計量的地步, 而在所有充分統計量中, 我們又偏好其中最精減者, 也就是最小充分統計量。由定義 2知, 最小充分統計量為任一充分統計量的函數, 因此給定某一充分統計量, 最小充分統計量若不是與此充分統計量等價, 就是攜帶的資料的確較其減縮。

  在例 1中, $T=\sum_{i=1}^{n} X_i$, $S=T/n=\overline{X}_n$, $U=T/3$, $V=2T-3$等, 皆為參數$\theta$之充分統計量。 事實上這幾個統計量為等價。 二等價的統計量必同時為充分統計量或同時非充分統計量。 又若$X$ $\mathcal{N}(0,\sigma^2)$分佈, 且設樣本數$n=1$, 則顯然$T_1(X)=X$, $T_2(X)=X^2$, $T_3(X)=\vert X\vert$等, 皆為$\sigma^2$之充分統計量, 其中$T_2$$T_3$等價。 $T_2$$T_3$皆為$\sigma^2$之最小充分統計量。


例 4.$X,Y$為i.i.d., 皆有 $\mathcal{E}(\theta)$分佈, $\theta>0$。則$X+Y$$\theta$之一充分統計量。 提示


例 5. 設隨機變數$X$取值在$\{1,2,3,4\}$, 其p.d.f.為

\begin{eqnarray*}
f(x)=
\left\{
\begin{array}{ll}
1/4 & ,x=1,2,\cr
(1+\theta)/4 & ,x=3,\cr
(1-\theta)/4 & ,x=4,
\end{array} \right.
\end{eqnarray*}

其中 $\theta\in [0,1]$。若令$T(1)=T(2)=1$, $T(3)=3, T(4)=4$, 則$T$$\theta$之一充分統計量。 提示

 

  讀者可否看出$T$為一最小充分統計量? 而可否給出所有最小充分統計量?

 

例 6. $X_1,\cdots,X_n$為一組由 $\mathcal{N}(\theta,1)$分佈所產生之隨機樣本。 我們可能會猜測 $\overline{X}_n=\sum_{i=1}^{n}
X_i/n$$\theta$之一充分統計量。如何證明呢? 提示

 

  由上述幾個例子知, 要由充分統計量的定義, 來判定一統計量是否為充分, 並非很方便, 不但要先猜出那一個統計量為充分, 且必須經過一繁瑣的過程, 以檢驗猜測是否正確。 此二步驟有時皆非容易。Halmos 及 Savage 在西元1949年, 給出一由p.d.f.來找出充分統計量的簡單方法, 稱為分解定理。我們敘述此結果如下, 證明可參考Casella and Berger(1990)一書pp.250-251。
  

  定理 2. $f(\mbox{\mathversion{bold}{$x$}}\vert\theta)$ $\mbox{\mathversion{bold}{$X$}}$之聯合p.d.f.。 則 $T(\mbox{\mathversion{bold}{$X$}})$$\theta$之一充分統計量, 若且唯若存在函數$g(t\vert\theta)$ $h(\mbox{\mathversion{bold}{$x$}})$, 使得對所有樣本點 $\mbox{\mathversion{bold}{$x$}}$及參數$\theta$,      

(2.1)


  在上述定理中, $g(t\vert\theta)$不一定為 $T(\mbox{\mathversion{bold}{$X$}})$之p.d.f., 但與 $T(\mbox{\mathversion{bold}{$X$}})$之p.d.f.的商, 為一 $\mbox{\mathversion{bold}{$x$}}$之函數。換句話說, 若 $T(\mbox{\mathversion{bold}{$X$}})$$\theta$之一充分統計量, 且 $T(\mbox{\mathversion{bold}{$X$}})$之p.d.f.存在, 則(2.1)式中之$g$可取為 $T(\mbox{\mathversion{bold}{$X$}})$之p.d.f.。 如前$\theta$可能是一向量, $T(\mbox{\mathversion{bold}{$X$}})$也可能為多維隨機向量。

例 7. $X_1,\cdots,X_n$為一組由 $\mathcal{B}(m,p)$分佈所產生之隨機樣本, $m$設為已知, 即$\theta=p$。令 $T(\mbox{\mathversion{bold}{$X$}})=\sum_{i=1}^{n} X_i$,則$T$$p$之一充分統計量。  提示

例 8. $X_1,\cdots,X_n$為一組由 $\mathcal{E}(\theta)$分佈所產生之隨機樣本, $\theta>0$。 令 $T(\mbox{\mathversion{bold}{$X$}})=\sum_{i=1}^{n} X_i$,則$T$$\theta$之一充分統計量。 提示

  與例 4比較, 上例顯示分解定理對判定充分統計量, 提供很大的便利。如果做熟練, 並不需將$g$$h$寫出, 以判定一統計量是否為充分統計量。 只要是 $f(\mbox{\mathversion{bold}{$x$}}\vert\theta)$可寫成一 $\mbox{\mathversion{bold}{$x$}}$的函數, 乘上一$T$$\theta$的函數, 即可知$T$$\theta$之一充分統計量。 通常並不難看出$T$為何, 見下例。


例2.9$X$ $\mathcal{N}(0,\sigma^2)$分佈, $\sigma>0$, 試給出$\sigma^2$之充分統計量。 提示

 

  又設 $X_1,\cdots,X_n$為一組由 $\mathcal{N}(0,\sigma^2)$分佈所產生之隨機樣本, $\sigma>0$。對
$n\geq 3$, 由分解定理, 下述四統計量皆為$\sigma^2$之充分統計量。

\begin{eqnarray*}
&& T_4(\mbox{\mathversion{bold}{$X$}})=(X_1,\cdots,X_n), \\
&...
...mathversion{bold}{$X$}})=X_1^2+\cdots+X_n^2\raisebox{-1.2mm}{。}
\end{eqnarray*}

又可看出對上述4個$T_i$, $i$愈大, $T_i$愈有資料減縮的效果。


例 10. $X_1,\cdots,X_n$為一組由 $\mathcal{N}(\mu,
\sigma^2)$分佈所產生之隨機樣本, $\mu\in R$, $\sigma>0$, $n\geq 2$

(i) 設 $\mbox{\mathversion{bold}{$\theta$}}=(\mu,\sigma^2)$。試給出$\theta$之一充分統計量。

(ii) 設$\theta=\mu$, 即$\sigma^2$設為已知。試給出$\theta$之一充分統計量。

(iii) 設 $\theta=\sigma^2$, 即$\mu$設為已知。試給出$\theta$之一充分統計量。  提示

  

  本例顯示, 使用分解定理, 有時得到表面上看起來不同, 其實為等價的統計量。 有時得到的統計量尚可再減縮。 又由分解定理當然也都可得到 $(X_1,\cdots,X_n)$ $(X_{(1)},\cdots,X_{(n)})$為二組充分統計量。 只是通常我們會找更能減縮資料的充分統計量。


例2.11 $X_1,\cdots,X_n$為一組由 $\mathcal{U}(\alpha,\beta)$分佈所產生之隨機樣本, $\alpha<\beta$

(i) 若$\alpha$$\beta$皆未知, 試給出$(\alpha,\beta)$之一充分統計量;

(ii) 若$\beta$已知, 試給出$\alpha$之一充分統計量;

(iii) 若$\alpha$已知, 試給出$\beta$之一充分統計量。  提示

 

註 1如前, 對一$R^n$的子集合$A$, $n\geq 1$, 令

例如, 取$A=\{0<x<y<4\}$, 則若$x=3$, $y=2$, $I_A$便為0。 至於符號
$I_A(x)$表若$x\in A$, 則$I_A(x)=1$, 若$x\not\in
A$, 則$I_A(x)=0$。 因此 $I_{\{\alpha<x_i<\beta\}}=I_{(\alpha,\beta)}(x_i)$


例 12. $X_1,\cdots,X_n$為一組由 $\mathcal{U}[-\theta,\theta]$分佈所產生之隨機樣本, $\theta>0$。試給出$\theta$之最小充分統計量。   提示



註 2 在例 12, 我們給更一般的結果: 設 $X_1,\cdots,X_n$為一組由如下之p.d.f.所產生之隨機樣本:

(2.5)

$q_1(\theta)$為漸減, 且$q_2(\theta)$為漸增, 則 $T_1(\mbox{\mathversion{bold}{$X$}})=\max
\{q_1^{-1}(X_{(1)}), q_2^{-1}(X_{(n)})\}$
$\theta$之一充分統計量; 若$q_1(\theta)$為漸增, 且$q_2(\theta)$為漸減, 則$T_2(\mbox{\mathversion{bold}{$X$}})=\min
\{\linebreak q_1^{-1}(X_{(1)}), q_2^{-1}(X_{(n)})\}$$\theta$之一充分統計量。 又若(2.5)式中之指示函數改為 $I_{\{q_1(\theta)<\mbox{\mathversion{bold}{$x$}}<q_2(\theta)\}}$, 結果仍相同。

  如何利用定理 2以檢驗例 5中之$T$$\theta$之一充分統計量呢? 表面上看起來不太容易, 其實還是可以的, 見下例。

例 13. 承例 5。試利用定理 2檢驗$T$$\theta$之一充分統計量。   提示

  有一類分佈可很容易地找到充分統計量, 見下定理。
  

  定理 3. $X_1,\cdots,X_n$為一組由p.d.f.$f(x\vert\theta)$所產生之隨機樣本。 假設
$f(x\vert\theta)$有下述形式:

$\displaystyle f(x\vert\theta)=h(x)c(\theta)\mbox{exp}\{ \sum_{j=1}^{k}w_{j} (\theta)
t_{j} (x) \}I_A(x),$

(2.7)

其中 $h(x)\geq 0, c(\theta)\geq 0$, 且$I_A$不能與$\theta$有關。則

\begin{eqnarray*}
T(\mbox{\mathversion{bold}{$X$}})=(\sum_{i=1}^{n}t_1(X_i),\cdots,\sum_{i=1}^{n}t_{k}(X_i))
\end{eqnarray*}

$\theta$之一充分統計量。


  具有形式如(2.7)式所給之p.d.f.的分佈, 便稱為屬於 $\mbox{\mathversion{bold}{$k$}}$個參數之指數族。 不少常見的分佈皆屬於指數族。


例 14. $X$$\mathcal{N}(\mu,
\sigma^2)$分佈。令$\mbox{\mathversion{bold}{$\theta$}}=(\mu,\sigma^2)$,試證$T_1(\mbox{\mathversion{bold}{$X$}})=(\overline{X}_n, S_n^2)$$\mbox{\mathversion{bold}{$\theta$}}$之一充分統計量。 提示

 

  與例 10比較, 對指數族分佈, 可同時採用分解定理或定理 3以找出充分統計量。 只是前者須有 $X_1,\cdots,X_n$之聯合p.d.f., 而後者只須有一個$X$之p.d.f.。本質上作法則並無太大差別。

  至於是否有非指數族的分佈呢? 也是有的, 見下例。

例 15. $\mathcal{H}(N,D,n)$分佈之p.d.f.為

\begin{eqnarray*}
f(x)=\frac {{D\choose x}{{N-D}\choose {n-x}}}{{N\choose
n}}I_{\{\max\{0,n-N+D\}\leq x\leq \min \{ n,D\}\}}\raisebox{-1.2mm}{。}
\end{eqnarray*}

不論參數為 $N,D,n,(N,n),(N,D), (D,n)$, 或$(N,D,n)$, 明顯地, 此分佈皆非指數族。

  指數族之一特性是其p.d.f.為正之處, 不能仰賴參數$\theta$。 在(2.7)式中, p.d.f.為0之處, 就恰是$h(x)=0$之處。 所以如 $\mathcal{U}(\alpha,\beta)$分佈便非指數族。 二項分佈 $\mathcal{B}(m,p)$, 若$m,p$皆為未知, 則非指數族(p.d.f.為正之處與$m$有關), 但當$\theta=p$時($m$設為已知)為指數族。此由下述p.d.f.便立即得知:

與(2.7)式相比, 得知當有樣本 $X_1,\cdots,X_n$時,

\begin{eqnarray*}
T_1(\mbox{\mathversion{bold}{$X$}})=(\sum_{i=1}^{n}X_i, \sum_{i=1}^{n} (m-X_i))
\end{eqnarray*}

$p$之一充分統計量。如果回到例 .7, $T(\mbox{\mathversion{bold}{$X$}})=\sum_{i=1}^{n} X_i$便已是$p$之充分統計量了, 為何此處$T_1$較複雜? 不難看出$T$$T_1$等價。事實上, 若知 $\sum_{i=1}^{n} X_i$, 則 $\sum_{i=1}^{n}(m-X_i)=mn-\sum_{i=1}^{n} X_i$當然是多餘了。 如果將$f(x\vert p)$改寫為

\begin{eqnarray*}
f(x\vert p) &=& {m\choose x}(1-p)^{m} (p/(1-p))^{x}\\
&=& {m\choose x} (1-p)^{m} \mbox{exp} \{ x\log (p/(1-p)) \},
\end{eqnarray*}

便可寫出充分統計量 $T(\mbox{\mathversion{bold}{$X$}})=\sum_{i=1}^{n} X_i$了。欲藉助定理 3, 對$f(x\vert\theta)$ 不同的寫法, 可能導致不同的充分統計量。 但它們之間是等價的。

  欲由定義 2尋找最小充分統計量當然不是很實際, 幸好我們有下述定理, 其證明可見Casella and Berger (1990) pp.255-256。
  

  定理 4. $\mbox{\mathversion{bold}{$X$}}=(X_1,\cdots,X_n)$之聯合p.d.f.為 $f(\mbox{\mathversion{bold}{$x$}}\vert\theta)$。 又設存在一函數
$T(\mbox{\mathversion{bold}{$X$}})$, 使得對任二樣本點 $\mbox{\mathversion{bold}{$x$}}$ $\mbox{\mathversion{bold}{$y$}}$, $f(\mbox{\mathversion{bold}{$x$}}\vert\theta)/f(\mbox{\mathversion{bold}{$y$}}\vert\theta)$$\theta$無關, 若且唯若 $T(\mbox{\mathversion{bold}{$x$}})=T(\mbox{\mathversion{bold}{$y$}})$。 則 $T(\mbox{\mathversion{bold}{$X$}})$$\theta$之一最小充分統計量。


例 16. $X_1,\cdots,X_n$為一組由 $\mathcal{N}(\mu,
\sigma^2)$分佈所產生之隨機樣本。

(i) 設 $\mbox{\mathversion{bold}{$\theta$}}=(\mu,\sigma^2)$。試給出$\theta$之一最小充分統計量。

(ii) 設$\theta=\mu$, $\sigma^2$則設為已知。試給出$\theta$之一最小充分統計量。

(iii) 設 $\theta=\sigma^2$, $\mu$則設為已知。試給出$\theta$之一最小充分統計量。  提示


例 17. $X_1,\cdots,X_n$為一組由 $\mathcal{B}(m,p)$分佈所產生之隨機樣本。

(i) 設 $\mbox{\mathversion{bold}{$\theta$}}=(m,p)$。試給出$\theta$之一最小充分統計量。

(ii) 若$p$已知。試給出$m$之一最小充分統計量。

(iii) 若$m$已知。試給出$p$之一最小充分統計量。   提示

 
例 18. $X_1,\cdots,X_n$為一組由 $\mathcal{U}(\theta,\theta+1)$分佈所產生之隨機樣本, $\theta\in R$, $n\geq 2$。 試給出$\theta$之一最小充分統計量。    提示

 

  最小充分統計量的維數常與參數的維數相同(如例 16)。但也不一定, 可能大於, 也可能小於。例如, 若$X$ $\mathcal{N}(\mu,
\sigma^2)$分佈, 則僅是一維的$X$ $(\mu,\sigma^2)$之一充分統計量。 

  如果分佈屬於指數族, 我們當然可很快地找出充分統計量; 如果分解定理行得通, 充分統計量亦可輕易地找出。 但即使看不出如何分解, 也不能立即得到結論說一統計量不為充分統計量。Sampson and Spencer(1976)提出幾個判別統計量不為充分, 以及充分統計量不為最小的方法。我們列成底下三個定理。 首先對隨機向量 $\mbox{\mathversion{bold}{$X$}}=(X_1,\cdots,X_n)$之p.d.f. $f(\mbox{\mathversion{bold}{$x$}}\vert\theta)$, 令

(2.10)

$SPf$表以$f$為p.d.f.之隨機向量(如果$n=1$則為隨機變數)取正值之處(即其支撐)。 對 $\mathcal{N}(\mu,
\sigma^2)$分佈, $\theta=(\mu,\sigma^2)$, $SPf=R$; 對 $\mathcal{P}(\theta)$分佈, $\theta>0$, $SPf=\{0,1,\cdots\}$; 對 $\mathcal{U}(0,\theta)$分佈, $\theta>0$, $SPf=(0,\infty)$
  

  定理 5.設有一統計量 $T(\mbox{\mathversion{bold}{$X$}})$。若存在 $\theta_1,\theta_2$, 及 $\mbox{\mathversion{bold}{$x$}},\mbox{\mathversion{bold}{$y$}}\in
SPf$, 使得

(i) $T(\mbox{\mathversion{bold}{$x$}})=T(\mbox{\mathversion{bold}{$y$}})$,

(ii) $f(\mbox{\mathversion{bold}{$x$}}\vert\theta_1)f(\mbox{\mathversion{bold}{$y$}}\...
...version{bold}{$x$}}\vert\theta_2)f(\mbox{\mathversion{bold}{$y$}}\vert\theta_1)$,

$T(\mbox{\mathversion{bold}{$X$}})$不為$\theta$之一充分統計量。

  

  定理 6. $S(\mbox{\mathversion{bold}{$X$}})$為一最小充分統計量, $T(\mbox{\mathversion{bold}{$X$}})$為一統計量。 若存在 $\mbox{\mathversion{bold}{$x$}},\mbox{\mathversion{bold}{$y$}}\in
SPf$, 使得 $T(\mbox{\mathversion{bold}{$x$}})=T(\mbox{\mathversion{bold}{$y$}})$, 且 $S(\mbox{\mathversion{bold}{$x$}})\neq
S(\mbox{\mathversion{bold}{$y$}})$, 則 $T(\mbox{\mathversion{bold}{$X$}})$不為一充分統計量。

  

  定理 7. $S(\mbox{\mathversion{bold}{$X$}}),T(\mbox{\mathversion{bold}{$X$}})$為二充分統計量。若存在 $\mbox{\mathversion{bold}{$x$}},\mbox{\mathversion{bold}{$y$}}\in
SPf$, 使得 $S(\mbox{\mathversion{bold}{$x$}})=S(\mbox{\mathversion{bold}{$y$}})$, 且 $T(\mbox{\mathversion{bold}{$x$}})\neq T(\mbox{\mathversion{bold}{$y$}})$, 則 $T(\mbox{\mathversion{bold}{$X$}})$不為一最小充分統計量。

 

  此三定理之證明均不難, 利用定義 1,  2及定理 1即可證出。


例2.19 $X_1,\cdots,X_n$為一組由p.d.f.$f(x\vert\theta)$, $\theta>0$, 所產生之隨機樣本, 其中

$f$之圖形與$x$軸形成一由$x=0$$x=2\theta$間之一三角形, 圖形之最高點發生在$x =\theta$。設, 如何利用定理 5, 以證明$T(\mbox{\mathversion{bold}{$X$}})=(\mbox{med}X, \max
X)$並非$\theta$之一充分統計量。   提示

 

  最後, 以分割的概念, 引進充分統計量, 乃是被不少人認為是一很好的理解充分統計量之意義的方式。 可參考Lindgren(1976)一書, 在此略過。

 

進一步閱讀資料:黃文璋 (2003) . 充分統計量數理統計講義第五章。國立高雄大學應用數學系。

上一節目錄下一節