抽樣的方法不少,但不論採何種方式,皆要能講出一番為何如此抽樣的道理。當然事先講得頭頭是道,不見得結果便很好。幸好在統計裡,事後諸葛是可被接受的。由所得結果,修正所用的方法,仍是諸葛。一般而言,視不同的情況,各有較適用的方法。底下在介紹幾種常用的抽樣方法前,先介紹幾個名詞。
首先母體(population),就是所有欲探討的元素之集合,可以是某校全體學生之集合,也可以是某地所有選民之集合。其次母體中之每一元素,皆是抽樣單位(sampling units)。母體之一些子集合,亦可構成抽樣單位,只要這些子集合,兩兩間沒有共同元素,且其聯集等於母體。例如,假設母體為某校全體學生之集合,則該校任一班亦可當做一抽樣單位。全部抽樣單位之名單,便稱為底冊(frame)。
經由機率的方式,所產生之樣本,便稱為機率樣本(probability sample),而其抽樣步驟,則稱為機率抽樣(probability sampling)。底下為幾種主要的機率抽樣設計。
(1) 簡單隨機抽樣(simple random sampling)
欲取一組樣本數為n之樣本,n當然不能超過母體中元素之總個數,若任一組可能的這種樣本,皆有相同的機率被抽到,便稱此抽樣步驟為簡單隨機抽樣,而所獲得的樣本,便稱為簡單隨機樣本(simple random sample)。注意,是母體中每一組樣本數為n之樣本,皆有相同的機率被抽到,而不只是母體中每一個樣本,皆有相同的機率被抽中。前者的條件較強。可以證明,若依序自母體中“隨機地”取出n個樣本,每次取出後不放回,則便得一組樣本數為n之簡單隨機樣本。若母體內元素之同質性較高,譬如說,母體為某大學大一的全體學生,想了解他們對調漲學費之看法,此時簡單隨機抽樣便很適用。
(2) 分層隨機抽樣(stratified random sampling)
假設母體可分成若干群,而每群中的元素性質較接近。譬如欲調查某部會公務員對某項議題之看法,又設不同職等公務員的意見,可能有不小的差別。則便可先依職等,將該部會的公務員,像是分成高、中、低三群。先在每群中藉簡單隨機抽樣產生樣本,然後得到全部的抽樣樣本。這種抽樣步驟,便稱為分層隨機抽樣,所得之樣本,則稱為分層隨機樣本(stratified random sample)。一般而言,當不同群的人,想法之差異可能不小時,採分層隨機抽樣,可避免使抽出的樣本,過度集中在某群中,因而能減少估計量的變異。
(3) 叢聚抽樣(cluster sampling)
有時先將母體分成若干群,以簡單隨機抽樣抽出幾群,再從抽出的每一群中,取出幾個樣本(如採簡單隨機抽樣),因而得到全部的抽樣樣本,這種方法便稱叢聚抽樣。雖然與分層隨機抽樣一般,都是先將母體分成若干群(即叢聚),不過其步驟並不一樣。在分層隨機抽樣中,沒有分那麼多群,且是在每一群中取簡單隨機樣本。而在叢聚抽樣中,分的群數較多,且是先對“群”採取簡單隨機抽樣,然後再從每一抽出的群中,抽取樣本。
假設要研究某種有關豬的寄生蟲之發病率。若要從全國的豬中抽取100頭來研究,便不是一件容易的事。不要說沒有全部豬的底冊,很難實施簡單隨機抽樣。就算真能隨機地抽出100頭豬,這邊一頭,那邊一頭,有些在山上,有些在海邊,由於必須“面訪”豬,研究人員得到處奔波,相當耗成本。因此從全國各養豬場(或村落)中,先以簡單隨機抽樣挑選一些養豬場,再從每一個選出的養豬場,各取幾頭豬來做樣本,便不失為一個簡單且有效的抽樣步驟。在叢聚抽樣裡,如果每一叢聚中的成員同質性較高,則甚至可以只要從每一叢聚中,僅挑一樣本即可。
(4) 系統抽樣(systematic sampling)
有時底冊中的抽樣單位是依序排列,則有下述較經濟挑選樣本的方法:先從底冊中挑一靠近名單之首的第a位抽樣單位,再取一適當的正整數b,然後將之後的每隔b抽樣單位者挑出,如此形成的一組樣本,便稱為系統樣本(systematic sample),而此法則稱為系統抽樣。例如,想從電話簿中抽出1%作為樣本,且取a=5,b=100,則可以第5戶,105戶,205戶,…,為樣本。如果要從底冊抽出100個樣本,且取a=21,b=10,則可以第21位,31位,…,1,011位為樣本。採系統抽樣法,可以快速地挑選出樣本。但若無恰當的底冊,或底冊中的元素有循環的性質(如學校各班依入學成績高低編學號),就不見得適合採用。
其次舉幾種常見的非機率抽樣。
(1) 配額抽樣(quota sampling)
設欲對某校學生進行抽樣調查,如果學生中有60%為男生,40%為女生,則以簡單隨機抽樣,將很難讓樣本中剛好有60%為男生。因此有時會擇定幾個主要因素,如性別、年齡、教育程度,及收入等,每位訪員被要求其訪問的對象中,有某固定比例是男生;某固定比例是50歲以上、35-49歲,及21-34歲;某固定比例有碩士以上學歷、大學學歷,及其他等。這樣選出來的樣本,會符合母體中各因素該有之比例,便稱為配額抽樣。
與機率抽樣不同,配額抽樣並未利用到機率的結構,因此並無法對抽樣的精準性,給出機率式的描述。機率抽樣樣本的產生較客觀,依一定的隨機方式,給訪員受訪者名單。至於配額抽樣,則通常由訪員主觀地去挑選樣本:假設某訪員要訪問20位,他所接到的指示,通常只是諸如樣本中要有11位男生,9位女生;8位50歲以上、7位35-49歲,及5位21-34歲;碩士以上學歷4人、大學學歷9人,其他7人等。至於訪問誰,便不能設限了,否則訪員將綁手綁腳。在時間限制下,訪員有時因此會傾向訪問較容易找到的受訪者,如此便可能造成取樣的偏差。
(2) 方便抽樣(convenience sampling)
諸如街頭訪問、主動回信,或主動打電話(如扣應)者,皆為方便抽樣,又稱偶然抽樣。這種樣本雖方便取得(因此得名),但卻不是那麼客觀,只能代表那些願意發法看法者之意見。世人熙熙,世人攘攘,當街上大部分的人都匆匆忙忙地在趕路時,願意停下來接受採訪者,可能是比較熱心、比較空閒、比較不滿、或比較孤單的人?
(3) 立意抽樣(purposive sampling)
對於某些特定的議題,有時會從某一群特定的人中抽取樣本,便稱為立意樣本(purposive sample)。例如,想知道立法委員的表現,則可能會從各媒體採訪立法院的記者中,抽取樣本,因他們對立法院較了解。立意抽樣,由於樣本同質性較高,或樣本可能牽涉到欲調查之議題,有時不見得能從中獲得較客觀的資料。
上述這些,便是常見的抽樣方式,都有其適用的情況,不見得那一個最好。讀者不妨想想,是否尚有其他方式?