這份作業要估計女性平均工作收入的 90% 信賴區間。操作前先確認收入單位與女性的編碼,再讓 SPSS 輸出平均數、有效樣本數、標準誤及區間上下界。估計的是母體平均收入,不是九成受訪者的收入範圍。
分析前先檢查資料
閱讀編碼簿,確認月收入還是年收入、單位是元還是千元,以及拒答、不適用等特殊代碼。像 −9、−999 這類代碼只有在資料字典指定時才能設為缺失,不能混入平均數。也不要在整份檔案任意搜尋取代數字。
性別若以數字儲存,先看值標籤,不猜 1 或 2 哪一個代表女性。檢查「選取觀察值」「分割檔案」「加權觀察值」是否保留上次分析的設定;這些都會改變結果。
用 Explore 取得 90% 區間
- 開啟「分析 → 描述統計 → 探索」(Analyze → Descriptive Statistics → Explore)。版本的中文翻譯可能略有不同。
- 把收入放進依變數清單,把性別放進因子清單。這樣可以分組輸出,不必刪掉男性資料。
- 在 Statistics 勾選描述統計,將 Confidence Interval for Mean 從預設 95 改成 90。
- 執行後,先找女性組的有效樣本數與缺失數,再看 Descriptives 中的平均數、Std. Error、Lower Bound 和 Upper Bound。
- 一併看分布及極端值。收入很偏斜或樣本很少時,不能只抄上下界就結束。
公式中的標準差與標準誤
在獨立隨機樣本、母體標準差未知的基本情境,平均數的 t 區間為:
樣本平均數 ± t 臨界值 × s/√n
其中 s 是樣本標準差,s/√n 才是平均數的標準誤。90% 雙尾區間使用自由度 n−1 的 t 分布第 95 百分位數;不能把 95% 常見的 1.96 直接套過來。
例如,純算式示範,並非課程資料結果:假設 n=100、平均收入 40 千元、標準差 10 千元,標準誤就是 1 千元。t 臨界值約 1.660,90% 區間約為 38.34–41.66 千元。換成元時,平均數與兩個端點都要一起換算。
90% 到底指什麼
若反覆按相同抽樣方式取樣,並以同一程序建立區間,長期而言約九成區間會涵蓋真正的母體平均數。對這次已算出的固定區間,頻率學派不把它解釋成「母體平均數有九成機率落在裡面」。它也不是個別女性收入的預測區間。
其他條件相同時,樣本數增加通常使區間變窄;收入變異或信賴水準提高,區間通常變寬。複雜抽樣資料若有權重、分層或群聚,應採用設計相容的標準誤,不能把上述簡單公式當作完整調查推論。
作業應報告哪些內容
交代女性組的有效 n、收入定義與單位、平均數、90% 區間、缺失值和抽樣處理。若用 One-Sample T Test,輸出的區間是「平均數減檢定值」的區間;只有檢定值為 0 時,數值才直接等於平均數區間。本文未重新計算原課程問卷,原題與影片留在下方。
參考:IBM Explore Statistics、NIST:平均數的信賴區間。
原課程內容與影片
請利用勞協問卷資料與本週之區間估計概念,在信心水準90%的前提下,估計估計女性之平均工作收入的信賴區間。
沒有留言:
張貼留言