2020/10/18

SPSS 信賴區間:估計平均工作收入|109-1 作業2與影片

這份作業要估計女性平均工作收入的 90% 信賴區間。操作前先確認收入單位與女性的編碼,再讓 SPSS 輸出平均數、有效樣本數、標準誤及區間上下界。估計的是母體平均收入,不是九成受訪者的收入範圍。

分析前先檢查資料

閱讀編碼簿,確認月收入還是年收入、單位是元還是千元,以及拒答、不適用等特殊代碼。像 −9、−999 這類代碼只有在資料字典指定時才能設為缺失,不能混入平均數。也不要在整份檔案任意搜尋取代數字。

性別若以數字儲存,先看值標籤,不猜 1 或 2 哪一個代表女性。檢查「選取觀察值」「分割檔案」「加權觀察值」是否保留上次分析的設定;這些都會改變結果。

用 Explore 取得 90% 區間

  1. 開啟「分析 → 描述統計 → 探索」(Analyze → Descriptive Statistics → Explore)。版本的中文翻譯可能略有不同。
  2. 把收入放進依變數清單,把性別放進因子清單。這樣可以分組輸出,不必刪掉男性資料。
  3. 在 Statistics 勾選描述統計,將 Confidence Interval for Mean 從預設 95 改成 90。
  4. 執行後,先找女性組的有效樣本數與缺失數,再看 Descriptives 中的平均數、Std. Error、Lower Bound 和 Upper Bound。
  5. 一併看分布及極端值。收入很偏斜或樣本很少時,不能只抄上下界就結束。

公式中的標準差與標準誤

在獨立隨機樣本、母體標準差未知的基本情境,平均數的 t 區間為:

樣本平均數 ± t 臨界值 × s/√n

其中 s 是樣本標準差,s/√n 才是平均數的標準誤。90% 雙尾區間使用自由度 n−1 的 t 分布第 95 百分位數;不能把 95% 常見的 1.96 直接套過來。

例如,純算式示範,並非課程資料結果:假設 n=100、平均收入 40 千元、標準差 10 千元,標準誤就是 1 千元。t 臨界值約 1.660,90% 區間約為 38.34–41.66 千元。換成元時,平均數與兩個端點都要一起換算。

90% 到底指什麼

若反覆按相同抽樣方式取樣,並以同一程序建立區間,長期而言約九成區間會涵蓋真正的母體平均數。對這次已算出的固定區間,頻率學派不把它解釋成「母體平均數有九成機率落在裡面」。它也不是個別女性收入的預測區間。

其他條件相同時,樣本數增加通常使區間變窄;收入變異或信賴水準提高,區間通常變寬。複雜抽樣資料若有權重、分層或群聚,應採用設計相容的標準誤,不能把上述簡單公式當作完整調查推論。

作業應報告哪些內容

交代女性組的有效 n、收入定義與單位、平均數、90% 區間、缺失值和抽樣處理。若用 One-Sample T Test,輸出的區間是「平均數減檢定值」的區間;只有檢定值為 0 時,數值才直接等於平均數區間。本文未重新計算原課程問卷,原題與影片留在下方。

參考:IBM Explore Statistics、NIST:平均數的信賴區間。

原課程內容與影片





題目:
請利用勞協問卷資料與本週之區間估計概念,在信心水準90%的前提下,估計估計女性之平均工作收入的信賴區間。


影片:




沒有留言:

張貼留言

日本好市多週報#3:998円地瓜紅豆可頌、南瓜派與煮湯家電,秋天的餐桌怎麼買?(2026/10/10)

地瓜與紅豆放進同一盒可頌,南瓜派則以整整一大盒的份量出場。這週翻日本好市多的價牌,秋天不只出現在食材名稱裡,也出現在煮湯、裝湯的器材上。甜點可以買回家就分,調理壺與保溫罐卻要等到平日真的拿出來用,才知道適不適合自己。我挑了10月3日至9日的四組商品,從下午茶一路看到隔天午餐:有...