同一個縣市連續觀察好幾年,就是 Panel Data。這份作業要比較勞動參與率、性別比與高學歷人口比的關係;重點是區分「縣市之間的差異」和「同一縣市隨時間的變化」,再選擇合適的模型。
資料先整理成一列一個縣市年度
原題的民國 104–109 年相當於西元 2015–2020 年。先統一年度、行政區及統計口徑,確認每個縣市每年只有一列。缺失值不等於 0,合併資料造成的重複列也不能直接丟進迴歸。
以下以 id 表示縣市代碼、year 表示年度,lfpr、sex_ratio、highedu_rate 分別代表勞參率、性別比與高學歷人口比。這是示範命名;先依自己的資料字典調整,本文沒有代入課程資料估計結果。
describe id year lfpr sex_ratio highedu_rate
isid id year
xtset id year
xtdescribe
xtsum lfpr sex_ratio highedu_rate
isid 用來檢查識別欄位是否唯一。若失敗,先查重複或缺漏的代碼;不要以刪到不報錯為目標。xtsum 則能幫忙分辨變數主要是在縣市之間不同,還是在縣市內隨時間變動。
固定效果與隨機效果在比較什麼
固定效果(FE)主要利用同一縣市隨時間的變動,控制該縣市不隨時間變化的未觀察特性。完全不隨時間改變的變數,無法在這種估計下另外辨識係數;它被省略不一定是程式錯誤。
隨機效果(RE)結合縣市內與縣市間的資訊,但需要額外假設:未觀察的縣市效果和模型中的解釋變數不相關。不是資料有抽樣、或縣市看起來很隨機,就可以選 RE。
先重現課程模型,再加入年度效果
* 課程的基本模型
xtreg lfpr sex_ratio highedu_rate, fe
xtreg lfpr sex_ratio highedu_rate, re
* 延伸規格:納入各年共同變化,按縣市群聚標準誤
xtreg lfpr sex_ratio highedu_rate i.year, fe vce(cluster id)
xtreg lfpr sex_ratio highedu_rate i.year, re vce(cluster id)
i.year 容許每一年有共同變動,和縣市固定效果是不同的控制。群聚標準誤則容許同一縣市不同年度的誤差相關,但縣市群聚數有限,推論仍須留意小樣本問題;這段延伸規格不是所有資料的通用答案。
結果要怎麼解讀
先核對觀察值數、縣市數、每縣市的年數與缺失情形,再讀係數、信賴區間及單位。如果人口比記成 0–100,增加 1 單位代表 1 個百分點;若記成 0–1,增加 0.01 才代表 1 個百分點。性別比也可能是每百名女性對應的男性數,不能一律當百分比。
FE 的係數是控制模型中其他項目後,縣市內變動與勞參率的關聯。它不能單憑統計顯著就被寫成因果效果,也不能拿來回答個人的教育程度如何改變就業選擇。
三個檢定不要混在一起
- 傳統 FE 輸出中的
F test that all u_i=0,在其誤差假設下比較個體效果是否可共同設為零;它不是 FE 與 RE 的選擇檢定。 - 傳統 Hausman 比較 FE 與 RE 的係數差異,須有相同樣本與可比較的規格。不拒絕虛無假設不代表已證明 RE 假設成立。
- 用了群聚或其他穩健標準誤後,不要直接套用傳統 Hausman 的結論。Stata 19 提供可搭配穩健推論的 Mundlak 檢定;舊版要另選相容方法。
交作業時應交代資料合併方式、變數單位、模型假設、標準誤處理與結果限制,而不是只選 p 值較小的模型。
參考:Stata xtreg 手冊、FE/RE 模型說明、Stata 19 的 CRE 與 Mundlak 檢定。可先閱讀Do 檔入門,把資料整理及估計寫成能重跑的流程。
原課程內容與影片
請利用政府公開資料,探討民國104年至109年間,各縣市之勞動參與率是否會受到性別比與高學歷(大專以上學歷)人口比之影響,若有影響,請問其影響為何?請使用固定效果模型與隨機效果模型分別分析之。另外,在使用固定效果模型時,請判斷是否存在Unobserved Heterogeneity的情形?
沒有留言:
張貼留言