![]()
系列簡介
這是我們一系列原創技術貼,從易到難,每天學習一點。所有內容均為疾控數據分析、科研論文相關,或者說很多和現在的熱門監測預警相關,所以我們這個系列就叫“監測預警基礎”。
今天是第43節,這算是我們一個小專題吧,大概11講,我們細化,短篇化,徹底把ARIMA模型搞懂。
今天是學透ARIMA專題第4講的內容,拆開每一部分講,這樣就徹底清楚了。
上一篇我們學習了 ARIMA 定階的核心工具,但很多新手還是會犯嘀咕:
AR、MA 這兩個模型,到底分別在擬合什么規律?難道要先做 AR 才有 MA?兩個模型合在一起的 ARMA,又解決了什么問題?
這一篇我們就把三個基礎模型徹底拆開講,全程用傳染病監測場景舉例,避開復雜數學推導,看完就能搞懂每個模型的本質,以及階數 p、q 的實際含義。
![]()
1. 大白話本質理解
AR 是 Autoregression(自回歸)的縮寫,核心邏輯非常簡單:用過去幾期的真實發病數,來預測當期的發病數
這個邏輯完全貼合我們對傳染病的常識:傳染病發病有連續性,本周的病例數,一定和前幾周的病例數直接相關 —— 上周病例多,本周大概率不會突然降下來;上周進入流行期,本周會繼續上升。
2. 模型公式與疾控場景解讀
p 階自回歸模型記作 AR (p),公式非常好懂:
![]()
我們用疾控的場景對應翻譯如下:
![]()
3. 現在來理解一下,P階到底是什么意思?
p 就是自回歸的階數,p 等于幾,就代表模型用了前幾期的發病數來預測當期
AR (1):只用上周 1 期的病例數預測本周,適合連續性極強的序列
AR (2):用上周 + 上上周 2 期的病例數預測本周
AR (3):用前三周的病例數預測本周
在疾控實際數據里,流感、手足口這類有連續流行趨勢的傳染病,大多符合低階 AR 模型的特征,一般 p 在 1-3 之間就足夠。
4. 對應定階特征:
呼應上一篇的知識點:AR (p) 模型的 PACF 圖(偏自相關圖)會在 p 階截尾,ACF 圖呈拖尾狀態。比如平穩序列的 PACF 在第 3 階之后全部落入置信區間,我們就初步判斷是 AR (3) 模型,p=3。
![]()
MA 是整個 ARIMA 體系里最容易被誤解的模型,我們先澄清兩個最常見的誤區:
第一,MA 的 “移動平均”,不是對病例數的滑動平均,和我們之前講的做數據平滑用的 7 天移動平均完全不是一回事;
第二,MA 是完全獨立的模型,不需要先做 AR 才能得到殘差,不存在 “先 AR 后 MA” 的先后順序。
1. 大白話本質
MA 是 Moving Average(移動平均)的縮寫,它的核心邏輯是:用過去幾期的突發隨機沖擊,來預測當期的發病數
什么是突發隨機沖擊?就是不在常規流行趨勢里的意外因素,也是疾控工作里最常見的變量:
正沖擊:某周突然出現學校聚集性疫情、境外輸入病例引發本地傳播、大規模篩查檢出大量病例。
負沖擊:某周恰逢假期檢測量驟降、防控措施落地快速壓制了傳播。
這些突發因素的影響,不會只持續 1 周。比如一次學校聚集疫情,當周會出現大量病例,第二周還會有續發病例,第三周影響才完全消失 ——MA 模型捕捉的,就是這種 “突發沖擊的滯后影響”。
2. 模型公式與疾控場景解讀
q 階移動平均模型記作 MA (q),公式如下:
我們采用疾控常見的場景翻譯一下:
![]()
3. q 階到底是什么意思?
q 就是移動平均的階數,q 等于幾,就代表突發沖擊的影響會持續 q 期
MA (1):突發沖擊只影響當期和下一期,第二周就完全消失
MA (2):突發沖擊會持續影響兩期,第三周才消失
MA (q):沖擊的影響持續 q 期
4. 大家最關心的問題:這些沖擊(ε)從哪來?
理論上,這些隨機沖擊是構成時間序列的原生因素,是我們假設的、影響發病的意外變量;實操中,軟件擬合 MA 模型時,會通過迭代算法,一邊計算沖擊的權重 θ,一邊同步推算出每一期的沖擊值,全程不需要我們手動計算,也不需要依賴 AR 模型的結果 —— 你只需要輸入原始發病數據,指定 q 的階數,軟件就能自動完成全部計算。
5. 對應定階特征
同樣呼應上一篇知識點:MA (q) 模型的 ACF 圖(自相關圖)會在 q 階截尾,PACF 圖呈拖尾狀態。比如平穩序列的 ACF 在第 2 階之后全部落入置信區間,我們就初步判斷是 MA (2) 模型,q=2。
![]()
1. 為什么需要組合模型?
單獨的 AR 模型,只能捕捉 “發病自身的延續趨勢”;單獨的 MA 模型,只能捕捉 “突發沖擊的滯后影響”。
但我們疾控的真實監測數據,往往兩種規律同時存在:
比如流感流行期,病例數既有自身的持續上升趨勢(AR 項捕捉);同時又會受到聚集疫情、寒潮、假期等突發因素的干擾,沖擊的影響會持續數周(MA 項捕捉)。
這時候單獨用 AR 或者 MA,都沒法完整擬合數據的規律,就需要把兩者結合起來,也就是 ARMA 模型。
2. 模型本質
ARMA (p,q) = AR (p) + MA (q),同時用「前 p 期的發病數」和「前 q 期的突發沖擊」,共同預測當期的發病數。
它的公式就是把兩個模型拼在一起,同時包含自回歸項和移動平均項,兼顧了序列的自身延續性和突發波動的滯后影響,是適配性最強的基礎平穩序列模型。
3. 對應定階特征
當 ACF 圖和 PACF 圖都呈現拖尾狀態,沒有明顯的截尾時,就說明序列同時有自回歸和移動平均特征,適合用 ARMA (p,q) 組合模型。
![]()
我總結一下,大家可以記住一個最樸素的區分:AR 是 “用過去的病情,推現在的病情”,看的是發病的延續性;MA 是 “用過去的意外,推現在的病情”,看的是突發因素的滯后影響。
很多新手會陷入 “必須手動定階完美” 的誤區,盯著 ACF/PACF 圖反復糾結 p 和 q 到底選幾。
這里給大家兩個疾控建模的實用建議:
第一,手動定階只是初步參考:真實監測數據很少有理論上完美的截尾,初步定出 p 和 q 的范圍就可以,比如 p 可能是 2 或 3,q 可能是 0 或 1;
第二,最終用 AIC 準則篩選最優模型:把初步范圍內的組合都試一遍,選 AIC 值最小的模型,就是擬合效果最優的。后面我們講實操的時候,會教大家用auto.arima()函數一鍵完成自動篩選,非常方便。
到這里,我們已經把 AR、MA、ARMA 三個平穩序列模型,以及差分(d)都講完了。
下一篇我們就把三個參數 p、d、q 合在一起,串起完整的 ARIMA (p,d,q) 建模全流程,給大家一套標準化的 5 步建模法,拿到任何監測數據,都知道從哪下手、每一步做什么。
參考:
《時間序列分析-基于R》. [M] .王燕.中國人民大學出版社出版
傳染病預測預警技術及實踐案例分析. [M]. 楊鵬, 王小莉. 人民衛生出版社
![]()
![]()
編輯:普通疾控人 | 審核:詩酒趁年華
文章來源 | 原創
說明 | 轉載只為分享,如有侵權聯系刪除
?版權聲明 | 部分信息和圖片來自公開網絡
轉載請注明
再次轉載請注明出處
![]()
科普健康 | 宣傳疾控
本號為多位疾控機構從業者運營
重點關注國內外健康事件
致力于疾控科普
在做好科普服務大眾的同時
做好疾控機構的宣傳
讓更多的人了解疾控,擁抱健康
歡迎加「小編」微信(cdcjkr126com)
本文具體說明
本文為原創內容,文章為個人理解所學,不涉及疫情信息及內部保密數據,發表的目的為自我總結及給有需求的人士學習使用。如有不妥之處,歡迎聯系小編修改、刪除。
更多精彩視頻,盡在“CDC疾控人”視頻號
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.