協整 Cointegration 與配對交易:Engle-Granger、ADF 檢定與 Z-score 訊號生成
第 23 課・共 34 課
目錄
協整 Cointegration 是配對交易的統計地基:兩隻股票的價格各自漂移、看似無跡可尋,但只要它們的某個組合長期穩定,價差偏離後就有「被拉回來」的性質,均值回歸策略才可成立。本講是 Liu Peng 量化交易學術課第 10 週第二講,也是全課公式最密的一講——講者由非平穩的問題講起,完整走過 Engle-Granger 兩步檢定、ADF 單位根測試,最後把價差標準化成 Z-score,推導出配對交易的進出場規則。
學習重點
- 非平穩數據的致命傷:統計分析假設底層參數固定,而股票價格的均值、方差隨時間漂移,直接做統計推斷不可靠。
- 協整不等於相關:相關只代表同向移動;協整要求兩條非平穩序列存在一個平穩的線性組合,這才是價差會回歸的數學保證。
- 兩大檢定路線:Johansen 檢定直接尋找平穩線性組合;Engle-Granger 檢定先做 OLS 回歸,再對殘差(即價差)做 ADF 單位根檢定。
- Z-score 訊號生成:價差減均值、除以標準差,把「偏離多少」換算成「多少個標準差」,進場門檻 ±2、平倉區間 ±1。
- 假設檢定的方向:ADF 的虛無假設是「非平穩」,拒絕虛無假設才代表平穩、才代表協整——方向解讀錯,結論就完全相反。
詳細筆記
為何非平穩數據做不了統計分析
講者開宗明義:要研究的兩隻股票,其價格序列很可能是非平穩 non-stationary 的。非平穩的意思是序列的統計性質不是固定常數,而是隨時間不斷改變——今天的均值和一年後的均值可以完全不同。
這對統計分析是致命傷。統計推斷的基本假設,是底層參數(均值、方差等)固定不變,我們才能用樣本去估計它們。一旦參數本身在漂移,估計出來的數字就沒有穩定的對象可言,任何建基其上的分析都不可靠。所以對價格序列做任何策略之前,第一步必須處理平穩性問題——而協整正是「兩條非平穩序列如何變出一條平穩序列」的答案。
協整與相關是兩個不同概念
講者特別點出:相關 correlation 與協整是不同的概念。相關只量度兩條序列同向移動的程度——兩隻股票可以相關系數極高,卻各自越走越遠,價差永不收窄。協整的要求嚴格得多:它要求存在一個線性組合(例如價差),這個組合本身是平穩的、圍繞固定均值波動。只有後者才保證偏離是暫時的、會被拉回均衡,這正是配對交易賴以成立、而單靠相關篩選標的會踩坑的分別。
兩條檢定路線:Johansen 與 Engle-Granger
講者用一張流程圖交代全講框架:輸入是兩條非平穩的價格序列,輸出是一條平穩的價差序列,再由價差比較短期波動與長期均衡,生成進出場訊號。由輸入到輸出有兩條路線:

- Johansen 檢定:直接尋找兩個資產的線性組合 $z_t = y_t - \beta x_t$,令合成出來的序列 $z_t$ 平穩。輸入非平穩數據,輸出平穩時間序列;若這樣的組合存在,兩資產即協整。
- Engle-Granger 檢定:先在兩資產之間建立線性回歸模型,把回歸殘差識別為兩者的價差,再檢定殘差是否平穩。
兩條路線的共同終點,都是得到一條「理應平穩」的價差序列。講者補充,得出價差後還可用 ADF 一類檢定確認其平穩性:設定顯著性門檻,通過門檻即代表序列在特定統計顯著性下平穩。有了平穩價差,策略的本質就是比較短期波動與長期均衡關係——辨認出暫時性的市場波動,從而制定策略、生成具體的進場與出場點。
線性回歸:價差的數學來源
講者先補回歸基礎。線性回歸假設兩個變量之間存在固定的線性關係:
$$y_t = \beta_0 + \beta_1 x_t + \varepsilon_t$$其中 $y_t$ 是目標變量(dependent variable),可理解為第一隻股票的價格;$x_t$ 是自變量(independent variable),即第二隻股票的價格;$\beta_0$ 是截距、$\beta_1$ 是斜率,兩者決定那條回歸直線——這正是「線性」回歸得名的原因。關鍵在最後一項 $\varepsilon_t$:它是誤差項,代表線性模型解釋不了的一切,例如模型遺漏了的其他因素 $x_2$、$x_3$。誤差項同時用來衡量模型好壞——誤差越小,模型擬合越好。
把上式移項:
$$\varepsilon_t = y_t - (\beta_0 + \beta_1 x_t)$$講者點出核心:這條誤差序列就是價差 spread,也就是線性回歸模型的殘差。所以「計算價差」與「計算回歸殘差」是同一件事,交易訊號正是由這條序列生成。
Engle-Granger 兩步檢定

Engle-Granger 檢定是兩步過程:
- 估計回歸系數:以一隻股票為因變量、另一隻為自變量,用普通最小平方法(OLS)估計 $\beta_0$ 與 $\beta_1$,把一個變量對另一個變量做回歸。
- 計算殘差並檢定平穩性:殘差即真實值減預測值,$\hat{\varepsilon}_t = y_t - \hat{y}_t$。把殘差視為一條時間序列,用單位根檢定測試它是否平穩。
結論的判讀很乾脆:殘差平穩,兩隻股票協整;殘差不平穩,兩者不協整。協整成立,代表兩者的價差存在長期均衡關係,才可以依靠價差生成交易訊號。
單位根與 ADF 檢定
甚麼是單位根 unit root?講者的解釋是:自相關程度達到一——當前時點的值與上一時點的值幾乎完全相關。以一階自回歸模型表示:
$$x_t = \rho x_{t-1} + u_t$$當 $|\rho| = 1$,序列帶單位根,呈隨機遊走、非平穩;當 $|\rho| < 1$,舊值的影響會逐漸消退,序列平穩。檢定協整時,我們當然希望殘差沒有單位根。
實務上用增廣迪基—富勒檢定 ADF test,它把問題改寫成對差分的回歸:
$$\Delta x_t = \alpha + \gamma x_{t-1} + \sum_{i=1}^{p} \delta_i \, \Delta x_{t-i} + u_t$$虛無假設是 $\gamma = 0$(存在單位根、序列非平穩),對立假設是 $\gamma < 0$(平穩)。要特別記住這個方向:ADF 的虛無假設是「非平穩」,所以拒絕虛無假設——p 值夠小——才是平穩的證據,也才是兩資產協整的證據。
平穩序列與正態分佈

講者正式定義:平穩時間序列 stationary time series 是統計性質——均值、方差、不同時點之間的協方差——全部為常數、不隨時間改變的序列。無論截取哪段時間窗來看,計出來的均值一樣、方差一樣、協方差一樣。
平穩的價差大致服從正態分佈 normal distribution。正態分佈由兩個參數完全決定:均值 $\mu$ 與標準差 $\sigma$,其密度函數為:
$$f(x; \mu, \sigma) = \frac{1}{\sqrt{2\pi\sigma^2}} \, e^{-\frac{(x-\mu)^2}{2\sigma^2}}$$講者強調這只是正態分佈的定義,指數函數裏的 $\sigma^2$ 與前置因子的 $\sigma^2$ 互相呼應。數學背景到此齊備:價差平穩 → 大致正態分佈 → 偏離均值多遠可以用標準差量度。
Z-score:標準化與假設檢定
最後一步是把價差轉換成 Z 分數 z-score。本質上這只是一個標準化技術——不同價差各有尺度,標準化後才能放在同一尺度比較:
$$z = \frac{x - \mu}{\sigma}$$原值減去均值、再除以標準差,答案就是「當日價差偏離均值多少個標準差」。經過這個變換,價差服從標準正態分佈。
標準正態分佈有個關鍵數字:$\pm 1.96$ 對應 95% 的機率,兩邊尾部各佔 5%。講者借機講解假設檢定的邏輯:若虛無假設為真,觀察值落入尾部屬於小概率事件——發生的機會極小——所以一旦落入,我們傾向認為虛無假設本身是錯的,予以拒絕,改為接受對立假設;放在協整檢定的語境,對立假設正是「兩個資產協整」。
由 Z-score 到配對交易訊號

講者示範的進出場規則以 Z-score 門檻制定:
- $z > 2$:價差高於均值兩個標準差以上。由於價差是「股票一減股票二」,差值過高意味股票一相對偏貴、長遠會回落,於是做空股票一、做多股票二。
- $z < -2$:反向操作,做多股票一、做空股票二。
- $-1 < z < 1$:價差回到相對正常範圍,兩邊持倉全部平掉。講者強調這是保護措施——股價急速移動可能逆倉而行,要在造成傷害之前離場,所以這條線同時兼任止蝕與鎖定利潤的功能,是出場訊號。
- 介乎 $\pm 1$ 與 $\pm 2$ 之間:維持原有持倉,繼續賺取暫時性市場波動帶來的回歸利潤。
整套邏輯環環相扣:非平穩的兩條價格 → 協整檢定得出平穩價差 → 正態分佈假設 → Z-score 量度偏離 → 門檻化為機械式進出場規則。
🙏 覺得內容有用?本站所有內容免費提供,使用推薦碼開戶就是支持我們繼續營運的最大鼓勵:
ZA Bank 邀請碼 P20923
—— 你享 HKD 2,000 迎新獎賞,本站獲得營運支持。
立即開戶 →
(聯盟連結|投資涉及風險,受條款及細則約束,此資料僅可於香港境內分發)
欣利克的看法
- 協整與相關的分界是本講最值錢的一頁。部分實作教學只用相關系數篩選標的,但相關高只代表走勢同向,不代表價差有回歸力;兩隻股票可以長期高度相關而價差持續擴大。協整要求「組合平穩」這個強得多的條件,才是均值回歸的數學保證。學員宜記住:相關是必要參考,協整才是入場許可證。
- ADF 的假設方向最易解讀顛倒。一般檢定裏「拒絕虛無假設」代表發現效應,但 ADF 的虛無假設是「存在單位根、非平穩」——拒絕它才等於平穩、才等於協整。初學者常見誤區是見到 p 值大就以為「關係顯著」,其實剛好相反:p 值大代表無法拒絕非平穩,該組合不可用作均值回歸。寫程式呼叫現成函數時,務必先看清楚文件寫明虛無假設是哪一邊。
- 本講與 Saleh 實作課正好互補。第 8 課裏 Saleh 用一行
are_cointegrated完成檢定,明言「數學從簡」;第 18 課則記錄實盤改良。本講補上的正是那行函數背後的完整推導——回歸、殘差、單位根、假設檢定方向。建議兩邊對照:學術課給你判斷工具是否適用的能力,實作課給你看工具落地時的取捨。 - 協整關係會破裂,檢定亦會誤判,這是截至 2026 年中文獻的共識。協整用歷史樣本估計,公司基本面、行業結構改變可令關係失效,須定期重新檢定。檢定力(test power)問題同樣不容忽視:樣本太短時 ADF 檢定容易誤判——把非平穩誤判為平穩(假陽性)或反之,前者對配對交易尤其危險,因為它直接導致錯誤的入場許可。門檻 ±2 亦非金科玉律,只是講者的示範設定。
名詞解釋
- 協整 Cointegration:兩條非平穩序列存在平穩線性組合的性質,配對交易的統計基礎。
- 平穩性 Stationarity:時間序列的均值、方差、協方差不隨時間改變的性質。
- 單位根 Unit Root:自回歸系數等於一的非平穩特徵,序列呈隨機遊走。
- ADF 檢定 Augmented Dickey-Fuller Test:單位根檢定,虛無假設為非平穩,拒絕虛無假設才是平穩的證據。
- 恩格爾—格蘭傑檢定 Engle-Granger Test:兩步協整檢定——OLS 回歸後對殘差做單位根檢定。
- 約翰森檢定 Johansen Test:直接尋找平穩線性組合的協整檢定,可處理多個資產。
- 價差 Spread:兩資產價格的差距,即回歸殘差,配對交易的交易對象。
- Z 分數 Z-score:價差偏離均值的標準差倍數,用來生成進出場訊號。
- 均值回歸 Mean Reversion:價格偏離均衡後傾向回歸的現象,本策略的利潤來源。
- 統計套利 Statistical Arbitrage:以統計方法識別定價偏離並套取收斂利潤的策略家族。
- 配對交易 Pairs Trading:同時做多一隻、做空另一隻協整資產的市場中性策略。
常見問題 FAQ
協整同相關有甚麼分別?
相關只量度兩條序列同向移動的程度,協整則要求兩條非平穩序列存在一個平穩的線性組合。兩隻股票可以高度相關但價差持續擴大、永不收窄,這種組合做均值回歸會持續虧損;只有通過協整檢定,價差才有數學上的回歸保證。簡單說:相關看「方向」,協整看「差距會否回來」。
Engle-Granger 與 Johansen 檢定應該用哪個?
講者的框架是兩者並列:Engle-Granger 兩步法概念直觀、實作簡單,適合兩個資產的單一協整關係,也是本講詳細示範的方法;Johansen 檢定建基於向量自回歸框架,可同時處理多於兩個資產、估計多重協整關係,理論較完整但設定較複雜。只做傳統一對一配對交易,Engle-Granger 已足夠;涉及一籃子資產的組合,才需要 Johansen。
為甚麼要用 Z-score 而不直接用價差做訊號?
不同股票組合的價差各有尺度——甲組合的價差波動可能是 5 元,乙組合可能是 0.5 元——直接用原始價差設門檻,每個組合都要重新摸索,也無法互相比較。Z-score 把偏離換算成「多少個標準差」,所有組合統一用 ±2 進場、±1 出場這類同一套規則,訊號才有可比性,也方便程式化執行。
通過協整檢定是否代表配對交易必然賺錢?
不是。檢定只用歷史數據證明過去存在協整關係,不保證未來繼續成立——基本面改變可令關係破裂;檢定本身亦有誤判機會,樣本不足時可能把非平穩誤判為平穩。即使關係真實存在,持倉期間價差仍可繼續擴大,令浮虧加深。這也是講者在出場規則中加入 ±1 平倉保護線的原因,而嚴謹的做法是定期重新檢定協整關係。
原影片
本文整理自以下影片,版權屬原創作者所有,建議配合原片觀看: