SVM、隨機森林、神經網絡:三大機器學習模型原理與量化交易應用

第 28 課・共 34 課

⚠️ 本站內容僅作教育用途,不構成投資建議。投資涉及風險,作出任何投資決定前請諮詢持牌專業人士。
目錄

承接上一課的配對交易機器學習框架,本講(Liu Peng 課程第 12 講第 2 段)逐一拆解三種核心算法:支持向量機 SVM、隨機森林 Random Forest 與神經網絡 Neural Network。講者的目標很清晰:理解每種模型的數學原理與超參數取捨,才知道在預測價差時該用哪一件工具、如何調校。

學習重點

詳細筆記

支持向量機:核函數與最大邊界

講者指出,支持向量機 Support Vector Machine(SVM)是深度學習興起之前最廣泛使用的算法之一,在數據科學競賽社群尤其流行,因為它同時勝任分類與回歸任務,表現穩定而靈活。

SVM 的核心操作有兩步。第一步是映射:透過核函數 Kernel Function,把特徵由原始特徵空間映射到高維特徵空間。為何要這樣做?因為在原始空間中難以線性分隔的數據,升到高維後往往更容易找到一個能清楚分隔類別的超平面 Hyperplane。第二步是優化:在眾多可行超平面中,SVM 選擇令兩類數據之間邊界 Margin 最大的那一個。設超平面為 $\mathbf{w}^\top\mathbf{x} + b = 0$,兩側邊界到超平面的距離與 $\|\mathbf{w}\|$ 成反比,因此最大邊界問題可寫成:

$$\max_{\mathbf{w},\,b} \frac{2}{\|\mathbf{w}\|} \quad \text{等價於} \quad \min_{\mathbf{w},\,b} \tfrac{1}{2}\|\mathbf{w}\|^2$$

講者強調,這個「最大邊界」原則正是 SVM 泛化表現好的根源:決策面與最近的數據點保持最大距離,模型對訓練數據的微擾不敏感,過度擬合 Overfitting 訓練集的風險自然降低,在測試集上的表現亦較穩定。

SVM 原理:核函數映射與最大邊界

截圖出自原片(Liu Peng):SVM 以核函數映射數據,再按最大邊界原則尋找分隔超平面。

支持向量回歸:ε 不敏感損失

配對交易的目標變數是價差 Spread——一個連續變數——因此實務上用的是 SVM 的回歸版本,即支持向量回歸 Support Vector Regression(SVR)。此時超平面本身就是預測函數,任務變成:尋找一個盡量貼近實際數據的超平面,同時控制模型複雜度。

一般回歸以平方誤差和作成本函數:

$$\mathrm{SSE} = \sum_{i=1}^{n} \left( y_i - \hat{y}_i \right)^2$$

但講者提醒,把 SSE 直接推向零是危險的——訓練誤差為零幾乎必然意味模型已把雜訊一併記住,即典型的過度擬合。SVR 的解法是引入 ε 不敏感損失 ε-insensitive Loss:只要預測誤差不超過 ε 這個緩衝帶,就不予計罰:

$$L_\epsilon(y, \hat{y}) = \max\left(0,\; |y - \hat{y}| - \epsilon\right)$$

與此相關的幾個術語:位於超平面兩側、距離 ε 之內的數據點稱為支持向量 Support Vectors;由支持向量可畫出兩條距離超平面 ε 的決策邊界;兩條邊界之間是容忍區 Tolerance Zone,模型對區內誤差視而不見;落在邊界以外的點則構成邊界違規 Margin Violation,SVR 的優化目標正是把這些違規最小化。

SVR 圖解:超平面、決策邊界與容忍區

截圖出自原片(Liu Peng):SVR 的超平面、兩條決策邊界、ε 容忍區與邊界違規點。

ε 的取捨:複雜度與精度之間

ε 是一個由使用者在訓練前設定的超參數,講者稱之為容忍參數,其選擇直接決定模型的性格:

換言之,ε 是預測精度與模型複雜度之間的調節旋鈕。實務上的調校方法是以交叉驗證反覆試驗多個候選值,選取平均表現最好的一個——這與上一課講及的格點搜尋 Grid Search 思路一脈相承。

隨機森林:集成學習與隨機抽樣

第二種算法是隨機森林 Random Forest,屬於集成模型 Ensemble Model:由大量簡單的子模型——決策樹 Decision Tree——組合而成。每棵樹的訓練數據都經過雙重隨機抽樣:行方向隨機抽選觀測值,列方向隨機抽選特徵。舉例來說,原始數據集有 1000 個觀測、10 個特徵,第一棵樹可能只用隨機抽出的 100 個觀測和 5 個特徵來訓練,第二棵樹再重新抽一次,如此類推。這個過程稱為 bagging(bootstrap aggregation)。

最終預測取全體樹的平均(回歸)或多數投票(分類)。設第 $t$ 棵樹的預測為 $f_t(\mathbf{x})$,森林的輸出為:

$$\hat{y} = \frac{1}{T} \sum_{t=1}^{T} f_t(\mathbf{x})$$

講者用了一個生動比喻:行政總裁手下有一班各自獨立工作的顧問,最終決策就是把各顧問的建議平均或投票得出。雙重隨機抽樣的用意正在於確保「顧問」之間的獨立性——各樹所用的數據子集與特徵子集不同,彼此的預測相關性低,平均之後方差下降,整體模型比任何單一決策樹更穩健。這正是集成學習「三個臭皮匠」的數學基礎:平均只在子模型夠獨立時才有效。

隨機森林:集成多棵決策樹

截圖出自原片(Liu Peng):隨機森林以 bagging 訓練多棵決策樹,取平均作最終預測。

神經網絡:由感知機出發

第三種算法是神經網絡 Neural Network,由多層互連的節點(神經元)組成。每個神經元是一個函數:接收上一層的輸入,執行非線性轉換,把輸出傳向下一層。每個神經元帶有一組權重,即網絡的參數;訓練神經網絡,本質上就是調校這些權重,令預測準確並能泛化到測試集。

網絡的基本單元稱為感知機 Perceptron,一個感知機完成兩步運算。第一步是加權總和:對 $p$ 維輸入 $\mathbf{x} \in \mathbb{R}^p$,各特徵乘上對應權重再求和,另加一個偏置 Bias(又稱截距)項,對加權總和作整體平移:

$$z = \sum_{i=1}^{p} w_i x_i + b = \mathbf{w}^\top \mathbf{x} + b$$

講者補充,偏置可以理解為人工加入一列全為 1 的欄位再乘上權重 $b$,不過主流框架會自動處理。第二步是非線性轉換:把 $z$ 送入激活函數 Activation Function $\phi$,得到感知機的輸出:

$$f(\mathbf{x}) = \phi\left( \mathbf{w}^\top \mathbf{x} + b \right)$$

ReLU:最常用的激活函數

眾多激活函數之中,ReLU 激活函數 Rectified Linear Unit(線性整流單元)最為流行,數學形式簡潔:

$$\phi(x) = \max(0, x) = \begin{cases} 0 & \text{若 } x \leq 0 \\ x & \text{若 } x > 0 \end{cases}$$

它是一個閾值開關:輸入高於零時原值通過,低於零時靜音歸零。講者指出其形狀與認購期權的 payoff 函數如出一轍,對學過期權的讀者應不陌生。

ReLU 長期穩居首選的原因有二。其一是梯度計算快:神經網絡的訓練依靠在優化循環中反覆計算梯度來調校權重,激活函數的梯度越易算,訓練越快;ReLU 在正區間梯度恆為 1,負區間恆為 0,幾乎沒有計算成本。其二是引入非線性:這一點至關重要——如果整個網絡只做加權總和而不加非線性轉換,多層線性函數疊加起來仍等於一個線性模型,層數再多也無法擬合複雜關係。激活函數正是賦予網絡逼近能力的關鍵部件。ReLU 亦衍生出多種變體,但憑上述兩點優勢,至今仍是主流框架的預設選項之一。

感知機拆解:加權總和與 ReLU

截圖出自原片(Liu Peng):感知機可拆解為加權總和加偏置,再經 ReLU 作非線性轉換。

三種模型的定位小結

講者沒有明示優劣排名,但由原片脈絡可整理出三者的分工:SVM/SVR 在中小樣本上表現穩定,核函數處理非線性的能力強,但 ε、核函數等超參數須仔細調校;隨機森林對特徵縮放不敏感、抗過度擬合能力好,訓練可大規模並行,代價是模型體積與可解釋性;神經網絡表達能力最強、可堆疊成深層架構,但參數量龐大,對數據量與調參經驗要求最高。在配對交易預測價差的場景中,三者都是可行的候選,後續章節將進入實作與比較。

🙏 覺得內容有用?本站所有內容免費提供,使用推薦碼開戶就是支持我們繼續營運的最大鼓勵:

ZA Bank 邀請碼 P20923 —— 你享 HKD 2,000 迎新獎賞,本站獲得營運支持。 立即開戶 → (聯盟連結|投資涉及風險,受條款及細則約束,此資料僅可於香港境內分發)

欣利克的看法

名詞解釋

常見問題 FAQ

SVM 和 SVR 有什麼分別?

兩者是同一算法的分類與回歸版本。分類版 SVM 尋找能以最大邊界分隔不同類別的超平面;回歸版 SVR 則把超平面直接用作預測函數,並引入 ε 不敏感損失——誤差在 ε 緩衝帶內不予計罰,藉此避免把平方誤差推向零而導致過度擬合。配對交易預測連續的價差水平,用的正是 SVR。

隨機森林為什麼要對數據和特徵雙重隨機抽樣?

目的是確保各決策樹之間的獨立性。如果所有樹都用相同的數據和特徵訓練,它們的預測會高度相關,平均之後無法降低方差,集成便形同虛設。雙重隨機抽樣(bagging)令各樹看到不同的「局部世界」,預測誤差低度相關,平均後整體模型才比單一決策樹更穩健。

神經網絡沒有激活函數會怎樣?

會退化成一個線性模型。多層線性運算(加權總和)疊加起來,數學上仍等價於單層線性變換,無論疊多少層都無法擬合非線性關係。激活函數(如 ReLU)在每層引入非線性轉換,正是神經網絡強大表達能力的來源。

ReLU 為什麼是最流行的激活函數?

主要有兩個原因。第一,梯度計算極快:ReLU 在正區間梯度恆為 1、負區間恆為 0,令反向傳播的優化循環效率大增。第二,它以極簡形式引入非線性,且形狀類似認購期權的 payoff 函數——輸入高於閾值時原值通過,低於閾值時歸零。ReLU 還有多種變體可應對不同訓練問題。

原影片

本文整理自以下影片,版權屬原創作者所有,建議配合原片觀看:

來源:https://www.youtube.com/watch?v=PDQ-sg9HoyE

🏦 ZA Bank 開戶優惠

本站所有內容免費提供。多使用網站的推薦碼,就是對我們繼續製作優質內容的最大鼓勵和支持 🙏

去 ZA Bank 開戶,享價值 HKD 2,000 迎新獎賞,仲有機會享 USD 30 指定美股兌換券!

  • 💛 全線上開戶,無需前往分行
  • 💛 無最低存款要求,零賬戶管理費
  • 💛 24x7 銀行服務

專屬邀請碼:P20923

立即開戶 → (聯盟連結)