量化交易導論:金融數據、模型開發流程與資產類別|Quant Theory 第 1 講筆記

第 1 課・共 34 課

⚠️ 本站內容僅作教育用途,不構成投資建議。投資涉及風險,作出任何投資決定前請諮詢持牌專業人士。
目錄

這是 Liu Peng 大學級量化交易課程(Quantitative Trading Strategies)第 1 週第 1 講的筆記,屬整套課程的概念起點。講者由「甚麼是量化交易」出發,講解四類金融數據、監督學習框架下的模型開發工作流程,以及機構算法交易的執行細節,最後導覽主要資產類別與衍生工具——其後二十多講的理論與實驗課,都建基於本講的框架之上。

學習重點

詳細筆記

量化交易的定義:演算法驅動的買賣訊號

講者開宗明義:量化交易 Quantitative Trading 又稱算法交易 Algorithmic Trading,指按照特定演算法自動進行的交易活動,輸出只有兩類訊號——買入或賣出某項金融工具(可稱證券、資產)。至於「好策略」是甚麼,講者的答案刻意簡單:可以複雜、也可以簡單到只是低買高賣。以股票為例,在價格低點買入、高點賣出,兩者之間的差額就是利潤。以數式表達,買入價為 $P_{\text{buy}}$、賣出價為 $P_{\text{sell}}$,簡單回報率為:

$$R = \frac{P_{\text{sell}} - P_{\text{buy}}}{P_{\text{buy}}}$$

買入即建立好倉 Long Position;反過來「高賣低買」則是淡倉 Short Position,即沽空:交易員手上沒有證券,先向他人借入並在市面賣出,若預測正確、價格其後下跌,再以低價買回歸還原主,賣出價與買回價之差就是利潤。兩個方向的經濟邏輯一致,分別只在先買後賣還是先賣後買。

講者接着點出全課的主軸:交易決策的質素取決於兩件事——輸入數據是否充足,模型無論簡單複雜都要靠數據訓練;模型是否穩健,即它不能只在歷史數據上有效,面對未來也要成立,因此需要回測驗證。這兩句話看似平實,實際上是整套課程反覆回到的兩條底線。

四類金融輸入數據

講者把量化模型的輸入數據分為四大類:

  1. 市場狀態 Market States:描述市場整體狀況的數據,最典型是 tick 數據——價格變動的最小單位。例如最小變動單位是一仙,價格便由 1.01 美元逐格跳到 1.02、1.03;每個價位附帶成交量,用來量度證券價格的上落。此類亦包括市場層面的因子,如買賣差價,講者預告會在第 2 週結合限價訂單簿詳細討論。
  2. 財經新聞 Financial News:以文字形式出現——新聞、分析報告、業績電話會議逐字稿等。文字數據較難分析,卻是許多研究的素材來源。
  3. 基本面 Fundamentals:包括整體經濟或行業狀況,以及公司層面的指標如收入、現金流、每股盈利——回答「公司做得好不好、大市做得好不好」的問題。
  4. 技術面 Technicals:由歷史價格序列衍生的技術指標,如移動平均線、隨機指標、特定時段內的波動程度,用來判斷價格向升還是向跌。

四類金融輸入數據:市場狀態、財經新聞、基本面、技術面(截圖出自原片(Liu Peng))

量化交易的整體流程

把數據與決策連起來,整個量化交易流程可概括為三層:輸入層匯集上述四類數據;中間是「引擎」——演算法、函數或模型——接收數據後自我訓練、從中尋找規律(機器學習正是訓練模型從數據中學習模式的範疇);輸出層是交易決策:買入/做多,或賣出/做空。流程圖如下:

量化交易流程:四類數據輸入模型,輸出買賣決策(截圖出自原片(Liu Peng))

模型開發工作流程:由訓練數據到映射函數

講者進一步拆解模型如何煉成。訓練數據以「輸入—輸出」配對形式出現,記作 $(X, y)$:輸入 $X$ 可以是歷史股價、市場指標、公司指標等任何相關特徵;輸出 $y$ 是想學習的目標,例如某資產明天的價格升跌方向。訓練的目的,是找出一個函數 $f$,把輸入映射為預測輸出:

$$\hat{y} = f(X)$$

式中 $\hat{y}$(讀作 y-hat)代表預測值,帽號用以區分真實標籤 $y$。若模型夠好,把今天的市場指標餵進去,就能預測明天的走向;到了明天,真實結果揭曉,拿 $\hat{y}$ 與 $y$ 對照,差距就是模型好壞的客觀量度。這個函數 $f$ 亦稱映射函數 Mapping Function——模型的本質,就是把給定輸入正確映射到對應輸出的機器。

講者特別強調模型 $f$ 的兩個組成部分:

有了預測 $\hat{y}$ 與真實標籤 $y$,便可計算成本 Cost(又稱損失),量化預測離真實有多遠。以 $N$ 個訓練樣本計,訓練目標可寫成:

$$\theta^{*} = \arg\min_{\theta} \; J(\theta), \qquad J(\theta) = \frac{1}{N} \sum_{i=1}^{N} L\big(\hat{y}_i,\, y_i\big)$$

其中 $\theta$ 代表全部參數,$L$ 是單一樣本的誤差量度,$J$ 是整體成本函數;訓練就是尋找令成本最小的參數組合 $\theta^{*}$。具體的 $L$ 形式本講未有展開——以最常見的均方誤差為例即 $L(\hat{y}_i, y_i) = (\hat{y}_i - y_i)^2$。成本會回饋給優化演算法 Optimization Algorithm,由它反覆微調參數數值,直至預測盡量貼近目標。講者提醒一點:訓練的目標是在訓練數據上逼近零誤差,但這可能導致過度擬合——模型把歷史背得滾瓜爛熟,面對新數據卻束手無策。

模型開發工作流程:訓練數據、模型(參數+架構)、預測、成本與優化的循環(截圖出自原片(Liu Peng))

機構算法交易:拆單、滑點、暗池與冰山訂單

理論之外,講者用一節交代機構層面的執行現實。機構的算法交易涉及龐大數量,若一張大單直接砸入市場,不但可能找不到足夠對手盤(執行風險),成交過程本身還會推高或壓低價格。因此標準做法是把大單拆成多張細單分批執行,並保持匿名,控制交易對市場的衝擊。相關的三個術語:

機構算法交易:大單拆細、滑點、暗池與冰山訂單(截圖出自原片(Liu Peng))

講者順帶提到成為量化交易員的條件:除了數學模型的理解與量化分析能力,還需要承受高壓工作環境的軟技能。

主要資產類別與衍生工具

本講最後部分是資產類別導覽。講者先界定衍生工具 Derivative:價值依附於更基本的相關資產之上的金融工具。這些工具都可在公開或私人市場買賣,可單一或組合持有,目的可以是謀利,也可以是風險管理(對沖)。逐類重點如下:

🙏 覺得內容有用?本站所有內容免費提供,使用推薦碼開戶就是支持我們繼續營運的最大鼓勵:

ZA Bank 邀請碼 P20923 —— 你享 HKD 2,000 迎新獎賞,本站獲得營運支持。 立即開戶 → (聯盟連結|投資涉及風險,受條款及細則約束,此資料僅可於香港境內分發)

欣利克的看法

名詞解釋

常見問題 FAQ

量化交易一定要用機器學習嗎?

不一定。按講者的定義,只要交易訊號由演算法自動產生,已屬量化交易——一條簡單的均線突破規則同樣符合。機器學習是構建模型的一種方法,適合從大量數據中尋找複雜規律,但模型是否要用到機器學習,取決於數據性質與問題複雜度,並非必然。

做多和做空的利潤計法有何分別?

做多是先買後賣,利潤是賣出價減買入價;做空是先借貨賣出、其後買回歸還,利潤是賣出價減買回價,兩者都是「低買高賣」,只是時序相反。要注意做空涉及借貨安排與成本,且價格上升沒有上限,潛在虧損理論上無限。

期貨和期權最大的分別是甚麼?

在於義務與權利:期貨合約雙方到期必須按預定條款履約;期權買方則只有權利而無義務,市況不利時可以放棄行使,最大損失是已付的期權金。因此期權常被比喻為替持倉「買保險」的工具,期貨則是直接鎖定未來交易價格。

為甚麼模型在歷史數據上表現好,實戰卻失效?

講者歸結為模型穩健度問題:訓練過度追求在訓練數據上的零誤差,容易導致過度擬合——模型記住了歷史的雜訊而非真正的規律。這正是回測與樣本外驗證存在的原因:模型必須在未見過的數據上仍然成立,才有實戰價值。

原影片

本文整理自以下影片,版權屬原創作者所有,建議配合原片觀看:

來源:https://www.youtube.com/watch?v=W0IFrZDRP3M

🏦 ZA Bank 開戶優惠

本站所有內容免費提供。多使用網站的推薦碼,就是對我們繼續製作優質內容的最大鼓勵和支持 🙏

去 ZA Bank 開戶,享價值 HKD 2,000 迎新獎賞,仲有機會享 USD 30 指定美股兌換券!

  • 💛 全線上開戶,無需前往分行
  • 💛 無最低存款要求,零賬戶管理費
  • 💛 24x7 銀行服務

專屬邀請碼:P20923

立即開戶 → (聯盟連結)