量化交易導論:金融數據、模型開發流程與資產類別|Quant Theory 第 1 講筆記
第 1 課・共 34 課
目錄
這是 Liu Peng 大學級量化交易課程(Quantitative Trading Strategies)第 1 週第 1 講的筆記,屬整套課程的概念起點。講者由「甚麼是量化交易」出發,講解四類金融數據、監督學習框架下的模型開發工作流程,以及機構算法交易的執行細節,最後導覽主要資產類別與衍生工具——其後二十多講的理論與實驗課,都建基於本講的框架之上。
學習重點
- 量化交易的定義:又稱算法交易,指按特定演算法自動產生買入或賣出訊號的交易活動;策略可簡可繁,核心離不開「低買高賣」。
- 交易決策的兩大支柱:輸入數據是否充足,以及模型是否穩健——只在歷史數據有效、面對未來失效的模型沒有價值。
- 四類金融輸入數據:市場狀態(tick 數據、買賣差價)、財經新聞(文字)、基本面(經濟與公司指標)、技術面(由價格衍生的指標)。
- 模型開發工作流程:訓練數據是「輸入—輸出」配對;模型由參數與架構組成;訓練目標是最小化預測與真實標籤之間的成本。
- 機構執行層面:大額訂單要拆細以降低執行風險與價格衝擊,配套概念包括滑點、暗池與冰山訂單。
詳細筆記
量化交易的定義:演算法驅動的買賣訊號
講者開宗明義:量化交易 Quantitative Trading 又稱算法交易 Algorithmic Trading,指按照特定演算法自動進行的交易活動,輸出只有兩類訊號——買入或賣出某項金融工具(可稱證券、資產)。至於「好策略」是甚麼,講者的答案刻意簡單:可以複雜、也可以簡單到只是低買高賣。以股票為例,在價格低點買入、高點賣出,兩者之間的差額就是利潤。以數式表達,買入價為 $P_{\text{buy}}$、賣出價為 $P_{\text{sell}}$,簡單回報率為:
$$R = \frac{P_{\text{sell}} - P_{\text{buy}}}{P_{\text{buy}}}$$買入即建立好倉 Long Position;反過來「高賣低買」則是淡倉 Short Position,即沽空:交易員手上沒有證券,先向他人借入並在市面賣出,若預測正確、價格其後下跌,再以低價買回歸還原主,賣出價與買回價之差就是利潤。兩個方向的經濟邏輯一致,分別只在先買後賣還是先賣後買。
講者接着點出全課的主軸:交易決策的質素取決於兩件事——輸入數據是否充足,模型無論簡單複雜都要靠數據訓練;模型是否穩健,即它不能只在歷史數據上有效,面對未來也要成立,因此需要回測驗證。這兩句話看似平實,實際上是整套課程反覆回到的兩條底線。
四類金融輸入數據
講者把量化模型的輸入數據分為四大類:
- 市場狀態 Market States:描述市場整體狀況的數據,最典型是 tick 數據——價格變動的最小單位。例如最小變動單位是一仙,價格便由 1.01 美元逐格跳到 1.02、1.03;每個價位附帶成交量,用來量度證券價格的上落。此類亦包括市場層面的因子,如買賣差價,講者預告會在第 2 週結合限價訂單簿詳細討論。
- 財經新聞 Financial News:以文字形式出現——新聞、分析報告、業績電話會議逐字稿等。文字數據較難分析,卻是許多研究的素材來源。
- 基本面 Fundamentals:包括整體經濟或行業狀況,以及公司層面的指標如收入、現金流、每股盈利——回答「公司做得好不好、大市做得好不好」的問題。
- 技術面 Technicals:由歷史價格序列衍生的技術指標,如移動平均線、隨機指標、特定時段內的波動程度,用來判斷價格向升還是向跌。

量化交易的整體流程
把數據與決策連起來,整個量化交易流程可概括為三層:輸入層匯集上述四類數據;中間是「引擎」——演算法、函數或模型——接收數據後自我訓練、從中尋找規律(機器學習正是訓練模型從數據中學習模式的範疇);輸出層是交易決策:買入/做多,或賣出/做空。流程圖如下:

模型開發工作流程:由訓練數據到映射函數
講者進一步拆解模型如何煉成。訓練數據以「輸入—輸出」配對形式出現,記作 $(X, y)$:輸入 $X$ 可以是歷史股價、市場指標、公司指標等任何相關特徵;輸出 $y$ 是想學習的目標,例如某資產明天的價格升跌方向。訓練的目的,是找出一個函數 $f$,把輸入映射為預測輸出:
$$\hat{y} = f(X)$$式中 $\hat{y}$(讀作 y-hat)代表預測值,帽號用以區分真實標籤 $y$。若模型夠好,把今天的市場指標餵進去,就能預測明天的走向;到了明天,真實結果揭曉,拿 $\hat{y}$ 與 $y$ 對照,差距就是模型好壞的客觀量度。這個函數 $f$ 亦稱映射函數 Mapping Function——模型的本質,就是把給定輸入正確映射到對應輸出的機器。
講者特別強調模型 $f$ 的兩個組成部分:
- 參數 Parameters:模型內部可學習、可調校的數值。小模型可能只有幾個參數,大型深度學習模型則以十億計,參數規模反映模型的潛在能力。
- 架構 Architecture:規定參數之間、以及參數與輸入數據如何連接,即資訊由 $X$ 流入模型、經過(機械式的)計算後產出 $\hat{y}$ 的路徑。架構在訓練前預先設定,訓練過程中一般不會改動。
有了預測 $\hat{y}$ 與真實標籤 $y$,便可計算成本 Cost(又稱損失),量化預測離真實有多遠。以 $N$ 個訓練樣本計,訓練目標可寫成:
$$\theta^{*} = \arg\min_{\theta} \; J(\theta), \qquad J(\theta) = \frac{1}{N} \sum_{i=1}^{N} L\big(\hat{y}_i,\, y_i\big)$$其中 $\theta$ 代表全部參數,$L$ 是單一樣本的誤差量度,$J$ 是整體成本函數;訓練就是尋找令成本最小的參數組合 $\theta^{*}$。具體的 $L$ 形式本講未有展開——以最常見的均方誤差為例即 $L(\hat{y}_i, y_i) = (\hat{y}_i - y_i)^2$。成本會回饋給優化演算法 Optimization Algorithm,由它反覆微調參數數值,直至預測盡量貼近目標。講者提醒一點:訓練的目標是在訓練數據上逼近零誤差,但這可能導致過度擬合——模型把歷史背得滾瓜爛熟,面對新數據卻束手無策。

機構算法交易:拆單、滑點、暗池與冰山訂單
理論之外,講者用一節交代機構層面的執行現實。機構的算法交易涉及龐大數量,若一張大單直接砸入市場,不但可能找不到足夠對手盤(執行風險),成交過程本身還會推高或壓低價格。因此標準做法是把大單拆成多張細單分批執行,並保持匿名,控制交易對市場的衝擊。相關的三個術語:
- 滑點 Slippage:意圖成交價與實際成交價之間的差異。打算在 1 美元賣出,實際成交價可高可低,差額就是滑點。
- 暗池 Dark Pool:能處理大額交易量的私人交易平台,訂單簿不公開,適合需要隱藏意圖的大單。
- 冰山訂單 Iceberg Order:公開盤面上只見小額訂單,水面下卻藏着龐大剩餘數量,成交後逐批補充——所見永遠只是冰山一角。

講者順帶提到成為量化交易員的條件:除了數學模型的理解與量化分析能力,還需要承受高壓工作環境的軟技能。
主要資產類別與衍生工具
本講最後部分是資產類別導覽。講者先界定衍生工具 Derivative:價值依附於更基本的相關資產之上的金融工具。這些工具都可在公開或私人市場買賣,可單一或組合持有,目的可以是謀利,也可以是風險管理(對沖)。逐類重點如下:
- 股票 Stocks/Equity:代表對發行公司按比例的所有權——總股數 100 股持有 10 股,即擁有公司 10%。獲利途徑有二:股價上升帶動持倉價值,以及定期或不定期派發的股息。
- 債券 Bonds:固定收益債務工具。投資者借錢給發行者,期內收取固定票息或浮動利息,到期收回本金。較股票穩定、風險較低,相應回報通常也較低。
- 年金 Annuities:與保險公司訂立的合約,換取未來的固定收入流,常見於退休規劃——例如退休後每月收取定額款項,為期十年、二十年以至終身,視乎產品類型。
- 現金及等價物 Cash and Equivalents:流動性最高的資產,通常指 90 天內到期的低風險低回投資,如銀行存款、短期美國國庫券、貨幣市場基金。特點是隨時可用,亦反映企業償付短期債務的能力。
- 商品 Commodities:黃金、石油、天然氣等基礎原材料,可在現貨市場直接買賣實物,也可經期貨、期權等衍生市場交易。
- 期貨 Futures:約定於未來指定日期、以預定價格與數量買賣資產的合約,雙方均有履約義務。例如鎖定一年後仍以每單位 100 買入,便消除了期間價格大幅波動的風險,是對沖價格變動的標準工具。期貨在交易所買賣;遠期合約 Forward 結構相似,分別在於遠期經場外交易(OTC)——不經中央交易所或經紀,雙方直接議價成交。
- 期權 Options:同樣約定未來以指定價格交易,但給予持有人的是權利而非義務——到期時可選擇行使或放棄。期貨是「必須做」,期權是「可以選擇做」。可用於對沖,也可用於投機,視乎方向。
- 貨幣 Currencies:經全球電子化的外匯市場(Forex)交易,以一種貨幣按當前匯率兌換另一種,交易者亦可押注貨幣對的走向獲利。
- 交易所買賣基金 ETF:一籃子證券(股票、債券、商品等)的集合投資,像普通股票一樣在交易所買賣;因已分散,一般視為比單一股票低風險。
- 房地產投資信託 REITs:持有、營運或融資收租物業的公司,投資者分享穩定租金收入,無須親自購置及管理物業。
- 互惠基金 Mutual Funds:同樣是證券組合,但只能在每個交易日收市後按當日計算的資產淨值 NAV 認購或贖回,不能如 ETF 般即市買賣。
- 對沖基金 Hedge Funds:追求高於平均的回報,策略範圍廣、頻率高、風險高,收費亦高於傳統基金。
🙏 覺得內容有用?本站所有內容免費提供,使用推薦碼開戶就是支持我們繼續營運的最大鼓勵:
ZA Bank 邀請碼 P20923
—— 你享 HKD 2,000 迎新獎賞,本站獲得營運支持。
立即開戶 →
(聯盟連結|投資涉及風險,受條款及細則約束,此資料僅可於香港境內分發)
欣利克的看法
- 量化交易不等於機器學習,這是本講最易誤讀的一點。 講者的定義其實很寬:任何按演算法產生買賣訊號的活動都是量化交易,一條「價格升穿 20 日均線就買入」的規則已經符合。機器學習只是「引擎」的其中一種選擇,模型複雜度應由數據與問題決定,不是由名氣決定。
- 訓練集零誤差不是目標,而是警號。 講者明言:訓練過程追求在訓練數據上逼近零誤差,「但這可能導致過度擬合」。一個把歷史每個轉折都背下來的模型,往往只是把雜訊當規律。本站在配對交易實戰一課示範過:不計手續費回報亮麗、計入成本後轉虧——理論訊號與可執行的利潤之間,永遠隔着交易成本。
- 本講的流程圖是整套課程的地圖,值得先記住再往下讀。 「輸入配對 $(X, y)$ → 映射函數 $f$ → 成本 $J(\theta)$ → 優化調參」這個循環,在之後講到統計套利、協整檢定、貝葉斯參數優化時會反覆出現,只是 $X$、$y$ 與 $L$ 的具體內容不同。學術課的價值,正在於提供這套通用框架檢視每個策略。
- 資料時效提醒: 影片於 2023 年初上載。數據分類、監督學習流程、資產類別等基本概念屬長期有效的知識,但市場微觀結構部分——暗池的監管要求、冰山訂單在高頻環境下的實際效果——隨規則與技術演變,引用時宜查閱最新資料。本站實作課《Python 量化交易策略筆記》可作對照:那邊是「寫出來、回測給你看」,這邊是「框架為何如此設計」,配合閱讀效果最好。
名詞解釋
- 滑點 Slippage:意圖成交價與實際成交價之間的偏差,大額訂單與波動市況下尤其明顯。
- 沽空 Short Selling:先借貨賣出、其後低價買回歸還,從價格下跌中獲利的操作。
- 回測 Backtesting:以歷史數據檢驗交易規則或模型假設是否成立的驗證方法。
- 暗池 Dark Pool:不公開訂單簿報價的私人交易平台,供機構執行大額訂單、減低市價衝擊。
- 冰山訂單 Iceberg Order:只顯示小部分數量的大額訂單,隱藏部分成交後逐批補充,掩飾真實交易規模。
- 期貨 Futures:約定未來指定日期以預定價格買賣資產的標準化合約,雙方均有履約義務。
- 期權 Option:賦予持有人於到期日或之前以指定價格買賣資產的權利而非義務的衍生合約。
- 外匯 Forex:全球電子化的貨幣兌換市場,交易者按匯率兌換貨幣或押注貨幣對走向。
常見問題 FAQ
量化交易一定要用機器學習嗎?
不一定。按講者的定義,只要交易訊號由演算法自動產生,已屬量化交易——一條簡單的均線突破規則同樣符合。機器學習是構建模型的一種方法,適合從大量數據中尋找複雜規律,但模型是否要用到機器學習,取決於數據性質與問題複雜度,並非必然。
做多和做空的利潤計法有何分別?
做多是先買後賣,利潤是賣出價減買入價;做空是先借貨賣出、其後買回歸還,利潤是賣出價減買回價,兩者都是「低買高賣」,只是時序相反。要注意做空涉及借貨安排與成本,且價格上升沒有上限,潛在虧損理論上無限。
期貨和期權最大的分別是甚麼?
在於義務與權利:期貨合約雙方到期必須按預定條款履約;期權買方則只有權利而無義務,市況不利時可以放棄行使,最大損失是已付的期權金。因此期權常被比喻為替持倉「買保險」的工具,期貨則是直接鎖定未來交易價格。
為甚麼模型在歷史數據上表現好,實戰卻失效?
講者歸結為模型穩健度問題:訓練過度追求在訓練數據上的零誤差,容易導致過度擬合——模型記住了歷史的雜訊而非真正的規律。這正是回測與樣本外驗證存在的原因:模型必須在未見過的數據上仍然成立,才有實戰價值。
原影片
本文整理自以下影片,版權屬原創作者所有,建議配合原片觀看: