quant-lit進階課程 ▸ Lesson 8

進階課程 · Lesson 8

Lesson 8:Overfitting 與 multiple testing

來源:Codex 製作

學習目標

1. Overfitting 是什麼

模型若學到歷史資料中的噪音,而非可重複結構,in-sample 很漂亮、out-of-sample 就崩解。交易策略特別危險,因為訊噪比低、regime 改變、成本非線性,而且研究者會反覆看結果再修改。

自由度不只來自模型參數,也包括:

即使最後規則只有兩個參數,若它是從數百個版本中挑出,effective trials(有效試驗次數)仍很高。

2. Multiple testing 的直覺

若一次檢驗在無效策略下有 5% 機率「看似顯著」,獨立測試 100 個無效策略,至少一個假陽性的機率為:

1 − (1 − 0.05)^100 ≈ 99.4%

真實策略彼此不獨立,所以不能直接套這個數字;但方向很清楚:試得越多,最佳回測越被幸運噪音抬高。

3. Research registry

在跑回測前記錄:

hypothesis_id:
提出日期:
經濟機制:
universe/期間/頻率:
固定資料版本:
預先指定參數範圍:
primary metric:
成本假設:
acceptance criteria:
所有嘗試與結果:

失敗策略也要保留。刪除失敗紀錄會讓未來研究者不知道同一資料已被反覆探勘。

4. 降低過度擬合的實務方法

5. PBO 與 DSR

Bailey、Borwein、López de Prado、Zhu 於 2015 年提出 Probability of Backtest Overfitting(PBO),以 combinatorially symmetric cross-validation 評估「樣本內勝出的設定在樣本外落後」的機率。

Deflated Sharpe Ratio(DSR)則嘗試修正 selection bias、multiple trials 與非正態報酬對 observed Sharpe 的膨脹。它們是研究診斷,不是通過即保證獲利的認證;輸入的 trial count、報酬分布與策略相依性若錯,輸出同樣會錯。

6. 紅旗

通關判準

你必須能回答:「這個策略是在多少個候選中被選出?哪些資料曾經影響過設計?」若答不出來,就不能把 reported Sharpe 當成單次檢驗結果。

上一課Lesson 7