進階課程 · Lesson 8
模型若學到歷史資料中的噪音,而非可重複結構,in-sample 很漂亮、out-of-sample 就崩解。交易策略特別危險,因為訊噪比低、regime 改變、成本非線性,而且研究者會反覆看結果再修改。
自由度不只來自模型參數,也包括:
即使最後規則只有兩個參數,若它是從數百個版本中挑出,effective trials(有效試驗次數)仍很高。
若一次檢驗在無效策略下有 5% 機率「看似顯著」,獨立測試 100 個無效策略,至少一個假陽性的機率為:
1 − (1 − 0.05)^100 ≈ 99.4%
真實策略彼此不獨立,所以不能直接套這個數字;但方向很清楚:試得越多,最佳回測越被幸運噪音抬高。
在跑回測前記錄:
hypothesis_id:
提出日期:
經濟機制:
universe/期間/頻率:
固定資料版本:
預先指定參數範圍:
primary metric:
成本假設:
acceptance criteria:
所有嘗試與結果:
失敗策略也要保留。刪除失敗紀錄會讓未來研究者不知道同一資料已被反覆探勘。
Bailey、Borwein、López de Prado、Zhu 於 2015 年提出 Probability of Backtest Overfitting(PBO),以 combinatorially symmetric cross-validation 評估「樣本內勝出的設定在樣本外落後」的機率。
Deflated Sharpe Ratio(DSR)則嘗試修正 selection bias、multiple trials 與非正態報酬對 observed Sharpe 的膨脹。它們是研究診斷,不是通過即保證獲利的認證;輸入的 trial count、報酬分布與策略相依性若錯,輸出同樣會錯。
你必須能回答:「這個策略是在多少個候選中被選出?哪些資料曾經影響過設計?」若答不出來,就不能把 reported Sharpe 當成單次檢驗結果。