從原始資料到模型
流程通常包括欄位定義、資料清理、特徵建立、時間切分、模型訓練、校準和樣本外評估。任何一步使用未來資訊,都可能令回測失真。
甚麼是資料洩漏?
資料洩漏是模型在訓練或預測時接觸到當時不可得的資訊。例如用最終賠率評估一個聲稱在 T-30 產生的模型,便可能把後來的市場資訊帶入。
深度學習是否必然較好?
不必然。複雜模型可以捕捉非線性關係,但亦更容易過度擬合。只有在相同資料和獨立測試下持續優於簡單基準,複雜度才有實際價值。
合理的驗證方式是按時間向前
賽馬資料有明確時間順序。隨機把同一季賽事拆入訓練與測試,可能讓相近時間的馬匹狀態或重複實體跨越兩邊,得出過度樂觀的分數。較合理做法是只用過去訓練,再預測較後期間。
每次重訓亦要保存特徵定義與模型版本。否則今天重算去年的賽事,可能使用當時不存在的資料或更新後的映射,不能稱為真正樣本外預測。
| 設計 | 主要風險 | 較合適用途 |
|---|---|---|
| 隨機切分 | 時間與實體訊息可能洩漏 | 早期除錯,不宜單獨支持公開表現 |
| 按時間留後 | 較接近實際,但只反映一個時段 | 樣本外基準 |
| 滾動向前 | 計算與版本管理較複雜 | 檢查不同季節和市場狀態的穩定性 |
方法比較,不是 Sigma Quant 的未公開模型架構或成績。
Sigma 如何選擇模型複雜度?
模型應以樣本外概率品質、穩定性、延遲及可監察程度比較,而不是按名稱判斷。複雜模型若只在回測多出少量分數,卻對缺失值、版本漂移或運算時間更敏感,實際價值未必更高。
公開方法論只描述資料類型、驗證、校準和限制,不披露可被濫用的專有特徵或程式碼。透明度的重點是能評估主張,而不是公開整套商業模型。