SIGMA QUANT INSIGHTS

機器學習如何用於香港賽馬分析?

賽馬機器學習把歷史賽事轉化為可訓練樣本,使用馬匹、賽事和市場特徵估算結果機率。真正困難的部分通常不是選擇最複雜演算法,而是確保資料時間正確、沒有洩漏、評估期獨立,以及輸出經過概率校準。

從原始資料到模型

流程通常包括欄位定義、資料清理、特徵建立、時間切分、模型訓練、校準和樣本外評估。任何一步使用未來資訊,都可能令回測失真。

甚麼是資料洩漏?

資料洩漏是模型在訓練或預測時接觸到當時不可得的資訊。例如用最終賠率評估一個聲稱在 T-30 產生的模型,便可能把後來的市場資訊帶入。

深度學習是否必然較好?

不必然。複雜模型可以捕捉非線性關係,但亦更容易過度擬合。只有在相同資料和獨立測試下持續優於簡單基準,複雜度才有實際價值。

合理的驗證方式是按時間向前

賽馬資料有明確時間順序。隨機把同一季賽事拆入訓練與測試,可能讓相近時間的馬匹狀態或重複實體跨越兩邊,得出過度樂觀的分數。較合理做法是只用過去訓練,再預測較後期間。

每次重訓亦要保存特徵定義與模型版本。否則今天重算去年的賽事,可能使用當時不存在的資料或更新後的映射,不能稱為真正樣本外預測。

賽馬模型驗證設計比較
設計 主要風險 較合適用途
隨機切分 時間與實體訊息可能洩漏 早期除錯,不宜單獨支持公開表現
按時間留後 較接近實際,但只反映一個時段 樣本外基準
滾動向前 計算與版本管理較複雜 檢查不同季節和市場狀態的穩定性

方法比較,不是 Sigma Quant 的未公開模型架構或成績。

Sigma 如何選擇模型複雜度?

模型應以樣本外概率品質、穩定性、延遲及可監察程度比較,而不是按名稱判斷。複雜模型若只在回測多出少量分數,卻對缺失值、版本漂移或運算時間更敏感,實際價值未必更高。

公開方法論只描述資料類型、驗證、校準和限制,不披露可被濫用的專有特徵或程式碼。透明度的重點是能評估主張,而不是公開整套商業模型。

QUICK ANSWERS

常見問題

模型需要多少歷史資料?

沒有固定答案,取決於特徵數量、賽制變化和評估目標。應以學習曲線及跨時期穩定性判斷。

可以用單一準確率比較模型嗎?

不建議。概率模型應同時比較 Log Loss、Brier Score、校準和市場基準。