1. Sigma Quant 預測甚麼?
模型的核心輸出是條件機率:在已知場次、馬匹和賽前資料下,估算不同結果發生的可能性。排名只是機率的排序結果,不能取代機率本身。
2. 資料來源與時間
分析可使用公開賽事紀錄、馬匹及賽事條件、歷史表現和可取得的市場資料。每份預測應記錄資料截點,避免把開賽後才出現的資訊帶入賽前評估。
- 賽事:日期、場地、路程、班次及跑道條件
- 馬匹:歷史賽績、評分、負磅、檔位及相關屬性
- 市場:指定時間點的公開賠率及其變化
- 資料治理:欄位定義、缺失值、異常值及版本記錄
3. 特徵與模型架構
特徵把原始資料轉化為模型可比較的訊號,例如近期表現、路程適應、步速特徵及市場隱含機率。Sigma Quant 可結合統計與機器學習組件,但模型複雜度必須以樣本外表現證明,而非以技術名詞包裝。
4. 機率估算與校準
分類準確率不足以評估概率模型。Sigma 的評估方向包括 Brier Score、Log Loss、預測概率分組後的實際發生率,以及 Expected Calibration Error(ECE)。
校準良好的模型不代表每場都猜中,而是長期而言,標示為某個機率範圍的事件以相近頻率發生。
5. 市場賠率與預測時間
公開賠率是市場資訊的一部分,不等同真實機率。比較模型與市場時,必須使用同一時間點的資料,並考慮彩池抽水、流動性及臨場變化。
6. 評估、限制與重現
可信的評估應分開回測、樣本外測試和即場預測,並保留模型版本、預測時間和完整樣本。結果不可只挑選表現良好的場次。
- 資料分佈會隨賽季、規則和參賽組合改變
- 突發事件可能不在賽前資料中
- 小樣本結果容易受隨機波動影響
- 任何過往表現都不保證未來結果