SIGMA QUANT INSIGHTS

賽馬概率模型 Calibration(校準)是甚麼?

模型校準是比較預測機率與實際發生頻率是否一致。若模型把一批馬匹評為約 30% 勝率,長期實際勝率也應接近 30%。校準不等於每場命中,也不等於排序能力;可信模型需要同時評估兩者。

可靠度圖如何閱讀?

把預測按機率區間分組,橫軸是平均預測機率,縱軸是實際發生率。點接近對角線表示較校準;但每個區間也應顯示樣本量或信賴區間。

概率校準的概念示例
預測機率組別 校準良好時的長期觀察 不代表
約 10% 在足夠樣本中,實際發生率接近 10% 每十次固定出現一次
約 20% 在足夠樣本中,實際發生率接近 20% 今次一定不會發生
約 30% 在足夠樣本中,實際發生率接近 30% 單場結果可證明模型準確

概念示例而非 Sigma Quant 結果。正式研究仍需列出每組樣本量、信賴區間、分析期及模型版本。

Brier Score 與 Log Loss

Brier Score 是預測機率與實際 0/1 結果之間平方誤差的平均。Log Loss 對極度自信卻錯誤的預測懲罰更大。兩者均應與市場或簡單基準比較。

ECE 有甚麼限制?

Expected Calibration Error 把各機率分組誤差加權平均,但結果受分組方法和樣本量影響。報告 ECE 時應同時展示分組規則和可靠度圖。

校準與排序能力是兩個問題

模型可以很會排序,卻把所有概率報得過高;也可以整體校準接近,但無法有效區分高低機會。前者在排名指標可能看似理想,實際概率不可靠;後者則缺乏選擇能力。

因此評估應同時查看可靠度圖、Brier Score 或 Log Loss,以及排序或市場基準。任何一個數字都不能獨立描述整個模型。

可靠度圖需要樣本量與區間

把概率分組後,每組實際率會受樣本量影響。只有十次觀察的一組,即使實際率與預測相差很大,也可能主要是抽樣波動;大量觀察仍持續偏離,才更值得關注。

正式圖表應顯示每組樣本數、分箱方法及不確定區間,並按模型版本和評估期分開。Sigma 的研究發布閘門要求這些欄位,避免用一條平滑曲線掩蓋資料稀疏。

QUICK ANSWERS

常見問題

校準良好是否代表可以獲利?

不代表。即使概率準確,市場價格、抽水和決策規則仍會影響結果。

可以用訓練資料計算校準嗎?

可以診斷,但不能證明泛化能力。主要結論應來自未參與訓練和調整的樣本外資料。