可靠度圖如何閱讀?
把預測按機率區間分組,橫軸是平均預測機率,縱軸是實際發生率。點接近對角線表示較校準;但每個區間也應顯示樣本量或信賴區間。
| 預測機率組別 | 校準良好時的長期觀察 | 不代表 |
|---|---|---|
| 約 10% | 在足夠樣本中,實際發生率接近 10% | 每十次固定出現一次 |
| 約 20% | 在足夠樣本中,實際發生率接近 20% | 今次一定不會發生 |
| 約 30% | 在足夠樣本中,實際發生率接近 30% | 單場結果可證明模型準確 |
概念示例而非 Sigma Quant 結果。正式研究仍需列出每組樣本量、信賴區間、分析期及模型版本。
Brier Score 與 Log Loss
Brier Score 是預測機率與實際 0/1 結果之間平方誤差的平均。Log Loss 對極度自信卻錯誤的預測懲罰更大。兩者均應與市場或簡單基準比較。
ECE 有甚麼限制?
Expected Calibration Error 把各機率分組誤差加權平均,但結果受分組方法和樣本量影響。報告 ECE 時應同時展示分組規則和可靠度圖。
校準與排序能力是兩個問題
模型可以很會排序,卻把所有概率報得過高;也可以整體校準接近,但無法有效區分高低機會。前者在排名指標可能看似理想,實際概率不可靠;後者則缺乏選擇能力。
因此評估應同時查看可靠度圖、Brier Score 或 Log Loss,以及排序或市場基準。任何一個數字都不能獨立描述整個模型。
可靠度圖需要樣本量與區間
把概率分組後,每組實際率會受樣本量影響。只有十次觀察的一組,即使實際率與預測相差很大,也可能主要是抽樣波動;大量觀察仍持續偏離,才更值得關注。
正式圖表應顯示每組樣本數、分箱方法及不確定區間,並按模型版本和評估期分開。Sigma 的研究發布閘門要求這些欄位,避免用一條平滑曲線掩蓋資料稀疏。