SIGMA QUANT INSIGHTS

香港賽馬數據品質為何比模型複雜度重要?

賽馬數據品質決定模型實際學到甚麼。馬名或代碼對應錯誤、欄位定義轉變、賽後資料混入賽前樣本,以及缺失值處理不一致,都可以令複雜模型產生精確但錯誤的結果。資料版本和驗證規則通常比增加模型層數更重要。

常見資料問題

退出馬匹、改場地、缺失賠率、重複紀錄、文字編碼和名稱別名都會影響合併結果。若沒有檢查,錯誤可能被模型視為真實訊號。

時間一致性

每個欄位都應記錄在預測時是否可得。賽後名次、最終分段或開賽後修訂資料不得進入賽前模型評估。

Sigma 的資料治理方向

保存來源、擷取時間、清理版本和模型輸入指紋,可以讓同一場預測日後被核對。當來源缺失或定義不明,應標示限制而非自動補成看似完整的數字。

實體解析錯誤會污染整條資料鏈

馬匹名稱可能重複、譯名可能改變,內部代碼亦未必等於公開馬匹編號。若以名稱或錯誤代碼合併資料,一匹馬的賽績可能被放到另一匹馬,之後的特徵、模型和公開頁面都會受影響。

Sigma 的公開馬匹頁以唯一公開編號建立網址,並把它與內部 H-code 分開。名稱後綴改變時按公開編號導向正確 canonical;未通過來源、完整度和授權檢查的實體不會進入 sitemap。

賽馬資料品質檢查示例
檢查 失敗風險 安全處理
日期與場地一致 把未知場地誤標成沙田 未知或衝突時停止發布
公開 ID 唯一 同名馬合併 以官方編號作獨立命名空間
時間早於開跑 賽後資料洩漏進賽前預測 保存完整時區時間戳並 fail closed

此表描述資料治理規則,不公開 Sigma 的專有特徵。

資料版本與模型版本不能混用

CSV 雜湊或資料修訂號可以證明輸入檔案是哪一版,但不能代表產生概率的模型版本。相反,模型版本亦不能證明使用了哪一份賽事資料。兩者必須分開保存。

可核對的證據頁應同時記錄原始來源雜湊、快照寫入時間和穩定模型版本。缺少任何一項時,可以保留內部草稿或回顧資料,但不應宣稱為已驗證賽前預測。

QUICK ANSWERS

常見問題

缺失值可以直接填零嗎?

通常不可以,因為零可能有實際含義。應按欄位原因選擇缺失標記、統計填補或排除,並在驗證中測試影響。

資料越多是否一定越好?

不一定。更多錯誤、洩漏或定義不一致的資料可能降低可靠性。