常見資料問題
退出馬匹、改場地、缺失賠率、重複紀錄、文字編碼和名稱別名都會影響合併結果。若沒有檢查,錯誤可能被模型視為真實訊號。
時間一致性
每個欄位都應記錄在預測時是否可得。賽後名次、最終分段或開賽後修訂資料不得進入賽前模型評估。
Sigma 的資料治理方向
保存來源、擷取時間、清理版本和模型輸入指紋,可以讓同一場預測日後被核對。當來源缺失或定義不明,應標示限制而非自動補成看似完整的數字。
實體解析錯誤會污染整條資料鏈
馬匹名稱可能重複、譯名可能改變,內部代碼亦未必等於公開馬匹編號。若以名稱或錯誤代碼合併資料,一匹馬的賽績可能被放到另一匹馬,之後的特徵、模型和公開頁面都會受影響。
Sigma 的公開馬匹頁以唯一公開編號建立網址,並把它與內部 H-code 分開。名稱後綴改變時按公開編號導向正確 canonical;未通過來源、完整度和授權檢查的實體不會進入 sitemap。
| 檢查 | 失敗風險 | 安全處理 |
|---|---|---|
| 日期與場地一致 | 把未知場地誤標成沙田 | 未知或衝突時停止發布 |
| 公開 ID 唯一 | 同名馬合併 | 以官方編號作獨立命名空間 |
| 時間早於開跑 | 賽後資料洩漏進賽前預測 | 保存完整時區時間戳並 fail closed |
此表描述資料治理規則,不公開 Sigma 的專有特徵。
資料版本與模型版本不能混用
CSV 雜湊或資料修訂號可以證明輸入檔案是哪一版,但不能代表產生概率的模型版本。相反,模型版本亦不能證明使用了哪一份賽事資料。兩者必須分開保存。
可核對的證據頁應同時記錄原始來源雜湊、快照寫入時間和穩定模型版本。缺少任何一項時,可以保留內部草稿或回顧資料,但不應宣稱為已驗證賽前預測。