Sigma Quant 數據庫包含哪些資料層?
資料庫按分析用途分成四個主要層次。賽事層描述日期、場地、場次及賽事條件;馬匹層保存可核對的身份和歷史表現;市場層記錄指定時間點的可用賠率;模型層保存版本、預測時間及概率輸出。這些資料不應在缺少時間或來源標記時混合使用。
| 資料層 | 主要內容 | 公開用途 | 目前邊界 |
|---|---|---|---|
| 賽事與結果 | 日期、場地、場次、途程、賽事條件及名次 | 解釋賽事背景及核對結果 | 以來源定義及使用權為準 |
| 馬匹歷史 | 公開馬匹編號、名稱及完整歷史紀錄 | 建立歷史摘要和同場比較 | 馬匹頁須通過新鮮度與授權閘門 |
| 市場資料 | 指定時間點的 Win、Place、Q、QP 等可用值 | 研究市場隱含機率與變化 | 記錄值不等同官方收市賠率 |
| 模型輸出 | 概率、排名、時間戳及模型版本 | 評估校準及保存賽前證據 | 未驗證來源包絡時不發布永久快照 |
本表是資料目錄,不是資料下載或第三方資料再分發聲明。
為何資料時間比欄位數量更重要?
賽馬資料會隨時間更新。退出馬匹、場地狀況、賠率和其他賽前資訊可能在同一日多次改變。若模型使用 T-30 資料,評估時就不能把 T-2 或賽後才知道的欄位加入,否則會造成資料洩漏。
Sigma Quant 的資料設計把資料截點、預測時間和模型版本視為分析的一部分。只有在來源、日期、場地、參賽名單和輸出內容屬於同一個可驗證包絡時,雜湊才可以作為該次預測的來源證據。
- 賽前資料:只包括預測截點前可取得的欄位
- 即場資料:必須標示更新時間,不能回填為較早預測
- 賽後資料:用於結果核對,不應改寫已保存的賽前輸出
哪些資料不會在公開目錄展示?
本頁不展示會員身份、付款、聯絡或帳戶資料,也不公開內部工程特徵、私有代碼、模型參數或未獲授權再分發的逐行第三方資料。公開摘要只在資料新鮮度、身份映射、來源權利及內容完整性均通過檢查後出現。
這個邊界有助讀者分辨「可理解的方法與摘要」和「受限制的原始或衍生資料」。方法透明不等於公開所有專有程式碼;同樣,擁有資料副本也不自動代表有權公開。
數據庫如何連接研究、預測與方法論?
目前賽事頁使用資料層產生伺服器端的公開概率預覽;方法論頁解釋特徵、概率與評估;研究頁列出公開研究必須具備的樣本、來源和版本證據。日後通過發布閘門的馬匹頁、會議快照和研究資料集會從本目錄連出,並自動進入 sitemap。
- 目前賽事資料:查看可公開的模型概率與資料截點
- 方法論:了解資料如何轉化為特徵和概率
- 研究:查看資料集、分析版本、限制及可重現證據
- 表現:分開回測、樣本外和實際賽前預測