2026-10-05 · Mystique Sports 玄機波馬 研究團隊

沙田排位偏差:如何用公開數據自己驗證,而不是聽人講

「內檔著數」講了幾十年——但你親手算過嗎?本文給出一套任何人都能複現的驗證流程。

「常識」值得被懷疑

「沙田 1000 米內檔著數」「跑 1600 排外檔蝕晒」——這類說法在馬迷圈流傳了幾十年。問題不是它們對不對,而是:引用的人幾乎從未親手驗證過。

排位偏差(draw bias)恰恰是賽馬數據分析裡最適合入門的題目:數據公開、變數單純、方法標準。本文示範一套任何人都能複現的驗證流程。我們不給結論——我們給方法,結論你自己算。

第一步:界定問題,愈窄愈好

「沙田有沒有排位偏差」是一個壞問題,因為它把太多不同條件混在一起。正確的做法是切片:

  • 場地:沙田(草地)——不要混快活谷,更不要混全天候跑道
  • 途程:1000m、1200m、1400m、1600m、1800m、2000m 分開算——起步點、彎道數目、直路長度完全不同
  • 班次/讓賽:先不分,但記錄下來做敏感性檢查
  • 時間範圍:至少三季,且標明是否橫跨跑道工程或欄位設置(A/B/C 欄)改變

一個合格的分析單元長這樣:「2023–24 至 2025–26 馬季,沙田草地,1000 米,全部賽事」。

第二步:定義「贏」的基線

假設無偏差:一場 14 匹的賽事,每個檔位的期望勝率 = 1/14 ≈ 7.1%。但要注意兩件事:

  1. 出賽馬數不同:把每場的「每檔期望勝率 = 1/該場出賽馬數」逐場計算再加總,而不是粗暴用平均場均馬數。
  2. 並非每個檔位都常滿:14 檔在 1000m 的出現頻率遠低於 1–5 檔。比較的應該是「該檔位實際勝率」對「該檔位在同等條件下的期望勝率」。

第三步:統計檢定——卡方只是起點

**卡方檢定(chi-square)**回答的是:「各檔位勝出次數的分佈,與無偏差假設下的期望,差異是否超出運氣範圍?」

但 p-value 達標(例如 < 0.05)只是入場券,還要看:

  • 效應量(effect size):統計顯著 ≠ 實際有用。某檔位勝率 8.5% 對期望 7.1%,即使顯著,幅度也未必有意義。
  • 置信區間:每個檔位的勝率用二項分佈置信區間(如 Wilson interval)表達。樣本 200 場和 800 場,區間寬度差一倍。
  • 樣本量預算:想檢出「7.1% vs 9%」這種幅度的偏差,粗略需要數百場同條件賽事——三季沙田 1000m 未必夠,這時應該老實寫「證據不足」,而不是硬下結論。

第四步:三個最常見的陷阱

陷阱一:多重比較

14 個檔位 × 6 個途程 × 2 個馬場 = 168 個假設。用 0.05 顯著性門檻,純運氣也會「中」約 8 個。必須做多重比較校正(如 Bonferroni 或 FDR),否則你找到的「偏差」只是噪音。

陷阱二:忽略混淆變數

好馬是否系統性地獲編好檔?在讓賽裡不會(檔位抽籤),但騎練選擇會——當抽籤結果公布後,練馬師可能按檔位決定跑法甚至退賽。更乾淨的做法是控制馬匹實力:用賠率隱含機率做分層,再看同實力層內的檔位效應。

陷阱三:用舊結論套新場地

跑道會變:保養方式、欄位設置(A/B/C 欄)、掛牌場地(好地/黏地)都會改變偏差形態。按場地狀況分層,並對最近兩季加權,比十年平均更有參考價值。

第五步:把結果變成可複現的表格

一份誠實的排位偏差報告只需四欄:

檔位 出賽次數 勝率(95% CI) 期望勝率 比值

配上數據範圍、檢定方法、校正方法,任何人都能用同一批公開賽果重算一遍。這就是本站的標準:方法公開,結論可複現。

與模型的關係

在我們的系統裡,排位不是獨立「貼士」,而是進入模型的眾多特徵之一,其權重由歷史數據決定,並用 Brier 分數持續校準(見〈Brier 分數〉)。單一因素的「常識」值多少錢,校準曲線會老實告訴你。


本文僅供研究與教育用途,不構成任何投注建議。賽馬涉及風險,18+。數據來源:公開賽果;統計方法如上,歡迎複現。

感謝閱讀。如對研究方法有疑問,歡迎透過會員中心的「聯絡研究團隊」與我們交流。

← 回到研究隨筆列表