模型校準報告
在 1068 場世界盃樣本中,模型最高機率結果整體校準較好:Brier 0.5628,ECE 3.6%。同一套 walk-forward 測試的勝平負命中率為 57.4%。這些是機率,不是保證。
世界盃比賽
回測屆數
最高機率結果命中率
Brier 分數
期望校準誤差
報告更新日期
可引用定義:校準用於檢查預測機率和真實發生頻率是否接近。一個校準良好的 60% 預測,在足夠大的樣本中應接近 60% 發生。
這代表什麼
模型在 40-80% 置信度區間表現最穩定,預測機率和世界盃真實結果大致貼合。非常高置信度分桶的歷史樣本更少,因此需要更謹慎解讀。簡單說:60-70% 的選擇歷史上像強熱門,但不是穩贏。
按置信度分桶的可靠性
每一行把賽前最高預測機率落在同一區間的比賽放在一起。例如 60-70% 分桶回答的是:當模型最高選擇約為三分之二機率時,它實際發生了多少次?
| 模型置信度 | 比賽 | 平均模型機率 | 真實命中率 | 差距 |
|---|---|---|---|---|
| 0-10% | 0 | — | — | — |
| 10-20% | 0 | — | — | — |
| 20-30% | 0 | — | — | — |
| 30-40% | 105 | 38.6% | 35.2% | -3.3% |
| 40-50% | 302 | 45.0% | 49.0% | +4.0% |
| 50-60% | 272 | 54.8% | 56.3% | +1.5% |
| 60-70% | 187 | 64.9% | 68.5% | +3.5% |
| 70-80% | 128 | 74.4% | 72.7% | -1.8% |
| 80-90% | 58 | 84.5% | 74.1% | -10.3% |
| 90-100% | 16 | 93.2% | 68.8% | -24.4% |
可靠性圖
樣本很少的分桶波動較大。本報告中 90-100% 分桶只有 16 場比賽,因此不要過度解讀它的差距。
方法
我們按日期順序重放資料集裡的每一場國際比賽(49,520 場)。在每場歷史世界盃比賽前,模型只使用當時已經可用的 Elo,然後用真實賽果更新評分,不使用未來資訊。
機率模型使用 Elo + Poisson:eloToGoals=0.0022,基礎進球 1.35,僅在非中立場加入 100 點主場優勢。本報告覆蓋 1930 到 2026 年的 23 屆世界盃。
比賽資料來自開源 martj42/international_results 資料集(1872 年以來的國際比賽);2026 世界盃賽程來自 TheSportsDB。22 屆世界盃回測已在 GitHub 開源。
英超校準(分資料集)
英超使用獨立引陣列(baseGoals 1.35,主場優勢 50 Elo 當量)。在嚴格 out-of-sample 協議下(引數僅在 2019–24 校準,2024-25、2025-26 兩季純測試),模型在 760 場中命中 51.3%、Brier 0.6083;同期去水市場基線為 51.4% / 0.5951。
FAQ
模型校準是什麼意思?
校準檢查預測機率是否匹配真實結果。如果模型給很多球隊 60% 機率,這些預測在足夠大樣本中應接近 60% 命中。
包含多少場比賽?
本報告使用 1068 場世界盃正賽比賽,覆蓋 1930 到 2026 年的 23 屆賽事,並使用不偷看未來的 walk-forward 測試。
如何閱讀置信度分桶?
每個分桶比較模型賽前給出的機率和真實發生率。40-80% 區間最有參考價值;高置信度分桶樣本較少,需要謹慎。
校準好的機率能保證結果嗎?
不能。校準是歷史可靠性檢查,不是保證。足球仍然有不確定性,小樣本分桶也會有噪音。
更新於 2026-08-07。