模型校準報告

在 1068 場世界盃樣本中,模型最高機率結果整體校準較好:Brier 0.5628,ECE 3.6%。同一套 walk-forward 測試的勝平負命中率為 57.4%。這些是機率,不是保證。

1068
世界盃比賽
23
回測屆數
57.4%
最高機率結果命中率
0.5628
Brier 分數
3.6%
期望校準誤差
2026-08-07
報告更新日期

可引用定義:校準用於檢查預測機率和真實發生頻率是否接近。一個校準良好的 60% 預測,在足夠大的樣本中應接近 60% 發生。

這代表什麼

模型在 40-80% 置信度區間表現最穩定,預測機率和世界盃真實結果大致貼合。非常高置信度分桶的歷史樣本更少,因此需要更謹慎解讀。簡單說:60-70% 的選擇歷史上像強熱門,但不是穩贏。

按置信度分桶的可靠性

每一行把賽前最高預測機率落在同一區間的比賽放在一起。例如 60-70% 分桶回答的是:當模型最高選擇約為三分之二機率時,它實際發生了多少次?

模型置信度 比賽 平均模型機率 真實命中率 差距
0-10% 0
10-20% 0
20-30% 0
30-40% 105 38.6% 35.2% -3.3%
40-50% 302 45.0% 49.0% +4.0%
50-60% 272 54.8% 56.3% +1.5%
60-70% 187 64.9% 68.5% +3.5%
70-80% 128 74.4% 72.7% -1.8%
80-90% 58 84.5% 74.1% -10.3%
90-100% 16 93.2% 68.8% -24.4%

可靠性圖

0-10%
模型 — 實際 —
10-20%
模型 — 實際 —
20-30%
模型 — 實際 —
30-40%
模型 38.6% 實際 35.2%
40-50%
模型 45.0% 實際 49.0%
50-60%
模型 54.8% 實際 56.3%
60-70%
模型 64.9% 實際 68.5%
70-80%
模型 74.4% 實際 72.7%
80-90%
模型 84.5% 實際 74.1%
90-100%
模型 93.2% 實際 68.8%

樣本很少的分桶波動較大。本報告中 90-100% 分桶只有 16 場比賽,因此不要過度解讀它的差距。

方法

我們按日期順序重放資料集裡的每一場國際比賽(49,520 場)。在每場歷史世界盃比賽前,模型只使用當時已經可用的 Elo,然後用真實賽果更新評分,不使用未來資訊。

機率模型使用 Elo + Poisson:eloToGoals=0.0022,基礎進球 1.35,僅在非中立場加入 100 點主場優勢。本報告覆蓋 1930 到 2026 年的 23 屆世界盃。

比賽資料來自開源 martj42/international_results 資料集(1872 年以來的國際比賽);2026 世界盃賽程來自 TheSportsDB。22 屆世界盃回測已在 GitHub 開源

英超校準(分資料集)

英超使用獨立引陣列(baseGoals 1.35,主場優勢 50 Elo 當量)。在嚴格 out-of-sample 協議下(引數僅在 2019–24 校準,2024-25、2025-26 兩季純測試),模型在 760 場中命中 51.3%、Brier 0.6083;同期去水市場基線為 51.4% / 0.5951。

FAQ

模型校準是什麼意思?

校準檢查預測機率是否匹配真實結果。如果模型給很多球隊 60% 機率,這些預測在足夠大樣本中應接近 60% 命中。

包含多少場比賽?

本報告使用 1068 場世界盃正賽比賽,覆蓋 1930 到 2026 年的 23 屆賽事,並使用不偷看未來的 walk-forward 測試。

如何閱讀置信度分桶?

每個分桶比較模型賽前給出的機率和真實發生率。40-80% 區間最有參考價值;高置信度分桶樣本較少,需要謹慎。

校準好的機率能保證結果嗎?

不能。校準是歷史可靠性檢查,不是保證。足球仍然有不確定性,小樣本分桶也會有噪音。

更新於 2026-08-07。