模型校准报告

在 1068 场世界杯样本中,模型最高概率结果整体校准较好:Brier 0.5628,ECE 3.6%。同一套 walk-forward 测试的胜平负命中率为 57.4%。这些是概率,不是保证。

1068
世界杯比赛
23
回测届数
57.4%
最高概率结果命中率
0.5628
Brier 分数
3.6%
期望校准误差
2026-08-07
报告更新日期

可引用定义:校准用于检查预测概率和真实发生频率是否接近。一个校准良好的 60% 预测,在足够大的样本中应接近 60% 发生。

这代表什么

模型在 40-80% 置信度区间表现最稳定,预测概率和世界杯真实结果大致贴合。非常高置信度分桶的历史样本更少,因此需要更谨慎解读。简单说:60-70% 的选择历史上像强热门,但不是稳赢。

按置信度分桶的可靠性

每一行把赛前最高预测概率落在同一区间的比赛放在一起。例如 60-70% 分桶回答的是:当模型最高选择约为三分之二概率时,它实际发生了多少次?

模型置信度 比赛 平均模型概率 真实命中率 差距
0-10% 0
10-20% 0
20-30% 0
30-40% 105 38.6% 35.2% -3.3%
40-50% 302 45.0% 49.0% +4.0%
50-60% 272 54.8% 56.3% +1.5%
60-70% 187 64.9% 68.5% +3.5%
70-80% 128 74.4% 72.7% -1.8%
80-90% 58 84.5% 74.1% -10.3%
90-100% 16 93.2% 68.8% -24.4%

可靠性图

0-10%
模型 — 实际 —
10-20%
模型 — 实际 —
20-30%
模型 — 实际 —
30-40%
模型 38.6% 实际 35.2%
40-50%
模型 45.0% 实际 49.0%
50-60%
模型 54.8% 实际 56.3%
60-70%
模型 64.9% 实际 68.5%
70-80%
模型 74.4% 实际 72.7%
80-90%
模型 84.5% 实际 74.1%
90-100%
模型 93.2% 实际 68.8%

样本很少的分桶波动较大。本报告中 90-100% 分桶只有 16 场比赛,因此不要过度解读它的差距。

方法

我们按日期顺序重放数据集里的每一场国际比赛(49,520 场)。在每场历史世界杯比赛前,模型只使用当时已经可用的 Elo,然后用真实赛果更新评分,不使用未来信息。

概率模型使用 Elo + Poisson:eloToGoals=0.0022,基础进球 1.35,仅在非中立场加入 100 点主场优势。本报告覆盖 1930 到 2026 年的 23 届世界杯。

比赛数据来自开源 martj42/international_results 数据集(1872 年以来的国际比赛);2026 世界杯赛程来自 TheSportsDB。22 届世界杯回测已在 GitHub 开源

英超校准(分数据集)

英超使用独立参数组(baseGoals 1.35,主场优势 50 Elo 当量)。在严格 out-of-sample 协议下(参数仅在 2019–24 校准,2024-25、2025-26 两季纯测试),模型在 760 场中命中 51.3%、Brier 0.6083;同期去水市场基线为 51.4% / 0.5951。

FAQ

模型校准是什么意思?

校准检查预测概率是否匹配真实结果。如果模型给很多球队 60% 概率,这些预测在足够大样本中应接近 60% 命中。

包含多少场比赛?

本报告使用 1068 场世界杯正赛比赛,覆盖 1930 到 2026 年的 23 届赛事,并使用不偷看未来的 walk-forward 测试。

如何阅读置信度分桶?

每个分桶比较模型赛前给出的概率和真实发生率。40-80% 区间最有参考价值;高置信度分桶样本较少,需要谨慎。

校准好的概率能保证结果吗?

不能。校准是历史可靠性检查,不是保证。足球仍然有不确定性,小样本分桶也会有噪音。

更新于 2026-08-07。