模型校准报告
在 1068 场世界杯样本中,模型最高概率结果整体校准较好:Brier 0.5628,ECE 3.6%。同一套 walk-forward 测试的胜平负命中率为 57.4%。这些是概率,不是保证。
世界杯比赛
回测届数
最高概率结果命中率
Brier 分数
期望校准误差
报告更新日期
可引用定义:校准用于检查预测概率和真实发生频率是否接近。一个校准良好的 60% 预测,在足够大的样本中应接近 60% 发生。
这代表什么
模型在 40-80% 置信度区间表现最稳定,预测概率和世界杯真实结果大致贴合。非常高置信度分桶的历史样本更少,因此需要更谨慎解读。简单说:60-70% 的选择历史上像强热门,但不是稳赢。
按置信度分桶的可靠性
每一行把赛前最高预测概率落在同一区间的比赛放在一起。例如 60-70% 分桶回答的是:当模型最高选择约为三分之二概率时,它实际发生了多少次?
| 模型置信度 | 比赛 | 平均模型概率 | 真实命中率 | 差距 |
|---|---|---|---|---|
| 0-10% | 0 | — | — | — |
| 10-20% | 0 | — | — | — |
| 20-30% | 0 | — | — | — |
| 30-40% | 105 | 38.6% | 35.2% | -3.3% |
| 40-50% | 302 | 45.0% | 49.0% | +4.0% |
| 50-60% | 272 | 54.8% | 56.3% | +1.5% |
| 60-70% | 187 | 64.9% | 68.5% | +3.5% |
| 70-80% | 128 | 74.4% | 72.7% | -1.8% |
| 80-90% | 58 | 84.5% | 74.1% | -10.3% |
| 90-100% | 16 | 93.2% | 68.8% | -24.4% |
可靠性图
样本很少的分桶波动较大。本报告中 90-100% 分桶只有 16 场比赛,因此不要过度解读它的差距。
方法
我们按日期顺序重放数据集里的每一场国际比赛(49,520 场)。在每场历史世界杯比赛前,模型只使用当时已经可用的 Elo,然后用真实赛果更新评分,不使用未来信息。
概率模型使用 Elo + Poisson:eloToGoals=0.0022,基础进球 1.35,仅在非中立场加入 100 点主场优势。本报告覆盖 1930 到 2026 年的 23 届世界杯。
比赛数据来自开源 martj42/international_results 数据集(1872 年以来的国际比赛);2026 世界杯赛程来自 TheSportsDB。22 届世界杯回测已在 GitHub 开源。
英超校准(分数据集)
英超使用独立参数组(baseGoals 1.35,主场优势 50 Elo 当量)。在严格 out-of-sample 协议下(参数仅在 2019–24 校准,2024-25、2025-26 两季纯测试),模型在 760 场中命中 51.3%、Brier 0.6083;同期去水市场基线为 51.4% / 0.5951。
FAQ
模型校准是什么意思?
校准检查预测概率是否匹配真实结果。如果模型给很多球队 60% 概率,这些预测在足够大样本中应接近 60% 命中。
包含多少场比赛?
本报告使用 1068 场世界杯正赛比赛,覆盖 1930 到 2026 年的 23 届赛事,并使用不偷看未来的 walk-forward 测试。
如何阅读置信度分桶?
每个分桶比较模型赛前给出的概率和真实发生率。40-80% 区间最有参考价值;高置信度分桶样本较少,需要谨慎。
校准好的概率能保证结果吗?
不能。校准是历史可靠性检查,不是保证。足球仍然有不确定性,小样本分桶也会有噪音。
更新于 2026-08-07。