Méthodologie
Cette page décrit exactement ce que nous calculons, avec quelles données, et où se situent les limites. Elle est mise à jour à chaque changement de méthode.
1. Les sources
Trois familles de données alimentent le site : les données de match (compositions, buts, tirs, minutes), les données de marché (cotes décimales, moyennées entre opérateurs), et les données de classement. Chaque bloc affiche sa date de dernière mise à jour. Une donnée dont nous n'avons pas la source n'est pas publiée.
2. Les absents, et ce qu'on peut en dire
Notre source d'absences rend une ligne par joueur et par match : un statut (annoncé absent ou incertain) et un motif. Elle ne publie ni date de début, ni date de retour. Nous relevons donc cette liste chaque jour et nous la conservons : l'ancienneté affichée sur une fiche (« absent depuis le 14 août, deux matchs manqués ») est comptée sur nos propres relevés, en ne comptant que des matchs réellement joués. Tant qu'une absence n'a été vue qu'une fois, la fiche écrit « annoncé pour cette rencontre » et rien de plus : un joueur peut être absent depuis des mois sans que la donnée le dise. Nous n'écrivons jamais une date de retour, aucune donnée disponible ne la porte.
3. Des cotes aux probabilités
Une cote décimale se convertit en probabilité implicite en divisant 1 par la cote. La somme des trois probabilités d'un match dépasse toujours 100 % : cette différence est la marge de l'opérateur. Nous la retirons en divisant chaque probabilité par le total, ce qui ramène l'ensemble à 100 %.
| Étape | Operation | Exemple |
|---|---|---|
| Probabilité brute | 1 / cote | 1 / 1,50 = 66,7 % |
| Total des trois | somme | 106,3 % |
| Probabilité normalisée | brute / total | 66,7 / 106,3 = 62,7 % |
4. Notre modèle
Le modèle estime, pour chaque équipe, un nombre de buts attendus à partir de sa production offensive et défensive récente, pondérée par la qualité des adversaires rencontrés. Une valeur d'avantage du terrain propre à chaque compétition s'y ajoute. Les deux espérances de buts sont ensuite converties en distribution de scores, dont on tire les trois probabilités d'issue.
- Fenêtre glissante : les matchs les plus récents comptent davantage, mais la forme sur cinq matchs ne déplace une probabilité que de quelques points de pourcentage.
- Absences : prises en compte uniquement lorsqu'elles sont confirmées. Une rumeur de blessure ne modifie aucun chiffre.
- Debut de saison : les probabilités des premières journées s'appuient majoritairement sur la saison précédente, faute d'échantillon.
5. Les limites, honnetement
Trois choses que notre modèle ne fait pas. Il ne sait pas anticiper un changement d'entraîneur ni une crise interne. Il sous-estime les matchs à enjeu asymétrique, où une équipe n'a plus rien à jouer. Et il n'a aucune information sur l'état physique réel des joueurs au-delà des absences publiées.
6. Le suivi de calibration
Chaque probabilité est archivée au coup d'envoi, puis comparée au résultat. La mesure qui compte : sur l'ensemble des matchs annoncés à 60-70 %, le favori doit gagner entre 60 et 70 % du temps. Si l'écart dépasse cinq points sur un échantillon de plus de deux cents matchs, le modèle est recalibré et la page est mise à jour.
7. Corrections
Une erreur de donnée est corrigée dès qu'elle est signalée, et la correction est mentionnée en pied d'article lorsqu'elle change le sens d'une analyse. Signalements : contact@oddzone.fr.