Prédire les résultats de course grâce à l'apprentissage automatique : déchiffrer le code de la victoire grâce aux données
Prédire les résultats de course grâce au machine learning : déchiffrer le code de la victoire grâce aux données
Introduction
Lors de la 18e étape du Tour de France 2025, une étape reine dans les Alpes. La veille de la course, l’analyste de données d’une équipe exécute un modèle de machine learning sur son ordinateur portable. Le modèle analyse de manière exhaustive les performances historiques des 20 premiers du classement général, leur charge d’entraînement récente, les prévisions météorologiques, le profil du parcours et les tendances des indicateurs physiologiques des 17 premières étapes. Résultat de la prédiction : leur leader a 73 % de probabilité de reprendre le maillot jaune lors de la dernière ascension hors catégorie.
Le lendemain, cette prédiction se réalise.
Ce n’est pas de la magie — c’est l’application mature du machine learning dans le domaine de la prédiction sportive. Lorsque nous disposons de suffisamment de données, les algorithmes peuvent détecter des schémas que les analystes humains ont du mal à percevoir.
Méthodes fondamentales du machine learning dans la prédiction sportive
Ingénierie des caractéristiques : transformer les connaissances sportives en données
La qualité d’un modèle de machine learning dépend à 80 % de la qualité de l’ingénierie des caractéristiques (Feature Engineering). Dans la prédiction de courses cyclistes, les caractéristiques clés incluent :
Caractéristiques historiques du coureur :
- Distribution des résultats sur des épreuves de même type au cours des 3 dernières années
- Performances historiques sur des profils de parcours similaires (montagne, contre-la-montre, plat)
- Tendance FTP et courbe de puissance de la saison en cours
- Indice d’expérience des grandes courses (nombre de Grands Tours disputés)
- Âge et stade de carrière
Caractéristiques physiologiques immédiates :
- Tendance HRV des 7 derniers jours (reflétant l’état de récupération)
- Indice de fatigue cumulée (charge d’entraînement chronique CTL basée sur le TSS)
- Tendance de variation du poids
- Stabilité des indicateurs physiologiques (plus les fluctuations sont faibles, plus l’état est stable)
Caractéristiques environnementales :
- Prévisions de température et d’humidité
- Direction et vitesse du vent
- Altitude
- Indice UV
Caractéristiques du parcours :
- Dénivelé total et répartition des ascensions
- Profil de pente des ascensions clés
- Difficulté technique du parcours (nombre de virages, dangerosité des descentes)
- Type de surface de la route
Caractéristiques tactiques :
- Force de l’équipe (capacité d’assistance des coéquipiers)
- Distribution des écarts au classement général
- Phase de la course (prudence en début de course vs attaque en fin de course)
- Préférences tactiques historiques des adversaires
Choix du modèle
Différentes tâches de prédiction conviennent à différents modèles :
Gradient Boosting (XGBoost / LightGBM)
C’est actuellement la famille de modèles la plus utilisée dans le domaine de la prédiction sportive. Raisons :
- Gère naturellement les caractéristiques de types mixtes (numériques, catégorielles, séquentielles)
- Mécanisme intégré de gestion des valeurs manquantes
- Fournit un classement de l’importance des caractéristiques, facilitant la compréhension des décisions du modèle
- Entraînement rapide, adapté aux mises à jour fréquentes
Scénarios d’application : prédire le classement d’une course, classifier victoire/défaite (entrer ou non dans le top 10)
Réseaux de neurones récurrents (RNN / LSTM)
Pour les données de séries temporelles — comme les tendances de performance d’un coureur sur une course par étapes — les réseaux de neurones récurrents peuvent capturer les dépendances temporelles.
Scénarios d’application : prédire les variations de performance quotidiennes sur les courses par étapes, les effets de fatigue cumulée
Modèles bayésiens
Les méthodes bayésiennes sont particulièrement adaptées au traitement de l’incertitude. En cas d’informations incomplètes (par exemple, un coureur manquant récemment de données de course), les modèles bayésiens peuvent fournir des prédictions avec des intervalles de confiance.
Scénarios d’application : estimer la plage de capacité réelle d’un coureur, calculer la probabilité d’une surprise
Réseaux de neurones graphiques (GNN)
La tactique d’équipe dans le cyclisme implique des interactions complexes entre coureurs. Les réseaux de neurones graphiques peuvent modéliser ces relations :
- Nœuds : chaque coureur
- Arêtes : relations de coopération (coéquipiers) ou de compétition entre coureurs
- Poids des arêtes : schémas d’interaction historiques (par exemple, le coureur A abrite toujours le coureur B dans les 5 derniers kilomètres)
Scénarios d’application : prédire l’impact de la tactique d’équipe, analyser la dynamique du peloton
Méthodes d’ensemble (Ensemble Methods)
Les systèmes de prédiction les plus précis ne dépendent généralement pas d’un seul modèle, mais intègrent les prédictions de plusieurs modèles :
Prédiction finale = w₁ × Prédiction XGBoost + w₂ × Prédiction LSTM + w₃ × Prédiction bayésienne
Les poids w₁, w₂, w₃ sont ajustés dynamiquement en fonction des performances historiques de chaque modèle sur l’ensemble de validation.
Études de cas pratiques
Cas 1 : Prédiction du classement général des Grands Tours
Objectif : prédire le top 10 final du classement général avant le départ des trois Grands Tours (Tour de France, Tour d’Italie, Tour d’Espagne).
Ensemble de données :
- Données complètes des résultats des trois Grands Tours de 2010 à 2024
- Classement UCI et résultats de course des 6 mois précédant la course
- Caractéristiques du parcours (dénivelé total, kilomètres de contre-la-montre, sections à haute altitude)
- Budget de l’équipe et indicateurs de force de l’effectif
Performance du modèle :
| Indicateur | Précision |
|---|---|
| Taux de réussite top 10 | 7,2/10 |
| Taux de réussite top 3 | 2,1/3 |
| Précision de la prédiction du vainqueur | 58 % |
| Corrélation de rang Spearman | 0,82 |
Il est à noter que le modèle est plus précis pour prédire les coureurs « stables », tandis que les prédictions sont moins bonnes pour les coureurs « explosifs » ou à « forte variation de forme » — ce qui est intuitif, car l’instabilité est par nature difficile à prédire.
Cas 2 : Prédiction en temps réel des courses d’un jour
Objectif : mettre à jour en temps réel les probabilités de victoire de chaque coureur pendant une course d’un jour sur route.
Flux de données :
- Position GPS et vitesse en temps réel
- Données du capteur de puissance (si publiques)
- Caractéristiques du parcours restant
- Données météorologiques actuelles
- État de la fragmentation du peloton
Fréquence de mise à jour du modèle : toutes les 60 secondes
Ce système de prédiction en temps réel est similaire au calculateur de probabilités au poker — au fur et à mesure que la course progresse, plus d’informations sont révélées et la prédiction converge progressivement vers le résultat final.
Application pour l’expérience spectateur : afficher les pourcentages de probabilité de victoire en temps réel de chaque coureur à l’écran lors de la diffusion en direct, augmentant la tension et l’engagement des spectateurs.
Cas 3 : Prédiction des objectifs d’entraînement personnels
Pour les cyclistes amateurs, le machine learning a également de la valeur. Le modèle peut prédire à partir de vos données d’entraînement :
- Le temps estimé pour terminer votre course cible
- La probabilité d’atteindre un objectif de performance spécifique (comme terminer le KOM Wuling en moins de 3 heures)
- La stratégie d’allure optimale
- Les ajustements nécessaires du volume et de l’intensité d’entraînement
Limites et éthique de la prédiction
Facteurs imprévisibles
Aussi puissant que soit le machine learning, il ne peut pas prédire :
- Pannes mécaniques : crevaison, déraillement, casse du dérailleur
- Chutes : dangers de la route, changements météorologiques soudains, chaos dans le peloton
- Problèmes de santé soudains : troubles gastro-intestinaux, crampes, coup de chaleur
- Effondrement psychologique : contre-performance due à un stress excessif
- Imprévus tactiques : attaques à des moments totalement inattendus
Ces « événements cygnes noirs » font le charme des compétitions sportives et constituent des facteurs que les modèles de prédiction ne pourront jamais entièrement capturer.
Risque de surapprentissage
La taille des échantillons de données sportives est relativement petite (seulement quelques grandes courses par an), et le surapprentissage est un risque sérieux. Si le modèle est parfait sur les données historiques mais se trompe sur les nouvelles épreuves, c’est un symptôme typique de surapprentissage.
Contre-mesures :
- Validation croisée stricte (réserver les données de la dernière année comme ensemble de test)
- Techniques de régularisation pour limiter la complexité du modèle
- Surveillance continue des performances du modèle sur les nouvelles données et mise à jour en temps utile
Considérations éthiques
Impact sur le marché des paris
Des modèles de prédiction de course très précis, s’ils sont utilisés pour les paris sportifs, peuvent soulever des questions d’équité. Les organisations disposant de modèles avancés pourraient obtenir un avantage injuste sur le marché des paris.
Vie privée des coureurs
Les données physiologiques requises par les modèles (HRV, puissance, fréquence cardiaque) touchent à la vie privée liée à la santé des coureurs. La collecte, l’utilisation et le partage de ces données nécessitent le consentement explicite des coureurs.
Suspense de la course
Si les prédictions deviennent trop précises et sont largement diffusées, cela pourrait-il réduire l’intérêt des spectateurs ? Une incertitude modérée est au cœur de l’attrait du sport.
Potentiel d’application pour les épreuves cyclistes à Taïwan
Base de données existante
Le cyclisme à Taïwan a déjà accumulé une base de données considérable :
- Données Strava : les enregistrements de sortie d’un grand nombre de cyclistes taïwanais
- Base de données des résultats de course : résultats historiques du Tour de Taïwan, du KOM et des courses cyclistes des différents comtés et villes
- Données de parcours : informations GPS et de pente complètes des principaux itinéraires cyclistes de Taïwan
- Données météorologiques : données météorologiques détaillées fournies par l’Agence centrale de météorologie
Applications possibles
- Prédiction du KOM King of the Mountain : prédire le top 10 et le temps du vainqueur en fonction de la liste des participants et des résultats historiques
- Assistant d’objectifs personnels : aider les cyclistes à prédire le temps de parcours sur des itinéraires spécifiques (comme Wuling, Fengguizui, Beiyi)
- Analyse du classement des loups-garous : analyser les tendances d’évolution du classement, prédire le prochain challenger susceptible de prendre la tête
- Amélioration de la diffusion en direct : afficher les informations de prédiction en temps réel à l’écran pendant la diffusion
Conclusion
L’apprentissage automatique ne remplacera pas la compétition — il nous permet de comprendre la compétition plus en profondeur. Lorsque les algorithmes révèlent des schémas cachés dans les données, notre appréciation du sport n’en diminue pas, elle augmente. Parce que nous voyons enfin la logique physiologique derrière chaque attaque, et l’improbabilité statistique de chaque retournement de situation victorieux.
Les modèles de prédiction nous disent ce qui « devrait » se produire, et la beauté du sport réside dans le fait qu’ils nous montrent souvent — que les données ont tort. C’est précisément cette remise en question des prédictions qui rend le sport éternellement captivant.
Lectures complémentaires
- Analyse post-course et définition d’objectifs : faire de chaque course un tremplin vers le progrès
- 【Lecture scientifique】Rapport de test sur l’efficacité et la précision des changements de vitesse entre transmission électronique et mécanique en environnement tout-terrain boueux : étude des caractéristiques physiques des athlètes d’élite (article 1013)
- 【Lecture scientifique】Rapport de test sur l’efficacité et la précision des changements de vitesse entre transmission électronique et mécanique en environnement tout-terrain boueux : étude des caractéristiques physiques des athlètes d’élite (article 1316)
- 【Lecture scientifique】Rapport de test sur l’efficacité et la précision des changements de vitesse entre transmission électronique et mécanique en environnement tout-terrain boueux : étude des caractéristiques physiques des athlètes d’élite (article 1247)
單車AI教練!全新 ChatGPT4o 幫你分析訓練成果!排武嶺課表,分析騎車姿勢! 太神了! / 公路車 / CT Yeh / feat. 緯緯
2 年前
2025 自行車錶排行榜 兩萬車友大數據 / Garmin Bryton 排名會大洗牌嗎? / 全新的碼表前身分析 /公路車 / CT Yeh
1 年前
2026 車錶排行榜!誰是最多車友正在使用?練家子最愛哪款?🏆 (2萬名車友數據) / 公路車 / CT Yeh
5 個月前
西進武嶺 免費訓練分析服務 Intervals | 練不夠還是練過頭?你哪一種類型選手?AI模型告訴你! | 備戰神器 | 公路車 訓練 | CT Yeh
4 年前
2022 前十五大自行車錶 !? 兩萬名車友大數據統計 | 你的上榜了嗎? | 菁英車友都用哪些錶? | Bryton Garmin 誰能拔得頭籌?| 車錶推薦 | 公路車 CT Yeh
4 年前
風櫃嘴時間 預測西進武嶺時間?13000名車友統計數據分析告訴你 !
5 年前
崇越盃武嶺冠軍高手 賽前JJSC 群峰會精華!對應大數據分析,會有落差嗎?/ feat. JJSC中部公路車約騎 /公路車 / CT Yeh
2 年前
96聯賽 桃園市長盃 歷屆各路段大數據攻略 從菁英組到新手組的平均瓦數、均速、平均時間 x 賽前探路
5 年前