跳至主要內容

Prédire les résultats de course grâce à l'apprentissage automatique : déchiffrer le code de la victoire grâce aux données

裝備介紹

Prédire les résultats de course grâce au machine learning : déchiffrer le code de la victoire grâce aux données

Introduction

Lors de la 18e étape du Tour de France 2025, une étape reine dans les Alpes. La veille de la course, l’analyste de données d’une équipe exécute un modèle de machine learning sur son ordinateur portable. Le modèle analyse de manière exhaustive les performances historiques des 20 premiers du classement général, leur charge d’entraînement récente, les prévisions météorologiques, le profil du parcours et les tendances des indicateurs physiologiques des 17 premières étapes. Résultat de la prédiction : leur leader a 73 % de probabilité de reprendre le maillot jaune lors de la dernière ascension hors catégorie.

Le lendemain, cette prédiction se réalise.

Ce n’est pas de la magie — c’est l’application mature du machine learning dans le domaine de la prédiction sportive. Lorsque nous disposons de suffisamment de données, les algorithmes peuvent détecter des schémas que les analystes humains ont du mal à percevoir.

Méthodes fondamentales du machine learning dans la prédiction sportive

Ingénierie des caractéristiques : transformer les connaissances sportives en données

La qualité d’un modèle de machine learning dépend à 80 % de la qualité de l’ingénierie des caractéristiques (Feature Engineering). Dans la prédiction de courses cyclistes, les caractéristiques clés incluent :

Caractéristiques historiques du coureur :

  • Distribution des résultats sur des épreuves de même type au cours des 3 dernières années
  • Performances historiques sur des profils de parcours similaires (montagne, contre-la-montre, plat)
  • Tendance FTP et courbe de puissance de la saison en cours
  • Indice d’expérience des grandes courses (nombre de Grands Tours disputés)
  • Âge et stade de carrière

Caractéristiques physiologiques immédiates :

  • Tendance HRV des 7 derniers jours (reflétant l’état de récupération)
  • Indice de fatigue cumulée (charge d’entraînement chronique CTL basée sur le TSS)
  • Tendance de variation du poids
  • Stabilité des indicateurs physiologiques (plus les fluctuations sont faibles, plus l’état est stable)

Caractéristiques environnementales :

  • Prévisions de température et d’humidité
  • Direction et vitesse du vent
  • Altitude
  • Indice UV

Caractéristiques du parcours :

  • Dénivelé total et répartition des ascensions
  • Profil de pente des ascensions clés
  • Difficulté technique du parcours (nombre de virages, dangerosité des descentes)
  • Type de surface de la route

Caractéristiques tactiques :

  • Force de l’équipe (capacité d’assistance des coéquipiers)
  • Distribution des écarts au classement général
  • Phase de la course (prudence en début de course vs attaque en fin de course)
  • Préférences tactiques historiques des adversaires

Choix du modèle

Différentes tâches de prédiction conviennent à différents modèles :

Gradient Boosting (XGBoost / LightGBM)

C’est actuellement la famille de modèles la plus utilisée dans le domaine de la prédiction sportive. Raisons :

  • Gère naturellement les caractéristiques de types mixtes (numériques, catégorielles, séquentielles)
  • Mécanisme intégré de gestion des valeurs manquantes
  • Fournit un classement de l’importance des caractéristiques, facilitant la compréhension des décisions du modèle
  • Entraînement rapide, adapté aux mises à jour fréquentes

Scénarios d’application : prédire le classement d’une course, classifier victoire/défaite (entrer ou non dans le top 10)

Réseaux de neurones récurrents (RNN / LSTM)

Pour les données de séries temporelles — comme les tendances de performance d’un coureur sur une course par étapes — les réseaux de neurones récurrents peuvent capturer les dépendances temporelles.

Scénarios d’application : prédire les variations de performance quotidiennes sur les courses par étapes, les effets de fatigue cumulée

Modèles bayésiens

Les méthodes bayésiennes sont particulièrement adaptées au traitement de l’incertitude. En cas d’informations incomplètes (par exemple, un coureur manquant récemment de données de course), les modèles bayésiens peuvent fournir des prédictions avec des intervalles de confiance.

Scénarios d’application : estimer la plage de capacité réelle d’un coureur, calculer la probabilité d’une surprise

Réseaux de neurones graphiques (GNN)

La tactique d’équipe dans le cyclisme implique des interactions complexes entre coureurs. Les réseaux de neurones graphiques peuvent modéliser ces relations :

  • Nœuds : chaque coureur
  • Arêtes : relations de coopération (coéquipiers) ou de compétition entre coureurs
  • Poids des arêtes : schémas d’interaction historiques (par exemple, le coureur A abrite toujours le coureur B dans les 5 derniers kilomètres)

Scénarios d’application : prédire l’impact de la tactique d’équipe, analyser la dynamique du peloton

Méthodes d’ensemble (Ensemble Methods)

Les systèmes de prédiction les plus précis ne dépendent généralement pas d’un seul modèle, mais intègrent les prédictions de plusieurs modèles :

Prédiction finale = w₁ × Prédiction XGBoost + w₂ × Prédiction LSTM + w₃ × Prédiction bayésienne

Les poids w₁, w₂, w₃ sont ajustés dynamiquement en fonction des performances historiques de chaque modèle sur l’ensemble de validation.

Études de cas pratiques

Cas 1 : Prédiction du classement général des Grands Tours

Objectif : prédire le top 10 final du classement général avant le départ des trois Grands Tours (Tour de France, Tour d’Italie, Tour d’Espagne).

Ensemble de données :

  • Données complètes des résultats des trois Grands Tours de 2010 à 2024
  • Classement UCI et résultats de course des 6 mois précédant la course
  • Caractéristiques du parcours (dénivelé total, kilomètres de contre-la-montre, sections à haute altitude)
  • Budget de l’équipe et indicateurs de force de l’effectif

Performance du modèle :

Indicateur Précision
Taux de réussite top 10 7,2/10
Taux de réussite top 3 2,1/3
Précision de la prédiction du vainqueur 58 %
Corrélation de rang Spearman 0,82

Il est à noter que le modèle est plus précis pour prédire les coureurs « stables », tandis que les prédictions sont moins bonnes pour les coureurs « explosifs » ou à « forte variation de forme » — ce qui est intuitif, car l’instabilité est par nature difficile à prédire.

Cas 2 : Prédiction en temps réel des courses d’un jour

Objectif : mettre à jour en temps réel les probabilités de victoire de chaque coureur pendant une course d’un jour sur route.

Flux de données :

  • Position GPS et vitesse en temps réel
  • Données du capteur de puissance (si publiques)
  • Caractéristiques du parcours restant
  • Données météorologiques actuelles
  • État de la fragmentation du peloton

Fréquence de mise à jour du modèle : toutes les 60 secondes

Ce système de prédiction en temps réel est similaire au calculateur de probabilités au poker — au fur et à mesure que la course progresse, plus d’informations sont révélées et la prédiction converge progressivement vers le résultat final.

Application pour l’expérience spectateur : afficher les pourcentages de probabilité de victoire en temps réel de chaque coureur à l’écran lors de la diffusion en direct, augmentant la tension et l’engagement des spectateurs.

Cas 3 : Prédiction des objectifs d’entraînement personnels

Pour les cyclistes amateurs, le machine learning a également de la valeur. Le modèle peut prédire à partir de vos données d’entraînement :

  • Le temps estimé pour terminer votre course cible
  • La probabilité d’atteindre un objectif de performance spécifique (comme terminer le KOM Wuling en moins de 3 heures)
  • La stratégie d’allure optimale
  • Les ajustements nécessaires du volume et de l’intensité d’entraînement

Limites et éthique de la prédiction

Facteurs imprévisibles

Aussi puissant que soit le machine learning, il ne peut pas prédire :

  • Pannes mécaniques : crevaison, déraillement, casse du dérailleur
  • Chutes : dangers de la route, changements météorologiques soudains, chaos dans le peloton
  • Problèmes de santé soudains : troubles gastro-intestinaux, crampes, coup de chaleur
  • Effondrement psychologique : contre-performance due à un stress excessif
  • Imprévus tactiques : attaques à des moments totalement inattendus

Ces « événements cygnes noirs » font le charme des compétitions sportives et constituent des facteurs que les modèles de prédiction ne pourront jamais entièrement capturer.

Risque de surapprentissage

La taille des échantillons de données sportives est relativement petite (seulement quelques grandes courses par an), et le surapprentissage est un risque sérieux. Si le modèle est parfait sur les données historiques mais se trompe sur les nouvelles épreuves, c’est un symptôme typique de surapprentissage.

Contre-mesures :

  • Validation croisée stricte (réserver les données de la dernière année comme ensemble de test)
  • Techniques de régularisation pour limiter la complexité du modèle
  • Surveillance continue des performances du modèle sur les nouvelles données et mise à jour en temps utile

Considérations éthiques

Impact sur le marché des paris

Des modèles de prédiction de course très précis, s’ils sont utilisés pour les paris sportifs, peuvent soulever des questions d’équité. Les organisations disposant de modèles avancés pourraient obtenir un avantage injuste sur le marché des paris.

Vie privée des coureurs

Les données physiologiques requises par les modèles (HRV, puissance, fréquence cardiaque) touchent à la vie privée liée à la santé des coureurs. La collecte, l’utilisation et le partage de ces données nécessitent le consentement explicite des coureurs.

Suspense de la course

Si les prédictions deviennent trop précises et sont largement diffusées, cela pourrait-il réduire l’intérêt des spectateurs ? Une incertitude modérée est au cœur de l’attrait du sport.

Potentiel d’application pour les épreuves cyclistes à Taïwan

Base de données existante

Le cyclisme à Taïwan a déjà accumulé une base de données considérable :

  • Données Strava : les enregistrements de sortie d’un grand nombre de cyclistes taïwanais
  • Base de données des résultats de course : résultats historiques du Tour de Taïwan, du KOM et des courses cyclistes des différents comtés et villes
  • Données de parcours : informations GPS et de pente complètes des principaux itinéraires cyclistes de Taïwan
  • Données météorologiques : données météorologiques détaillées fournies par l’Agence centrale de météorologie

Applications possibles

  1. Prédiction du KOM King of the Mountain : prédire le top 10 et le temps du vainqueur en fonction de la liste des participants et des résultats historiques
  2. Assistant d’objectifs personnels : aider les cyclistes à prédire le temps de parcours sur des itinéraires spécifiques (comme Wuling, Fengguizui, Beiyi)
  3. Analyse du classement des loups-garous : analyser les tendances d’évolution du classement, prédire le prochain challenger susceptible de prendre la tête
  4. Amélioration de la diffusion en direct : afficher les informations de prédiction en temps réel à l’écran pendant la diffusion

Conclusion

L’apprentissage automatique ne remplacera pas la compétition — il nous permet de comprendre la compétition plus en profondeur. Lorsque les algorithmes révèlent des schémas cachés dans les données, notre appréciation du sport n’en diminue pas, elle augmente. Parce que nous voyons enfin la logique physiologique derrière chaque attaque, et l’improbabilité statistique de chaque retournement de situation victorieux.

Les modèles de prédiction nous disent ce qui « devrait » se produire, et la beauté du sport réside dans le fait qu’ils nous montrent souvent — que les données ont tort. C’est précisément cette remise en question des prédictions qui rend le sport éternellement captivant.

Lectures complémentaires

相關影片
訂閱CT的頻道

訂閱 CT Yeh,看武嶺實測與路線攻略

北進武嶺、西進武嶺、經典百K,每條路線都親自騎過,配速、爬升、補給點全部實拍實測。

467 部影片 · 累計 838 萬次觀看