Préparation des waypoints¶
La préparation vise à produire une table compatible avec ReLUT tout en gardant la trace des transformations appliquées.
Étapes¶
- Lire les fichiers CSV déclarés dans
paths.waypoint_glob. - Borne optionnelle du nombre de fichiers et d'utilisateurs pour les tests.
- Parser les colonnes numériques.
- Parser
tracked_aten timestamp UTC. - Vérifier les bornes de latitude et longitude.
- Filtrer les points dont la précision GPS dépasse le seuil configuré.
- Supprimer les doublons exacts utilisateur, timestamp, latitude, longitude.
- Calculer les distances entre points successifs.
- Construire
speed_kmh.
Filtre de précision¶
Le seuil par défaut est :
Interprétation :
- les points avec
accuracy <= 75m sont conservés ; - les points sans valeur d'accuracy sont conservés ;
- les points moins précis sont retirés.
Ce choix privilégie un test du modèle sur des points relativement fiables, mais il peut retirer des portions de trajectoire où le signal GPS se dégrade, ce qui est justement fréquent en milieu urbain dense.
Vitesses extrêmes¶
Le seuil par défaut est :
Les vitesses supérieures sont plafonnées, pas supprimées. Ce choix évite que quelques sauts GPS produisent des variables d'entrée extrêmes pour le modèle, tout en conservant le point pour la continuité temporelle.
Doublons¶
Les doublons exacts sont supprimés :
Le doublon est défini par :
Les doublons avec même timestamp mais coordonnées différentes ne sont pas supprimés automatiquement. Ils doivent être inspectés si les contrôles qualité signalent des vitesses ou distances aberrantes.
Effets possibles¶
Ces choix de préparation influencent directement les prédictions :
- retirer des points peut modifier la fréquence médiane ;
- imputer une vitesse peut lisser ou amplifier les ralentissements ;
- plafonner une vitesse peut masquer un saut GPS ;
- garder un point imprécis en fin de segment peut déplacer le stationnement supposé.
La préparation doit donc être relue avec les sorties cleaning_report.json et
relut_validation_by_segment.csv.