Contrôles qualité¶
Le pipeline produit quatre niveaux de contrôle : préparation des entrées, exploration des seuils, conformité avant modèle et relecture après prédiction.
Conformité ReLUT¶
Chaque segment préparé est contrôlé selon les critères suivants :
| Critère | Seuil ou règle |
|---|---|
| colonnes requises | lon, lat, timestamp, speed_kmh non nulles |
| coordonnées | longitude entre -180 et 180, latitude entre -90 et 90 |
| vitesse | non négative |
| timestamps | ordre croissant |
| nombre de lignes | 2 à 10 000 |
| durée | moins de 30 jours |
| fréquence médiane | moins de 20 secondes |
| gap maximal | moins de 3 600 secondes |
Ces contrôles sont exportés dans :
Contrôles de nettoyage¶
Le fichier suivant résume les pertes et imputations :
Il faut notamment relire :
- le nombre de points retirés par précision GPS ;
- le nombre de doublons supprimés ;
- le nombre de vitesses manquantes ou inconnues ;
- le nombre de vitesses plafonnées.
Contrôles exploratoires¶
Avant de figer les résultats, deux familles de sorties doivent être relues.
Spatial¶
Output/reports/spatial_eda_candidate_profile.csv
Output/reports/spatial_eda_threshold_sensitivity.csv
Ces fichiers servent à comprendre la contribution des signaux spatiaux :
distance finale dans le buffer, passage près de l'activité, boucle géométrique
et tortuosité. La comparaison entre spatial_candidate_broad et
spatial_candidate_conservative doit être conservée tant que la méthode n'est
pas validée sur un échantillon relu.
Les cartes de diagnostic de l'EDA spatiale peuvent être régénérées depuis le
notebook 21 si une relecture détaillée est nécessaire, mais elles ne sont plus
conservées par défaut dans Output/maps afin d'éviter les doublons avec les
cartes de restitution consolidées.
Temporel¶
Output/reports/temporal_eda_waypoint_profile.csv
Output/reports/temporal_eda_segment_sensitivity.csv
Ces fichiers servent à vérifier la qualité des waypoints voiture et la
sensibilité du découpage au seuil gap_minutes. Sur un jeu plus complet que le
sample, un changement de ce seuil peut modifier le nombre de segments et donc le
dernier point transmis au modèle.
Relecture après modèle¶
Les sorties de prédiction doivent être relues à trois niveaux.
Segment¶
prediction_summary_by_segment.csv donne pour chaque segment :
- nombre de points ;
- durée ;
- distance totale ;
- probabilité maximale ;
- probabilité moyenne ;
- timestamp du début prédit ;
- durée prédite de recherche ;
- distance restante au stationnement supposé.
Courbe temporelle¶
prediction_probability_examples.png montre la probabilité p(search) au fil
du segment. C'est utile pour repérer :
- un basculement net en fin de trajet ;
- une probabilité élevée dès le début ;
- des oscillations fortes ;
- un plateau artificiel dû au post-traitement.
Cartes¶
Les cartes de restitution consolidées sont :
Output/maps/relut_full_leg_probability_sample.html
Output/maps/spatial_temporal_comparison_examples.html
Output/maps/territorial_h3_hotspots.html
Output/maps/routing_geometry_comparison.html
La carte prioritaire pour la relecture qualitative est
relut_full_leg_probability_sample.html : elle affiche un échantillon de legs
complètes originales, avec une couleur par segment selon la probabilité ReLUT de
recherche de stationnement. Elle permet de vérifier si les probabilités fortes
se situent dans un contexte plausible : approche de destination, boucle,
ralentissement final, retour en arrière, quartier urbain, etc.
Critères d'alerte¶
Un segment doit être inspecté manuellement si :
- la recherche commence dès les premières minutes ;
- la durée prédite est proche du plafond configuré ;
- la distance restante au début de recherche est très faible ou très élevée ;
- la courbe de probabilité est élevée sur tout le trajet ;
- le segment contient un grand gap temporel ;
- la carte montre une trajectoire incohérente ou une fin hors réseau routier.