Pourquoi les pourcentages sont fondamentaux dans l'évaluation de l'algorithme

Les pourcentages transforment les nombres bruts en proportions interprétables, permettant aux informaticiens de comparer les performances des algorithmes à travers des ensembles de données de différentes tailles et domaines. Sans normalisation, un classificateur qui fait 80 erreurs sur un ensemble de données de 100 000 points pourrait apparaître pire qu'une autre qui fait 10 erreurs sur un ensemble de données de 100 points, même si le premier est beaucoup plus précis. En convertissant en pourcentages, vous créez une échelle commune – de 0 à 100 – qui révèle des performances relatives.

En régression, vous pouvez calculer l'erreur moyenne en pourcentage absolu (MAPE) pour comprendre la précision des prévisions par rapport aux valeurs réelles. En regroupement, le pourcentage de variance expliqué (par exemple, en utilisant la méthode du coude) vous indique combien de structure l'algorithme capturé. Dans toute évaluation d'algorithme, le principe de base est le même : diviser la quantité d'intérêt par un total qui fournit un point de référence significatif.

Calculs de pourcentage de base dans l'analyse de l'algorithme

Chaque mesure en pourcentage suit la même formule sous-jacente : (partie/total) × 100. Cependant, l'interprétation des changements «partie» et «total» dépend de la question que vous posez. Nous passerons par les paramètres fondamentaux et nous nous étendrons ensuite aux paramètres multiclasses.

Précision : le point de départ le plus commun

L'exactitude mesure la proportion de prédictions correctes parmi toutes les prédictions. Pour un classificateur binaire, elle est calculée comme suit:

  • Précision (%) = ((Pratiques positives + Négatives réelles) / Prévisions totales) × 100

Bien que intuitive, la précision peut être trompeuse lorsque les classes sont déséquilibrées. Une précision de 95 % peut sembler excellente, mais si 95 % des données appartiennent à la classe majoritaire, un modèle qui prévoit toujours que la classe atteint 95 % de précision sans rien apprendre. C'est pourquoi des mesures supplémentaires sont essentielles. Lorsque l'ensemble de données est équilibré (par exemple, 50/50 fractionné), la précision devient un indicateur fiable.

Précision, rappel et score F1

Ces mesures reposent sur des pourcentages dérivés d'une matrice de confusion :

  • Précision : De tous les cas où l'algorithme a été identifié comme positif, quel pourcentage était réellement positif? Il répond: "Combien digne de confiance est une prédiction positive?"
  • Rappel : De toutes les instances vraiment positives, quel pourcentage l'algorithme a-t-il correctement identifié? Il répond: "Comment l'algorithme trouve-t-il tous les positifs?"
  • F1 Note: La moyenne harmonique de précision et de rappel, exprimée en pourcentage, est équilibrée, surtout quand une métrique peut être artificiellement gonflée.

Par exemple, dans un algorithme de diagnostic médical, un rappel de 98 % (ne dépassant que 2 % des cas réels) pourrait être beaucoup plus important que la précision de 90 %. Le choix du pourcentage à optimiser dépend du coût des faux positifs par rapport aux faux négatifs. La moyenne harmonique pénalise le déséquilibre extrême : un algorithme avec précision 100% et rappel 0 % donne un F1 de 0 %, pas 50%.

Taux d'erreur et ses variations

Le complément de précision est le taux d'erreur: (Misclassifications / Total) × 100. Mais l'erreur peut être ventilée plus loin :

  • Taux de faux positifs (RPT) : (Principales positives / Total des négatifs) × 100
  • Taux de faux négatifs (FNR) : (Négatifs faux / Total positifs) × 100

Ces pourcentages sont critiques dans des domaines comme la cybersécurité, où un taux positif faux élevé peut écraser les analystes, ou dans la conduite autonome, où un faux négatif (fail à détecter un piéton) est catastrophique. La courbe ROC trace le taux positif vrai (rappel) par rapport au taux positif faux à différents seuils, et la zone sous la courbe ROC (AUC) peut être interprétée comme le pourcentage de chance que l'algorithme classe un positif aléatoire plus élevé qu'un négatif aléatoire.

Au-delà de la classification binaire : Pourcentages multi-classes

Dans les problèmes multiclasses, les pourcentages sont calculés par classe puis agrégés. Deux stratégies communes sont:

  • Macro-évérification: Calculer la précision, le rappel ou la F1 pour chaque classe et prendre la moyenne non pondérée. Cela donne un poids égal à toutes les classes, peu importe leur taille. Il met en valeur les performances sur les classes rares.
  • Micro-analyse: Résumez tous les vrais positifs, faux positifs, etc., selon les classes avant de calculer le pourcentage. Ceci est dominé par la classe la plus fréquente et est semblable à la précision globale.

Lors de l'évaluation d'un classificateur d'image de 100 catégories, les mesures macro-moyennes révèlent si le modèle échoue chez des espèces rares, alors que les mesures micro-moyennes peuvent masquer ces défaillances.

Application des pourcentages à l'efficacité de l'algorithme et à l'utilisation des ressources

Au-delà des mesures de classification, les pourcentages quantifient l'efficacité d'un algorithme en termes de temps, de mémoire ou d'énergie.

Utilisation et parallélisation du CPU

La loi d'Amdahl utilise des pourcentages de code série contre parallélisation pour prédire la vitesse maximale. Par exemple, si 80% d'un algorithme peut être parallélisé, la vitesse théorique sur un nombre infini de carottes est limitée à 5× (1 / (1 - 0,8) = 5). En pratique, l'efficacité parallèle mesure le pourcentage de vitesse théorique effectivement atteint : (accélération réelle / nombre de carottes) × 100. Un système utilisant 16 carottes qui atteint seulement 10× vitesse a une efficacité parallèle de 62,5 %.

Taux de succès de la mémoire et de la cache

La performance du cache est mesurée par des taux de succès, le pourcentage d'accès à la mémoire servi depuis le cache plutôt que par la mémoire principale plus lente. Un taux de succès du cache de 95 % par rapport à 99 % peut considérablement affecter le temps d'exécution global dans des algorithmes à forte intensité de données comme les jointures de base de données ou le tri. Par exemple, une augmentation de 4 % du taux de succès du cache L1 peut réduire les cycles de décrochage de mémoire de 30 % en multiplication matricielle, selon le modèle d'accès de l'algorithme.

Efficacité énergétique dans l'informatique verte

Pour les algorithmes de sensibilisation à l'énergie, les mesures comme performances par watt La réduction de la consommation d'énergie de 20 % tout en maintenant le débit de 90 % peut être un facteur déterminant dans le déploiement du centre de données. La tension dynamique et l'échelle de fréquence (DVFS) peuvent réduire l'énergie de 30 % au coût d'une baisse de performance de 10 %, un compromis pris par le produit de relais d'énergie, qui est souvent normalisé en pourcentages par rapport à une configuration de base.

Pourcentages de prétraitement et de normalisation des données

Les pourcentages apparaissent également dans la préparation des données. L'échelle Min-max normalise les caractéristiques numériques à une plage de 0 à 100 % :

valeur échelle = ((originale - min) / (maximum - min)) × 100

Cependant, les valeurs aberrantes peuvent comprimer la majorité des données en une bande de pourcentage étroite – si une valeur est 100 fois plus grande que le reste, la plupart des valeurs à l'échelle peuvent être inférieures à 1 %. Une échelle robuste utilisant des percentiles (p. ex. les 5e et 95e percentiles) évite cette question. Le pourcentage de valeurs manquantes par fonction est une autre mesure de prétraitement critique : si plus de 50 % des valeurs d'une fonction sont manquantes, l'imputation peut introduire plus de bruit que le signal.

Traitement des ensembles de données équilibrés avec des données en pourcentage

Les ensembles de données déséquilibrés — dont une classe est largement supérieure à une autre — sont courants dans la détection de la fraude, le diagnostic de maladies rares et la détection d'anomalies.

  • Précision équilibrée : La moyenne de rappel pour chaque classe, empêchant la classe majoritaire de dominer. Pour les classes binaires, précision équilibrée = (rappel sur positif + rappel sur négatif) / 2.
  • Courbes de rappel de précision : Les parcelles qui montrent l'équilibre entre la précision et le rappel à différents pourcentages de seuil. La zone sous la courbe de rappel de précision (PR-AUC) est un pourcentage unique qui résume la capacité du modèle à identifier la classe positive pour tous les seuils.
  • Détention sensible aux coûts: Au lieu d'utiliser 50% comme seuil de décision, fixer un pourcentage personnalisé basé sur le rapport de coût (par exemple, faux négatifs coûtent 10× plus que faux positifs → réduire le seuil à 20% pour capturer plus de positifs). Le seuil optimal peut être trouvé en maximisant un score Fβ pondéré, où β est le rapport d'importance entre le rappel et la précision.

Par exemple, un modèle de détection de fraude avec une précision de 99,9 %, mais seulement 1 % de rappel sur la fraude réelle, est presque inutile. La déclaration de précision et de pourcentages de rappel impose la transparence.

Importance statistique des écarts en pourcentage

En comparant deux algorithmes, une différence de 2% de précision peut être due à des variations aléatoires plutôt qu'à une amélioration réelle. Test McNemar (pour les résultats catégorisés appariés) ou essai t pairé (pour des mesures continues comme la précision moyenne) sont utilisées pour déterminer si la différence de pourcentage observée est significative. p- les valeurs aux côtés des pourcentages de précision pour transmettre la confiance. De plus, les intervalles de confiance autour d'un pourcentage (p. ex. « précision 85 % ± 3 % au niveau de confiance 95 %) montrent l'étendue plausible de la performance réelle.

En rééchantillonnant l'ensemble de test (avec remplacement) 1000 fois et en recomptabilisant chaque fois la précision, vous pouvez prendre les 2,5 et 97,5 centiles des pourcentages de bootstraped comme l'intervalle de confiance de 95 %. Cette approche fonctionne pour toute mesure basée sur le pourcentage, y compris la précision, le rappel et la note F1. Toujours rapporter l'estimation ponctuelle et un intervalle pour éviter de surinterpréter une valeur de pourcentage unique.

Exemples du monde réel : Pourcentages dans la comparaison de l'algorithme

Tri de la performance algorithmique

Lors de l'évaluation des algorithmes de tri sur des données presque triées, nous pourrions mesurer la Pourcentage d ' éléments égarés et comment cela affecte l'exécution. Le tri d'insertion devient très efficace lorsque le pourcentage d'éléments hors-commande est faible, alors que le tri rapide peut encore nécessiter des comparaisons O(n log n). En traçant l'exécution par rapport au pourcentage d'inversion, les ingénieurs peuvent choisir le meilleur algorithme pour les caractéristiques d'un ensemble de données. Par exemple, une base de données triant une liste d'ID clients qui ont été commandés précédemment pourrait voir l'insertion trier 10× plus rapidement que le tri rapide lorsque le pourcentage d'inversion est inférieur à 5%.

Modèles de classement des moteurs de recherche

Dans la recherche d'information, des mesures comme Précision@K et Rappel@K Par exemple, un moteur de recherche pourrait signaler que 70 % des 10 résultats les plus importants sont pertinents (Precision@10 = 70 %). La comparaison des différents algorithmes de classement sur le même ensemble de requêtes révèle que le pourcentage le plus élevé est pertinent dans les positions de classement minimales. Le gain cumulatif actualisé normalisé (nDCG) est aussi souvent déclaré comme un pourcentage (0–100%) du classement idéal.

Déploiement du modèle d'apprentissage automatique

Un modèle qui atteint 95 % de précision sur un ensemble d'essais en attente pourrait tomber à 80 % de la production en raison de la dérive des données. La surveillance du pourcentage de prédictions qui tombent en dessous d'un seuil de confiance devient un signal d'avertissement. Pourcentage de caractéristiques dérivées— les caractéristiques dont la distribution a changé de plus d'un seuil prédéfini (par exemple, 10 % dans la valeur p du test KS) peuvent déclencher des pipelines de recyclage automatisés.

A/B Essai des variations d'algorithme

Si l'algorithme A atteint un CTR de 3,2 % et l'algorithme B atteint 3,5 %, l'amélioration relative est de (3,5 – 3,2) / 3,2 × 100 = 9,4 %. Cependant, une petite différence absolue (0,3 point de pourcentage) peut nécessiter une grande taille d'échantillon pour atteindre une signification statistique.

Pièges communs lorsque vous travaillez avec des pourcentages

Des pourcentages mal interprétés peuvent conduire à des conclusions erronées.

  • Taux de base Fausseté : Par exemple, un test qui est précis à 99 % pour une maladie qui touche 1 personne sur 10 000 produira des résultats positifs plus faux que de vrais résultats positifs. Le pourcentage de prédictions positives qui sont vraies (précision) peut être inférieur à 10 %, même avec une sensibilité et une spécificité à 99 %.
  • Comparaison des pourcentages de différentes bases : Un algorithme avec une précision de 90 % sur 100 échantillons n'est pas nécessairement meilleur qu'un algorithme avec une précision de 85 % sur 10 000 échantillons. L'estimation de ce dernier est plus fiable.
  • Ignorer l'échelle : Une amélioration de 5 % de la précision, de 95 % à 99,75%, est en fait une réduction de 5× du taux d'erreur (de 5 % à 0,25 %), qui peut être beaucoup plus significative qu'une amélioration de 5 %, de 50 % à 55 %.
  • Le Paradox de Simpson : Par exemple, l'algorithme A pourrait avoir une meilleure précision sur les sous-groupes masculin et féminin, mais une plus grande précision globale en raison de la taille différente des groupes.

Pour éviter ces équations, présentez toujours les chiffres bruts, la taille de base et la réduction absolue des erreurs en plus du pourcentage. Utilisez une matrice de confusion avec les pourcentages de lignes et de colonnes pour rendre les dépendances visibles.

Visualisation des pourcentages pour une meilleure communication

Les pourcentages deviennent plus pertinents lorsqu'ils sont visualisés. Les graphiques communs comprennent :

  • Cartes à barres empilées montrant le pourcentage de prévisions correctes par rapport à des prévisions incorrectes pour différentes catégories.
  • Graphiques à tarte pour des proportions simples (p. ex. pourcentage de temps passé en différentes phases algorithmiques).
  • Cartes thermiques avec des valeurs cellulaires en pourcentages pour les matrices de confusion, ce qui facilite la détection des classes confondues. Normaliser chaque ligne pour s'élever à 100% pour voir la distribution des étiquettes vraies par classe prédite.
  • Fonctions de distribution cumulative normalisées pour les percentiles de latence (p. ex., « 99 % des demandes de renseignements sont terminées moins de 200 ms »).
  • Cartes radar Pour comparer plusieurs mesures basées sur des pourcentages, on peut utiliser des algorithmes (p. ex. précision, rappel, F1, ASC et précision équilibrée).
  • Graphiques de balles pour montrer les performances réelles en pourcentage par rapport à une cible ou un repère, souvent utilisés dans les tableaux de bord.

Toujours indiquer les axes avec les pourcentages de tiques et inclure le dénominateur dans le titre ou la légende (p. ex., « Acquête (30 000 échantillons) »).

Conclusion : Les pourcentages comme outil de comparaison universel

Des pourcentages distillent les performances complexes de l'algorithme en des informations intuitives et évolutives. De la précision et du rappel aux taux de succès du cache et à l'efficacité parallèle, ils permettent aux praticiens de comparer les algorithmes entre les différentes tailles de problèmes, domaines et détails de mise en oeuvre. Cependant, les pourcentages doivent être contextualisés avec les distributions de données, la signification statistique et les coûts spécifiques au domaine.

Pour plus de détails sur les concepts fondamentaux, voir le Matrice de confusion sur Wikipédia, le Cours de Google Machine Learning sur la précision et les rappelset les Guide d'évaluation des modèles d'apprentissage de la science pour des mises en œuvre pratiques. "La relation entre la précision et les courbes ROC" par Davis et Goadrich fournit une perspective statistique plus profonde.