Les benchmarks d'IA sont essentiels pour évaluer la performance d'un modèle. Voici un aperçu de ce que les benchmarks peuvent et ne peuvent pas faire.

Google DeepMind via Pexels
Les élèves passent des tests standardisés à l'école pour évaluer leur performance par rapport à leurs camarades. C'est le même principe que pour les benchmarks de l'intelligence artificielle (IA), qui testent les capacités de chaque modèle et montrent aux entreprises où elles doivent s'améliorer. Bien qu'il n'existe pas de test parfait, les benchmarks peuvent aider les entreprises d'IA à créer des modèles plus sûrs et plus fiables pour un usage personnel et professionnel.

Neeqolah Creative Works via Unsplash
Un système d'IA est un modèle qui utilise pour analyser les données, générer du contenu et prendre des décisions. Avant que les entreprises ne publient des systèmes d'IA au public, les modèles subissent des formations et des tests. Pourtant, même après des tests rigoureux, les modèles peuvent fournir ou générer du contenu nuisible.
Rejoignez plus de 500 000 lecteurs qui commencent leur journée avec Quartz.
En vous abonnant, vous acceptez nos Conditions d'utilisation et notre Politique de confidentialité.
C'est là que Les benchmarks d'IA entrent en jeu. Un benchmark est un test qui évalue les performances du modèle et les compare à d'autres systèmes ou à un ensemble de réponses standardisées. Lorsque les entreprises obtiennent les résultats, elles peuvent identifier les domaines nécessitant des améliorations et évaluer comment leurs modèles se comparent à d'autres logiciels d'IA sur le marché.
Pendant le test, les modèles d'IA accomplissent un ensemble de tâches qui peuvent inclure l'extraction d'informations à partir d'un ensemble de questions ou d'images. Les tâches courantes incluent la traduction, la reconnaissance d'objets, la génération de code, la compréhension du langage et le raisonnement. Ensuite, les développeurs reçoivent un score de test qui les aide à évaluer l'utilité de leur modèle.
Les résultats peuvent inclure ces métriques :
Voici quelques-uns des benchmarks IA les plus célèbres :
Les résultats des benchmarks indiquent aux développeurs dans quelle mesure leur IA fonctionne par rapport à d'autres modèles. Une fois qu'ils ont analysé les forces et les faiblesses de leur modèle, ils peuvent le rendre public ou continuer à peaufiner le logiciel pour améliorer son score. Cela aide les développeurs à fixer des objectifs et à respecter leurs délais.
De plus, les benchmarks offrent un aperçu de l'avancement global de l'IA. Au fur et à mesure que les modèles réussissent ces examens, les développeurs créent des benchmarks plus avancés qui mettent l'IA au défi d'atteindre de nouveaux sommets. Ces examens peuvent contenir des ensembles de données plus larges, des normes plus élevées, des tâches de plus en plus difficiles et plus de ressources pour les créateurs.
Avec ces informations, les entreprises peuvent choisir le meilleur modèle pour leurs tâches. Selon leurs besoins, elles peuvent vouloir un logiciel qui excelle dans la traduction, l'analyse de texte, la détection d'images, les mathématiques, les prévisions ou l'écriture. De bons scores de benchmark peuvent donner aux entreprises la confiance qu'elles investissent dans le bon logiciel.
Bien que les benchmarks donnent aux développeurs une idée générale de l'efficacité de leur modèle, ils ne peuvent pas prédire les performances du logiciel dans des situations réelles. Les benchmarks soumettent les modèles à un nombre limité de tests dans un environnement contrôlé. Cependant, une fois que le public commence à utiliser ces modèles, il inventera des scénarios que les créateurs de benchmarks n'ont jamais envisagés.
En conséquence, il est impossible de déterminer comment une IA réagira dans chaque situation. Les benchmarks sont un outil utile, mais ils ne garantissent rien.
De même, un score élevé aux benchmarks ne prouve pas que le modèle d'IA comprend les données comme un utilisateur humain. Le modèle peut exceller à répondre aux questions de test mais avoir du mal avec le raisonnement, la compréhension et l'analyse, ce qui le rend moins utile pour les entreprises qui attendent une réflexion approfondie de leur logiciel.
En général, les benchmarks testent les capacités techniques du modèle, telles que la reconnaissance d'objets et la compréhension du langage. Cependant, ils n'évaluent pas la capacité de l'IA à se comporter de manière juste et éthique, à s'adapter à des invites inhabituelles ou à proposer des réponses créatives. Pour ces tâches, un modèle peut nécessiter une formation avec des testeurs humains.
Les benchmarks peuvent encourager les développeurs à "enseigner le test" en créant des bots qui réussissent leurs examens mais échouent à relever les défis du monde réel, tels que résumer des documents ou générer de la poésie. Lorsque les entreprises forment leurs modèles sur un ensemble de données limité, le logiciel peut se bloquer lorsqu'il rencontre une invite qu'il n'a jamais vue auparavant.
Ces ensembles de données pourraient aussi avoir biais qui influencent les scores du modèle ou l'encouragent à produire des contenus nuisibles. Par exemple, lorsque les collecteurs récupèrent des textes et des images pour ces ensembles de données, ils peuvent inclure des matériels racistes ou sexistes qui conduisent à des microagressions.
Beaucoup de références sont obsolètes, ce qui entraîne des résultats erronés. Bien qu'un modèle puisse obtenir un score parfait, l'examen pourrait avoir recueilli des informations à partir de sites Web anciens ou défaillants hébergeant des données inexactes. Cela oblige les entreprises à tester à nouveau leurs modèles avec des références avancées, telles que le défi ultra-difficile "L'examen final de l'humanité".
De plus, certaines tâches sont tout simplement difficiles à évaluer. Un benchmark pourrait tester un modèle pour des faits basiques, mais il peut avoir du mal à comprendre des concepts avancés, comme écrire une chanson originale ou répondre à des questions pièges. Sans une formation rigoureuse, une IA peut décevoir les utilisateurs en échouant à émuler les traits humains attendus, tels que le bon sens.