Présentation
Arena est une plateforme communautaire destinée à utiliser, comparer et évaluer des modèles d’intelligence artificielle dans des situations réelles. Elle permet d’envoyer une même demande à plusieurs modèles, de confronter leurs résultats et d’indiquer celui que l’on préfère.
Le projet a été lancé en 2023 par des chercheurs de l’UC Berkeley et de l’écosystème LMSYS sous le nom de Chatbot Arena. Il s’agissait initialement d’une expérience académique consacrée aux grands modèles de langage et à l’évaluation par préférences humaines.
Chatbot Arena est ensuite devenu LMArena, puis simplement Arena en janvier 2026. Ce changement de nom reflète l’élargissement du projet au-delà des seuls language models : la plateforme couvre désormais le texte, le code, la recherche Web, la vision, les documents, les images, les vidéos, le développement d’interfaces et les agents.
Arena est aujourd’hui exploité par Arena Intelligence, Inc.. L’entreprise conserve l’approche communautaire et scientifique du projet d’origine tout en développant des services commerciaux d’évaluation destinés aux laboratoires d’intelligence artificielle, aux entreprises et aux développeurs.
Le fonctionnement historique d’Arena repose sur le Battle Mode. Deux modèles anonymes reçoivent le même prompt et produisent chacun une réponse. L’utilisateur compare les résultats sans connaître l’identité des modèles, puis vote pour la meilleure réponse, déclare une égalité ou signale que les deux résultats sont insuffisants.
Les noms des modèles sont révélés après le vote. Cette anonymisation cherche à réduire l’influence de la marque, de la réputation ou des attentes de l’utilisateur sur son jugement.
Les votes sont ensuite agrégés pour construire des classements publics. Contrairement à un benchmark composé d’une liste fixe de questions, Arena s’appuie sur des demandes réelles soumises par sa communauté. Les modèles sont donc confrontés à des usages, langues, styles et niveaux de difficulté très variés.
La plateforme ne se limite plus aux combats anonymes. Le Direct Mode permet de sélectionner un modèle précis et de l’utiliser comme un assistant classique. Le mode Side by Side permet de choisir deux modèles identifiés afin de comparer directement leur comportement.
Arena propose également Max, un routeur qui analyse la demande et sélectionne automatiquement un modèle en fonction de ses performances observées et de sa latence. Max couvre plusieurs modalités, notamment le texte, la recherche, la vision, la génération et l’édition d’images ainsi que le développement front-end.
Code Arena confronte les modèles sur la création d’interfaces, de sites et d’applications. L’utilisateur peut consulter les propositions, prévisualiser les résultats, examiner le code et poursuivre la conversation pour améliorer les deux versions.
Agent Mode étend le fonctionnement à des tâches plus longues et structurées. L’agent peut rechercher des informations, manipuler des fichiers, produire des images, écrire du code et utiliser un environnement de type terminal ou sandbox.
Les différents votes alimentent plusieurs classements spécialisés. Un modèle peut ainsi être performant en rédaction générale sans occuper la même position pour le code, la recherche, l’analyse de documents, la génération d’images ou la vidéo.
Arena constitue donc à la fois un outil gratuit permettant d’essayer de nombreux modèles, un comparateur interactif, une plateforme de collecte de préférences humaines et une infrastructure publique d’évaluation de l’intelligence artificielle.
Le service Web reste propriétaire. Arena publie toutefois une partie de ses données, travaux de recherche et outils méthodologiques. Le moteur Arena-Rank, utilisé pour calculer les classements, est notamment disponible sous licence Apache-2.0.
Fonctionnalités
-
Battle Mode : confrontation de deux modèles recevant exactement la même demande.
-
Modèles anonymes : masquage de leur identité pendant la comparaison afin de limiter les biais liés à la marque.
-
Révélation après le vote : affichage du nom des deux modèles une fois le jugement enregistré.
-
Vote pour la réponse A ou B : sélection du résultat considéré comme le plus utile ou le plus réussi.
-
Égalité : possibilité d’indiquer que les deux réponses présentent une qualité comparable.
-
Deux réponses insuffisantes : signalement lorsque les deux modèles échouent ou produisent un résultat inutilisable.
-
Conversations en plusieurs tours : poursuite d’un échange pour comparer la manière dont les modèles conservent le contexte.
-
Direct Mode : utilisation d’un modèle choisi explicitement, sans confrontation anonyme.
-
Side by Side : sélection de deux modèles identifiés afin de les comparer directement.
-
Sélecteur de modèles : liste des modèles disponibles, classés et filtrables selon leurs modalités.
-
Informations sur les modalités : icônes permettant d’identifier les capacités de texte, vision, image, vidéo ou autres d’un modèle.
-
Modèles propriétaires : accès à des modèles commerciaux fournis par leurs éditeurs.
-
Modèles open weight : présence de modèles dont les poids sont téléchargeables sous différentes licences.
-
Nouveaux modèles en avant-première : évaluation occasionnelle de modèles avant leur lancement public définitif.
-
Max Smart Router : sélection automatique du modèle jugé adapté à une demande.
-
Routage selon les performances : utilisation des résultats de la communauté pour orienter le choix du modèle.
-
Prise en compte de la latence : recherche d’un compromis entre qualité du résultat et rapidité de réponse.
-
Max multimodal : routage disponible pour plusieurs catégories au-delà du texte.
-
Recherche Web avec Max : sélection automatique d’un modèle ou système adapté aux questions nécessitant des informations en ligne.
-
Vision avec Max : analyse de demandes comportant des images.
-
Génération d’images avec Max : orientation automatique vers un modèle visuel approprié.
-
Édition d’images avec Max : choix d’un modèle spécialisé dans la transformation de visuels.
-
Développement front-end avec Max : routage des demandes de création de pages ou d’interfaces.
-
Text Arena : comparaison de modèles sur la conversation, la rédaction, le raisonnement et les tâches généralistes.
-
Code Arena : confrontation de modèles capables de produire du code et des interfaces.
-
WebDev Arena : classement consacré à la création d’applications et de sites Web.
-
Image-to-WebDev Arena : évaluation de la capacité à transformer une référence visuelle en interface Web.
-
Vision Arena : comparaison de modèles capables d’analyser des images.
-
Document Arena : interrogation et comparaison de modèles à partir de documents importés, notamment des PDF.
-
Search Arena : comparaison de systèmes utilisant la recherche Web pour produire des réponses documentées.
-
Text-to-Image Arena : confrontation de modèles générant des images depuis un prompt.
-
Image Edit Arena : comparaison des modèles de modification ou transformation d’images.
-
Text-to-Video Arena : évaluation de modèles générant une vidéo depuis une description.
-
Image-to-Video Arena : animation ou transformation d’une image en vidéo.
-
Video Edit Arena : comparaison de systèmes capables de modifier des vidéos.
-
Agent Arena : évaluation de modèles ou orchestrateurs réalisant des tâches complexes avec plusieurs outils.
-
Image Arena : génération de deux images anonymes à partir d’un même prompt.
-
Comparaison visuelle : choix du résultat le plus fidèle, esthétique ou pertinent selon la demande.
-
Video Arena : génération et comparaison de vidéos par plusieurs modèles.
-
Importation de fichiers : ajout de documents ou ressources compatibles dans certains modes.
-
Analyse de PDF : questions, résumés et extraction d’informations depuis des documents.
-
Analyse d’images : description, interprétation ou raisonnement à partir d’un visuel.
-
Recherche sur le Web : production de réponses utilisant des informations récentes et des sources en ligne.
-
Génération d’images : utilisation gratuite et limitée de modèles de création visuelle.
-
Édition d’images : transformation d’un contenu visuel fourni par l’utilisateur.
-
Génération vidéo : création de séquences depuis un texte ou une image selon les modèles disponibles.
-
Agent Mode : réalisation de workflows plus longs que les interactions classiques.
-
Recherche intégrée aux agents : collecte d’informations depuis le Web au cours d’une tâche.
-
Outils de programmation : génération et modification de code dans un workflow agentique.
-
Sandbox et Bash : environnement d’exécution permettant à un agent d’effectuer certaines opérations techniques.
-
Création de fichiers : production de ressources au cours d’une tâche complexe.
-
Maintien du contexte : poursuite d’un projet entre plusieurs étapes d’un même échange.
-
Évaluation des agents : classement fondé sur plusieurs signaux allant au-delà d’un vote final unique.
-
Confirmed Success : mesure de la réussite confirmée d’une tâche agentique.
-
Praise vs Complaint : prise en compte des réactions positives ou négatives de l’utilisateur.
-
Steerability : évaluation de la capacité d’un agent à suivre les corrections et nouvelles instructions.
-
Bash Recovery : analyse de la manière dont l’agent récupère après une erreur d’exécution.
-
Tool Hallucination : détection des outils ou actions prétendus sans avoir réellement été utilisés.
-
Prévisualisation des interfaces : affichage direct des applications produites dans Code Arena.
-
Affichage du code : consultation des fichiers ou blocs générés par les modèles.
-
Itérations conversationnelles : amélioration progressive des deux propositions dans Code Arena.
-
Liens de prévisualisation : possibilité de partager certains prototypes générés.
-
Leaderboards publics : consultation des classements sans devoir créer un compte.
-
Classement général : vue synthétique des principaux résultats à travers plusieurs arènes.
-
Classements spécialisés : séparation des modèles selon leur tâche ou modalité.
-
Rank : position brute du modèle selon son score central.
-
Rank Spread : plage de positions possibles compte tenu de l’incertitude statistique.
-
Score Arena : estimation relative de la performance du modèle d’après ses confrontations.
-
Intervalle de confiance : indication de l’incertitude associée au score.
-
Nombre de votes : volume de comparaisons utilisées pour évaluer le modèle.
-
Prix par million de tokens : information indicative sur le tarif d’entrée et de sortie du modèle lorsqu’elle est disponible.
-
Mises à jour dynamiques : évolution des scores à mesure que de nouveaux votes sont collectés.
-
Filtres de modèles : sélection selon le fournisseur, la catégorie ou d’autres caractéristiques.
-
Expert Leaderboard : classement fondé sur des prompts soumis ou sélectionnés par des contributeurs experts.
-
Occupational Leaderboards : analyse des performances selon des domaines professionnels.
-
Classements par profession : comparaison dans des catégories telles que le développement, la recherche, le droit ou d’autres secteurs disponibles.
-
Factuality Leaderboard : classement combinant préférence humaine et exactitude des affirmations.
-
Signal de factualité : vérification automatisée d’affirmations pouvant être confrontées à des sources Web.
-
Pondération configurable de la factualité : ajout d’un poids spécifique au signal de correction factuelle.
-
Classement Text avec factualité : comparaison des modèles de texte en tenant compte de l’exactitude.
-
Classement Search avec factualité : évaluation des modèles utilisant la recherche selon la qualité et la correction de leurs affirmations.
-
Contrôle du style : méthodologie destinée à limiter l’avantage artificiel lié à certaines habitudes de présentation.
-
Modèle Bradley-Terry : estimation des performances relatives à partir des résultats de confrontations deux à deux.
-
Arena-Rank : paquet Python utilisé pour calculer les scores et classements.
-
Intervalles calculés statistiquement : quantification de l’incertitude plutôt qu’affichage d’une position comme une vérité absolue.
-
Rééquilibrage des modèles : méthode limitant certains effets liés aux différences de volume de confrontations.
-
Méthodologie open source : publication du moteur de classement sous licence Apache-2.0.
-
Données publiques partielles : diffusion d’une partie des conversations, votes ou résultats sous forme de jeux de données.
-
Historique des leaderboards : mise à disposition de données permettant d’étudier l’évolution des classements.
-
Changelog méthodologique : journal des modifications apportées au système d’évaluation.
-
Publications scientifiques : documentation des méthodes et résultats dans plusieurs articles de recherche.
-
Critères de présence dans les classements : obligation pour les modèles d’être disponibles publiquement ou de respecter les règles d’avant-première.
-
Modèles open weight admissibles : présence possible lorsqu’un modèle est publiquement téléchargeable.
-
Modèles accessibles par API : admissibilité des modèles disposant d’une API publique et documentée.
-
Services publics admissibles : prise en compte des modèles disponibles dans une application largement accessible.
-
Évaluation préalable au lancement : possibilité encadrée de tester un modèle avant sa sortie publique.
-
Minimum de confrontations : collecte d’un nombre suffisant de votes avant de considérer un score comme stabilisé.
-
Création de compte par email : inscription avec une adresse vérifiée.
-
Connexion avec Google : authentification au moyen d’un compte Google.
-
Historique des conversations : conservation des chats associés au compte.
-
Synchronisation entre appareils : récupération de l’historique après connexion sur un autre navigateur.
-
Archivage des échanges : organisation des conversations enregistrées.
-
Suppression de sessions : retrait de certains chats depuis l’interface utilisateur.
-
Accès sans compte aux classements : consultation publique des leaderboards.
-
Fonctions supplémentaires après connexion : accès à Direct, Side by Side, Image Arena et Video Arena.
-
Limites plus élevées pour les comptes connectés : différence de quotas entre utilisateurs anonymes et enregistrés.
-
Limites propres à chaque modèle : restriction du nombre de requêtes vers certains modèles particulièrement coûteux ou sollicités.
-
Limite globale des chats : plafond sur le volume total d’utilisation.
-
Solde quotidien d’usage : mécanisme de limitation destiné à répartir les ressources disponibles.
-
Réinitialisation après vingt-quatre heures : récupération automatique de l’accès après l’épuisement du quota quotidien.
-
Accès gratuit sans option prioritaire payante : absence actuelle d’un abonnement grand public supprimant les limites.
-
Évaluations commerciales : prestations destinées aux fournisseurs de modèles et entreprises.
-
Rapports fondés sur les préférences humaines : analyse professionnelle des performances d’un modèle sur des usages réels.
Cas d’usage
Comparer deux modèles sans connaître leur marque
Battle Mode permet d’envoyer la même question à deux modèles anonymes et de comparer directement leurs réponses.
L’utilisateur juge uniquement le résultat visible, sans être influencé par le nom OpenAI, Anthropic, Google, Meta, Mistral ou celui d’un autre éditeur.
Cette approche est utile pour déterminer quel modèle répond réellement le mieux à une demande précise plutôt que de se fier uniquement à sa réputation.
Choisir un assistant généraliste
Arena peut être utilisé pour tester plusieurs modèles avec les tâches habituelles d’un assistant : rédaction, explication, résumé, traduction, analyse ou génération d’idées.
En répétant les comparaisons avec ses propres prompts, l’utilisateur peut identifier les modèles dont le ton, la précision et le niveau de détail correspondent le mieux à ses attentes.
Le classement général fournit une première indication, mais les tests personnels restent plus pertinents pour choisir un outil quotidien.
Vérifier quel modèle écrit le mieux
Une même consigne de rédaction peut être soumise à deux modèles pour comparer la structure, le style, la créativité et le respect des contraintes.
Cette méthode convient aux articles, descriptions, scénarios, dialogues, synthèses, contenus marketing et publications sociales.
Le vote reste subjectif : une réponse plus élégante n’est pas forcément plus exacte ou mieux adaptée à une ligne éditoriale particulière.
Comparer les modèles pour la programmation
Code Arena permet de confronter plusieurs modèles sur la création d’un composant, d’une interface ou d’une application.
Les deux résultats peuvent être prévisualisés et leur code examiné avant le vote.
Un développeur peut ainsi évaluer non seulement l’apparence finale, mais aussi la lisibilité, la structure, la maintenabilité et la conformité technique du code.
Construire rapidement un prototype Web
L’utilisateur peut décrire une page, une application ou un composant puis laisser deux modèles produire leur proposition.
La conversation peut ensuite se poursuivre pour ajouter des fonctions, corriger une interface ou modifier le design.
Cette approche convient aux maquettes, démonstrations, landing pages et premières explorations d’un produit.
Comparer une reproduction depuis une image
Image-to-WebDev permet de fournir une référence visuelle puis d’observer la manière dont plusieurs modèles la transforment en interface.
Cette fonction peut servir à tester la fidélité au cadrage, aux couleurs, à la typographie et à la hiérarchie visuelle.
Le résultat doit toutefois être vérifié pour l’accessibilité, le responsive design et la qualité du code.
Choisir un modèle de génération d’images
Image Arena soumet le même prompt à deux modèles anonymes et présente leurs résultats côte à côte.
L’utilisateur peut comparer la fidélité à la demande, la composition, le style, les détails, l’anatomie et la qualité du texte intégré.
Les votes alimentent ensuite le classement Text-to-Image.
Évaluer un outil de retouche générative
Image Edit Arena permet de comparer la manière dont plusieurs modèles transforment une même image selon une instruction.
Cette évaluation peut porter sur le respect de l’identité, la conservation du décor, la précision des modifications et l’absence d’artefacts.
Elle est utile pour choisir un modèle de remplacement d’objet, de changement de style ou de modification locale.
Comparer les générateurs de vidéo
Video Arena permet de confronter des modèles de texte vers vidéo ou d’image vers vidéo.
Les critères peuvent inclure la cohérence du mouvement, le respect du prompt, la stabilité des personnages, la qualité visuelle et la continuité temporelle.
Le classement peut aider à repérer les modèles les plus appréciés, mais une vidéo doit toujours être examinée dans son intégralité.
Tester la compréhension visuelle
Vision Arena compare les réponses de modèles recevant une image et une question.
Cette fonction peut être utilisée pour décrire une scène, lire une interface, interpréter un graphique ou analyser une référence créative.
Les erreurs de reconnaissance et d’interprétation restent possibles, notamment lorsque le visuel est ambigu ou très détaillé.
Interroger un document
Document Arena permet de charger un document, notamment un PDF, puis de poser des questions à plusieurs modèles.
L’utilisateur peut comparer leur capacité à résumer, retrouver une information, interpréter un tableau ou suivre une consigne liée au contenu.
Cette fonction ne doit pas être utilisée avec des documents confidentiels ou contenant des données sensibles.
Comparer les assistants de recherche Web
Search Arena évalue les modèles capables de rechercher des informations récentes et de produire une réponse documentée.
L’utilisateur peut examiner la pertinence des sources, la couverture du sujet, la qualité des citations et la synthèse finale.
Le filtre de factualité fournit un signal complémentaire sur la correction des affirmations, sans remplacer une vérification humaine.
Identifier un modèle selon une profession
Les classements Occupational permettent d’observer les différences entre modèles selon des catégories de travail.
Un modèle bien classé globalement peut être moins performant sur des demandes juridiques, scientifiques, techniques ou rédactionnelles spécialisées.
Ces filtres aident à éviter de réduire la qualité d’un modèle à un score général unique.
Examiner les performances sur des prompts experts
Expert Leaderboard se concentre sur des demandes provenant de contributeurs disposant d’une expertise particulière.
Il peut fournir un signal plus exigeant que les prompts généralistes de la communauté.
La représentation des disciplines et profils d’experts doit néanmoins être prise en compte lors de l’interprétation du classement.
Tester un modèle avant de souscrire à son service
Arena donne accès à de nombreux modèles propriétaires sans nécessiter un abonnement individuel auprès de chaque éditeur.
Il devient possible d’essayer une réponse, comparer plusieurs modèles et repérer ceux qui méritent un test plus approfondi.
Les quotas, paramètres et intégrations proposés dans Arena ne reproduisent toutefois pas nécessairement l’expérience complète de l’application officielle.
Laisser Max sélectionner le modèle
Max convient aux personnes qui ne souhaitent pas choisir manuellement entre des dizaines de références.
Le routeur analyse la modalité et la demande, puis sélectionne un modèle en tenant compte des performances et de la latence.
Cette simplicité réduit le contrôle sur la décision de routage et ne garantit pas que le modèle choisi sera toujours optimal pour un besoin très particulier.
Réaliser une tâche complexe avec un agent
Agent Mode peut réunir recherche, analyse, programmation, génération d’images et manipulation de fichiers au sein d’un même workflow.
Il convient à la préparation d’un projet, la création d’un prototype, une recherche approfondie ou l’organisation de plusieurs opérations successives.
Les outils employés et les commandes exécutées doivent être contrôlés, en particulier lorsque des fichiers ou un environnement Bash sont impliqués.
Suivre l’évolution du marché de l’IA
Les leaderboards permettent d’observer les nouvelles versions, les changements de position et l’apparition de nouveaux fournisseurs.
Ils constituent une ressource utile pour une veille sur le texte, le code, l’image, la vidéo, la recherche et les agents.
Une position doit toujours être interprétée avec sa date, son nombre de votes et son intervalle de confiance.
Étudier les préférences des utilisateurs
Les données et publications d’Arena peuvent être utilisées pour analyser la manière dont les humains évaluent les réponses des modèles.
Les chercheurs peuvent étudier les biais de style, les différences de langues, les domaines professionnels ou l’évolution des préférences.
Seule une partie des données est rendue publique, après différents traitements et filtrages.
Reproduire un système de classement
Arena-Rank permet aux chercheurs et développeurs de calculer leurs propres classements à partir de données de confrontations.
Le paquet peut être appliqué aux modèles d’intelligence artificielle, mais également à d’autres compétitions basées sur des comparaisons deux à deux.
La création d’un système fiable exige néanmoins un échantillonnage, un nettoyage des données et une interprétation statistique appropriés.
Avis PANACHES
Arena occupe une place particulière dans l’écosystème de l’intelligence artificielle. Il ne s’agit ni d’un simple assistant, ni d’un agrégateur classique, ni d’un benchmark fixe : la plateforme combine accès aux modèles, comparaison interactive, collecte de préférences et recherche méthodologique.
Son principal atout réside dans la comparaison anonyme. Les utilisateurs connaissent souvent la réputation d’un modèle avant même de lire sa réponse. Masquer son identité limite une partie de ce biais et oblige à juger le résultat réellement produit.
Cette anonymisation ne supprime pas tous les biais. Certaines signatures rédactionnelles, formats de citations ou habitudes stylistiques peuvent permettre de reconnaître un fournisseur. Le jugement reste aussi influencé par les préférences personnelles de l’utilisateur.
La collecte de prompts réels constitue un autre avantage important. Les benchmarks traditionnels finissent souvent par être connus, optimisés ou contaminés par les données d’entraînement. Arena confronte continuellement les modèles à de nouvelles demandes issues d’usages quotidiens.
Cette diversité rapproche l’évaluation des conditions réelles, mais rend les données plus difficiles à contrôler. Les prompts peuvent être imprécis, subjectifs, redondants ou concentrés sur les sujets populaires auprès de la communauté.
Le classement ne doit donc pas être interprété comme une mesure absolue de l’intelligence. Il reflète la préférence moyenne observée dans un ensemble de confrontations, à une période donnée et avec les modèles disponibles sur la plateforme.
Le Rank Spread est souvent plus informatif que le rang brut. Deux modèles affichés respectivement en troisième et sixième position peuvent être statistiquement difficiles à départager lorsque leurs intervalles se chevauchent.
Le nombre de votes compte également. Un modèle récemment ajouté peut afficher un score élevé avec davantage d’incertitude qu’un modèle évalué sur des dizaines de milliers de confrontations.
La séparation entre arènes représente une amélioration essentielle. Le meilleur modèle généraliste n’est pas nécessairement le meilleur pour créer une interface, modifier une image, analyser un PDF ou produire une vidéo.
Les filtres professionnels et experts renforcent cette lecture spécialisée. Ils permettent de rechercher une performance pertinente pour un métier plutôt que de suivre aveuglément le classement global.
L’ajout d’un signal de factualité répond à une faiblesse importante des votes humains. Une réponse longue, assurée et bien présentée peut être préférée même lorsqu’elle contient plusieurs erreurs.
Le classement de factualité ne résout pas entièrement le problème. La vérification automatisée dépend de l’extraction des affirmations, de la recherche Web, des sources disponibles et du système chargé de déterminer leur correction.
Arena reste néanmoins plus transparent que de nombreux classements commerciaux. La publication d’Arena-Rank, d’une partie des données, des articles scientifiques et du changelog permet d’examiner une partie importante du processus.
La plateforme devient aussi un véritable agrégateur de modèles. Direct Mode et Side by Side donnent gratuitement accès à des modèles qui exigeraient normalement plusieurs comptes ou abonnements distincts.
Cet accès est particulièrement utile pour découvrir un nouveau modèle. Il faut toutefois éviter de conclure trop vite que son comportement dans Arena sera identique à celui de son application officielle.
Les fournisseurs peuvent utiliser des system prompts, réglages, quotas ou points d’accès différents. Certaines fonctions natives, mémoires, connecteurs, projets ou paramètres avancés ne sont pas reproduits.
Max représente une approche intéressante de la sélection automatique. Au lieu de demander à l’utilisateur de connaître les forces de chaque modèle, Arena utilise ses données d’évaluation pour orienter la requête.
Cette idée rejoint directement les besoins de PANACHES autour de la sélection intelligente des modèles. Une tâche de code, une recherche documentaire, une génération d’image ou une conversation légère ne devraient pas nécessairement utiliser le même moteur.
Le routage automatique introduit cependant une nouvelle couche opaque. Pour un projet reproductible, il peut être préférable de fixer explicitement le modèle plutôt que de laisser le routeur évoluer au fil de ses mises à jour.
Agent Mode montre également l’évolution d’Arena vers un environnement de travail plus complet. La plateforme ne mesure plus uniquement une réponse isolée, mais la capacité à mener une tâche, utiliser des outils et récupérer après une erreur.
Cette évaluation est plus proche des usages modernes des agents, mais elle devient aussi plus complexe. La réussite dépend du modèle, de l’orchestrateur, des outils, de la sandbox, des permissions et de la manière dont l’utilisateur formule ses retours.
Les arènes Image et Video donnent à Arena une importance particulière pour les créateurs. Elles rendent visibles les différences entre des modèles dont les démonstrations officielles sont souvent difficiles à comparer objectivement.
Le vote visuel reste toutefois fortement subjectif. Une image spectaculaire peut être préférée à une image plus fidèle au prompt, tandis qu’une vidéo dynamique peut masquer des incohérences de continuité.
Pour PANACHES Media, Arena constitue une excellente source de veille. Les classements permettent de suivre les nouveaux modèles et d’identifier rapidement les outils qui progressent dans le texte, le code, l’image, la vidéo ou la recherche.
Les positions ne devraient pas être reprises seules dans un article. Une analyse sérieuse doit préciser l’arène, la date, le nombre de votes, l’incertitude, la méthode et les limites du signal utilisé.
La principale réserve concerne la confidentialité. Les prompts, images, documents, votes et interactions constituent précisément les données dont Arena a besoin pour améliorer ses évaluations.
La politique de confidentialité prévoit que certaines données peuvent être utilisées pour la recherche, l’amélioration du service et le développement de produits. Elles peuvent aussi être transmises aux fournisseurs des modèles utilisés.
Les conditions accordent par ailleurs à Arena une licence très large sur les contenus transmis et générés. Cette disposition rend le service inadapté aux secrets commerciaux, travaux non publiés, données personnelles et projets confidentiels.
Pour PANACHES, Arena doit donc être considéré comme un laboratoire public de comparaison, et non comme un espace privé destiné aux documents internes.
Son caractère entièrement distant l’éloigne également de la philosophie local-first de PANACHES. Les modèles, quotas, disponibilités et politiques peuvent changer sans contrôle local.
Arena reste malgré tout une référence incontournable. Peu de plateformes réunissent une communauté aussi importante, autant de modalités, un accès direct aux modèles et une méthodologie partiellement auditable.
La fiche mérite donc une place centrale dans l’annuaire PANACHES, à la fois comme outil de comparaison, source de veille, environnement d’expérimentation et exemple de routage fondé sur des évaluations réelles.
Points d’attention
-
Le nom officiel est Arena : LMArena et Chatbot Arena sont d’anciens noms encore présents dans certaines URL, publications ou pages tierces.
-
Ne pas confondre Arena avec une simple liste de benchmarks : le service permet aussi d’utiliser directement des modèles et des agents.
-
Classements en évolution permanente : une position observée aujourd’hui peut changer après de nouveaux votes ou une modification méthodologique.
-
Toujours relever la date : une capture ou un article doit préciser quand le leaderboard a été consulté.
-
Identifier l’arène concernée : Text, Code, Search, Vision, Document, Image et Video ne mesurent pas les mêmes capacités.
-
Ne pas utiliser uniquement le classement général : un modèle peut être excellent dans une catégorie et moyen dans une autre.
-
Examiner le Rank Spread : le rang brut peut exagérer la différence entre des modèles statistiquement proches.
-
Lire les intervalles de confiance : un score central n’est qu’une estimation accompagnée d’une incertitude.
-
Contrôler le nombre de votes : un modèle récent peut disposer d’un échantillon beaucoup plus faible.
-
Les classements sont relatifs : le score dépend des autres modèles présents dans les confrontations.
-
Les résultats ne mesurent pas toutes les qualités : sécurité, coût, consommation, confidentialité et facilité de déploiement ne sont pas résumés par le score.
-
Les votes reflètent une préférence : ils ne garantissent ni la vérité, ni la sécurité, ni la conformité professionnelle.
-
Le style peut influencer le vote : une réponse plus longue, structurée ou assurée peut être préférée indépendamment de sa correction.
-
La factualité reste partielle : toutes les affirmations ne sont pas vérifiables automatiquement sur le Web.
-
Le signal de factualité est pondéré : il ne remplace pas entièrement les préférences humaines dans les classements concernés.
-
Les prompts sont auto-sélectionnés par la communauté : la distribution des usages ne correspond pas forcément à celle d’une entreprise ou d’un pays.
-
Biais linguistiques possibles : les langues les plus utilisées peuvent disposer de davantage de votes et de comparaisons.
-
Biais démographiques possibles : les utilisateurs d’Arena ne représentent pas nécessairement l’ensemble de la population.
-
Reconnaissance possible des modèles : certaines formulations ou présentations peuvent révéler indirectement leur identité.
-
Un vote ne remplace pas une grille d’évaluation : pour un choix professionnel, définir ses propres critères reste préférable.
-
Tester avec ses propres tâches : les prompts du projet sont souvent plus utiles que la position globale.
-
Comparer plusieurs fois : une seule génération peut être affectée par l’aléatoire du modèle.
-
Les modèles peuvent utiliser des réglages spécifiques : leur configuration dans Arena n’est pas forcément identique à celle de leur application officielle.
-
Certaines fonctions natives sont absentes : mémoire, projets, connecteurs, outils ou personnalisation peuvent ne pas être disponibles.
-
Disponibilité variable des modèles : un fournisseur peut limiter, remplacer ou retirer un accès.
-
Les avant-premières sont temporaires : un modèle testé avant sa sortie peut changer ou être retiré du classement.
-
Vérifier l’identité entre preview et version publique : Arena prévoit des règles, mais les différences restent un point à surveiller.
-
Le prix par million de tokens est indicatif : il décrit généralement le tarif API du fournisseur, pas le coût d’utilisation d’Arena.
-
Accès gratuit soumis à des limites : la gratuité ne signifie pas utilisation illimitée.
-
Limites quotidiennes : l’utilisation peut être bloquée jusqu’à la réinitialisation du quota.
-
Limites par modèle : un modèle populaire ou coûteux peut devenir indisponible avant les autres.
-
Limites globales de chat : plusieurs modèles peuvent être affectés par un même plafond général.
-
Aucune formule grand public prioritaire : Arena ne propose actuellement pas de paiement permettant de supprimer ces restrictions.
-
Les quotas peuvent évoluer : le système quotidien est encore susceptible d’être modifié.
-
Créer un compte augmente l’accès : Direct, Side by Side, Image et Video nécessitent généralement une connexion.
-
L’historique dépend du compte : les conversations anonymes peuvent ne pas être récupérables.
-
Une seule identité de compte : les conditions limitent notamment la multiplication des comptes.
-
Service réservé aux adultes : les conditions indiquent un âge minimal de dix-huit ans.
-
Usage personnel ou interne : les conditions limitent l’utilisation générale du service à ces cadres, sauf accord complémentaire.
-
Interdiction de l’automatisation non autorisée : les requêtes programmatiques, bots et extractions automatisées sont limitées par les conditions.
-
Ne pas scraper les classements : l’extraction automatisée des noms, scores et données peut contrevenir aux règles du service.
-
Ne pas manipuler les votes : faux votes, campagnes coordonnées et rémunération en échange de votes sont interdits.
-
Voter honnêtement : sélectionner systématiquement un côté ou tenter d’identifier une marque dégrade la qualité du signal.
-
Ne pas envoyer de données confidentielles : les prompts et fichiers peuvent être traités par Arena et des fournisseurs tiers.
-
Ne pas charger de secrets commerciaux : code privé, contrats, stratégies et documents non publiés doivent rester hors de la plateforme.
-
Éviter les données personnelles : noms, coordonnées, dossiers médicaux, données financières et identifiants sensibles ne doivent pas être transmis.
-
Les fournisseurs de modèles peuvent recevoir les contenus : les données nécessaires à la génération sont envoyées aux services tiers concernés.
-
Les fournisseurs peuvent appliquer leurs propres politiques : chaque modèle peut être régi par des conditions et pratiques différentes.
-
Les prompts peuvent servir à la recherche : Arena indique pouvoir utiliser les votes et demandes pour produire des études et des analyses.
-
Les données peuvent contribuer à l’amélioration : les contenus peuvent être employés pour développer Arena ou les technologies associées.
-
Une partie des données peut être publiée : les conversations, entrées et résultats peuvent apparaître dans des jeux de données ou publications après traitement.
-
Ne rien transmettre qui ne devrait jamais devenir public : la politique recommande explicitement d’éviter tout contenu sensible.
-
Licence étendue sur les contenus : les conditions accordent à Arena des droits mondiaux, transférables, perpétuels et sous-licenciables.
-
Les contenus restent attribués à l’utilisateur entre les parties : cette propriété contractuelle est soumise à la licence accordée au service.
-
Les sorties peuvent ne pas être protégées par le droit d’auteur : Arena ne garantit pas leur éligibilité à une protection juridique.
-
Les sorties ne sont pas nécessairement uniques : d’autres utilisateurs peuvent obtenir des résultats similaires.
-
Respecter les droits sur les fichiers importés : l’utilisateur doit disposer des autorisations nécessaires.
-
Contrôler les images de personnes : l’utilisation d’une apparence reconnaissable peut engager des droits à l’image.
-
Relire toutes les réponses : les modèles peuvent produire des informations fausses, obsolètes ou inventées.
-
Vérifier les citations : Search Arena peut afficher une source qui ne soutient pas exactement l’affirmation associée.
-
Ne pas utiliser seul pour une décision sensible : santé, droit, finance et sécurité exigent des sources et professionnels adaptés.
-
Examiner les fichiers produits par les agents : une tâche réussie en apparence peut contenir des erreurs cachées.
-
Contrôler les commandes Bash : une commande peut modifier, supprimer ou exposer des fichiers dans l’environnement utilisé.
-
Vérifier les outils réellement employés : les hallucinations d’outils font partie des problèmes évalués dans Agent Arena.
-
Relire le code généré : une interface visuellement réussie peut contenir des dépendances inutiles ou des vulnérabilités.
-
Tester le responsive design : une prévisualisation correcte sur un écran ne garantit pas une adaptation mobile.
-
Vérifier l’accessibilité : contraste, navigation clavier, labels et structure sémantique doivent être contrôlés.
-
Contrôler les images générées : anatomie, texte, logos et détails répétitifs peuvent comporter des défauts.
-
Inspecter les vidéos en entier : artefacts, transformations d’identité et incohérences peuvent apparaître au cours du mouvement.
-
Comparer la fidélité, pas seulement l’esthétique : le résultat le plus spectaculaire n’est pas toujours celui qui respecte le mieux la consigne.
-
Arena-Rank n’est pas toute la plateforme : l’ouverture du moteur de classement ne rend pas le service Web complet open source.
-
FastChat est un projet historique distinct : il a servi de base à Chatbot Arena, mais n’est plus le code complet de la plateforme actuelle.
-
Licences multiples : Arena-Rank, les jeux de données, les anciens outils et les modèles tiers peuvent utiliser des licences différentes.
-
Vérifier la licence de chaque modèle : open weight ne signifie pas forcément libre de restrictions commerciales.
-
Les jeux de données publics sont partiels : ils ne permettent pas nécessairement de reproduire exactement l’intégralité du leaderboard en temps réel.
-
Les méthodes peuvent changer : pondérations, filtres, intervalles et règles d’inclusion évoluent avec la recherche.
-
Consulter le changelog : une variation de rang peut provenir d’une mise à jour méthodologique et non d’un changement du modèle.
-
Conserver ses propres résultats : notes, captures et prompts importants doivent être archivés en dehors du service.
-
Prévoir une alternative : l’accès gratuit à un modèle peut être réduit ou interrompu.
-
Ne pas dépendre d’Arena comme API : la plateforme n’est pas conçue comme un endpoint automatisé pour une application.
-
Utiliser l’API officielle du fournisseur pour la production : elle offre généralement des contrats, quotas et paramètres plus adaptés.
-
Comparer avec des évaluations complémentaires : benchmarks automatiques, tests internes, coûts et contraintes techniques doivent compléter Arena.
-
Ne pas confondre popularité et pertinence personnelle : le meilleur modèle moyen n’est pas forcément le meilleur pour le workflow de l’utilisateur.
-
Choisir par tâche : texte, code, recherche, image, vidéo et agents peuvent justifier des modèles différents.
-
Considérer Arena comme un laboratoire public : sa force est l’exploration et la comparaison, pas la confidentialité.