Presentación

Arena es una plataforma comunitaria destinada a utilizar, comparar y evaluar modelos de inteligencia artificial en situaciones reales. Permite enviar una misma solicitud a varios modelos, confrontar sus resultados e indicar cuál se prefiere.

El proyecto fue lanzado en 2023 por investigadores de UC Berkeley y del ecosistema LMSYS bajo el nombre de Chatbot Arena. Inicialmente era un experimento académico dedicado a los grandes modelos de lenguaje y a la evaluación mediante preferencias humanas.

Chatbot Arena se convirtió después en LMArena y, posteriormente, simplemente en Arena en enero de 2026. Este cambio de nombre refleja la ampliación del proyecto más allá de los language models: la plataforma abarca ahora texto, código, búsqueda Web, visión, documentos, imágenes, vídeos, desarrollo de interfaces y agentes.

Arena está actualmente gestionada por Arena Intelligence, Inc. La empresa conserva el enfoque comunitario y científico del proyecto original, al mismo tiempo que desarrolla servicios comerciales de evaluación destinados a laboratorios de inteligencia artificial, empresas y desarrolladores.

El funcionamiento histórico de Arena se basa en el Battle Mode. Dos modelos anónimos reciben el mismo prompt y producen cada uno una respuesta. El usuario compara los resultados sin conocer la identidad de los modelos y después vota por la mejor respuesta, declara un empate o señala que ambos resultados son insuficientes.

Los nombres de los modelos se revelan después del voto. Esta anonimización busca reducir la influencia de la marca, la reputación o las expectativas del usuario sobre su juicio.

Después, los votos se agregan para construir clasificaciones públicas. A diferencia de un benchmark compuesto por una lista fija de preguntas, Arena se basa en solicitudes reales enviadas por su comunidad. Los modelos se enfrentan así a usos, idiomas, estilos y niveles de dificultad muy variados.

La plataforma ya no se limita a enfrentamientos anónimos. El Direct Mode permite seleccionar un modelo concreto y utilizarlo como un asistente convencional. El modo Side by Side permite elegir dos modelos identificados para comparar directamente su comportamiento.

Arena también ofrece Max, un router que analiza la solicitud y selecciona automáticamente un modelo en función de su rendimiento observado y su latencia. Max cubre varias modalidades, entre ellas texto, búsqueda, visión, generación y edición de imágenes, además del desarrollo front-end.

Code Arena compara modelos en la creación de interfaces, sitios y aplicaciones. El usuario puede consultar las propuestas, previsualizar los resultados, examinar el código y continuar la conversación para mejorar ambas versiones.

Agent Mode amplía el funcionamiento a tareas más largas y estructuradas. El agente puede buscar información, manipular archivos, producir imágenes, escribir código y utilizar un entorno similar a un terminal o una sandbox.

Los distintos votos alimentan varias clasificaciones especializadas. Un modelo puede rendir bien en redacción general sin ocupar la misma posición en código, búsqueda, análisis de documentos, generación de imágenes o vídeo.

Arena constituye, por tanto, una herramienta gratuita para probar numerosos modelos, un comparador interactivo, una plataforma de recopilación de preferencias humanas y una infraestructura pública de evaluación de inteligencia artificial.

El servicio Web sigue siendo propietario. Sin embargo, Arena publica una parte de sus datos, investigaciones y herramientas metodológicas. El motor Arena-Rank, utilizado para calcular las clasificaciones, está especialmente disponible bajo licencia Apache-2.0.

Funcionalidades

  • Battle Mode: comparación de dos modelos que reciben exactamente la misma solicitud.

  • Modelos anónimos: ocultación de su identidad durante la comparación para limitar los sesgos relacionados con la marca.

  • Revelación después del voto: visualización del nombre de ambos modelos una vez registrado el juicio.

  • Voto por la respuesta A o B: selección del resultado considerado más útil o mejor logrado.

  • Empate: posibilidad de indicar que ambas respuestas presentan una calidad comparable.

  • Dos respuestas insuficientes: señalización cuando ambos modelos fallan o producen un resultado inutilizable.

  • Conversaciones de varios turnos: continuación de un intercambio para comparar cómo conservan los modelos el contexto.

  • Direct Mode: utilización de un modelo elegido explícitamente, sin confrontación anónima.

  • Side by Side: selección de dos modelos identificados para compararlos directamente.

  • Selector de modelos: lista de los modelos disponibles, ordenables y filtrables según sus modalidades.

  • Información sobre modalidades: iconos que permiten identificar las capacidades de texto, visión, imagen, vídeo u otras de cada modelo.

  • Modelos propietarios: acceso a modelos comerciales proporcionados por sus editores.

  • Modelos open weight: presencia de modelos cuyos pesos pueden descargarse bajo diferentes licencias.

  • Nuevos modelos en acceso anticipado: evaluación ocasional de modelos antes de su lanzamiento público definitivo.

  • Max Smart Router: selección automática del modelo considerado adecuado para una solicitud.

  • Enrutamiento según el rendimiento: utilización de los resultados de la comunidad para orientar la elección del modelo.

  • Consideración de la latencia: búsqueda de un equilibrio entre la calidad del resultado y la velocidad de respuesta.

  • Max multimodal: enrutamiento disponible para varias categorías más allá del texto.

  • Búsqueda Web con Max: selección automática de un modelo o sistema adaptado a preguntas que requieren información en línea.

  • Visión con Max: análisis de solicitudes que incluyen imágenes.

  • Generación de imágenes con Max: orientación automática hacia un modelo visual adecuado.

  • Edición de imágenes con Max: elección de un modelo especializado en la transformación de elementos visuales.

  • Desarrollo front-end con Max: enrutamiento de solicitudes para crear páginas o interfaces.

  • Text Arena: comparación de modelos en conversación, redacción, razonamiento y tareas generalistas.

  • Code Arena: confrontación de modelos capaces de producir código e interfaces.

  • WebDev Arena: clasificación dedicada a la creación de aplicaciones y sitios Web.

  • Image-to-WebDev Arena: evaluación de la capacidad de transformar una referencia visual en una interfaz Web.

  • Vision Arena: comparación de modelos capaces de analizar imágenes.

  • Document Arena: consulta y comparación de modelos a partir de documentos importados, especialmente PDF.

  • Search Arena: comparación de sistemas que utilizan búsqueda Web para producir respuestas documentadas.

  • Text-to-Image Arena: confrontación de modelos que generan imágenes a partir de un prompt.

  • Image Edit Arena: comparación de modelos de modificación o transformación de imágenes.

  • Text-to-Video Arena: evaluación de modelos que generan vídeo a partir de una descripción.

  • Image-to-Video Arena: animación o transformación de una imagen en vídeo.

  • Video Edit Arena: comparación de sistemas capaces de modificar vídeos.

  • Agent Arena: evaluación de modelos u orquestadores que realizan tareas complejas con varias herramientas.

  • Image Arena: generación de dos imágenes anónimas a partir de un mismo prompt.

  • Comparación visual: elección del resultado más fiel, estético o pertinente según la solicitud.

  • Video Arena: generación y comparación de vídeos mediante varios modelos.

  • Importación de archivos: incorporación de documentos o recursos compatibles en determinados modos.

  • Análisis de PDF: preguntas, resúmenes y extracción de información desde documentos.

  • Análisis de imágenes: descripción, interpretación o razonamiento a partir de un elemento visual.

  • Búsqueda en la Web: producción de respuestas que utilizan información reciente y fuentes en línea.

  • Generación de imágenes: uso gratuito y limitado de modelos de creación visual.

  • Edición de imágenes: transformación de un contenido visual proporcionado por el usuario.

  • Generación de vídeo: creación de secuencias a partir de texto o imágenes según los modelos disponibles.

  • Agent Mode: realización de workflows más largos que las interacciones convencionales.

  • Búsqueda integrada en los agentes: recopilación de información desde la Web durante una tarea.

  • Herramientas de programación: generación y modificación de código dentro de un workflow de agente.

  • Sandbox y Bash: entorno de ejecución que permite a un agente realizar determinadas operaciones técnicas.

  • Creación de archivos: producción de recursos durante una tarea compleja.

  • Mantenimiento del contexto: continuación de un proyecto entre varias etapas de un mismo intercambio.

  • Evaluación de agentes: clasificación basada en varias señales que van más allá de un único voto final.

  • Confirmed Success: medición del éxito confirmado de una tarea realizada por un agente.

  • Praise vs Complaint: consideración de las reacciones positivas o negativas del usuario.

  • Steerability: evaluación de la capacidad de un agente para seguir correcciones y nuevas instrucciones.

  • Bash Recovery: análisis de cómo se recupera el agente después de un error de ejecución.

  • Tool Hallucination: detección de herramientas o acciones afirmadas sin haber sido utilizadas realmente.

  • Previsualización de interfaces: visualización directa de las aplicaciones producidas en Code Arena.

  • Visualización del código: consulta de los archivos o bloques generados por los modelos.

  • Iteraciones conversacionales: mejora progresiva de ambas propuestas dentro de Code Arena.

  • Enlaces de previsualización: posibilidad de compartir determinados prototipos generados.

  • Leaderboards públicos: consulta de las clasificaciones sin necesidad de crear una cuenta.

  • Clasificación general: vista resumida de los principales resultados a través de varias arenas.

  • Clasificaciones especializadas: separación de los modelos según su tarea o modalidad.

  • Rank: posición bruta del modelo según su puntuación central.

  • Rank Spread: intervalo de posiciones posibles teniendo en cuenta la incertidumbre estadística.

  • Arena Score: estimación relativa del rendimiento del modelo a partir de sus confrontaciones.

  • Intervalo de confianza: indicación de la incertidumbre asociada a la puntuación.

  • Número de votos: volumen de comparaciones utilizado para evaluar el modelo.

  • Precio por millón de tokens: información indicativa sobre el precio de entrada y salida del modelo cuando está disponible.

  • Actualizaciones dinámicas: evolución de las puntuaciones a medida que se recopilan nuevos votos.

  • Filtros de modelos: selección según el proveedor, la categoría u otras características.

  • Expert Leaderboard: clasificación basada en prompts enviados o seleccionados por colaboradores expertos.

  • Occupational Leaderboards: análisis del rendimiento según campos profesionales.

  • Clasificaciones por profesión: comparación en categorías como desarrollo, investigación, derecho u otros sectores disponibles.

  • Factuality Leaderboard: clasificación que combina preferencia humana y exactitud de las afirmaciones.

  • Señal de factualidad: verificación automatizada de afirmaciones que pueden contrastarse con fuentes Web.

  • Ponderación configurable de la factualidad: incorporación de un peso específico a la señal de corrección factual.

  • Clasificación Text con factualidad: comparación de modelos de texto teniendo en cuenta la exactitud.

  • Clasificación Search con factualidad: evaluación de modelos que utilizan búsqueda según la calidad y corrección de sus afirmaciones.

  • Control del estilo: metodología destinada a limitar la ventaja artificial asociada a determinados hábitos de presentación.

  • Modelo Bradley-Terry: estimación de rendimientos relativos a partir de resultados de comparaciones por pares.

  • Arena-Rank: paquete Python utilizado para calcular puntuaciones y clasificaciones.

  • Intervalos calculados estadísticamente: cuantificación de la incertidumbre en lugar de presentar una posición como una verdad absoluta.

  • Reequilibrio de modelos: método que limita ciertos efectos relacionados con diferencias en el volumen de confrontaciones.

  • Metodología open source: publicación del motor de clasificación bajo licencia Apache-2.0.

  • Datos públicos parciales: publicación de una parte de las conversaciones, votos o resultados en forma de datasets.

  • Historial de leaderboards: disponibilidad de datos que permiten estudiar la evolución de las clasificaciones.

  • Changelog metodológico: registro de los cambios realizados en el sistema de evaluación.

  • Publicaciones científicas: documentación de los métodos y resultados en varios artículos de investigación.

  • Criterios de presencia en las clasificaciones: obligación de que los modelos estén disponibles públicamente o respeten las reglas de acceso anticipado.

  • Modelos open weight admisibles: posible inclusión cuando un modelo puede descargarse públicamente.

  • Modelos accesibles mediante API: admisibilidad de los modelos que disponen de una API pública y documentada.

  • Servicios públicos admisibles: consideración de modelos disponibles dentro de una aplicación ampliamente accesible.

  • Evaluación previa al lanzamiento: posibilidad regulada de probar un modelo antes de su publicación.

  • Número mínimo de confrontaciones: recopilación de suficientes votos antes de considerar estabilizada una puntuación.

  • Creación de cuenta por correo electrónico: registro mediante una dirección verificada.

  • Inicio de sesión con Google: autenticación mediante una cuenta de Google.

  • Historial de conversaciones: conservación de los chats asociados a la cuenta.

  • Sincronización entre dispositivos: recuperación del historial después de iniciar sesión en otro navegador.

  • Archivado de intercambios: organización de las conversaciones guardadas.

  • Eliminación de sesiones: retirada de determinados chats desde la interfaz de usuario.

  • Acceso sin cuenta a las clasificaciones: consulta pública de los leaderboards.

  • Funciones adicionales después de iniciar sesión: acceso a Direct, Side by Side, Image Arena y Video Arena.

  • Límites más altos para cuentas conectadas: diferencia de cuotas entre usuarios anónimos y registrados.

  • Límites específicos para cada modelo: restricción del número de solicitudes hacia modelos especialmente costosos o demandados.

  • Límite global de chats: techo aplicado al volumen total de uso.

  • Saldo diario de utilización: mecanismo de limitación destinado a repartir los recursos disponibles.

  • Restablecimiento después de veinticuatro horas: recuperación automática del acceso tras agotar la cuota diaria.

  • Acceso gratuito sin opción prioritaria de pago: ausencia actual de una suscripción pública que elimine los límites.

  • Evaluaciones comerciales: servicios destinados a proveedores de modelos y empresas.

  • Informes basados en preferencias humanas: análisis profesional del rendimiento de un modelo en usos reales.

Casos de uso

Comparar dos modelos sin conocer su marca

Battle Mode permite enviar la misma pregunta a dos modelos anónimos y comparar directamente sus respuestas.

El usuario juzga únicamente el resultado visible, sin verse influido por los nombres OpenAI, Anthropic, Google, Meta, Mistral o el de otro editor.

Este enfoque resulta útil para determinar qué modelo responde realmente mejor a una solicitud concreta, en lugar de confiar únicamente en su reputación.

Elegir un asistente generalista

Arena puede utilizarse para probar varios modelos con las tareas habituales de un asistente: redacción, explicación, resumen, traducción, análisis o generación de ideas.

Al repetir las comparaciones con sus propios prompts, el usuario puede identificar los modelos cuyo tono, precisión y nivel de detalle se ajustan mejor a sus expectativas.

La clasificación general ofrece una primera indicación, pero las pruebas personales siguen siendo más pertinentes para elegir una herramienta de uso cotidiano.

Comprobar qué modelo escribe mejor

Una misma consigna de redacción puede enviarse a dos modelos para comparar la estructura, el estilo, la creatividad y el respeto de las restricciones.

Este método resulta adecuado para artículos, descripciones, guiones, diálogos, síntesis, contenidos de marketing y publicaciones sociales.

El voto sigue siendo subjetivo: una respuesta más elegante no es necesariamente más exacta ni está mejor adaptada a una línea editorial particular.

Comparar modelos para programación

Code Arena permite confrontar varios modelos en la creación de un componente, una interfaz o una aplicación.

Ambos resultados pueden previsualizarse y su código puede examinarse antes de votar.

Un desarrollador puede evaluar así no solo la apariencia final, sino también la legibilidad, la estructura, la mantenibilidad y la conformidad técnica del código.

Construir rápidamente un prototipo Web

El usuario puede describir una página, una aplicación o un componente y dejar que dos modelos produzcan sus propuestas.

Después, la conversación puede continuar para añadir funciones, corregir una interfaz o modificar el diseño.

Este enfoque resulta adecuado para maquetas, demostraciones, landing pages y primeras exploraciones de un producto.

Comparar una reproducción a partir de una imagen

Image-to-WebDev permite proporcionar una referencia visual y observar cómo varios modelos la transforman en una interfaz.

Esta función puede servir para probar la fidelidad al encuadre, los colores, la tipografía y la jerarquía visual.

Sin embargo, el resultado debe revisarse en términos de accesibilidad, responsive design y calidad del código.

Elegir un modelo de generación de imágenes

Image Arena envía el mismo prompt a dos modelos anónimos y presenta sus resultados en paralelo.

El usuario puede comparar la fidelidad a la solicitud, la composición, el estilo, los detalles, la anatomía y la calidad del texto integrado.

Después, los votos alimentan la clasificación Text-to-Image.

Evaluar una herramienta de retoque generativo

Image Edit Arena permite comparar cómo transforman varios modelos una misma imagen siguiendo una instrucción.

La evaluación puede centrarse en la conservación de la identidad, la coherencia del fondo, la precisión de las modificaciones y la ausencia de artefactos.

Resulta útil para elegir un modelo de sustitución de objetos, cambio de estilo o modificación local.

Comparar generadores de vídeo

Video Arena permite confrontar modelos de texto a vídeo o de imagen a vídeo.

Los criterios pueden incluir la coherencia del movimiento, el respeto del prompt, la estabilidad de los personajes, la calidad visual y la continuidad temporal.

La clasificación puede ayudar a localizar los modelos más apreciados, pero un vídeo siempre debe examinarse por completo.

Probar la comprensión visual

Vision Arena compara las respuestas de modelos que reciben una imagen y una pregunta.

Esta función puede utilizarse para describir una escena, leer una interfaz, interpretar un gráfico o analizar una referencia creativa.

Los errores de reconocimiento e interpretación siguen siendo posibles, especialmente cuando el elemento visual es ambiguo o muy detallado.

Consultar un documento

Document Arena permite cargar un documento, especialmente un PDF, y formular preguntas a varios modelos.

El usuario puede comparar su capacidad para resumir, localizar información, interpretar una tabla o seguir una instrucción relacionada con el contenido.

Esta función no debe utilizarse con documentos confidenciales ni con archivos que contengan datos sensibles.

Comparar asistentes de búsqueda Web

Search Arena evalúa modelos capaces de buscar información reciente y producir una respuesta documentada.

El usuario puede examinar la pertinencia de las fuentes, la cobertura del tema, la calidad de las citas y la síntesis final.

El filtro de factualidad aporta una señal complementaria sobre la corrección de las afirmaciones, sin sustituir una verificación humana.

Identificar un modelo según una profesión

Las clasificaciones Occupational permiten observar diferencias entre modelos según categorías profesionales.

Un modelo bien clasificado globalmente puede rendir peor en solicitudes jurídicas, científicas, técnicas o de redacción especializada.

Estos filtros ayudan a evitar que la calidad de un modelo se reduzca a una única puntuación general.

Examinar el rendimiento con prompts expertos

Expert Leaderboard se centra en solicitudes procedentes de colaboradores con una experiencia particular.

Puede ofrecer una señal más exigente que los prompts generalistas de la comunidad.

Sin embargo, la representación de las disciplinas y perfiles expertos debe tenerse en cuenta al interpretar la clasificación.

Probar un modelo antes de suscribirse a su servicio

Arena proporciona acceso a numerosos modelos propietarios sin exigir una suscripción individual con cada editor.

Es posible probar una respuesta, comparar varios modelos e identificar aquellos que merecen una evaluación más profunda.

Sin embargo, las cuotas, parámetros e integraciones ofrecidos en Arena no reproducen necesariamente la experiencia completa de la aplicación oficial.

Dejar que Max seleccione el modelo

Max resulta adecuado para quienes no desean elegir manualmente entre decenas de referencias.

El router analiza la modalidad y la solicitud y después selecciona un modelo teniendo en cuenta el rendimiento y la latencia.

Esta sencillez reduce el control sobre la decisión de enrutamiento y no garantiza que el modelo elegido sea siempre óptimo para una necesidad muy específica.

Realizar una tarea compleja con un agente

Agent Mode puede reunir búsqueda, análisis, programación, generación de imágenes y manipulación de archivos dentro de un mismo workflow.

Resulta adecuado para preparar un proyecto, crear un prototipo, realizar una investigación profunda u organizar varias operaciones sucesivas.

Las herramientas utilizadas y los comandos ejecutados deben controlarse, especialmente cuando intervienen archivos o un entorno Bash.

Seguir la evolución del mercado de la IA

Los leaderboards permiten observar nuevas versiones, cambios de posición y la aparición de nuevos proveedores.

Constituyen un recurso útil para realizar seguimiento de modelos de texto, código, imagen, vídeo, búsqueda y agentes.

Una posición siempre debe interpretarse junto con su fecha, número de votos e intervalo de confianza.

Estudiar las preferencias de los usuarios

Los datos y publicaciones de Arena pueden utilizarse para analizar cómo evalúan los humanos las respuestas de los modelos.

Los investigadores pueden estudiar sesgos estilísticos, diferencias lingüísticas, campos profesionales o la evolución de las preferencias.

Solo una parte de los datos se hace pública, después de diferentes tratamientos y filtrados.

Reproducir un sistema de clasificación

Arena-Rank permite a investigadores y desarrolladores calcular sus propias clasificaciones a partir de datos de confrontaciones.

El paquete puede aplicarse a modelos de inteligencia artificial, pero también a otras competiciones basadas en comparaciones por pares.

Sin embargo, crear un sistema fiable exige un muestreo, una limpieza de datos y una interpretación estadística adecuados.

Opinión de PANACHES

Arena ocupa un lugar particular dentro del ecosistema de la inteligencia artificial. No es un simple asistente, ni un agregador convencional, ni un benchmark fijo: la plataforma combina acceso a modelos, comparación interactiva, recopilación de preferencias e investigación metodológica.

Su principal ventaja reside en la comparación anónima. Los usuarios suelen conocer la reputación de un modelo incluso antes de leer su respuesta. Ocultar su identidad limita una parte de este sesgo y obliga a juzgar el resultado realmente producido.

Esta anonimización no elimina todos los sesgos. Determinadas firmas de redacción, formatos de citas o hábitos estilísticos pueden permitir reconocer a un proveedor. El juicio también sigue influido por las preferencias personales del usuario.

La recopilación de prompts reales constituye otra ventaja importante. Los benchmarks tradicionales terminan siendo conocidos, optimizados o contaminados por los datos de entrenamiento. Arena enfrenta continuamente los modelos a nuevas solicitudes procedentes de usos cotidianos.

Esta diversidad acerca la evaluación a condiciones reales, pero dificulta el control de los datos. Los prompts pueden ser imprecisos, subjetivos, redundantes o concentrarse en temas populares entre la comunidad.

Por tanto, la clasificación no debe interpretarse como una medición absoluta de la inteligencia. Refleja la preferencia media observada en un conjunto de confrontaciones, durante un periodo concreto y con los modelos disponibles en la plataforma.

El Rank Spread suele ser más informativo que el rango bruto. Dos modelos situados respectivamente en tercera y sexta posición pueden resultar estadísticamente difíciles de diferenciar cuando sus intervalos se solapan.

El número de votos también importa. Un modelo añadido recientemente puede mostrar una puntuación elevada con mucha más incertidumbre que otro evaluado en decenas de miles de confrontaciones.

La separación entre arenas representa una mejora esencial. El mejor modelo generalista no es necesariamente el mejor para crear una interfaz, editar una imagen, analizar un PDF o producir un vídeo.

Los filtros profesionales y expertos refuerzan esta lectura especializada. Permiten buscar un rendimiento pertinente para una profesión en lugar de seguir ciegamente la clasificación global.

La incorporación de una señal de factualidad responde a una debilidad importante de los votos humanos. Una respuesta larga, segura y bien presentada puede resultar preferida incluso cuando contiene varios errores.

La clasificación de factualidad no resuelve completamente el problema. La verificación automatizada depende de la extracción de afirmaciones, la búsqueda Web, las fuentes disponibles y el sistema encargado de determinar su corrección.

Sin embargo, Arena sigue siendo más transparente que muchas clasificaciones comerciales. La publicación de Arena-Rank, de una parte de los datos, de los artículos científicos y del changelog permite examinar una parte importante del proceso.

La plataforma también se está convirtiendo en un verdadero agregador de modelos. Direct Mode y Side by Side proporcionan acceso gratuito a modelos que normalmente exigirían varias cuentas o suscripciones distintas.

Este acceso resulta especialmente útil para descubrir un modelo nuevo. Sin embargo, conviene evitar concluir demasiado rápido que su comportamiento dentro de Arena será idéntico al de su aplicación oficial.

Los proveedores pueden utilizar system prompts, ajustes, cuotas o endpoints diferentes. Determinadas funciones nativas, memorias, conectores, proyectos o parámetros avanzados no se reproducen.

Max representa un enfoque interesante para la selección automática. En lugar de exigir al usuario que conozca las fortalezas de cada modelo, Arena utiliza sus datos de evaluación para orientar la solicitud.

Esta idea coincide directamente con las necesidades de PANACHES relacionadas con la selección inteligente de modelos. Una tarea de código, una búsqueda documental, una generación de imágenes o una conversación ligera no deberían utilizar necesariamente el mismo motor.

Sin embargo, el enrutamiento automático introduce una nueva capa opaca. Para un proyecto reproducible, puede ser preferible fijar explícitamente el modelo en lugar de dejar que el router evolucione con sus actualizaciones.

Agent Mode también muestra la evolución de Arena hacia un entorno de trabajo más completo. La plataforma ya no mide únicamente una respuesta aislada, sino la capacidad de realizar una tarea, utilizar herramientas y recuperarse después de un error.

Esta evaluación se acerca más a los usos modernos de los agentes, pero también se vuelve más compleja. El éxito depende del modelo, el orquestador, las herramientas, la sandbox, los permisos y la manera en que el usuario formula sus comentarios.

Las arenas Image y Video conceden a Arena una importancia particular para los creadores. Hacen visibles las diferencias entre modelos cuyas demostraciones oficiales suelen ser difíciles de comparar objetivamente.

Sin embargo, el voto visual sigue siendo muy subjetivo. Una imagen espectacular puede resultar preferida frente a otra más fiel al prompt, mientras que un vídeo dinámico puede ocultar incoherencias de continuidad.

Para PANACHES Media, Arena constituye una excelente fuente de seguimiento. Las clasificaciones permiten observar nuevos modelos e identificar rápidamente herramientas que progresan en texto, código, imagen, vídeo o búsqueda.

Las posiciones no deberían reproducirse solas en un artículo. Un análisis serio debe especificar el arena, la fecha, el número de votos, la incertidumbre, el método y los límites de la señal utilizada.

La principal reserva se refiere a la privacidad. Los prompts, imágenes, documentos, votos e interacciones constituyen precisamente los datos que Arena necesita para mejorar sus evaluaciones.

La política de privacidad contempla que determinados datos puedan utilizarse para investigación, mejora del servicio y desarrollo de productos. También pueden transmitirse a los proveedores de los modelos utilizados.

Además, las condiciones conceden a Arena una licencia muy amplia sobre los contenidos enviados y generados. Esta disposición vuelve el servicio inadecuado para secretos comerciales, trabajos no publicados, datos personales y proyectos confidenciales.

Para PANACHES, Arena debe considerarse, por tanto, un laboratorio público de comparación y no un espacio privado destinado a documentos internos.

Su carácter completamente remoto también lo aleja de la filosofía local-first de PANACHES. Los modelos, cuotas, disponibilidad y políticas pueden cambiar sin control local.

A pesar de ello, Arena sigue siendo una referencia imprescindible. Pocas plataformas reúnen una comunidad tan importante, tantas modalidades, acceso directo a modelos y una metodología parcialmente auditable.

La ficha merece, por tanto, un lugar central dentro del directorio de PANACHES, tanto como herramienta de comparación, fuente de seguimiento, entorno de experimentación y ejemplo de enrutamiento basado en evaluaciones reales.

Puntos de atención

  • El nombre oficial es Arena: LMArena y Chatbot Arena son nombres anteriores todavía presentes en determinadas URL, publicaciones o páginas de terceros.

  • No confundir Arena con una simple lista de benchmarks: el servicio también permite utilizar directamente modelos y agentes.

  • Las clasificaciones evolucionan permanentemente: una posición observada hoy puede cambiar después de nuevos votos o de una modificación metodológica.

  • Registrar siempre la fecha: una captura o artículo debe precisar cuándo se consultó el leaderboard.

  • Identificar el arena correspondiente: Text, Code, Search, Vision, Document, Image y Video no miden las mismas capacidades.

  • No utilizar únicamente la clasificación general: un modelo puede ser excelente en una categoría y medio en otra.

  • Examinar el Rank Spread: el rango bruto puede exagerar la diferencia entre modelos estadísticamente próximos.

  • Leer los intervalos de confianza: una puntuación central solo es una estimación acompañada de incertidumbre.

  • Comprobar el número de votos: un modelo reciente puede disponer de una muestra mucho más pequeña.

  • Las clasificaciones son relativas: la puntuación depende de los demás modelos presentes en las confrontaciones.

  • Los resultados no miden todas las cualidades: seguridad, coste, consumo, privacidad y facilidad de despliegue no quedan resumidos en la puntuación.

  • Los votos reflejan una preferencia: no garantizan la verdad, la seguridad ni la adecuación profesional.

  • El estilo puede influir en el voto: una respuesta más larga, estructurada o segura puede resultar preferida independientemente de su corrección.

  • La factualidad sigue siendo parcial: no todas las afirmaciones pueden verificarse automáticamente en la Web.

  • La señal de factualidad está ponderada: no sustituye completamente las preferencias humanas en las clasificaciones correspondientes.

  • Los prompts son autoseleccionados por la comunidad: la distribución de los usos no coincide necesariamente con la de una empresa o un país.

  • Posibles sesgos lingüísticos: los idiomas más utilizados pueden disponer de más votos y comparaciones.

  • Posibles sesgos demográficos: los usuarios de Arena no representan necesariamente a toda la población.

  • Los modelos pueden seguir siendo reconocibles: determinadas formulaciones o presentaciones pueden revelar indirectamente su identidad.

  • Un voto no sustituye una tabla de evaluación: para una elección profesional, sigue siendo preferible definir criterios propios.

  • Probar con tareas propias: los prompts del proyecto suelen ser más útiles que la posición global.

  • Comparar varias veces: una única generación puede verse afectada por la aleatoriedad del modelo.

  • Los modelos pueden utilizar ajustes específicos: su configuración dentro de Arena no es necesariamente idéntica a la de su aplicación oficial.

  • Determinadas funciones nativas están ausentes: memoria, proyectos, conectores, herramientas o personalización pueden no estar disponibles.

  • Disponibilidad variable de los modelos: un proveedor puede limitar, sustituir o retirar el acceso.

  • Los accesos anticipados son temporales: un modelo probado antes de su lanzamiento puede cambiar o ser retirado de la clasificación.

  • Comprobar la identidad entre preview y versión pública: Arena establece reglas, pero las diferencias siguen siendo un punto que debe vigilarse.

  • El precio por millón de tokens es indicativo: generalmente describe el precio de la API del proveedor, no el coste de utilizar Arena.

  • Acceso gratuito sujeto a límites: gratuito no significa ilimitado.

  • Límites diarios: el uso puede bloquearse hasta que se restablezca la cuota.

  • Límites por modelo: un modelo popular o costoso puede dejar de estar disponible antes que los demás.

  • Límites globales de chat: varios modelos pueden verse afectados por un mismo techo general.

  • Ningún plan público prioritario: Arena no ofrece actualmente una opción de pago que elimine estas restricciones.

  • Las cuotas pueden evolucionar: el sistema diario todavía puede modificarse.

  • Crear una cuenta aumenta el acceso: Direct, Side by Side, Image y Video generalmente requieren iniciar sesión.

  • El historial depende de la cuenta: las conversaciones anónimas pueden no ser recuperables.

  • Una única identidad de cuenta: las condiciones limitan especialmente la multiplicación de cuentas.

  • Servicio reservado a adultos: las condiciones indican una edad mínima de dieciocho años.

  • Uso personal o interno: las condiciones limitan generalmente el uso del servicio a estos contextos, salvo acuerdo complementario.

  • Prohibición de automatización no autorizada: las solicitudes programáticas, bots y extracciones automatizadas están limitadas por las condiciones.

  • No realizar scraping de las clasificaciones: la extracción automatizada de nombres, puntuaciones y datos puede infringir las reglas del servicio.

  • No manipular los votos: los votos falsos, campañas coordinadas y pagos a cambio de votos están prohibidos.

  • Votar con honestidad: seleccionar sistemáticamente un lado o intentar identificar una marca degrada la calidad de la señal.

  • No enviar datos confidenciales: los prompts y archivos pueden ser procesados por Arena y proveedores externos.

  • No cargar secretos comerciales: el código privado, contratos, estrategias y documentos no publicados deben mantenerse fuera de la plataforma.

  • Evitar los datos personales: nombres, datos de contacto, historiales médicos, información financiera e identificadores sensibles no deben transmitirse.

  • Los proveedores de modelos pueden recibir los contenidos: los datos necesarios para la generación se envían a los servicios externos correspondientes.

  • Los proveedores pueden aplicar sus propias políticas: cada modelo puede estar regido por condiciones y prácticas diferentes.

  • Los prompts pueden utilizarse para investigación: Arena indica que puede emplear votos y solicitudes para producir estudios y análisis.

  • Los datos pueden contribuir a la mejora: los contenidos pueden utilizarse para desarrollar Arena o tecnologías relacionadas.

  • Una parte de los datos puede publicarse: las conversaciones, entradas y resultados pueden aparecer en datasets o publicaciones después de ser procesados.

  • No transmitir nada que nunca deba hacerse público: la política recomienda explícitamente evitar cualquier contenido sensible.

  • Licencia amplia sobre los contenidos: las condiciones conceden a Arena derechos mundiales, transferibles, perpetuos y sublicenciables.

  • Los contenidos siguen atribuidos al usuario entre las partes: esta propiedad contractual está sujeta a la licencia concedida al servicio.

  • Las salidas pueden no estar protegidas por derechos de autor: Arena no garantiza que puedan recibir protección jurídica.

  • Las salidas no son necesariamente únicas: otros usuarios pueden obtener resultados similares.

  • Respetar los derechos sobre los archivos importados: el usuario debe disponer de las autorizaciones necesarias.

  • Controlar las imágenes de personas: utilizar una apariencia reconocible puede implicar derechos de imagen.

  • Revisar todas las respuestas: los modelos pueden producir información falsa, obsoleta o inventada.

  • Verificar las citas: Search Arena puede mostrar una fuente que no apoye exactamente la afirmación asociada.

  • No utilizarlo como única fuente para una decisión sensible: salud, derecho, finanzas y seguridad requieren fuentes y profesionales adecuados.

  • Examinar los archivos producidos por los agentes: una tarea aparentemente exitosa puede contener errores ocultos.

  • Controlar los comandos Bash: un comando puede modificar, eliminar o exponer archivos dentro del entorno utilizado.

  • Comprobar las herramientas utilizadas realmente: las alucinaciones de herramientas forman parte de los problemas evaluados en Agent Arena.

  • Revisar el código generado: una interfaz visualmente lograda puede contener dependencias innecesarias o vulnerabilidades.

  • Probar el responsive design: una previsualización correcta en una pantalla no garantiza la adaptación móvil.

  • Comprobar la accesibilidad: contraste, navegación mediante teclado, etiquetas y estructura semántica deben revisarse.

  • Controlar las imágenes generadas: anatomía, texto, logotipos y detalles repetitivos pueden presentar defectos.

  • Examinar los vídeos por completo: artefactos, transformaciones de identidad e incoherencias pueden aparecer durante el movimiento.

  • Comparar la fidelidad y no solo la estética: el resultado más espectacular no siempre es el que mejor respeta la instrucción.

  • Arena-Rank no representa toda la plataforma: la apertura del motor de clasificación no convierte el servicio Web completo en open source.

  • FastChat es un proyecto histórico distinto: sirvió de base para Chatbot Arena, pero ya no constituye el código completo de la plataforma actual.

  • Existen varias licencias: Arena-Rank, los datasets, las herramientas históricas y los modelos de terceros pueden utilizar licencias distintas.

  • Comprobar la licencia de cada modelo: open weight no significa necesariamente ausencia de restricciones comerciales.

  • Los datasets públicos son parciales: no permiten necesariamente reproducir exactamente el leaderboard completo en tiempo real.

  • Los métodos pueden cambiar: las ponderaciones, filtros, intervalos y reglas de inclusión evolucionan con la investigación.

  • Consultar el changelog: una variación de rango puede proceder de una actualización metodológica y no de un cambio del modelo.

  • Conservar los resultados propios: las notas, capturas y prompts importantes deben archivarse fuera del servicio.

  • Prever una alternativa: el acceso gratuito a un modelo puede reducirse o interrumpirse.

  • No depender de Arena como API: la plataforma no está diseñada como un endpoint automatizado para una aplicación.

  • Utilizar la API oficial del proveedor para producción: generalmente ofrece contratos, cuotas y parámetros más adecuados.

  • Comparar con evaluaciones complementarias: los benchmarks automáticos, pruebas internas, costes y restricciones técnicas deben completar Arena.

  • No confundir popularidad con pertinencia personal: el mejor modelo promedio no es necesariamente el mejor para el workflow del usuario.

  • Elegir según la tarea: texto, código, búsqueda, imagen, vídeo y agentes pueden justificar modelos diferentes.

  • Considerar Arena como un laboratorio público: su fortaleza reside en la exploración y la comparación, no en la privacidad.