Ir al contenido
fedi.software

Agentes

Modelos clasificados en tareas agénticas (llamadas a herramientas y trabajo en varios pasos) según la clasificación de agentes de LMArena. Su puntuación está centrada en cero, no es un Elo.

Actualizado · Fuentes: LMArena, LiteLLM, models.dev

Coste al mes
Tier Modelo Puntuación Entrada / salida, por 1M Al mes Contexto App Comparar
B0,0050,959 US$ / 2,74 US$ 1M
C-0,0690,20 US$ / 0,90 US$Gratis 1M
D-0,1241,50 US$ / 7,50 US$ 256K
Comparar ()

Los tiers son nuestros: el puesto de un modelo en la clasificación contando solo los modelos cuyo intervalo de confianza completo está por encima. S: el 10% superior, A: hasta el 30%, B: hasta el 60%, C: hasta el 85%, D: el resto.

Calidad frente a precio puntuación en vertical, precio combinado (3 partes de entrada : 1 de salida) en horizontal, USD por 1M de tokens
-0,2 -0,1 0,0 0,1 0,2 0,01 US$ 0,10 US$ 1 US$ 10 US$ Claude Fable 5.1 Claude Opus 5.5 Claude Sonnet 5.5

Primero, lo importante: esto no es un Elo

La clasificación de agentes de LMArena usa otra métrica. En lugar de un Elo, cada modelo tiene una puntuación centrada en cero, que va aproximadamente de valores negativos a positivos. La columna se llama «Puntuación» y muestra tres decimales. Un valor por encima de cero significa que la gente prefirió ese modelo más a menudo que el modelo medio de esta tabla; por debajo de cero, menos a menudo.

La consecuencia práctica es clara: compara los modelos solo dentro de esta tabla. Poner su «Puntuación» al lado del Elo de la tabla de texto o de programación no tiene sentido, porque son escalas distintas.

Qué se evalúa

Las tareas son agénticas: trabajo en varios pasos en el que el modelo llama a herramientas, lee sus resultados y decide qué hacer después. Las personas valoran la sesión completa, y aquí los votos se cuentan por sesiones, no por respuestas sueltas. Es una forma de ver qué modelos rinden cuando no basta con contestar una pregunta.

Las demás columnas son las de siempre:

  • tier, calculado con la misma regla que en el resto de tablas;
  • precio por 1M de tokens de entrada y de salida, de models.dev y LiteLLM;
  • ventana de contexto y variación del precio en 30 días;
  • la calculadora «Coste al mes» y la casilla para comparar.

Cómo funcionan los tiers aquí

Un modelo necesita al menos 300 votos para tener letra; si no, verás «Aún sin tier». El puesto se calcula con los intervalos de confianza del 95%: uno más el número de modelos cuyo intervalo queda entero por encima. Luego se reparten las letras con los cortes del 10, 30, 60 y 85%. Como agentes es una tabla joven, con menos modelos que la de texto, el reparto puede moverse más de un día para otro.

Otras cautelas

El entorno de agentes que usa la arena no es el que vas a usar tú. Tu agente tendrá otras herramientas, otras instrucciones y otros límites, y eso cambia el resultado. Toma esta tabla como una pista para hacer una lista corta y prueba luego los modelos dentro de tu propio flujo. Si buscas el programa que ejecuta el agente, mira los agentes de programación; si necesitas ampliar lo que sabe hacer, el directorio de skills.