Ir al contenido
fedi.software

Texto

Modelos de chat clasificados por votos humanos a ciegas en LMArena, con el intervalo de confianza de cada puntuación y el precio actual por millón de tokens.

Actualizado · Fuentes: LMArena, LiteLLM, models.dev

Coste al mes
Tier Modelo Elo Entrada / salida, por 1M Al mes Contexto App Comparar
S1.449— —
A1.4480,50 US$ / 3 US$ 131K
A1.4410,066 US$ / 0,26 US$ 262K
A1.420— —
A1.406— —
A1.401— —
A1.401— 131K
B1.377— 131K
B1.3620,30 US$ / 2,50 US$ 1M
B1.311— —
B1.288— —
B1.274— —
C1.263— —
C1.259— —
C1.228— —
C1.208— —
C1.202— —
Comparar ()

Los tiers son nuestros: el puesto de un modelo en la clasificación contando solo los modelos cuyo intervalo de confianza completo está por encima. S: el 10% superior, A: hasta el 30%, B: hasta el 60%, C: hasta el 85%, D: el resto.

Calidad frente a precio puntuación en vertical, precio combinado (3 partes de entrada : 1 de salida) en horizontal, USD por 1M de tokens
1.000 1.200 1.400 1.600 0,01 US$ 0,10 US$ 1 US$ 10 US$ 100 US$ Claude Opus 5.5 Claude Fable 5.1 Claude Opus 5

Cómo leer la tabla de modelos de texto

La clasificación sale de la arena de texto de LMArena, en su categoría general. El mecanismo es sencillo: una persona escribe un prompt, recibe dos respuestas de modelos anónimos y vota la que prefiere. Con miles de esos duelos se construye una puntuación de tipo Elo. Nosotros añadimos a cada modelo el precio actual, el contexto y un tier propio.

En cada fila verás:

  • el tier y la puntuación con su intervalo de confianza del 95%, dibujado como una barra;
  • el fabricante y la marca «Pesos abiertos» si el modelo se puede descargar;
  • el precio mínimo que encontramos por 1M de tokens de entrada y de salida, en USD;
  • la ventana de contexto y la variación del precio en 30 días;
  • un enlace para descargar la app cuando está en nuestro catálogo.

Las barras importan más que el número

Si las barras de dos modelos se solapan, la diferencia entre ellos no es estadísticamente clara. Por eso varios modelos pueden compartir el tier S aunque sus puntuaciones no sean idénticas. El tier se calcula solo entre modelos con al menos 300 votos: el resto aparece como «Aún sin tier». Las letras siguen las mismas reglas en toda la sección: S por debajo del 10% de la tabla, A hasta el 30%, B hasta el 60%, C hasta el 85% y D el resto.

Precio, calculadora y gráfico

El precio es el mínimo que había entre proveedores el día de los datos. Puede ser distinto del que cobra el propio fabricante, y no se muestran descuentos por caché, por lotes ni precios regionales. La etiqueta «Precio bajo» marca los modelos con un precio combinado por debajo de 1 USD por 1M de tokens.

Debajo de la tabla está «Coste al mes»: indicas cuántos tokens usas y qué parte es de entrada, y ves el gasto estimado de cada modelo. El gráfico «Calidad frente a precio» coloca la puntuación en vertical y el precio combinado en horizontal, con 3 partes de entrada por 1 de salida. Con los filtros puedes quedarte con modelos gratuitos, de pesos abiertos, baratos o de un fabricante concreto, y con la casilla de cada fila puedes comparar hasta 4 modelos.

Lo que esta tabla no mide

La puntuación refleja las preferencias de quienes votan en la arena, con prompts mayoritariamente en inglés. No mide la velocidad, el coste ni el rendimiento en una tarea concreta. Si programas, mira también la tabla de programación; si quieres una API sin coste, la de modelos gratuitos.