Ir al contenido
fedi.software

Programación

Modelos clasificados con tareas de programación: tier, Elo con su intervalo de confianza, precio por millón de tokens y ventana de contexto.

Actualizado · Fuentes: LMArena, LiteLLM, models.dev

Coste al mes
Tier Modelo Elo Entrada / salida, por 1M Al mes Contexto App Comparar
S1.4890,959 US$ / 2,74 US$ 1M
A1.4360,09 US$ / 0,30 US$Gratis 256K
B1.3670,21 US$ / 0,57 US$ 66K
B1.339— —
B1.3302,50 US$ / 10 US$ 256K
B1.3165,21 US$ / 16,44 US$ 16K
C1.2310,07 US$ / 0,14 US$ 16K
C1.1970,50 US$ / 1,50 US$ 128K
C1.1872,50 US$ / 10 US$ 128K
C1.1722,50 US$ / 10 US$ 128K
C1.1690,15 US$ / 0,60 US$ 128K
C1.1300,17 US$ / 0,68 US$ 4K
C1.1280,15 US$ / 0,60 US$ 128K
C1.1010,15 US$ / 0,60 US$ 8K
C1.093— —
C1.0930,13 US$ / 0,52 US$ 4K
C1.081— —
D1.0390,13 US$ / 0,52 US$ 128K
D1.035— —
Comparar ()

Los tiers son nuestros: el puesto de un modelo en la clasificación contando solo los modelos cuyo intervalo de confianza completo está por encima. S: el 10% superior, A: hasta el 30%, B: hasta el 60%, C: hasta el 85%, D: el resto.

Calidad frente a precio puntuación en vertical, precio combinado (3 partes de entrada : 1 de salida) en horizontal, USD por 1M de tokens
1.000 1.200 1.400 1.600 0,01 US$ 0,10 US$ 1 US$ 10 US$ 100 US$ MiMo-V2.6-Pro Claude Opus 5.5 Claude Opus 4.6

¿Qué se clasifica exactamente aquí?

Es la categoría de programación de la arena de texto de LMArena. El método es el mismo que en la clasificación general: la gente vota a ciegas entre dos respuestas anónimas, pero aquí solo cuentan los prompts que tratan de código. Preguntas como «por qué falla esta consulta SQL» o «reescribe esta función en Python» acaban en esta tabla. El resultado se expresa como una puntuación Elo con su intervalo de confianza del 95%.

¿En qué se diferencia de las tablas de desarrollo web y de agentes?

Esta tabla valora respuestas en un chat sobre código. Construir una app web completa a partir de un prompt se mide en la clasificación de desarrollo web, y el trabajo en varios pasos con herramientas, en la de agentes. Un modelo puede ir bien en una y peor en otra, así que conviene mirar la tabla que se parece a tu forma de trabajar.

¿Qué columnas tiene?

  • Tier y Elo con su barra de intervalo.
  • Precio por 1M de tokens de entrada y de salida, y su variación en 30 días.
  • Ventana de contexto.
  • La calculadora «Coste al mes», el gráfico «Calidad frente a precio» y la casilla para comparar.

Los precios proceden de models.dev y LiteLLM. La etiqueta «Precio bajo» aparece por debajo de 1 USD por 1M de tokens de precio combinado.

¿Por qué fijarse en el contexto?

Si quieres que el modelo trabaje con un repositorio entero, la ventana de contexto decide cuánto código cabe en una sola petición. Una ventana grande a un precio alto puede salir más cara que dos peticiones con un modelo más barato, y al revés. Por eso tiene sentido mirar el contexto justo al lado del precio y hacer la cuenta en la calculadora con tu volumen real.

¿Cómo se asignan los tiers?

Igual que en la tabla de texto: solo entran los modelos con al menos 300 votos; los demás muestran «Aún sin tier». El puesto depende de cuántos modelos tienen el intervalo entero por encima, y las letras se reparten con los cortes del 10, 30, 60 y 85%.

¿Basta con esta tabla para elegir?

No del todo. Responder bien en un chat sobre código no equivale a pasar los tests de un proyecto real. Úsala para hacer una lista corta y prueba después los candidatos con tu propio código, o compáralos lado a lado.