Ir al contenido
fedi.software

Programación

Modelos clasificados con tareas de programación: tier, Elo con su intervalo de confianza, precio por millón de tokens y ventana de contexto.

Actualizado · Fuentes: LMArena, LiteLLM, models.dev

Coste al mes
Tier Modelo Elo Entrada / salida, por 1M Al mes Contexto App Comparar
S1.547— —
S1.5101 US$ / 4 US$Gratis 1M
S1.5090,75 US$ / 3,75 US$ 1M
S1.4980,75 US$ / 3,75 US$ 1M
S1.4920,1857 US$ / 1,11 US$ 1M
S1.4920,375 US$ / 1,88 US$ 1M
S1.4890,275 US$ / 1,10 US$Gratis 262K
S1.4841 US$ / 6 US$ 1M
S1.4830,30 US$ / 1,90 US$ 262K
S1.4820,57 US$ / 3,43 US$ 1M
A1.4690,20 US$ / 0,90 US$Gratis 1M
A1.4600,07 US$ / 0,43 US$ 1M
A1.4590,10 US$ / 0,25 US$Gratis 262K
A1.4531,15 US$ / 8 US$ 262K
A1.4530,08 US$ / 0,32 US$Gratis 205K
A1.4520,15 US$ / 1,25 US$ 1M
A1.4520,87 US$ / 7 US$ 1M
A1.4460,042 US$ / 0,22 US$Gratis 262K
A1.4240,09 US$ / 0,71 US$ 1M
A1.4210,27 US$ / 1,10 US$ 205K
B1.4000,30 US$ / 2,50 US$ 1M
B1.4000,125 US$ / 0,75 US$ 1M
B1.3990,40 US$ / 1,80 US$ 256K
B1.3800,22 US$ / 0,88 US$ 205K
B1.3730,10 US$ / 0,10 US$ 1M
B1.3720,09 US$ / 0,36 US$ 1M
B1.3700,20 US$ / 1 US$ 205K
B1.3580,132 US$ / 1,25 US$ 1M
B1.3510,10 US$ / 0,42 US$ 990K
B1.3220,08 US$ / 0,16 US$Gratis 131K
B1.3220,052 US$ / 0,21 US$ 990K
B1.294— —
B1.2810,05 US$ / 0,10 US$Gratis 131K
C1.269Gratis 128K
C1.262— —
C1.255— —
C1.2300,04 US$ / 0,08 US$Gratis 131K
C1.218— —
C1.2110,65 US$ / 0,65 US$ 8K
C1.191— —
C1.1740,20 US$ / 0,20 US$ 8K
C1.112Gratis 128K
C1.1082 US$ / 12 US$ 1M
C1.104— —
D1.084— —
D1.0480,15 US$ / 0,15 US$ 8K
D1.034— —
D1.010— —
D994— —
Comparar ()

Los tiers son nuestros: el puesto de un modelo en la clasificación contando solo los modelos cuyo intervalo de confianza completo está por encima. S: el 10% superior, A: hasta el 30%, B: hasta el 60%, C: hasta el 85%, D: el resto.

Calidad frente a precio puntuación en vertical, precio combinado (3 partes de entrada : 1 de salida) en horizontal, USD por 1M de tokens
1.000 1.200 1.400 1.600 0,01 US$ 0,10 US$ 1 US$ 10 US$ 100 US$ MiMo-V2.6-Pro Claude Opus 5.5 Claude Opus 4.6

¿Qué se clasifica exactamente aquí?

Es la categoría de programación de la arena de texto de LMArena. El método es el mismo que en la clasificación general: la gente vota a ciegas entre dos respuestas anónimas, pero aquí solo cuentan los prompts que tratan de código. Preguntas como «por qué falla esta consulta SQL» o «reescribe esta función en Python» acaban en esta tabla. El resultado se expresa como una puntuación Elo con su intervalo de confianza del 95%.

¿En qué se diferencia de las tablas de desarrollo web y de agentes?

Esta tabla valora respuestas en un chat sobre código. Construir una app web completa a partir de un prompt se mide en la clasificación de desarrollo web, y el trabajo en varios pasos con herramientas, en la de agentes. Un modelo puede ir bien en una y peor en otra, así que conviene mirar la tabla que se parece a tu forma de trabajar.

¿Qué columnas tiene?

  • Tier y Elo con su barra de intervalo.
  • Precio por 1M de tokens de entrada y de salida, y su variación en 30 días.
  • Ventana de contexto.
  • La calculadora «Coste al mes», el gráfico «Calidad frente a precio» y la casilla para comparar.

Los precios proceden de models.dev y LiteLLM. La etiqueta «Precio bajo» aparece por debajo de 1 USD por 1M de tokens de precio combinado.

¿Por qué fijarse en el contexto?

Si quieres que el modelo trabaje con un repositorio entero, la ventana de contexto decide cuánto código cabe en una sola petición. Una ventana grande a un precio alto puede salir más cara que dos peticiones con un modelo más barato, y al revés. Por eso tiene sentido mirar el contexto justo al lado del precio y hacer la cuenta en la calculadora con tu volumen real.

¿Cómo se asignan los tiers?

Igual que en la tabla de texto: solo entran los modelos con al menos 300 votos; los demás muestran «Aún sin tier». El puesto depende de cuántos modelos tienen el intervalo entero por encima, y las letras se reparten con los cortes del 10, 30, 60 y 85%.

¿Basta con esta tabla para elegir?

No del todo. Responder bien en un chat sobre código no equivale a pasar los tests de un proyecto real. Úsala para hacer una lista corta y prueba después los candidatos con tu propio código, o compáralos lado a lado.