Ir al contenido
fedi.software

Desarrollo web

Modelos clasificados por su capacidad de crear apps web funcionales a partir de un prompt en la arena WebDev de LMArena, con precios y contexto.

Actualizado · Fuentes: LMArena, LiteLLM, models.dev

Coste al mes
Tier Modelo Elo Entrada / salida, por 1M Al mes Contexto App Comparar
S1.6230,40 US$ / 1,40 US$Gratis 1M
A1.6160,03 US$ / 0,10 US$Gratis 1M
A1.6050,30 US$ / 1,05 US$Gratis 1M
A1.5700,959 US$ / 2,74 US$ 1M
B1.5080,45 US$ / 2,15 US$ 200K
B1.4340,2740 US$ / 1,10 US$ 205K
B1.4340,40 US$ / 1,75 US$ 205K
B1.4000,7042 US$ / 3,10 US$ 200K
C1.3390,2740 US$ / 1,10 US$ 205K
C1.255— —
Comparar ()

Los tiers son nuestros: el puesto de un modelo en la clasificación contando solo los modelos cuyo intervalo de confianza completo está por encima. S: el 10% superior, A: hasta el 30%, B: hasta el 60%, C: hasta el 85%, D: el resto.

Calidad frente a precio puntuación en vertical, precio combinado (3 partes de entrada : 1 de salida) en horizontal, USD por 1M de tokens
1.000 1.200 1.400 1.600 1.800 2.000 0,01 US$ 0,10 US$ 1 US$ 10 US$ Claude Opus 5.5 GPT-6 Astra Claude Sonnet 5.5

La clasificación de desarrollo web procede de la arena WebDev de LMArena, que funciona de un modo algo distinto a la de texto. Aquí dos modelos reciben el mismo prompt, por ejemplo «haz una lista de tareas con filtros», y cada uno construye una app web que funciona. La persona que ha escrito el prompt prueba las dos versiones y vota la que prefiere, sin saber qué modelo hay detrás.

Qué valoran los votos

El voto recae sobre el resultado completo, no solo sobre el estilo del código. Influyen varias cosas a la vez:

  • si la app arranca y hace lo que se pidió;
  • cómo se ve la maquetación;
  • si el modelo siguió todas las instrucciones del prompt;
  • la calidad del código que genera el resultado.

Con esos duelos se calcula una puntuación Elo con su intervalo de confianza del 95%. La barra de cada fila muestra ese intervalo: cuando dos barras se solapan, la diferencia entre los modelos no está clara.

Una tabla con su propio grupo de modelos

La arena WebDev tiene su propio conjunto de modelos, distinto del de las tablas de texto y de programación. Algunos aparecen en las tres y otros solo en una. Las columnas sí son las mismas: tier, Elo con intervalo, precio por 1M de tokens de entrada y de salida, variación en 30 días y contexto. También están la calculadora «Coste al mes» y el gráfico «Calidad frente a precio», que usa un precio combinado de 3 partes de entrada por 1 de salida. Los precios vienen de models.dev y LiteLLM, y la marca «Precio bajo» se aplica por debajo de 1 USD por 1M de tokens.

Tiers y modelos nuevos

Los tiers siguen la misma regla que en toda la sección. Un modelo necesita al menos 300 votos para recibir letra; mientras tanto aparece como «Aún sin tier». Con el puesto calculado a partir de los intervalos, S corresponde al 10% superior, A hasta el 30%, B hasta el 60%, C hasta el 85% y D al resto.

Límites de esta clasificación

Las apps de la arena son pequeñas: una página, un juego sencillo, un panel. Los proyectos grandes, con muchos archivos y dependencias, no se evalúan. Un buen puesto aquí indica que el modelo resuelve bien prototipos rápidos, pero no garantiza que mantenga una base de código extensa. Para eso, prueba también un agente de programación con tu propio repositorio.