Naar de inhoud
fedi.software

Webontwikkeling

Modellen gerangschikt op het bouwen van werkende webapps vanuit een prompt in de WebDev-arena van LMArena, met prijzen en context.

Bijgewerkt · Bronnen: LMArena, LiteLLM, models.dev

Kosten per maand
Tier Model Elo Input / output, per 1M Per maand Context App Vergelijken
S1.680— —
A1.592US$ 0,75 / US$ 3,75 1M
A1.583US$ 0,75 / US$ 3,75 1M
A1.536US$ 0,375 / US$ 1,88 1M
B1.499US$ 0,1857 / US$ 1,11 1M
B1.446US$ 1 / US$ 6 1M
–1.440US$ 0,15 / US$ 1,25 1M
B1.439US$ 0,57 / US$ 3,43 1M
B1.439US$ 0,07 / US$ 0,43 1M
C1.365US$ 0,10 / US$ 0,25Gratis 262K
C1.358US$ 0,042 / US$ 0,22Gratis 262K
C1.256US$ 0,125 / US$ 0,75 1M
D1.227US$ 0,87 / US$ 7 1M
D1.190US$ 0,05 / US$ 0,10 131K
D1.170US$ 0,25 / US$ 0,75 128K

De tiers zijn van ons: de plaats van een model in de ranglijst, waarbij alleen modellen meetellen waarvan het hele betrouwbaarheidsinterval erboven ligt. S — top 10%, A — tot 30%, B — tot 60%, C — tot 85%, D — de rest.

Kwaliteit versus prijs omhoog score, opzij gemengde prijs (3 delen input : 1 output), USD per 1M tokens
1.000 1.200 1.400 1.600 1.800 2.000 US$ 0,01 US$ 0,10 US$ 1 US$ 10 Claude Opus 5.5 GPT-6 Astra Claude Sonnet 5.5

Twee modellen, één opdracht, één werkende app

In de WebDev-arena van LMArena krijgen twee anonieme modellen dezelfde prompt, bijvoorbeeld een takenlijst, een rekenmachine of een klein spel in de browser. Beide bouwen een werkende webapp, en mensen stemmen op de app die ze beter vinden. Die stemmen worden omgezet in een rating in de stijl van Elo, met een 95%-betrouwbaarheidsinterval. Omdat er een compleet resultaat wordt beoordeeld, telt alles mee: of de lay-out klopt, of de code echt werkt en of het model deed wat er gevraagd werd. Het gaat dus niet alleen om nette code, maar om de app als geheel.

Een eigen set modellen

Deze ranglijst heeft een andere verzameling modellen dan de ranglijsten tekst en programmeren. Een model dat hier hoog staat, hoeft daar niet voor te komen, en omgekeerd. Vergelijk ratings daarom alleen binnen deze pagina. De kolommen zijn wel dezelfde:

  • tier en Elo met interval;
  • de laagste prijs per 1M tokens bij aanbieders, via models.dev en LiteLLM;
  • het contextvenster en de prijsontwikkeling over 30 dagen;
  • de calculator “Kosten per maand” en de grafiek “Kwaliteit versus prijs”, met een gemengde prijs van 3 delen input en 1 deel output.

Tiers en “Lage prijs”

De tiers volgen dezelfde regel als op de andere ranglijsten. Modellen met minder dan 300 stemmen staan er zonder tier bij. De rest krijgt een plaats: één plus het aantal modellen waarvan het hele interval hoger ligt. Gedeeld door het aantal modellen geeft dat S onder 10%, A onder 30%, B onder 60% en C onder 85%; de rest is D. Het label “Lage prijs” betekent hier een gemengde prijs onder 1 USD per 1M tokens.

Waar houdt de vergelijking op?

De apps in de arena zijn klein. Hoe een model omgaat met een groot project, met veel bestanden, bestaande code en een build-proces, meet deze ranglijst niet. Gebruik hem om een shortlist te maken voor frontend- en prototypewerk, en test die shortlist daarna in je eigen omgeving, bijvoorbeeld met een van de codeeragents.