Przejdź do treści
fedi.software

Programowanie

Modele uszeregowane na zadaniach programistycznych: tier, Elo z przedziałem ufności, cena za milion tokenów i okno kontekstu.

Zaktualizowano · Źródła: LMArena, LiteLLM, models.dev

Koszt miesięczny
Tier Model Elo Wejście / wyjście, za 1M Miesięcznie Kontekst Aplikacja Porównaj
S1 5150,10 USD / 0,20 USD 1M
S1 4971,25 USD / 4,25 USD 1M
S1 4940,10 USD / 0,20 USD 1M
S1 482— —
A1 417— —
B1 3910,25 USD / 0,75 USD 128K
B1 381— —
B1 375— —
B1 323— —
B1 312— —
B1 312— —
B1 3020,05 USD / 0,10 USDZa darmo 1M
B1 2913,50 USD / 3,50 USD 4K
B1 2860,05 USD / 0,10 USD 328K
C1 2680,05 USD / 0,23 USDZa darmo 24K
C1 267— —
C1 2600,40 USD / 0,40 USDZa darmo 131K
C1 230— —
C1 2060,51 USD / 0,74 USD 8K
C1 1950,02 USD / 0,04 USDZa darmo 32K
C1 190— —
C1 169— —
C1 165— —
C1 159— —
C1 154— —
C1 1520,04 USD / 0,04 USD 8K
C1 143— —
C1 132— —
C1 129— —
C1 116— —
C1 113— —
C1 112— —
C1 0980,02 USD / 0,02 USDZa darmo 80K
C1 098— —
C1 089— —
C1 080— —
D1 0791 USD / 1 USD 4K
D1 078— —
D1 0710,01 USD / 0,01 USDZa darmo 60K
D1 067— —
D1 064— —
D1 0620,10 USD / 0,50 USD 4K
–1 053— —
D1 048— —
D1 046— —
D1 045— —
D1 041— —
–1 039— —
D1 010— —
D1 0020,05 USD / 0,25 USD 4K
D1 001— —
–996— —
D945— —
D928— —
D913— —
D900— —
D886— —
D799— —
D776— —
D764— —
D683— —
Porównaj ()

Tiery są nasze: miejsce modelu w rankingu liczone tylko względem modeli, których cały przedział ufności leży powyżej. S — górne 10%, A — do 30%, B — do 60%, C — do 85%, D — reszta.

Jakość a cena ocena w pionie, cena łączona (3 części wejścia : 1 wyjścia) w poziomie, USD za 1M tokenów
1 000 1 200 1 400 1 600 0,01 USD 0,10 USD 1 USD 10 USD 100 USD MiMo-V2.6-Pro Claude Opus 5.5 Claude Opus 4.6

Co mierzy ten ranking

Ranking programistyczny korzysta z kategorii „coding” areny tekstowej LMArena. Metoda jest ta sama co w rankingu ogólnym – ślepe głosowanie między dwiema anonimowymi odpowiedziami, przeliczane na ocenę Elo – ale liczą się wyłącznie pytania dotyczące kodu. Model, który świetnie prowadzi rozmowę, może tu zająć inne miejsce, bo ludzie oceniają co innego: poprawność kodu, jasność wyjaśnień i to, czy rozwiązanie w ogóle da się uruchomić.

Kolumny tabeli

  • tier liczony według tej samej zasady co w rankingu tekstowym: co najmniej 300 głosów, 95-procentowy przedział ufności i progi 10, 30, 60 i 85%;
  • ocena Elo z paskiem przedziału;
  • cena za 1M tokenów wejścia i wyjścia – minimalna znaleziona u dostawców;
  • okno kontekstu i zmiana ceny w ciągu 30 dni;
  • kalkulator, wykres „Jakość a cena” i pole porównania do 4 modeli.

Jak wybrać model do kodu

Zacznij od tieru, a nie od pojedynczego miejsca: modele w tym samym tierze różnią się w granicach błędu statystycznego. Potem zestaw okno kontekstu z ceną. Jeśli chcesz, by model pracował na całym repozytorium, długi kontekst ma większe znaczenie niż kilka punktów Elo, ale każde zapytanie z dużym kontekstem więcej kosztuje. Kalkulator „Koszt miesięczny” pomoże oszacować wydatki przy twoim wolumenie tokenów.

Granice tej oceny

Arena ocenia odpowiedzi na czacie o kodzie. To nie to samo, co uruchamianie testów na prawdziwym projekcie. Budowanie całych aplikacji webowych ma osobny ranking WebDev, a wieloetapową pracę z narzędziami – ranking agentów. Jeśli wybierasz model do agenta programistycznego, sprawdź wszystkie trzy i porównaj je na stronie porównania. Ocena pochodzi z pytań zadawanych przez użytkowników areny, w większości po angielsku, więc nie odzwierciedla każdego języka programowania ani każdej dziedziny. Najpewniejszą weryfikacją pozostaje krótki test na twoim własnym kodzie.