Przejdź do treści
fedi.software

Programowanie

Modele uszeregowane na zadaniach programistycznych: tier, Elo z przedziałem ufności, cena za milion tokenów i okno kontekstu.

Zaktualizowano · Źródła: LMArena, LiteLLM, models.dev

Koszt miesięczny
Tier Model Elo Wejście / wyjście, za 1M Miesięcznie Kontekst Aplikacja Porównaj
S1 5070,0015 USD / 0,09 USDZa darmo 1M
S1 5020,338 USD / 1,01 USD 1M
S1 4970,825 USD / 2,48 USD 1M
S1 4970,75 USD / 6 USD 1M
S1 4962 USD / 10 USD 1M
S1 4941,50 USD / 12 USD 1M
S1 4898 USD / 40 USD 1M
S1 487— —
S1 4850,045 USD / 0,32 USD 262K
S1 4831,50 USD / 2 USD 1M
S1 4822 USD / 10 USD 1M
S1 4730,282 USD / 1,13 USD 1M
S1 4721,03 USD / 6,16 USD 262K
S1 4690,2088 USD / 0,4176 USD 1M
A1 4670,276 USD / 1,65 USD 1M
A1 4660,06 USD / 0,37 USD 1M
A1 4640,1644 USD / 0,9864 USDZa darmo 262K
A1 4570,035 USD / 0,07 USD 1M
A1 4560,36 USD / 1,43 USD 262K
A1 4540,18 USD / 0,35 USD 164K
A1 4541 USD / 8 USD 400K
A1 4481,60 USD / 8 USD 1M
A1 4470,25 USD / 2 USD 128K
A1 4450,09 USD / 0,55 USD 131K
A1 4440,08 USD / 0,40 USD 1M
A1 4400,144 USD / 0,574 USDZa darmo 131K
A1 4390,22 USD / 0,33 USD 164K
A1 4380,375 USD / 4 USD 400K
A1 4380,20 USD / 0,88 USD 131K
A1 4360,1126 USD / 0,9008 USDZa darmo 262K
A1 4361 USD / 8 USD 400K
A1 4270,25 USD / 0,25 USD 164K
A1 4270,0846 USD / 0,6768 USD 262K
A1 4260,25 USD / 0,70 USD 128K
A1 4250,287 USD / 2,87 USD 131K
A1 4240,11 USD / 0,60 USD 131K
A1 4170,19 USD / 0,71 USD 164K
B1 4160,09 USD / 0,30 USD 256K
B1 4134,50 USD / 14 USD 128K
B1 4120,13 USD / 0,50 USDZa darmo 262K
B1 4120,0282 USD / 0,282 USD 1M
B1 4100,0564 USD / 0,4512 USD 262K
B1 4081,80 USD / 7,20 USD 200K
B1 4071,75 USD / 14 USD 128K
B1 4060,04 USD / 0,29 USD 400K
B1 4050,16 USD / 1 USD 400K
B1 39775 USD / 150 USD 128K
B1 3920,15 USD / 0,65 USD 131K
B1 3911,60 USD / 6,40 USD 1M
B1 3800,032 USD / 0,14 USD 131K
B1 3780,99 USD / 4 USD 200K
B1 3710,40 USD / 0,40 USD 80K
B1 3680,99 USD / 4 USD 200K
B1 3680,10 USD / 0,425 USD 164K
B1 3670,32 USD / 1,28 USD 1M
B1 36714 USD / 54 USD 200K
B1 3630,99 USD / 4 USD 200K
B1 3621,10 USD / 4,40 USD 128K
B1 359— —
B1 3580,05 USD / 0,10 USD 131K
B1 3510,04 USD / 0,32 USD 400K
B1 3370,0509 USD / 0,335 USD 41K
B1 3330,18 USD / 0,20 USD 24K
B1 3280,115 USD / 0,287 USD 1M
B1 314— —
B1 309— —
B1 3070,009 USD / 0,045 USDZa darmo 131K
B1 3060,08 USD / 0,26 USD 1M
B1 2975 USD / 15 USD 128K
B1 2920,12 USD / 0,30 USD 131K
B1 2900,15 USD / 0,60 USD 128K
B1 2880,345 USD / 1,38 USD 33K
B1 2842,50 USD / 10 USD 128K
B1 2760,06 USD / 0,20 USDZa darmo 33K
C1 2689 USD / 27 USD 128K
C1 25410 USD / 30 USD 8K
C1 251— 33K
C1 1960,90 USD / 0,90 USD 33K
C1 184— —
C1 165— —
C1 155— —
C1 138— —
C1 1360,45 USD / 1,40 USD 16K
C1 107— —
C1 096— —
D1 072— —
D999— —
Porównaj ()

Tiery są nasze: miejsce modelu w rankingu liczone tylko względem modeli, których cały przedział ufności leży powyżej. S — górne 10%, A — do 30%, B — do 60%, C — do 85%, D — reszta.

Jakość a cena ocena w pionie, cena łączona (3 części wejścia : 1 wyjścia) w poziomie, USD za 1M tokenów
1 000 1 200 1 400 1 600 0,01 USD 0,10 USD 1 USD 10 USD 100 USD MiMo-V2.6-Pro Claude Opus 5.5 Claude Opus 4.6

Co mierzy ten ranking

Ranking programistyczny korzysta z kategorii „coding” areny tekstowej LMArena. Metoda jest ta sama co w rankingu ogólnym – ślepe głosowanie między dwiema anonimowymi odpowiedziami, przeliczane na ocenę Elo – ale liczą się wyłącznie pytania dotyczące kodu. Model, który świetnie prowadzi rozmowę, może tu zająć inne miejsce, bo ludzie oceniają co innego: poprawność kodu, jasność wyjaśnień i to, czy rozwiązanie w ogóle da się uruchomić.

Kolumny tabeli

  • tier liczony według tej samej zasady co w rankingu tekstowym: co najmniej 300 głosów, 95-procentowy przedział ufności i progi 10, 30, 60 i 85%;
  • ocena Elo z paskiem przedziału;
  • cena za 1M tokenów wejścia i wyjścia – minimalna znaleziona u dostawców;
  • okno kontekstu i zmiana ceny w ciągu 30 dni;
  • kalkulator, wykres „Jakość a cena” i pole porównania do 4 modeli.

Jak wybrać model do kodu

Zacznij od tieru, a nie od pojedynczego miejsca: modele w tym samym tierze różnią się w granicach błędu statystycznego. Potem zestaw okno kontekstu z ceną. Jeśli chcesz, by model pracował na całym repozytorium, długi kontekst ma większe znaczenie niż kilka punktów Elo, ale każde zapytanie z dużym kontekstem więcej kosztuje. Kalkulator „Koszt miesięczny” pomoże oszacować wydatki przy twoim wolumenie tokenów.

Granice tej oceny

Arena ocenia odpowiedzi na czacie o kodzie. To nie to samo, co uruchamianie testów na prawdziwym projekcie. Budowanie całych aplikacji webowych ma osobny ranking WebDev, a wieloetapową pracę z narzędziami – ranking agentów. Jeśli wybierasz model do agenta programistycznego, sprawdź wszystkie trzy i porównaj je na stronie porównania. Ocena pochodzi z pytań zadawanych przez użytkowników areny, w większości po angielsku, więc nie odzwierciedla każdego języka programowania ani każdej dziedziny. Najpewniejszą weryfikacją pozostaje krótki test na twoim własnym kodzie.