本文へスキップ
fedi.software

コーディング

プログラミング用プロンプトでのモデルランキング:ティア、信頼区間付きのElo、100万トークンあたりの価格、コンテキストウィンドウ。

更新日 · 出典: LMArena, LiteLLM, models.dev

月額コスト
ティア モデル Elo 入力/出力、100万あたり 月額 コンテキスト アプリ 比較
S1,474$2 / $6 500K
A1,463$1.25 / $6 500K
A1,459$1.25 / $2.50 1M
A1,458$1.25 / $2.50 1M
A1,447$1.25 / $2.50 2M
A1,445$2 / $10 200K
A1,432$3 / $15 131K
A1,430$2.70 / $13.50 256K
A1,423$1.60 / $4.80 500K
B1,414$1.25 / $2.50 1M
B1,381— —
B1,379$0.30 / $0.50 131K
B1,375— —
B1,357$0.25 / $0.80 262K
B1,312— —
B1,312— —
B1,287$2 / $10 131K
C1,269— —
C1,267— —
C1,230— —
C1,190— —
C1,169— —
C1,165— —
C1,159— —
C1,154— —
C1,143— —
C1,132— —
C1,129— —
C1,116— —
C1,113— —
C1,112— —
C1,098— —
C1,089— —
C1,080— —
D1,078— —
D1,067— —
D1,064— —
–1,053— —
D1,048— —
D1,045— —
D1,041— —
–1,039— —
D1,010— —
D1,001— —
–996— —
D945— —
D928— —
D913— —
D900— —
D886— —
D799— —
D776— —
D764— —
比較する ()

ティアは当サイト独自のものです。ボード内での順位を、信頼区間全体がそのモデルより上にあるモデルだけを数えて決めます。S — 上位10%、A — 30%まで、B — 60%まで、C — 85%まで、D — それ以外。

品質と価格 縦軸はレーティング、横軸は混合価格(入力3:出力1)、USD/100万トークン
1,000 1,200 1,400 1,600 $0.01 $0.10 $1 $10 $100 MiMo-V2.6-Pro Claude Opus 5.5 Claude Opus 4.6

このボードは何を比べていますか?

LMArena のテキストアリーナのうち、コードに関する質問だけを集めた「coding」カテゴリーの結果です。仕組みはテキストボードと同じで、名前を伏せた二つのモデルの答えを人が比べて投票し、その結果を Elo 形式のレーティングにしています。列も同じく、ティア、95% 信頼区間付きの Elo、1M トークンあたりの価格、コンテキスト、30 日間の価格推移、計算機、グラフ、比較のチェックボックスがそろっています。

Web 開発やエージェントのボードとは何が違いますか?

ここで評価されるのは、チャットの中でコードについて答える力です。動く Web アプリを丸ごと作る課題はWeb 開発ボード、ツールを呼び出しながら何段階もの作業をこなす力はエージェントボードで見ます。用途に合わせてボードを選び分けてください。

選ぶときに何を見ればよいですか?

  • ティアと信頼区間:区間が重なるモデルどうしの差は小さいと考えます。
  • コンテキストウィンドウ:リポジトリ全体を読ませるなら長い方が有利です。価格と並べて確認しましょう。
  • 価格:「低価格」は混合価格が 1M トークンあたり 1 USD 未満のモデルです。

ティアはどう決まりますか?

当サイトが独自に計算しています。投票が 300 票以上のモデルの中で、95% 信頼区間の全体が自分より上にあるモデルの数に 1 を足して順位とし、モデルの数で割った割合で S(10% 未満)、A(30% 未満)、B(60% 未満)、C(85% 未満)、D に分けます。

注意点は?

投票が 300 票に満たないモデルは「ティア未判定」になります。チャットでの答えのよさは、実際のプロジェクトでテストを通すこととは別物です。気になるモデルは、自分のコードで小さく試してから本格的に使いましょう。