本文へスキップ
fedi.software

Web開発

LMArenaのWebDevアリーナで、プロンプトから動くWebアプリを作る能力によるモデルランキング。価格とコンテキストも掲載。

更新日 · 出典: LMArena, LiteLLM, models.dev

月額コスト
ティア モデル Elo 入力/出力、100万あたり 月額 コンテキスト アプリ 比較
S1,671$0.338 / $1.01 1M
S1,657$0.10 / $0.20 1M
S1,637$0.10 / $0.20 262K
A1,591$0.045 / $0.32 262K
A1,542$1.25 / $4.25 1M
A1,532$0.10 / $0.20 1M
B1,515$0.825 / $2.48 1M
B1,482$1.03 / $6.16 262K
B1,461$0.276 / $1.65 1M
B1,399$0.1644 / $0.9864無料 262K
C1,360$0.1126 / $0.9008無料 262K
C1,357$0.0846 / $0.6768 262K
C1,355— —
C1,274$0.13 / $0.50無料 262K
C1,263$1.50 / $7.50 256K
C1,253$0.0564 / $0.4512 262K
C1,243$0.0282 / $0.282 1M
D1,230$0.50 / $1.50 262K
D1,196— —
D1,076$0.40 / $2 262K
比較する ()

ティアは当サイト独自のものです。ボード内での順位を、信頼区間全体がそのモデルより上にあるモデルだけを数えて決めます。S — 上位10%、A — 30%まで、B — 60%まで、C — 85%まで、D — それ以外。

品質と価格 縦軸はレーティング、横軸は混合価格(入力3:出力1)、USD/100万トークン
1,000 1,200 1,400 1,600 1,800 2,000 $0.01 $0.10 $1 $10 Claude Opus 5.5 GPT-6 Astra Claude Sonnet 5.5

アプリを作らせて比べるアリーナ

このボードの元になっているのは LMArena の WebDev アリーナです。同じ依頼文から二つのモデルがそれぞれ動く Web アプリを作り、人はできあがったアプリを触って、よい方に投票します。答えの文章ではなく、実際に動く成果物で比べるのが特徴です。

評価されるモデルの顔ぶれは、テキストやコーディングのボードとは別です。列の構成は同じで、ティア、信頼区間付きの Elo、価格、コンテキストを確認できます。

レーティングが表すもの

投票する人は、画面のレイアウト、コードが動くかどうか、依頼どおりにできているかをまとめて判断しています。つまりレーティングは、コードの書き方の美しさだけではなく、結果全体の出来を反映したものです。

  • ティアは 95% 信頼区間を考えた順位から計算しています。
  • 投票が 300 票未満のモデルは「ティア未判定」です。
  • 「低価格」は混合価格が 1M トークンあたり 1 USD 未満です。

ティアと価格の見方

ティアは、レーティングがあり投票が 300 票以上のモデルの中で、95% 信頼区間の全体が自分より上にあるモデルの数から順位を決め、その割合で S から D に分けています。区間が重なるモデルどうしは差がはっきりしないため、同じティアに並ぶことがあります。価格は、データの日にプロバイダーの中で見つかった最も安いもので、「品質と価格」のグラフでは入力 3 対出力 1 の混合価格で比べられます。

使うときの注意

アリーナで作られるアプリは小さなものです。大規模なプロジェクトでの力は評価されていません。実際の開発に使う前に、手元の小さな課題で試してみると判断しやすくなります。モデル同士を並べて見たいときは比較が便利です。依頼文の書き方しだいで結果が大きく変わることもあるので、同じ依頼を複数のモデルに出して見比べると、自分の用途に合うモデルが見つけやすくなります。