Ir para o conteúdo
fedi.software

Agentes

Modelos classificados em tarefas agênticas — chamadas de ferramentas e trabalho em várias etapas — pelo ranking de agentes do LMArena. A pontuação é centrada em zero, não é um Elo.

Atualizado · Fontes: LMArena, LiteLLM, models.dev

Custo por mês
Tier Modelo Pontuação Entrada / saída, por 1M Por mês Contexto App Comparar
S0,143US$ 10 / US$ 50 1M
S0,138US$ 4 / US$ 20 1M
S0,125US$ 2 / US$ 10 1M
S0,087US$ 5 / US$ 25 1M
S0,082US$ 3 / US$ 18,50 1M
A0,066US$ 0,425 / US$ 2,12 1M
A0,044US$ 1,44 / US$ 7,20 1M
B0,025US$ 0,338 / US$ 1,01 1M
B-0,007US$ 0,10 / US$ 0,20 262K
C-0,017US$ 0,045 / US$ 0,32 262K
C-0,051US$ 0,825 / US$ 2,48 1M
C-0,072US$ 0,282 / US$ 1,13 1M
D-0,124US$ 1,50 / US$ 7,50 256K
Comparar ()

Os tiers são nossos: a posição de um modelo no ranking, contando só os modelos cujo intervalo de confiança inteiro fica acima dele. S — 10% do topo, A — até 30%, B — até 60%, C — até 85%, D — o restante.

Qualidade x preço nota no eixo vertical, preço combinado (3 partes de entrada : 1 de saída) no horizontal, USD por 1M de tokens
-0,2 -0,1 0,0 0,1 0,2 US$ 0,01 US$ 0,10 US$ 1 US$ 10 Claude Fable 5.1 Claude Opus 5.5 Claude Sonnet 5.5

Antes de tudo: esta nota não é Elo

O ranking de agentes usa o placar de agentes do LMArena, e a métrica dele é diferente das outras páginas. Em vez de uma nota no estilo Elo, cada modelo recebe uma pontuação centrada em zero, que vai de valores negativos a positivos. A coluna se chama “Pontuação” e mostra três casas decimais. Por isso, compare os modelos só dentro deste ranking; nunca coloque esses números ao lado das notas Elo dos rankings de texto, programação ou imagem.

O que é avaliado

A arena propõe tarefas em várias etapas, em que o modelo precisa chamar ferramentas — buscar informação, executar uma ação, ler o resultado e continuar. As pessoas avaliam as sessões inteiras, e cada sessão conta como um voto. Uma pontuação acima de zero significa que o modelo foi preferido com mais frequência do que o modelo médio deste ranking.

Como ler a tabela

  • Tier: usa a mesma regra de toda a seção — pelo menos 300 votos, intervalo de confiança de 95% e as faixas de 10, 30, 60 e 85%.
  • Preço: por 1M de tokens, com a mesma calculadora “Custo por mês”; em agentes, cada tarefa costuma consumir muitos tokens, então vale simular antes.
  • Comparação: marque até 4 modelos e veja-os lado a lado.

Limites

É um ranking jovem, com menos modelos do que o de texto. E o ambiente de agentes usado na arena não é o mesmo que você vai usar: ferramentas, permissões e instruções mudam o resultado. Trate a pontuação como ponto de partida e teste o modelo no seu próprio fluxo.

Próximos passos

Para programação no terminal ou no editor, veja os agentes de programação. Para automatizar tarefas entre aplicativos, a página de automação reúne construtores de fluxos. E, se o seu agente usa skills, o diretório de skills mostra o que está em alta.