Análise independente em português de +700 modelos de IA das principais empresas. ELO do Chatbot Arena, Intelligence Index, preços em reais e especificações. Atualizado diariamente.
O SWEN.AI é o maior portal independente de benchmark de inteligência artificial do Brasil, acompanhando mais de +700 modelos de linguagem (LLMs) com dados atualizados a cada 6 horas. O benchmark SWEN.AI classifica os modelos de IA usando o Intelligence Index da Artificial Analysis — um score composto de 0 a 100 que agrega avaliações padronizadas incluindo GPQA Diamond (ciência de nível doutorado), MMLU-Pro (conhecimento acadêmico amplo), AIME (matemática olímpica), HLE (raciocínio científico de fronteira) e LiveCodeBench (programação). Diferente de rankings baseados em popularidade ou votos de usuários, a metodologia do SWEN.AI prioriza a capacidade técnica objetiva medida por meio de benchmarks controlados e reprodutíveis. O Claude Opus 5 (Anthropic) lidera atualmente com Score AA de 60,7 de 100, seguido por GPT-5.6 (OpenAI) e Gemini 3.5 Pro (Google). O ranking também inclui preços em Real (BRL), velocidade de inferência em tokens por segundo e tamanho da janela de contexto — permitindo que profissionais e empresas brasileiras comparem modelos de IA com base em mérito técnico, custo e desempenho em vez de alegações de marketing. Todos os dados são provenientes da Artificial Analysis, LMArena e OpenRouter, com metodologia completa documentada publicamente.
Por Luis Fernando Roquette • Última atualização: 17 de agosto de 2026
746 modelos • 617 com benchmarks • 571 com Score AA • Sincronizado: 17 de agosto de 2026
Qual o melhor LLM hoje?
Mais Inteligente
Score AA — Artificial Analysis · atualizado a cada 6h
Mais veloz?
Mais Rápidos
Output tokens/segundo · maior é melhor
Melhor custo-benefício?
Mais Entrega por Menos
Score AA por US$ (preço blended 3:1)
Score AA — Artificial Analysis · top 20
Score AA = AA Intelligence Index da Artificial Analysis. Atualizado a cada 6h. Clique em qualquer modelo para ver benchmarks detalhados.
746
Modelos
105
Empresas
571
Com Score AA
100
Reasoning
117
Open Source
210
Multimodal
Classificação baseada no AA Intelligence Index da Artificial Analysis — score composto atualizado a cada 6 horas.
Benchmark de IA é uma avaliação independente e padronizada que mede e compara a capacidade real de modelos de inteligência artificial em tarefas específicas. Diferente de alegações de marketing das big techs, benchmarks fornecem métricas objetivas e verificáveis para escolher o modelo certo para cada caso de uso.
Os 3 critérios que mais importam ao comparar modelos de IA:
ELO: Ranking de preferência humana do LMArena (Chatbot Arena). Usuários reais comparam respostas às cegas e votam. Maior = as pessoas preferem para conversas cotidianas.
Intel. (AA Intelligence Index): Score composto 0-100 da Artificial Analysis que agrega GPQA Diamond, MMLU-Pro, AIME, HLE, LiveCodeBench e outros. Mede capacidade técnica real — raciocínio, matemática, código, ciências.
Input $/1M: Preço em USD por 1 milhão de tokens de input (≈750 mil palavras). O quanto você paga para enviar texto ao modelo. Tokens de output custam separado.
Contexto: Máximo de tokens que o modelo processa de uma vez — determina quanto texto (código, documentos, histórico de conversa) cabe em uma única requisição.
Tokens/s: Velocidade de geração — quantos tokens o modelo produz por segundo. Maior = respostas mais rápidas, menor latência, melhor para apps em tempo real.
| # | Modelo | ELO | Input $/1M |
|---|---|---|---|
| 🥇 | Claude Opus 5Novo | 1493 | $5.00 |
| 🥈 | Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) | 1506 | $10.00 |
| · | Claude Fable 5 (batch) | — | $5.00 |
| 4 | Grok 4.6Novo | 1464 | $2.00 |
| · | GPT-5.6 Sol (max) | — | $5.00 |
| · | Kimi K3 | — | $3.00 |
| 7 | GPT-5.6 Sol (xhigh) | 1481 | $5.00 |
| · | GPT-5.6 Sol (batch) | — | $2.50 |
| · | Claude Opus 5 (batch)Novo | — | $2.50 |
| · | Claude Opus 5 (Fast)Novo | — | $10.00 |
| · | Qwen3.8 MaxNovo | — | $2.00 |
| · | Qwen3.8 2.4T A95BNovo | — | $2.00 |
| 13 | Claude Opus 4.8 (Adaptive Reasoning, Max Effort) | 1481 | $5.00 |
| · | Claude Opus 4.8 (batch) | — | $2.50 |
| · | GPT-5.6 Sol (high) | — | $5.00 |
| 16 | Muse Spark 1.2 (xhigh)Novo | 1498 | $1.25 |
| · | GPT-5.6 Terra (max) | — | $2.00 |
| 18 | GPT-5.5 | 1482 | $5.00 |
| 19 | Gemini 3.7 Flash (high)Novo | 1490 | $0.75 |
| · | Grok 4.5 | — | $2.00 |
Preços em USD por 1M tokens de input. Estimativa em BRL: câmbio de mercado + IOF de 6,38%. Consulte metodologia para detalhes.
OS = Open Source • MM = Multimodal • R = Reasoning •Score AA: Artificial Analysis • Intel.: Artificial Analysis •Preços: OpenRouter •Ver metodologia completa
Progressão diária do AA Intelligence Index para os modelos no topo. Maior = mais capaz.
Tokens por segundo — top 15
Velocidade em tokens/segundo medida via API. TTFT = Time to First Token (latência até a primeira resposta).
Claude Opus 5 é o modelo de IA mais inteligente em 2026 com Score AA de 63.1, segundo o AA Intelligence Index da Artificial Analysis — score composto atualizado a cada 6 horas. O mercado de modelos de linguagem (LLMs) em 2026 é dominado por uma corrida entre OpenAI, Anthropic, Google DeepMind, Meta AI e labs como DeepSeek, Alibaba (Qwen) e xAI (Grok). Com mais de 746 modelos disponíveis via API, escolher o modelo certo para cada caso de uso tornou-se uma decisão complexa que envolve qualidade (medida por benchmarks como AA Intelligence Index, MMLU e SWE-bench), preço por token, velocidade de inferência, contexto e capacidades multimodais.
Metodologia do Intelligence Index — composição do score. Fontes: Artificial Analysis, LMArena, OpenRouter. Atualizado a cada 6h. CC BY 4.0.
Pelo AA Intelligence Index da Artificial Analysis, Claude Opus 5 lidera com Score AA de 63.1. Porém, o "melhor" depende do caso de uso: para custo-benefício, OpenAI: GPT-5 Nano (batch) oferece excelente qualidade por preço baixo.
O Score AA é o AA Intelligence Index da Artificial Analysis — um score composto (0-100) que combina múltiplos benchmarks de raciocínio, código, matemática e ciência. É atualizado automaticamente a cada 6 horas com dados da API pública da Artificial Analysis.
Entre modelos com boa qualidade (Score AA > 40), Hy3-preview (Non-reasoning) é o mais acessível a $0.06/1M tokens de input.
Benchmarks são indicativos, não definitivos. O AA Intelligence Index é considerado robusto por combinar múltiplas avaliações padronizadas. Benchmarks individuais (MMLU, GPQA) podem sofrer contaminação. Recomendamos testar no seu caso de uso específico.
Claude (Anthropic) e Gemini (Google) tendem a ter melhor performance em português brasileiro. O SWEN.AI mantém um benchmark proprietário em PT-BR com 10 modelos testados em ENEM, OAB e SAC — veja os resultados em /benchmark/ptbr.