Qual modelo de IA entrega mais inteligência por dólar gasto? Ranking calculado por AA Intelligence Index ÷ preço/1M tokens — modelos com alta qualidade e baixo custo de API ficam no topo. 30 modelos ranqueados.
Fórmula: (AA Intelligence Index × 10) ÷ preço_input/1M tokens. Fonte: Artificial Analysis, atualizado a cada 6h.
30 modelos com AA Intelligence Index e preço disponíveis.
| # | Modelo | Empresa | Score AA | $/1M in | $/1M out | tok/s | Score C/B |
|---|---|---|---|---|---|---|---|
| 1 | OpenAI: GPT-5 Nano (batch) | 20.1 | $$0.03 | $$0.20 | — | 8,040 | |
| 2 | Hy3-preview (Reasoning) | Tencent | 42.2 | $$0.06 | $$0.21 | 64 | 7,033 |
| 3 | Qwen3.5 4B (Reasoning) | 20.4 | $$0.03 | $$0.15 | 36 | 6,800 | |
| 4 | Gemma 4 E4B (Reasoning) | 12.4 | $$0.02 | $$0.10 | 76 | 6,200 | |
| 5 | Ling-3.0-flash | Ant Bailing | 37.8 | $$0.07 | $$0.22 | 422 | 5,400 |
| 6 | Qwen3.5 4B (Non-reasoning) | 16.1 | $$0.03 | $$0.15 | 36 | 5,367 | |
| 7 | HyperNova 60B 2605 | Multiverse Computing | 18.3 | $$0.04 | $$0.14 | 360 | 4,575 |
| 8 | Gemma 4 E4B (Non-reasoning) | 8.7 | $$0.02 | $$0.10 | 77 | 4,350 | |
| 9 | GPT-5 Nano | 20.1 | $$0.05 | $$0.40 | 157 | 4,020 | |
| 10 | OpenAI: GPT-5.4 Nano (batch) | 39.7 | $$0.10 | $$0.63 | — | 3,970 | |
| 11 | Llama 3.1 8B Instruct | 7.8 | $$0.02 | $$0.05 | 143 | 3,900 | |
| 12 | DeepSeek V4 Flash | 51.8 | $$0.14 | $$0.28 | 136 | 3,700 | |
| 13 | GLM-4.7-Flash (Reasoning) | 23.3 | $$0.07 | $$0.40 | 118 | 3,329 | |
| 14 | DeepSeek V4 Flash (Reasoning, Max Effort) | 42.1 | $$0.13 | $$0.28 | — | 3,238 | |
| 15 | MiMo-V2-Flash (Reasoning) | Xiaomi | 31.9 | $$0.10 | $$0.30 | — | 3,190 |
| 16 | DeepSeek-V4-Flash | 42.1 | $$0.14 | $$0.28 | 124 | 3,007 | |
| 17 | Sarvam 105B (high) | Sarvam | 11.9 | $$0.04 | $$0.17 | — | 2,975 |
| 18 | NVIDIA Nemotron 3 Nano 30B A3B (Reasoning) | 14.5 | $$0.05 | $$0.20 | 226 | 2,900 | |
| 19 | NVIDIA: Nemotron 3 Nano 30B A3B | 14.5 | $$0.05 | $$0.20 | 205 | 2,900 | |
| 20 | DeepSeek V4 Flash (Reasoning, High Effort) | 39.0 | $$0.14 | $$0.28 | — | 2,786 | |
| 21 | MiMo-V2.5 | Xiaomi | 38.0 | $$0.14 | $$0.28 | 84 | 2,714 |
| 22 | OpenAI: GPT-5.6 Luna Pro | 26.8 | $$0.10 | $$0.60 | — | 2,680 | |
| 23 | GPT-5.6 Luna (max) | 52.3 | $$0.20 | $$1.20 | 202 | 2,615 | |
| 24 | Step 3.5 Flash | StepFun | 26.0 | $$0.10 | $$0.30 | 188 | 2,600 |
| 25 | gpt-oss-20b | 15.2 | $$0.06 | $$0.19 | 123 | 2,533 | |
| 26 | OpenAI: GPT-5 Mini (batch) | 31.6 | $$0.13 | $$1.00 | — | 2,528 | |
| 27 | GPT-5.6 Luna (xhigh) | 50.1 | $$0.20 | $$1.20 | 199 | 2,505 | |
| 28 | GPT-5.6 Luna (high) | 47.0 | $$0.20 | $$1.20 | 186 | 2,350 | |
| 29 | Google: Gemini 2.5 Flash Lite (batch) | 11.4 | $$0.05 | $$0.20 | — | 2,280 | |
| 30 | Gemma 4 12B (Reasoning) | 22.3 | $$0.10 | $$0.30 | 111 | 2,230 |
Score C/B = (AA Intelligence Index × 10) ÷ preço_input/1M. Maior = melhor custo-benefício.Ver metodologia →
O ranking de custo-benefício não é um substituto para o ranking de qualidade absoluta. Um modelo no topo desta lista não é necessariamente “melhor” — é o que entrega mais qualidade relativa ao seu custo. Para projetos onde a qualidade máxima é crítica (diagnóstico médico, análise jurídica, código de produção), use oranking por inteligência absoluta.
Custo-benefício deve ser o critério dominante quando: (1) volume de tokens é alto (chatbots de WhatsApp com centenas de mensagens/dia); (2) a tarefa tem critérios de qualidade definidos e mensuráveis (respostas corretas em FAQs, extração de dados estruturados); (3) você tem múltiplos modelos passando no critério de qualidade mínimo. Nesses casos, o modelo mais barato que passa é a escolha correta — pagar a mais não adiciona valor.
O preço por token é só parte do custo total. Inclua também: (1) custo de latência — modelos mais baratos tendem a ser mais lentos, impactando a experiência em tempo real; (2) custo de prompt engineering — modelos com menos capacidade requerem prompts mais elaborados; (3) custo de erros — um modelo barato que erra 10% mais pode custar mais em revisão humana; (4) custo de integração — APIs com menor documentação aumentam o custo de desenvolvimento.
(AA Intelligence Index × 10) ÷ preço_input/1M tokens. O Intelligence Index mede raciocínio + código + contexto de 0 a 100 (Artificial Analysis, atualizado a cada 6h); multiplicar por 10 escala a métrica; dividir pelo preço normaliza por custo. Maior score = mais inteligência por dólar.
OpenAI: GPT-5 Nano (batch) lidera em 2026 com Score AA 20.1 por $0.025/1M tokens. Modelos com alto AA Intelligence Index e baixo preço ficam no topo desta lista.
Depende da tarefa. Para volume alto e tarefas simples, modelos baratos entregam 80% da qualidade por 10% do custo. Para análise complexa, o ganho de qualidade pode justificar o preço maior.