Qual modelo de IA entrega mais inteligência por dólar gasto? Ranking calculado por AA Intelligence Index ÷ preço/1M tokens — modelos com alta qualidade e baixo custo de API ficam no topo. 30 modelos ranqueados.
Fórmula: (AA Intelligence Index × 10) ÷ preço_input/1M tokens. Fonte: Artificial Analysis, atualizado a cada 6h.
30 modelos com AA Intelligence Index e preço disponíveis.
| # | Modelo | Empresa | Score AA | $/1M in | $/1M out | tok/s | Score C/B |
|---|---|---|---|---|---|---|---|
| 1 | Agnes 3.0 Flash | Sapiens AI | 35.5 | $$0.05 | $$0.15 | 317 | 7,100 |
| 2 | Gemma 4 E4B (Reasoning) | 8.9 | $$0.02 | $$0.10 | 49 | 4,450 | |
| 3 | Qwen3.5 4B (Reasoning) | 13.1 | $$0.03 | $$0.15 | 26 | 4,367 | |
| 4 | Gemma 4 E4B (Non-reasoning) | 7.5 | $$0.02 | $$0.10 | 44 | 3,750 | |
| 5 | GPT-6 Luna (max) | 37.3 | $$0.10 | $$0.50 | 134 | 3,730 | |
| 6 | Qwen3.5 4B (Non-reasoning) | 10.8 | $$0.03 | $$0.15 | 24 | 3,600 | |
| 7 | Ling 3.0 Flash | InclusionAI | 24.9 | $$0.07 | $$0.22 | 351 | 3,557 |
| 8 | Agnes 2.5 Pro Beta | Sapiens AI | 35.2 | $$0.10 | $$0.30 | 168 | 3,520 |
| 9 | Ling-3.0-flash-VL | InclusionAI | 24.6 | $$0.07 | $$0.22 | 146 | 3,514 |
| 10 | Llama 3.1 8B Instruct | 6.9 | $$0.02 | $$0.05 | 138 | 3,450 | |
| 11 | GPT-6 Luna (xhigh) | 33.9 | $$0.10 | $$0.50 | 128 | 3,390 | |
| 12 | Ling-3.0-flash-Fin | InclusionAI | 22.6 | $$0.07 | $$0.22 | 159 | 3,229 |
| 13 | GPT-6 Luna (high) | 32.1 | $$0.10 | $$0.50 | 135 | 3,210 | |
| 14 | Granite 4.2 3B | IBM | 9.1 | $$0.03 | $$0.12 | 220 | 3,033 |
| 15 | GPT-6 Luna (medium) | 29.5 | $$0.10 | $$0.50 | 143 | 2,950 | |
| 16 | HyperNova 60B 2605 | Multiverse Computing | 11.7 | $$0.04 | $$0.14 | 355 | 2,925 |
| 17 | Hy3-preview (Non-reasoning) | Tencent | 17.0 | $$0.06 | $$0.21 | 78 | 2,833 |
| 18 | GLM-5.3-Flash | Z AI | 41.8 | $$0.15 | $$0.50 | 43 | 2,787 |
| 19 | Qwen3.8-Flash-Next | 39.8 | $$0.15 | $$0.47 | 53 | 2,653 | |
| 20 | GPT-5 Nano | 13.0 | $$0.05 | $$0.40 | 149 | 2,600 | |
| 21 | GPT-5 nano (medium) | 12.5 | $$0.05 | $$0.40 | 143 | 2,500 | |
| 22 | Sarvam 105B (high) | Sarvam | 8.8 | $$0.04 | $$0.17 | — | 2,200 |
| 23 | Sarvam 30B | Sarvam | 6.6 | $$0.03 | $$0.11 | — | 2,200 |
| 24 | Z.ai: GLM 4.7 Flash | 14.9 | $$0.07 | $$0.40 | 71 | 2,129 | |
| 25 | GPT-6 Luna (low) | 20.9 | $$0.10 | $$0.50 | 124 | 2,090 | |
| 26 | MiMo-V2-Flash (Reasoning) | Xiaomi | 20.8 | $$0.10 | $$0.30 | — | 2,080 |
| 27 | DeepSeek V4 Flash (Reasoning, High Effort) | 26.0 | $$0.13 | $$0.28 | — | 2,000 | |
| 28 | GPT-5.6 Luna (max) | 37.3 | $$0.20 | $$1.20 | 126 | 1,865 | |
| 29 | DeepSeek V4 Flash 0420 (Non-reasoning) | 24.2 | $$0.13 | $$0.28 | — | 1,862 | |
| 30 | Granite 4.2 8B | IBM | 11.1 | $$0.06 | $$0.25 | 82 | 1,850 |
Score C/B = (AA Intelligence Index × 10) ÷ preço_input/1M. Maior = melhor custo-benefício.Ver metodologia →
O ranking de custo-benefício não é um substituto para o ranking de qualidade absoluta. Um modelo no topo desta lista não é necessariamente “melhor” — é o que entrega mais qualidade relativa ao seu custo. Para projetos onde a qualidade máxima é crítica (diagnóstico médico, análise jurídica, código de produção), use oranking por inteligência absoluta.
Custo-benefício deve ser o critério dominante quando: (1) volume de tokens é alto (chatbots de WhatsApp com centenas de mensagens/dia); (2) a tarefa tem critérios de qualidade definidos e mensuráveis (respostas corretas em FAQs, extração de dados estruturados); (3) você tem múltiplos modelos passando no critério de qualidade mínimo. Nesses casos, o modelo mais barato que passa é a escolha correta — pagar a mais não adiciona valor.
O preço por token é só parte do custo total. Inclua também: (1) custo de latência — modelos mais baratos tendem a ser mais lentos, impactando a experiência em tempo real; (2) custo de prompt engineering — modelos com menos capacidade requerem prompts mais elaborados; (3) custo de erros — um modelo barato que erra 10% mais pode custar mais em revisão humana; (4) custo de integração — APIs com menor documentação aumentam o custo de desenvolvimento.
(AA Intelligence Index × 10) ÷ preço_input/1M tokens. O Intelligence Index mede raciocínio + código + contexto de 0 a 100 (Artificial Analysis, atualizado a cada 6h); multiplicar por 10 escala a métrica; dividir pelo preço normaliza por custo. Maior score = mais inteligência por dólar.
Agnes 3.0 Flash lidera em 2026 com Score AA 35.5 por $0.05/1M tokens. Modelos com alto AA Intelligence Index e baixo preço ficam no topo desta lista.
Depende da tarefa. Para volume alto e tarefas simples, modelos baratos entregam 80% da qualidade por 10% do custo. Para análise complexa, o ganho de qualidade pode justificar o preço maior.