Quanto Custa um Token de IA? Preços por 1M Tokens em 2026

Quanto Custa um Token de IA? Preços por 1M Tokens em 2026

·

·

Imagem de destaque: Custo por Token de IA em 2026: Tabela Comparativa e Histórico de Preços [48 Stats]
IA & Tecnologia

O custo de uma aplicação com IA depende dos tokens de entrada, dos tokens de saída e da tarifa do modelo. Primeiro calcule esses dois volumes; depois compare preços na mesma modalidade de processamento. Abaixo você encontra a fórmula, exemplos de tarifas e dados históricos sobre a evolução dos custos.

Se você quer entender custos, ferramentas e aplicações práticas de IA no mesmo lugar, use o hub de inteligência artificial na prática.

Resposta rápida: quanto custa um token de IA?

Divida a tarifa por milhão por 1.000.000. Em um exemplo hipotético de US$ 1 por milhão de tokens de entrada, cada token de entrada custa US$ 0,000001. A saída tem tarifa própria e deve ser calculada separadamente.

Para uma estimativa em reais, multiplique pelo câmbio usado no seu orçamento. Com R$ 5,20 por dólar apenas como hipótese de cálculo, o exemplo equivale a R$ 0,0000052 por token de entrada; isso não é uma cotação atual do dólar.

Fórmula: (tokens de entrada × tarifa de entrada + tokens de saída × tarifa de saída) ÷ 1.000.000, com ambas as tarifas em dólares por milhão de tokens.

Veja a tabela de preços e suas condições ou simule seu volume na calculadora de custo de IA por tokens. Confira as tarifas selecionadas na ferramenta com a fonte do provedor.

Principais descobertas sobre custo de tokens

  • O cálculo correto separa entrada e saída: use o mesmo volume e a mesma modalidade ao comparar modelos.
  • Queda de 1.000 vezes em três anos: a a16z encontrou esse fator ao comparar o menor preço para alcançar o mesmo patamar de MMLU, de US$ 60 para US$ 0,06 por milhão de tokens.
  • Mais de 280 vezes: o Stanford AI Index 2025 mediu essa redução para desempenho no nível do GPT-3.5 entre novembro de 2022 e outubro de 2024.
  • A velocidade depende do benchmark: a Epoch AI encontrou taxas de 9 a 900 vezes por ano, alertando que os resultados mais extremos são recentes e podem não persistir.
  • Modelos na fronteira ficaram aproximadamente 5 a 10 vezes mais baratos por ano nos benchmarks analisados por Gundlach et al.; a contribuição estimada da eficiência algorítmica foi de cerca de 3 vezes por ano.

A tabela de tarifas foi conferida em 23/09/2026. As seções históricas comparam níveis de desempenho e períodos específicos; não use esses números como cotação atual nem como promessa de redução futura.

1.000×
queda para o mesmo patamar de MMLU em três anos, segundo a16z
280×+
redução para desempenho no nível do GPT-3.5 entre nov/2022 e out/2024
5–10×/ano
queda estimada para modelos na fronteira nos benchmarks do estudo do MIT
~3×/ano
contribuição estimada da eficiência algorítmica após ajustes

1. Como o custo de inferência caiu

A queda é real, mas precisa ser medida mantendo um nível de desempenho comparável. A a16z comparou o modelo mais barato capaz de atingir MMLU 42: o custo passou de US$ 60 por milhão de tokens com GPT-3, em novembro de 2021, para US$ 0,06 com Llama 3.2 3B via Together.ai três anos depois. A própria análise reconhece limitações como contaminação de benchmark e diferenças entre avaliações.

O Stanford AI Index 2025 registra queda superior a 280 vezes no custo de inferência para desempenho no nível do GPT-3.5 entre novembro de 2022 e outubro de 2024. Esse resultado descreve um patamar de desempenho e um intervalo específicos; não significa que toda API ou aplicação ficou 280 vezes mais barata.

A Epoch AI encontrou taxas de queda entre 9 e 900 vezes por ano conforme benchmark e nível de desempenho. A mediana passou de 50 para 200 vezes por ano quando a análise foi restringida ao período posterior a janeiro de 2024. Os autores alertam que as taxas mais rápidas são recentes e podem não persistir.

Leitura prática: preços históricos ajustados por qualidade ajudam a entender a tendência do mercado, mas não substituem a tarifa atual do modelo nem um teste com a carga real da aplicação.

2. Quanto custa 1 milhão de tokens: exemplos de tarifas de API

Tarifas conferidas em 23 de setembro de 2026, em dólares por milhão de tokens, para processamento Standard de texto e contexto curto quando o provedor separa faixas. Cache, Batch, Fast mode, contexto longo, região de dados e ferramentas podem alterar a cobrança.

ModeloEntrada / 1MLeitura de cache / 1MSaída / 1MFonte
GPT-6 LunaUS$ 0,10US$ 0,01US$ 0,50OpenAI
Claude Haiku 4.5US$ 1,00US$ 0,10US$ 5,00Anthropic
GPT-6 SolUS$ 2,00US$ 0,20US$ 10,00OpenAI
Claude Sonnet 5US$ 3,00US$ 0,30US$ 15,00Anthropic
Claude Opus 5.5US$ 4,00US$ 0,20US$ 20,00Anthropic
GPT-6 AstraUS$ 10,00US$ 1,00US$ 50,00OpenAI
Gemini 3.5 Flash-LiteUS$ 0,30Consulte a modalidadeUS$ 2,50Google

Exemplo atualizado: 100 mil chamadas com 500 tokens de entrada e 300 de saída totalizam 50 milhões de entrada e 30 milhões de saída. Com GPT-6 Luna Standard, sem cache, a conta é 50 × 0,10 + 30 × 0,50 = US$ 20, antes de ferramentas ou outras cobranças.

Como o prompt caching reduz o custo

Prompt caching reaproveita prefixos compartilhados, como instruções, esquemas, ferramentas e contexto repetido. Na família GPT-6, a OpenAI informa desconto de até 90% nos tokens de entrada servidos pelo cache, com janela elegível de 30 minutos, painel de taxa de acerto, diagnóstico de falhas, pontos de controle explícitos e pré-aquecimento.

  • Mantenha instruções e definições de ferramentas estáveis no início.
  • Coloque conteúdo variável e mensagens novas no final.
  • Monitore a taxa de acerto; uma sessão existente não garante o reaproveitamento do cache.
  • Compare custo total por tarefa, não apenas tarifa por token.

Fonte: OpenAI — Prompt caching. O desconto máximo não é garantia para toda requisição.

Somar a tarifa de entrada à de saída representa o custo de 1 milhão de tokens de cada tipo, ou 2 milhões no total. Use o mesmo volume, contexto, modalidade e nível de qualidade ao comparar modelos.

3. DeepSeek como estudo de caso histórico

O lançamento do DeepSeek R1 em janeiro de 2025 ampliou a discussão sobre custo e desempenho de modelos de raciocínio. Comparações publicadas naquele período mostravam tarifas de API menores que as de alguns concorrentes, mas eram fotografias de preços, provedores e modalidades específicos.

Não é correto transformar essa fotografia em uma diferença permanente ou atribuir sozinho ao modelo toda variação do mercado financeiro. A página oficial da DeepSeek hoje apresenta outra família, outros horários e outra estrutura de cobrança. Para decidir agora, consulte a tabela atual da DeepSeek e compare a mesma carga de entrada e saída.

O que permanece válido: o caso DeepSeek mostrou que preço, abertura de pesos, eficiência e qualidade precisam ser avaliados juntos. O número histórico só é útil quando vem acompanhado de data, modelo, provedor e modalidade.

Quer aplicar IA de forma prática no seu negócio?

O ebook “IA no Piloto Automático” mostra como usar IA em marketing, vendas e automações — mesmo sem equipe técnica e sem gastar fortunas em API.

Ver o ebook por R$19,90 →

4. Por que os custos continuam caindo

A redução vem de uma combinação de hardware, software de serving, arquitetura dos modelos, algoritmos e competição. Esses fatores interagem; não são vetores completamente independentes.

EvidênciaResultadoComo interpretar
Stanford AI Index 2025Custos de hardware caíram cerca de 30% ao ano; eficiência energética melhorou aproximadamente 40% ao anoTendências agregadas de hardware, não desconto garantido em qualquer API
Gundlach et al. (MIT FutureTech)Preço-performance de modelos na fronteira caiu cerca de 5 a 10 vezes ao ano nos benchmarks estudadosResultado condicionado aos benchmarks e à fronteira de custo-desempenho
Gundlach et al. (ajuste)Eficiência algorítmica estimada em aproximadamente 3 vezes ao anoEstimativa após restringir a modelos open-weight e ajustar o progresso de hardware

Na tabela detalhada do paper, fatores como 5.315 e 11.664 usam ponto decimal inglês: significam aproximadamente 5,3 e 11,7 vezes, não milhares de vezes. Os intervalos de confiança também são amplos, portanto o resumo de 5 a 10 vezes por ano é mais adequado para comunicação geral.

O estudo foi aceito no workshop “Evaluating the Evolving LLM Lifecycle” do NeurIPS 2025. Isso é diferente de afirmar, sem qualificação, que o trabalho foi aceito na trilha principal da conferência.

5. API gerenciada ou modelo open-weight?

Não existe um percentual universal de economia. “Open source”, “open-weight” e “modelo barato disponível por API” descrevem situações diferentes. A melhor opção depende da licença, da tarefa, do volume, da infraestrutura e da capacidade operacional.

CritérioAPI gerenciadaOpen-weight auto-hospedado
Volume e utilizaçãoBoa opção para demanda variável e início rápidoFaz mais sentido quando a utilização é alta e previsível
OperaçãoProvedor cuida da infraestrutura e das atualizaçõesEquipe assume serving, monitoramento, segurança e capacidade
Privacidade e controleDepende dos termos e recursos do provedorPode oferecer mais controle, sujeito à licença e à arquitetura adotada
CustoCobrança por uso, cache, ferramentas e modalidadeInclui GPU, ociosidade, energia ou cloud, engenharia e observabilidade
QualidadePrecisa ser medida na tarefa realTambém precisa ser medida; benchmark isolado não garante equivalência

Um break-even só é defensável quando informa modelo, precisão, hardware, região, contrato, throughput, utilização e custos operacionais. Por isso, este artigo não adota um número universal de conversas ou tokens por dia.

6. Como estimar o custo real de uma aplicação

Comece pelo volume observado ou por um cenário explícito. Separe tokens de entrada e saída, escolha a modalidade correta e acrescente componentes cobrados à parte.

ComponenteO que conferir
EntradaPrompt, histórico, documentos recuperados e instruções do sistema
SaídaTamanho médio das respostas e tokens de raciocínio cobrados, quando aplicável
CacheRegras de leitura, escrita, expiração e desconto do provedor
FerramentasBusca, armazenamento, execução de código, áudio, imagem e chamadas externas
ModalidadeStandard, Batch, Flex, processamento rápido ou região de dados
OperaçãoRetentativas, observabilidade, avaliação, segurança e revisão humana

Em muitos modelos, a tarifa de saída é maior que a de entrada, mas a razão varia. Use sempre as duas tarifas oficiais. Uma aplicação barata por token também pode ficar cara se repetir contexto longo, gerar respostas excessivas ou refazer chamadas com frequência.

Regra de decisão: compare custo total e qualidade suficiente para a tarefa. O modelo de menor tarifa não é necessariamente o de menor custo operacional.

Custo por token de IA: números auditados

Resumo das métricas que permaneceram após a revisão factual.

MétricaValorEscopo e fonte
Queda no menor custo para MMLU 421.000× em três anosa16z; US$ 60/M para US$ 0,06/M
Desempenho no nível do GPT-3.5Mais de 280×Stanford AI Index; nov/2022 a out/2024
Faixa por benchmark e nível de desempenho9× a 900× por anoEpoch AI; extremos recentes podem não persistir
Mediana após janeiro de 2024200× por anoEpoch AI; recorte do período mais recente
Modelos na fronteira de custo-desempenhoAproximadamente 5–10× por anoGundlach et al.; benchmarks de conhecimento, raciocínio, matemática e software
Eficiência algorítmica estimadaAproximadamente 3× por anoGundlach et al.; modelos open-weight e ajuste de hardware
Custo de hardwareQueda de aproximadamente 30% ao anoStanford AI Index 2025
Eficiência energética do hardwareMelhora de aproximadamente 40% ao anoStanford AI Index 2025
Tarifas atuaisComparar entrada e saída na mesma modalidadeTabela conferida em 23/09/2026

Metodologia e fontes

Este artigo separa tarifas atuais de tendências históricas ajustadas por desempenho. A tabela de preços foi conferida nas páginas oficiais dos provedores em 23/09/2026. As demais métricas mantêm o período, o benchmark e as limitações declaradas por suas fontes. Não constituem previsão de preços nem garantia de economia para uma aplicação específica.

Revisão factual integral: 19/09/2026. Tarifas e prompt caching atualizados em 23/09/2026. Para citar esta página: viniensina.com.br/custo-token-ia-2026/.

Perguntas Frequentes

Quanto custa um token de IA?

Depende da tarifa e do tipo de token. Em um exemplo hipotético de US$ 1 por milhão de tokens de entrada, cada token de entrada custa US$ 0,000001. Com câmbio hipotético de R$ 5,20 por dólar, isso equivale a R$ 0,0000052. Tokens de saída são calculados com sua própria tarifa.

O que é custo por token de IA?

É o valor cobrado para processar unidades de texto chamadas tokens. Em geral, provedores cobram separado por tokens de entrada e de saída.

Por que output token costuma ser mais caro?

Provedores normalmente publicam tarifas separadas para entrada e saída, e a saída costuma ter preço maior em muitos modelos. A diferença varia; confira a tabela oficial e calcule os dois volumes separadamente.

Como calcular custo de uma aplicação com IA?

Use a fórmula: tokens de entrada vezes preço de input, mais tokens de saída vezes preço de output, dividido por 1 milhão. Depois multiplique pelo câmbio se quiser estimar em reais.

ChatGPT Plus inclui custo de API?

Não necessariamente. Plano de chat e API costumam ser cobranças separadas. Para automações, produtos e integrações, confirme a tabela oficial da API do provedor.

Vale usar modelo barato em produção?

Vale quando a tarefa é simples e mensurável. Para tarefas críticas, compare custo, qualidade, latência, privacidade e taxa de erro.

🔥 Ebook Recomendado

IA no Piloto Automático

Aprenda a usar IA + Meta Ads para automatizar seu marketing e vender todos os dias — mesmo sem equipe técnica.

R$19,90
acesso imediato · ebook completo
Quero Acesso Agora →
🔒 Garantia de 7 dias