O custo de uma aplicação com IA depende dos tokens de entrada, dos tokens de saída e da tarifa do modelo. Primeiro calcule esses dois volumes; depois compare preços na mesma modalidade de processamento. Abaixo você encontra a fórmula, exemplos de tarifas e dados históricos sobre a evolução dos custos.
Se você quer entender custos, ferramentas e aplicações práticas de IA no mesmo lugar, use o hub de inteligência artificial na prática.
Resposta rápida: quanto custa um token de IA?
Divida a tarifa por milhão por 1.000.000. Em um exemplo hipotético de US$ 1 por milhão de tokens de entrada, cada token de entrada custa US$ 0,000001. A saída tem tarifa própria e deve ser calculada separadamente.
Para uma estimativa em reais, multiplique pelo câmbio usado no seu orçamento. Com R$ 5,20 por dólar apenas como hipótese de cálculo, o exemplo equivale a R$ 0,0000052 por token de entrada; isso não é uma cotação atual do dólar.
Fórmula: (tokens de entrada × tarifa de entrada + tokens de saída × tarifa de saída) ÷ 1.000.000, com ambas as tarifas em dólares por milhão de tokens.
Veja a tabela de preços e suas condições ou simule seu volume na calculadora de custo de IA por tokens. Confira as tarifas selecionadas na ferramenta com a fonte do provedor.
Neste relatório
- Como o custo de inferência caiu
- Quanto custa 1 milhão de tokens: tarifas de API
- DeepSeek como estudo de caso histórico
- Por que os custos continuam caindo
- API gerenciada ou modelo open-weight?
- Como estimar o custo real de uma aplicação
- Custo por Token de IA em Números: Tabela Completa
- Metodologia e Fontes
Principais descobertas sobre custo de tokens
- O cálculo correto separa entrada e saída: use o mesmo volume e a mesma modalidade ao comparar modelos.
- Queda de 1.000 vezes em três anos: a a16z encontrou esse fator ao comparar o menor preço para alcançar o mesmo patamar de MMLU, de US$ 60 para US$ 0,06 por milhão de tokens.
- Mais de 280 vezes: o Stanford AI Index 2025 mediu essa redução para desempenho no nível do GPT-3.5 entre novembro de 2022 e outubro de 2024.
- A velocidade depende do benchmark: a Epoch AI encontrou taxas de 9 a 900 vezes por ano, alertando que os resultados mais extremos são recentes e podem não persistir.
- Modelos na fronteira ficaram aproximadamente 5 a 10 vezes mais baratos por ano nos benchmarks analisados por Gundlach et al.; a contribuição estimada da eficiência algorítmica foi de cerca de 3 vezes por ano.
A tabela de tarifas foi conferida em 23/09/2026. As seções históricas comparam níveis de desempenho e períodos específicos; não use esses números como cotação atual nem como promessa de redução futura.
1. Como o custo de inferência caiu
A queda é real, mas precisa ser medida mantendo um nível de desempenho comparável. A a16z comparou o modelo mais barato capaz de atingir MMLU 42: o custo passou de US$ 60 por milhão de tokens com GPT-3, em novembro de 2021, para US$ 0,06 com Llama 3.2 3B via Together.ai três anos depois. A própria análise reconhece limitações como contaminação de benchmark e diferenças entre avaliações.
O Stanford AI Index 2025 registra queda superior a 280 vezes no custo de inferência para desempenho no nível do GPT-3.5 entre novembro de 2022 e outubro de 2024. Esse resultado descreve um patamar de desempenho e um intervalo específicos; não significa que toda API ou aplicação ficou 280 vezes mais barata.
A Epoch AI encontrou taxas de queda entre 9 e 900 vezes por ano conforme benchmark e nível de desempenho. A mediana passou de 50 para 200 vezes por ano quando a análise foi restringida ao período posterior a janeiro de 2024. Os autores alertam que as taxas mais rápidas são recentes e podem não persistir.
2. Quanto custa 1 milhão de tokens: exemplos de tarifas de API
Tarifas conferidas em 23 de setembro de 2026, em dólares por milhão de tokens, para processamento Standard de texto e contexto curto quando o provedor separa faixas. Cache, Batch, Fast mode, contexto longo, região de dados e ferramentas podem alterar a cobrança.
| Modelo | Entrada / 1M | Leitura de cache / 1M | Saída / 1M | Fonte |
|---|---|---|---|---|
| GPT-6 Luna | US$ 0,10 | US$ 0,01 | US$ 0,50 | OpenAI |
| Claude Haiku 4.5 | US$ 1,00 | US$ 0,10 | US$ 5,00 | Anthropic |
| GPT-6 Sol | US$ 2,00 | US$ 0,20 | US$ 10,00 | OpenAI |
| Claude Sonnet 5 | US$ 3,00 | US$ 0,30 | US$ 15,00 | Anthropic |
| Claude Opus 5.5 | US$ 4,00 | US$ 0,20 | US$ 20,00 | Anthropic |
| GPT-6 Astra | US$ 10,00 | US$ 1,00 | US$ 50,00 | OpenAI |
| Gemini 3.5 Flash-Lite | US$ 0,30 | Consulte a modalidade | US$ 2,50 |
Exemplo atualizado: 100 mil chamadas com 500 tokens de entrada e 300 de saída totalizam 50 milhões de entrada e 30 milhões de saída. Com GPT-6 Luna Standard, sem cache, a conta é 50 × 0,10 + 30 × 0,50 = US$ 20, antes de ferramentas ou outras cobranças.
Como o prompt caching reduz o custo
Prompt caching reaproveita prefixos compartilhados, como instruções, esquemas, ferramentas e contexto repetido. Na família GPT-6, a OpenAI informa desconto de até 90% nos tokens de entrada servidos pelo cache, com janela elegível de 30 minutos, painel de taxa de acerto, diagnóstico de falhas, pontos de controle explícitos e pré-aquecimento.
- Mantenha instruções e definições de ferramentas estáveis no início.
- Coloque conteúdo variável e mensagens novas no final.
- Monitore a taxa de acerto; uma sessão existente não garante o reaproveitamento do cache.
- Compare custo total por tarefa, não apenas tarifa por token.
Fonte: OpenAI — Prompt caching. O desconto máximo não é garantia para toda requisição.
Somar a tarifa de entrada à de saída representa o custo de 1 milhão de tokens de cada tipo, ou 2 milhões no total. Use o mesmo volume, contexto, modalidade e nível de qualidade ao comparar modelos.
3. DeepSeek como estudo de caso histórico
O lançamento do DeepSeek R1 em janeiro de 2025 ampliou a discussão sobre custo e desempenho de modelos de raciocínio. Comparações publicadas naquele período mostravam tarifas de API menores que as de alguns concorrentes, mas eram fotografias de preços, provedores e modalidades específicos.
Não é correto transformar essa fotografia em uma diferença permanente ou atribuir sozinho ao modelo toda variação do mercado financeiro. A página oficial da DeepSeek hoje apresenta outra família, outros horários e outra estrutura de cobrança. Para decidir agora, consulte a tabela atual da DeepSeek e compare a mesma carga de entrada e saída.
Quer aplicar IA de forma prática no seu negócio?
O ebook “IA no Piloto Automático” mostra como usar IA em marketing, vendas e automações — mesmo sem equipe técnica e sem gastar fortunas em API.
Ver o ebook por R$19,90 →4. Por que os custos continuam caindo
A redução vem de uma combinação de hardware, software de serving, arquitetura dos modelos, algoritmos e competição. Esses fatores interagem; não são vetores completamente independentes.
| Evidência | Resultado | Como interpretar |
|---|---|---|
| Stanford AI Index 2025 | Custos de hardware caíram cerca de 30% ao ano; eficiência energética melhorou aproximadamente 40% ao ano | Tendências agregadas de hardware, não desconto garantido em qualquer API |
| Gundlach et al. (MIT FutureTech) | Preço-performance de modelos na fronteira caiu cerca de 5 a 10 vezes ao ano nos benchmarks estudados | Resultado condicionado aos benchmarks e à fronteira de custo-desempenho |
| Gundlach et al. (ajuste) | Eficiência algorítmica estimada em aproximadamente 3 vezes ao ano | Estimativa após restringir a modelos open-weight e ajustar o progresso de hardware |
Na tabela detalhada do paper, fatores como 5.315 e 11.664 usam ponto decimal inglês: significam aproximadamente 5,3 e 11,7 vezes, não milhares de vezes. Os intervalos de confiança também são amplos, portanto o resumo de 5 a 10 vezes por ano é mais adequado para comunicação geral.
5. API gerenciada ou modelo open-weight?
Não existe um percentual universal de economia. “Open source”, “open-weight” e “modelo barato disponível por API” descrevem situações diferentes. A melhor opção depende da licença, da tarefa, do volume, da infraestrutura e da capacidade operacional.
| Critério | API gerenciada | Open-weight auto-hospedado |
|---|---|---|
| Volume e utilização | Boa opção para demanda variável e início rápido | Faz mais sentido quando a utilização é alta e previsível |
| Operação | Provedor cuida da infraestrutura e das atualizações | Equipe assume serving, monitoramento, segurança e capacidade |
| Privacidade e controle | Depende dos termos e recursos do provedor | Pode oferecer mais controle, sujeito à licença e à arquitetura adotada |
| Custo | Cobrança por uso, cache, ferramentas e modalidade | Inclui GPU, ociosidade, energia ou cloud, engenharia e observabilidade |
| Qualidade | Precisa ser medida na tarefa real | Também precisa ser medida; benchmark isolado não garante equivalência |
Um break-even só é defensável quando informa modelo, precisão, hardware, região, contrato, throughput, utilização e custos operacionais. Por isso, este artigo não adota um número universal de conversas ou tokens por dia.
6. Como estimar o custo real de uma aplicação
Comece pelo volume observado ou por um cenário explícito. Separe tokens de entrada e saída, escolha a modalidade correta e acrescente componentes cobrados à parte.
| Componente | O que conferir |
|---|---|
| Entrada | Prompt, histórico, documentos recuperados e instruções do sistema |
| Saída | Tamanho médio das respostas e tokens de raciocínio cobrados, quando aplicável |
| Cache | Regras de leitura, escrita, expiração e desconto do provedor |
| Ferramentas | Busca, armazenamento, execução de código, áudio, imagem e chamadas externas |
| Modalidade | Standard, Batch, Flex, processamento rápido ou região de dados |
| Operação | Retentativas, observabilidade, avaliação, segurança e revisão humana |
Em muitos modelos, a tarifa de saída é maior que a de entrada, mas a razão varia. Use sempre as duas tarifas oficiais. Uma aplicação barata por token também pode ficar cara se repetir contexto longo, gerar respostas excessivas ou refazer chamadas com frequência.
Custo por token de IA: números auditados
Resumo das métricas que permaneceram após a revisão factual.
| Métrica | Valor | Escopo e fonte |
|---|---|---|
| Queda no menor custo para MMLU 42 | 1.000× em três anos | a16z; US$ 60/M para US$ 0,06/M |
| Desempenho no nível do GPT-3.5 | Mais de 280× | Stanford AI Index; nov/2022 a out/2024 |
| Faixa por benchmark e nível de desempenho | 9× a 900× por ano | Epoch AI; extremos recentes podem não persistir |
| Mediana após janeiro de 2024 | 200× por ano | Epoch AI; recorte do período mais recente |
| Modelos na fronteira de custo-desempenho | Aproximadamente 5–10× por ano | Gundlach et al.; benchmarks de conhecimento, raciocínio, matemática e software |
| Eficiência algorítmica estimada | Aproximadamente 3× por ano | Gundlach et al.; modelos open-weight e ajuste de hardware |
| Custo de hardware | Queda de aproximadamente 30% ao ano | Stanford AI Index 2025 |
| Eficiência energética do hardware | Melhora de aproximadamente 40% ao ano | Stanford AI Index 2025 |
| Tarifas atuais | Comparar entrada e saída na mesma modalidade | Tabela conferida em 23/09/2026 |
Metodologia e fontes
Este artigo separa tarifas atuais de tendências históricas ajustadas por desempenho. A tabela de preços foi conferida nas páginas oficiais dos provedores em 23/09/2026. As demais métricas mantêm o período, o benchmark e as limitações declaradas por suas fontes. Não constituem previsão de preços nem garantia de economia para uma aplicação específica.
- OpenAI — preços de API
- Anthropic — preços da Claude API
- Google — preços da Gemini API
- DeepSeek — preços atuais da API
- a16z — LLMflation: LLM Inference Cost Is Going Down Fast
- Stanford HAI — AI Index Report 2025
- Epoch AI — LLM inference price trends
- Gundlach et al. — The Price of Progress
Revisão factual integral: 19/09/2026. Tarifas e prompt caching atualizados em 23/09/2026. Para citar esta página: viniensina.com.br/custo-token-ia-2026/.
Perguntas Frequentes
Quanto custa um token de IA?
Depende da tarifa e do tipo de token. Em um exemplo hipotético de US$ 1 por milhão de tokens de entrada, cada token de entrada custa US$ 0,000001. Com câmbio hipotético de R$ 5,20 por dólar, isso equivale a R$ 0,0000052. Tokens de saída são calculados com sua própria tarifa.
O que é custo por token de IA?
É o valor cobrado para processar unidades de texto chamadas tokens. Em geral, provedores cobram separado por tokens de entrada e de saída.
Por que output token costuma ser mais caro?
Provedores normalmente publicam tarifas separadas para entrada e saída, e a saída costuma ter preço maior em muitos modelos. A diferença varia; confira a tabela oficial e calcule os dois volumes separadamente.
Como calcular custo de uma aplicação com IA?
Use a fórmula: tokens de entrada vezes preço de input, mais tokens de saída vezes preço de output, dividido por 1 milhão. Depois multiplique pelo câmbio se quiser estimar em reais.
ChatGPT Plus inclui custo de API?
Não necessariamente. Plano de chat e API costumam ser cobranças separadas. Para automações, produtos e integrações, confirme a tabela oficial da API do provedor.
Vale usar modelo barato em produção?
Vale quando a tarefa é simples e mensurável. Para tarefas críticas, compare custo, qualidade, latência, privacidade e taxa de erro.
![Imagem de destaque: Custo por Token de IA em 2026: Tabela Comparativa e Histórico de Preços [48 Stats]](https://viniensina.com.br/wp-content/uploads/2026/05/cover-custo-por-token-de-ia-em-2026-tabela-co-1.jpg)