Newsletter

Quanto custa a API dos modelos de IA: o preço por token explicado

O que é um token, por que a saída custa mais que a entrada e quanto sai cada modelo — com a tabela comparativa e exemplos de conta mensal.

Quanto custa a API dos modelos de IA: o preço por token explicado

Cobrar por token confunde quem está acostumado a mensalidade, mas a lógica é simples: você paga pelo texto que envia e pelo texto que recebe, e o que sai custa bem mais caro que o que entra. Entender essa mecânica é o que separa uma conta de dezenas de reais de uma de milhares para o mesmo trabalho.

Adicione ao Google Notícias

O que é um token

Token é o pedaço de texto que o modelo processa. Não é exatamente uma palavra: palavras comuns costumam ser um token, palavras longas ou incomuns viram dois ou três, e pontuação conta.

Duas regras de bolso que servem para estimar em português:

  • Cerca de 4 caracteres por token.

  • Cerca de 750 palavras a cada 1.000 tokens.

Uma página de texto comum fica em torno de 500 a 700 tokens. Uma conversa de atendimento inteira raramente passa de alguns milhares.

Você paga duas vezes na mesma chamada

Toda requisição tem duas partes cobradas separadamente:

  • Entrada — tudo que você envia: instruções, contexto, histórico da conversa, documento colado.

  • Saída — o texto que o modelo escreve de volta.

A saída custa entre três e cinco vezes mais que a entrada no mesmo modelo. Por isso, controlar o tamanho da resposta costuma economizar mais que reduzir o que você envia.

A tabela de preços

Valores por 1 milhão de tokens, cobrados em dólar pelos próprios fabricantes:

ModeloEntradaSaídaMelhor para
Claude Opus 5US$ 5,00US$ 25,00Raciocínio pesado, tarefa longa
Claude Sonnet 5US$ 3,00US$ 15,00Uso geral em produção
Claude Haiku 4.5US$ 1,00US$ 5,00Volume alto, resposta curta
GPT-5.6 (topo)US$ 5,00US$ 30,00Raciocínio pesado
GPT-5.6 (intermediário)US$ 2,00US$ 12,00Uso geral
GPT-5.6 (econômico)US$ 0,20US$ 1,20Alto volume
GPT-4o miniUS$ 0,15US$ 0,60Tarefa simples em massa
Gemini 3.1 ProUS$ 2,00US$ 12,00Uso geral
Gemini FlashUS$ 0,75US$ 3,75Alto volume (preço promocional)
Gemini Flash-LiteUS$ 0,10US$ 0,40Classificação e triagem

Dois avisos sobre esta tabela. Alguns valores são promocionais e sobem em data marcada — o Gemini Flash, por exemplo, dobra quando a promoção termina. E a cobrança é em dólar: a variação cambial entra na sua conta sem aviso.

Duas setas de tamanhos diferentes, uma entrando e outra saindo

Quanto isso vira no mês

Atendimento — 1.000 conversas

Uma conversa acumula cerca de 4.000 tokens de entrada e 800 de saída.

ModeloPor conversa1.000/mês
EconômicoUS$ 0,008US$ 8
IntermediárioUS$ 0,024US$ 24
TopoUS$ 0,040US$ 40

Classificação — 50 mil itens

Cerca de 500 tokens de entrada e 50 de saída por item. Com um modelo de triagem, o mês inteiro fica em torno de US$ 4. É o uso mais barato e o mais subestimado.

Geração de texto — 200 artigos

Cerca de 3.000 de entrada e 2.000 de saída por texto. Com modelo intermediário, cerca de US$ 8 no mês.

O padrão fica claro: numa operação pequena ou média, o custo puro de IA raramente passa de algumas dezenas de dólares. Quem recebe fatura de milhares está com um problema de configuração, não de volume.

Publicidade

Quer essa conta feita para o seu caso?

Estimar custo de IA sem mapear o processo é chute. A Naweb faz o diagnóstico e devolve o número separado em duas linhas: quanto custa construir e quanto custa manter rodando por mês.

Pedir diagnóstico gratuito →A Naweb é a empresa de automação e IA que mantém o tekimobile.

Os três descontos que quase ninguém usa

  1. Cache. O trecho que você envia sempre igual — instruções, base de conhecimento — é cobrado por uma fração do preço quando reaproveitado. Exige manter esse conteúdo idêntico e no início da mensagem.

  2. Processamento em lote. Quando a resposta não precisa sair na hora, custa metade. Vale para relatório noturno, classificação de arquivo e geração em massa.

  3. Modelo certo por tarefa. A diferença entre o topo e o econômico passa de dez vezes. Classificar e-mail não exige o modelo mais caro.

Se você inclui a data e a hora nas instruções do sistema, está invalidando o cache a cada requisição sem perceber. Mantenha o começo da mensagem estável e coloque o que varia no fim.

Como estimar antes de construir

  1. Estime o tamanho médio de entrada e saída de uma operação — em caracteres, dividido por 4.

  2. Multiplique pelo número de operações previstas no mês.

  3. Aplique o preço do modelo escolhido, separando entrada e saída.

  4. Some 30% de folga para o mês fora da curva.

  5. Configure teto de gasto e alerta antes de colocar em produção.

Com a mecânica entendida, dá para escolher o modelo pelo trabalho que ele vai fazer — e não pela marca — o que costuma cortar a conta em várias vezes sem mudar nada no resultado final.

Erros que multiplicam a conta

  • Modelo de topo para tudo. O erro mais caro e o mais comum.

  • Reenviar o histórico completo a cada mensagem, pagando de novo pelo mesmo texto.

  • Resposta sem limite de tamanho. A saída é a parte cara.

  • Ignorar cache e lote. São descontos que já estão disponíveis e ninguém liga.

  • Rodar sem teto de gasto. Um erro em laço consome num fim de semana o orçamento do trimestre.

Publicidade

Quer essa conta feita para o seu caso?

A Naweb faz o diagnóstico e devolve o número separado em duas linhas: quanto custa construir e quanto custa manter rodando por mês.

Pedir diagnóstico gratuito →A Naweb é a empresa de automação e IA que mantém o tekimobile.

Perguntas frequentes

O que é um token em IA?

É o pedaço de texto que o modelo processa. Em português, uma estimativa útil é 4 caracteres por token, ou cerca de 750 palavras a cada mil tokens.

Por que a saída custa mais que a entrada?

Gerar texto exige mais processamento que ler texto. Na prática, a saída custa de três a cinco vezes mais no mesmo modelo — por isso limitar o tamanho da resposta é a economia mais direta.

Qual o modelo de IA mais barato?

Os modelos econômicos das três grandes famílias ficam na casa de centavos de dólar por milhão de tokens de entrada. Para classificar, extrair e triar, resolvem com folga.

Dá para prever quanto vou gastar por mês?

Dá, com boa margem: estime entrada e saída médias, multiplique pelo volume e aplique o preço. Some 30% de folga e configure teto de gasto — a estimativa erra, o teto não deixa o erro sair caro.

Os preços mudam com frequência?