Saber que a OpenAI cobra $2,50 por milhão de tokens de input não diz nada sobre quanto vais pagar no fim do mês. O que importa é quantos tokens o teu caso de uso específico consome, com que volume, e que modelo escolhes para ele. Dois projetos com o mesmo orçamento em tokens podem ter faturas dez vezes diferentes, só por causa da forma da tarefa.
Este artigo pega nos preços atuais da OpenAI, Anthropic e Google e faz a conta para quatro cenários reais de negócio — não tabelas de preço por token, mas o que cada um custa por mês.
Os quatro cenários
Para cada um, assumimos um caso médio realista, não o melhor cenário possível:
- Chatbot de suporte ao cliente. 400 tokens de input (pergunta + instruções de sistema) e 250 de output por conversa. Volume: 200 mil conversas/mês.
- Agente de código. 3 000 tokens de input (contexto de ficheiros + instruções) e 800 de output por chamada. Volume: 10 mil chamadas/mês — uma equipa pequena a usá-lo ao longo do dia.
- Análise de documentos. 8 000 tokens de input (um documento típico) e 400 de output (o resumo ou extração). Volume: 2 mil documentos/mês.
- Geração de conteúdo de marketing. 600 tokens de input (briefing) e 1 200 de output (o texto gerado). Volume: 1 000 peças/mês.
Quanto custa cada um por mês
Valores de setembro de 2026, com um modelo de nível intermédio de cada fornecedor — Claude Sonnet 5, GPT-5.4 e Gemini 3.5 Flash — antes de descontos de caching ou batch.
| Cenário | Chamadas/mês | Claude Sonnet 5 | GPT-5.4 | Gemini 3.5 Flash |
|---|---|---|---|---|
| Chatbot de suporte | 200 mil | $660 | $950 | $570 |
| Agente de código | 10 mil | $140 | $195 | $117 |
| Análise de documentos | 2 mil | $40 | $52 | $31 |
| Geração de conteúdo | 1 mil | $13 | $20 | $12 |
O que a tabela mostra
O volume domina, não a complexidade por chamada. O chatbot é o caso mais simples dos quatro — poucos tokens por interação — mas é de longe o mais caro, só por ter 20x mais chamadas que o agente de código. Antes de otimizar o modelo, vale a pena perceber onde está o volume real.
A diferença entre fornecedores mantém-se proporcional em todos os cenários. Neste nível de modelo, o Gemini fica sempre uns 15 a 40% abaixo do Claude, e a OpenAI sempre uns 30 a 40% acima. Isto é consistente com o que já mostrámos na comparação de preços por token: a ordem entre fornecedores não muda por caso de uso, só a escala do que está em jogo.
Análise de documentos e conteúdo são baratos mesmo a volumes decentes. Com output curto e um número de chamadas moderado, nenhum dos dois passa dos $50/mês nestes exemplos. É o chatbot de alto volume e o agente de código com contexto grande que merecem atenção ao orçamento.
O efeito da escolha do nível de modelo
A tabela acima usa o nível intermédio dos três fornecedores. Mas para o chatbot de suporte — a maior fatura dos quatro cenários — a tarefa é normalmente simples o suficiente para um modelo económico. Refazendo a conta com o nível mais barato de cada fornecedor:
| Fornecedor | Modelo económico | Custo/mês (chatbot) | Poupança vs. nível intermédio |
|---|---|---|---|
| Anthropic | Claude Haiku 4.5 | $330 | 50% |
| Gemini 3.5 Flash-Lite | $149 | 74% | |
| OpenAI | GPT-5.4-nano | $78,50 | 92% |
A OpenAI é o caso mais extremo: trocar o GPT-5.4 pelo GPT-5.4-nano no mesmo chatbot corta a fatura de $950 para menos de $80 — mais de dez vezes menos, para uma tarefa que na maioria dos casos nem precisa do modelo maior. É o mesmo ponto do artigo sobre como calcular o custo de um projeto de IA: a escolha do modelo pesa mais no orçamento do que a escolha do fornecedor.
Onde entra o caching
O cenário de análise de documentos é o que mais beneficia de prompt caching, porque o input (8 000 tokens) inclui normalmente instruções e formato de saída que se repetem em todos os documentos — só o conteúdo do documento em si muda. Os três fornecedores dão desconto em tokens de input repetidos: a Anthropic lê tokens em cache a 95% de desconto, a OpenAI e a Google a até 90%. Num cenário onde metade do input é repetido entre chamadas, isto pode cortar uma fatia significativa dos $31 a $52 mensais deste caso de uso — e a proporção só cresce com o volume.
Como aplicar isto ao teu caso
- Mede os tokens reais de uma chamada típica, não do melhor caso. Usa a consola do fornecedor ou um contador de tokens.
- Multiplica pelo volume mensal esperado. É aqui que cenários com poucos tokens por chamada podem acabar mais caros que cenários "pesados" com baixo volume.
- Testa o nível económico primeiro, sobretudo em tarefas de alto volume como o chatbot deste artigo — a diferença pode ser de uma ordem de grandeza.
- Reserva o nível intermédio ou topo de gama para tarefas onde a qualidade da resposta importa mais do que o custo — código complexo, decisões de negócio, conteúdo final sem revisão.
Para fazeres esta conta com os teus números, usa a calculadora de custo de IA por tokens. O guia de custos de IA junta o resto do tema num só sítio.
Conclusão
O preço por token é o ponto de partida, não a resposta. O que decide a fatura no fim do mês é o cruzamento entre volume, tokens por chamada e o nível de modelo escolhido — e como este artigo mostra, esse cruzamento pode fazer o mesmo fornecedor custar dez vezes mais ou menos consoante a decisão. Antes de escolher um fornecedor, faz a conta para o teu caso de uso real, não para a tabela de preços.
Os valores usados são de setembro de 2026, antes de descontos de caching e batch — confirma sempre os preços oficiais antes de fechar uma arquitetura.
Fontes
Escreve sobre IA aplicada, operação, GEO/SEO e como transformar empresas em máquinas que continuam a funcionar mesmo quando ninguém está a olhar.
