voltar ao blog
    Bastidores

    Quanto custa a IA por caso de uso real: chatbot, código, documentos e conteúdo

    Traduzimos os preços por token da OpenAI, Anthropic e Google em custo mensal para quatro cenários reais de negócio.

    HB
    Henrique Baeta
    Commercial & Doer
    11 set 20265 min de leitura

    Saber que a OpenAI cobra $2,50 por milhão de tokens de input não diz nada sobre quanto vais pagar no fim do mês. O que importa é quantos tokens o teu caso de uso específico consome, com que volume, e que modelo escolhes para ele. Dois projetos com o mesmo orçamento em tokens podem ter faturas dez vezes diferentes, só por causa da forma da tarefa.

    Este artigo pega nos preços atuais da OpenAI, Anthropic e Google e faz a conta para quatro cenários reais de negócio — não tabelas de preço por token, mas o que cada um custa por mês.

    Os quatro cenários

    Para cada um, assumimos um caso médio realista, não o melhor cenário possível:

    1. Chatbot de suporte ao cliente. 400 tokens de input (pergunta + instruções de sistema) e 250 de output por conversa. Volume: 200 mil conversas/mês.
    2. Agente de código. 3 000 tokens de input (contexto de ficheiros + instruções) e 800 de output por chamada. Volume: 10 mil chamadas/mês — uma equipa pequena a usá-lo ao longo do dia.
    3. Análise de documentos. 8 000 tokens de input (um documento típico) e 400 de output (o resumo ou extração). Volume: 2 mil documentos/mês.
    4. Geração de conteúdo de marketing. 600 tokens de input (briefing) e 1 200 de output (o texto gerado). Volume: 1 000 peças/mês.

    Quanto custa cada um por mês

    Valores de setembro de 2026, com um modelo de nível intermédio de cada fornecedor — Claude Sonnet 5, GPT-5.4 e Gemini 3.5 Flash — antes de descontos de caching ou batch.

    CenárioChamadas/mêsClaude Sonnet 5GPT-5.4Gemini 3.5 Flash
    Chatbot de suporte200 mil$660$950$570
    Agente de código10 mil$140$195$117
    Análise de documentos2 mil$40$52$31
    Geração de conteúdo1 mil$13$20$12

    O que a tabela mostra

    O volume domina, não a complexidade por chamada. O chatbot é o caso mais simples dos quatro — poucos tokens por interação — mas é de longe o mais caro, só por ter 20x mais chamadas que o agente de código. Antes de otimizar o modelo, vale a pena perceber onde está o volume real.

    A diferença entre fornecedores mantém-se proporcional em todos os cenários. Neste nível de modelo, o Gemini fica sempre uns 15 a 40% abaixo do Claude, e a OpenAI sempre uns 30 a 40% acima. Isto é consistente com o que já mostrámos na comparação de preços por token: a ordem entre fornecedores não muda por caso de uso, só a escala do que está em jogo.

    Análise de documentos e conteúdo são baratos mesmo a volumes decentes. Com output curto e um número de chamadas moderado, nenhum dos dois passa dos $50/mês nestes exemplos. É o chatbot de alto volume e o agente de código com contexto grande que merecem atenção ao orçamento.

    O efeito da escolha do nível de modelo

    A tabela acima usa o nível intermédio dos três fornecedores. Mas para o chatbot de suporte — a maior fatura dos quatro cenários — a tarefa é normalmente simples o suficiente para um modelo económico. Refazendo a conta com o nível mais barato de cada fornecedor:

    FornecedorModelo económicoCusto/mês (chatbot)Poupança vs. nível intermédio
    AnthropicClaude Haiku 4.5$33050%
    GoogleGemini 3.5 Flash-Lite$14974%
    OpenAIGPT-5.4-nano$78,5092%

    A OpenAI é o caso mais extremo: trocar o GPT-5.4 pelo GPT-5.4-nano no mesmo chatbot corta a fatura de $950 para menos de $80 — mais de dez vezes menos, para uma tarefa que na maioria dos casos nem precisa do modelo maior. É o mesmo ponto do artigo sobre como calcular o custo de um projeto de IA: a escolha do modelo pesa mais no orçamento do que a escolha do fornecedor.

    Onde entra o caching

    O cenário de análise de documentos é o que mais beneficia de prompt caching, porque o input (8 000 tokens) inclui normalmente instruções e formato de saída que se repetem em todos os documentos — só o conteúdo do documento em si muda. Os três fornecedores dão desconto em tokens de input repetidos: a Anthropic lê tokens em cache a 95% de desconto, a OpenAI e a Google a até 90%. Num cenário onde metade do input é repetido entre chamadas, isto pode cortar uma fatia significativa dos $31 a $52 mensais deste caso de uso — e a proporção só cresce com o volume.

    Como aplicar isto ao teu caso

    1. Mede os tokens reais de uma chamada típica, não do melhor caso. Usa a consola do fornecedor ou um contador de tokens.
    2. Multiplica pelo volume mensal esperado. É aqui que cenários com poucos tokens por chamada podem acabar mais caros que cenários "pesados" com baixo volume.
    3. Testa o nível económico primeiro, sobretudo em tarefas de alto volume como o chatbot deste artigo — a diferença pode ser de uma ordem de grandeza.
    4. Reserva o nível intermédio ou topo de gama para tarefas onde a qualidade da resposta importa mais do que o custo — código complexo, decisões de negócio, conteúdo final sem revisão.

    Para fazeres esta conta com os teus números, usa a calculadora de custo de IA por tokens. O guia de custos de IA junta o resto do tema num só sítio.

    Conclusão

    O preço por token é o ponto de partida, não a resposta. O que decide a fatura no fim do mês é o cruzamento entre volume, tokens por chamada e o nível de modelo escolhido — e como este artigo mostra, esse cruzamento pode fazer o mesmo fornecedor custar dez vezes mais ou menos consoante a decisão. Antes de escolher um fornecedor, faz a conta para o teu caso de uso real, não para a tabela de preços.

    Os valores usados são de setembro de 2026, antes de descontos de caching e batch — confirma sempre os preços oficiais antes de fechar uma arquitetura.

    Fontes

    HB
    Escrito por
    Henrique Baeta
    Commercial & Doer

    Escreve sobre IA aplicada, operação, GEO/SEO e como transformar empresas em máquinas que continuam a funcionar mesmo quando ninguém está a olhar.

    serviços relacionados

    Serviços ligados a este artigo

    Newsletter

    Conhecimento real time

    Sem spam.

    Ao subscrever aceitas a nossa política de privacidade.