volver al blog
    Tras bambalinas

    Cuánto cuesta la IA por caso de uso real: chatbot, código, documentos y contenido

    Traducimos los precios por token de OpenAI, Anthropic y Google a coste mensual para cuatro escenarios reales de negocio.

    HB
    Henrique Baeta
    Commercial & Doer
    11 sep 20265 min de lectura

    Saber que OpenAI cobra 2,50 $ por millón de tokens de input no dice nada sobre cuánto vas a pagar a final de mes. Lo que importa es cuántos tokens consume tu caso de uso concreto, con qué volumen y qué modelo eliges para él. Dos proyectos con el mismo presupuesto en tokens pueden tener facturas diez veces distintas, solo por la forma de la tarea.

    Este artículo toma los precios actuales de OpenAI, Anthropic y Google y hace la cuenta para cuatro escenarios reales de negocio: no tablas de precios por token, sino lo que cuesta cada uno al mes.

    Los cuatro escenarios

    Para cada uno, suponemos un caso medio realista, no el mejor escenario posible:

    1. Chatbot de atención al cliente. 400 tokens de input (pregunta + instrucciones de sistema) y 250 de output por conversación. Volumen: 200.000 conversaciones/mes.
    2. Agente de código. 3.000 tokens de input (contexto de archivos + instrucciones) y 800 de output por llamada. Volumen: 10.000 llamadas/mes, un equipo pequeño usándolo a lo largo del día.
    3. Análisis de documentos. 8.000 tokens de input (un documento típico) y 400 de output (el resumen o la extracción). Volumen: 2.000 documentos/mes.
    4. Generación de contenido de marketing. 600 tokens de input (briefing) y 1.200 de output (el texto generado). Volumen: 1.000 piezas/mes.

    Cuánto cuesta cada uno al mes

    Valores de septiembre de 2026, con un modelo de gama media de cada proveedor (Claude Sonnet 5, GPT-5.4 y Gemini 3.5 Flash), antes de descuentos por caching o batch.

    EscenarioLlamadas/mesClaude Sonnet 5GPT-5.4Gemini 3.5 Flash
    Chatbot de atención200 mil$660$950$570
    Agente de código10 mil$140$195$117
    Análisis de documentos2 mil$40$52$31
    Generación de contenido1 mil$13$20$12

    Qué muestra la tabla

    Domina el volumen, no la complejidad por llamada. El chatbot es el caso más sencillo de los cuatro, con pocos tokens por interacción, pero es con diferencia el más caro, solo por tener 20 veces más llamadas que el agente de código. Antes de optimizar el modelo, conviene entender dónde está el volumen real.

    La diferencia entre proveedores se mantiene proporcional en todos los escenarios. En esta gama de modelo, Gemini queda siempre entre un 15 y un 40% por debajo de Claude, y OpenAI siempre entre un 30 y un 40% por encima. Coincide con lo que ya mostramos en la comparativa de precios por token: el orden entre proveedores no cambia según el caso de uso, solo la escala de lo que está en juego.

    El análisis de documentos y el contenido son baratos incluso con volúmenes razonables. Con un output corto y un número de llamadas moderado, ninguno de los dos supera los 50 $/mes en estos ejemplos. Son el chatbot de alto volumen y el agente de código con contexto grande los que merecen atención presupuestaria.

    El efecto de elegir la gama de modelo

    La tabla anterior usa la gama media de los tres proveedores. Pero para el chatbot de atención, la mayor factura de los cuatro escenarios, la tarea suele ser lo bastante sencilla para un modelo económico. Rehaciendo la cuenta con la gama más barata de cada proveedor:

    ProveedorModelo económicoCoste/mes (chatbot)Ahorro frente a gama media
    AnthropicClaude Haiku 4.5$33050%
    GoogleGemini 3.5 Flash-Lite$14974%
    OpenAIGPT-5.4-nano$78,5092%

    OpenAI es el caso más extremo: cambiar GPT-5.4 por GPT-5.4-nano en el mismo chatbot reduce la factura de 950 $ a menos de 80 $, más de diez veces menos, para una tarea que en la mayoría de los casos ni siquiera necesita el modelo mayor. Es la misma idea del artículo sobre cómo calcular el coste de un proyecto de IA: la elección del modelo pesa más en el presupuesto que la elección del proveedor.

    Dónde entra el caching

    El escenario de análisis de documentos es el que más se beneficia del prompt caching, porque el input (8.000 tokens) suele incluir instrucciones y un formato de salida que se repiten en todos los documentos; solo cambia el contenido del documento en sí. Los tres proveedores aplican descuentos a los tokens de input repetidos: Anthropic lee los tokens en caché con un 95% de descuento, OpenAI y Google con hasta un 90%. En un escenario en el que la mitad del input se repite entre llamadas, esto puede recortar una parte significativa de los 31 a 52 $ mensuales de este caso de uso, y la proporción solo crece con el volumen.

    Cómo aplicarlo a tu caso

    1. Mide los tokens reales de una llamada típica, no del mejor caso. Usa la consola del proveedor o un contador de tokens.
    2. Multiplica por el volumen mensual previsto. Aquí es donde los escenarios con pocos tokens por llamada pueden acabar siendo más caros que escenarios "pesados" de bajo volumen.
    3. Prueba primero la gama económica, sobre todo en tareas de alto volumen como el chatbot de este artículo; la diferencia puede ser de un orden de magnitud.
    4. Reserva la gama media o alta para tareas en las que la calidad de la respuesta importa más que el coste: código complejo, decisiones de negocio, contenido final sin revisión.

    Para hacer esta cuenta con tus números, usa la calculadora de coste de IA por tokens. La guía de costes de IA reúne el resto del tema en un solo lugar.

    Conclusión

    El precio por token es el punto de partida, no la respuesta. Lo que decide la factura a final de mes es el cruce entre volumen, tokens por llamada y la gama de modelo elegida, y como muestra este artículo, ese cruce puede hacer que el mismo proveedor cueste diez veces más o menos según la decisión. Antes de elegir proveedor, haz la cuenta para tu caso de uso real, no para la tabla de precios.

    Los valores utilizados son de septiembre de 2026, antes de descuentos por caching y batch. Confirma siempre los precios oficiales antes de cerrar una arquitectura.

    Fuentes

    HB
    Escrito por
    Henrique Baeta
    Commercial & Doer

    Escribe sobre IA aplicada, operación, GEO/SEO y cómo transformar empresas en máquinas que siguen funcionando incluso cuando nadie mira.

    servicios relacionados

    Servicios vinculados a este artículo

    Newsletter

    Conocimiento real time

    Sin spam.

    Al suscribirte aceptas nuestra política de privacidad.