Usamos cookies para mejorar tu experiencia y medir el tráfico. Política de cookies

    Scalor
    CONVÉNCENOS →
    Glosario/Retrieval & RAG

    Chunking

    divisão de documentos

    Proceso de fragmentación de documentos extensos en partes más pequeñas y coherentes para que los sistemas de IA puedan procesar, recuperar y cruzar información de forma precisa.

    Qué es

    En el contexto de la inteligencia artificial aplicada, el chunking es el acto de dividir un texto largo en trozos (chunks) más pequeños. Si imaginamos que la base de datos de una empresa es una enciclopedia, el chunking es el proceso de decidir si vamos a indexar esa información por capítulos, por páginas o por párrafos.

    Este proceso es vital porque la mayoría de los modelos de lenguaje (LLMs) tienen un límite de memoria inmediata — la llamada context window. Además, cuando un sistema de RAG (Retrieval-Augmented Generation) intenta encontrar una respuesta en un documento de 100 páginas, no puede enviar el archivo completo al modelo sin perder precisión o gastar recursos innecesarios. El chunking garantiza que la IA reciba solo el fragmento exacto que contiene la respuesta, manteniendo el contexto necesario para que la información tenga sentido.

    Cómo funciona

    El chunking no consiste solo en cortar texto de 500 en 500 caracteres. Para que el resultado sea útil, la división debe respetar la estructura semántica del contenido. Existen varios enfoques:

    1. División por caracteres o tokens: Es la forma más sencilla, donde el texto se corta al alcanzar un límite fijo. El riesgo es cortar una frase o una palabra a la mitad, perdiendo el sentido.
    2. División recursiva: El sistema intenta dividir el texto por párrafos; si el párrafo es demasiado grande, divide por frases; si la frase es gigante, divide por palabras. Es el método estándar para mantener la coherencia.
    3. División estructural: Utiliza la lógica del documento, como encabezados (H1, H2), celdas de tablas o secciones de un archivo PDF, para garantizar que un tema no se separe de su explicación.
    4. Solapamiento (Overlap): Para evitar que el contexto se pierda entre dos fragmentos, se suele repetir una pequeña parte del final del primer chunk al inicio del segundo. Esto sirve como un 'pegamento' semántico.

    Tras la división, cada chunk se transforma en un vector numérico (embedding) y se guarda en una base de datos vectorial, quedando listo para ser buscado.

    Cuándo usar

    El chunking es obligatorio en casi todos los proyectos de IA que involucren documentos propios de la empresa. Debe aplicarse cuando:

    • Implementa un sistema de RAG: Para que el bot de atención al cliente o el asistente jurídico encuentre la cláusula exacta sin leer todo el contrato cada vez.
    • Maneja documentos técnicos: Manuales de máquinas o catálogos de piezas donde la información es densa y granular.
    • Trabaja con límites de coste: Enviar menos texto (solo los chunks relevantes) a la API de OpenAI o de Anthropic reduce drásticamente la factura mensual.
    • Necesita precisión: Cuando la respuesta a una pregunta depende de un detalle específico oculto en la página 45 de un informe financiero.

    Errores comunes

    El error más frecuente en las PYMEs es utilizar un tamaño de chunk inadecuado. Si el chunk es demasiado pequeño (ej: solo una frase), la IA pierde el contexto. Si es demasiado grande (ej: 3 páginas), la respuesta se vuelve vaga y el sistema recupera mucho 'ruido' que no interesa para la pregunta del usuario.

    Otro error es ignorar la estructura del archivo. Dividir un archivo Excel o una tabla de precios de forma puramente textual destruye la relación entre las columnas y las filas, haciendo que los datos sean ilegibles para la IA. Por último, no usar overlap es un error técnico común: si la respuesta a una pregunta comienza al final de un bloque y termina al inicio del otro, el sistema puede fallar al capturar la información completa.

    Ejemplo práctico para una PYME

    Imagine una empresa de fabricación de moldes que tiene un manual de procedimientos de 200 páginas sobre mantenimiento de máquinas y seguridad en el trabajo. Si un operario pregunta al asistente de IA: '¿Cuál es el par de apriete para el tornillo de la inyectora X?', el sistema no lee todo el PDF.

    Con un buen chunking, el manual ha sido previamente dividido en bloques de unas 300 palabras, respetando los títulos de las secciones. El sistema identifica el chunk que habla específicamente de la 'Inyectora X' y del 'Mantenimiento de Cabezales'. Extrae ese párrafo, lo envía al LLM y responde en segundos: 'El par es de 50Nm'. Sin el chunking, el sistema enviaría demasiada información, tardaría más tiempo y podría confundir el par de la Inyectora X con el de la Máquina Y descrita en otra página.

    Preguntas frecuentes

    P: ¿Cuál es el tamaño ideal de un chunk? R: No hay un número mágico, pero para texto administrativo en español, bloques de entre 500 a 1000 tokens con un 10-15% de solapamiento suelen ser un buen punto de partida.

    P: ¿El chunking altera mi documento original? R: No. El chunking es solo una forma de organizar la información en la base de datos de consulta. Su documento original permanece intacto en el servidor o en la nube.

    P: ¿Puedo hacer chunking de imágenes o tablas? R: Sí, pero requiere técnicas diferentes. Las tablas deben convertirse a formatos como Markdown o JSON antes de ser divididas, y las imágenes requieren descripción textual (captioning) o modelos multimodales.

    P: ¿Por qué no puedo simplemente darle el documento entero a la IA si tiene una ventana de contexto grande? R: Aunque modelos como Gemini o GPT-4o aceptan muchos datos, incluir información excesiva e irrelevante en el prompt causa 'pérdida en el medio' (la IA ignora detalles centrales) e aumenta los costes de operación innecesariamente.

    Ejemplos prácticos

    • 01Dividir un contrato de prestación de servicios por cláusulas individuales para un análisis jurídico rápido.
    • 02Fragmentar un manual de instrucciones técnico en secciones de 800 caracteres con 100 de solapamiento.
    • 03Separar las transcripciones de reuniones mensuales por temas del orden del día para facilitar la búsqueda.
    • 04Indexar un catálogo de 5000 productos dividiéndolo por categorías y fichas técnicas individuales.

    ¿Quieres usar Chunking en tu empresa?

    30 minutos, gratis, sin compromiso. Te decimos dónde encaja.

    Diagnóstico IA gratis