Context Window
Capacité maximale d'informations qu'un modèle d'IA peut traiter en une seule fois avant de commencer à oublier les détails initiaux.
Qu'est-ce que c'est
La Context Window, ou fenêtre de contexte, est la limite physique de la mémoire à court terme d'un modèle de langage (LLM). Imaginez que vous lisez un contrat juridique de 50 pages : votre capacité à garder tous les détails de la page 1 en tête pendant que vous lisez la page 50 est votre fenêtre de contexte humaine. Dans l'IA, cette fenêtre définit la quantité de texte (tokens) que le modèle peut analyser simultanément avant de produire une réponse.
Pour une PME, ce concept est crucial car il détermine la complexité des tâches qu'elle peut automatiser. Si vous essayez d'alimenter un manuel technique de 200 pages dans un modèle avec une petite fenêtre de contexte, l'IA ignorera simplement le début du document ou présentera des erreurs par manque de mémoire. Il ne s'agit pas seulement de ce que le modèle « sait » (son entraînement préalable), mais de ce qu'il peut « voir » au moment précis où il traite votre demande.
Comment ça marche
Techniquement, la fenêtre de contexte est mesurée en tokens, qui sont des morceaux de mots (environ 0,75 mot par token). Lorsque vous envoyez une question à l'IA, le contexte est formé par la somme de votre question actuelle, de l'historique de la conversation et de tout document que vous avez joint.
Les modèles modernes utilisent une architecture appelée Transformer, qui utilise un mécanisme d'« attention ». Ce mécanisme permet à l'IA de relier différentes parties du texte à l'intérieur de la fenêtre. Cependant, à mesure que la fenêtre de contexte augmente, le coût informatique et la latence ont également tendance à augmenter. Si la fenêtre de contexte est de 128 000 tokens (comme GPT-4o), le modèle peut conserver l'équivalent d'un livre moyen dans sa mémoire de travail. Si ce seuil est dépassé, les tokens les plus anciens sont jetés pour faire place aux nouveaux, selon un système « premier entré, premier sorti ».
Il est important de noter que tous les modèles ne gèrent pas la fenêtre de contexte de la même manière. Certains souffrent du phénomène « lost in the middle », où ils accordent beaucoup d'importance au début et à la fin du contexte fourni, mais ignorent des détails cruciaux qui se trouvent au milieu d'un long document.
Quand l'utiliser
Vous devez prêter attention à la fenêtre de contexte chaque fois que votre opération implique des données volumineuses. Dans des scénarios de service client, par exemple, si l'historique de la conversation est long, la fenêtre de contexte garantit que l'IA se souvient que le client a mentionné un problème avec la facture il y a dix minutes.
D'autres situations typiques incluent :
- Analyse de documents étendus : Charger des procès-verbaux de réunions annuelles ou des rapports financiers trimestriels pour en extrair les tendances.
- Programmation et Audit de Code : Analyser plusieurs fichiers de code source en même temps pour trouver des bugs ou suggérer des améliorations structurelles.
- Traduction contextuelle : Traduire un chapitre entier en veillant à ce que le ton et la terminologie restent cohérents avec les chapitres précédents.
Erreurs courantes
- Confondre Fenêtre de Contexte et Base de Connaissances : Penser que parce qu'un modèle a une fenêtre d'un million de tokens, il « sait » tout sur votre entreprise. Le contexte est temporaire ; une fois la session fermée, l'IA ne conserve pas cette information à moins qu'elle ne soit intégrée via RAG (Retrieval-Augmented Generation).
- Ignorer le coût : De nombreuses entreprises utilisent des fenêtres de contexte géantes sans nécessité. Le coût d'une API est souvent calculé par le nombre de tokens traités. Envoyer 50 PDF dans la fenêtre de contexte à chaque question est financièrement insoutenable par rapport à une recherche intelligente dans une base de données vectorielle.
- Assumer une précision totale dans les fenêtres longues : Ce n'est pas parce qu'un modèle peut lire 200 000 tokens qu'il interprétera correctement chaque détail. Le risque d'hallucination augmente proportionnellement à la densité d'informations non pertinentes dans le contexte.
Exemple pratique pour une PME
Imaginez un petit cabinet comptable. Ils reçoivent un nouveau règlement budgétaire de l'État de 150 pages.
Sans une fenêtre de contexte adéquate, le comptable devrait copier et coller de petites sections de la loi et demander comment elles s'appliquent au Client X. Avec une large fenêtre de contexte (ex : 128k tokens), le comptable charge le PDF complet du règlement et l'historique de facturation du client de l'année dernière dans le même prompt.
L'IA peut alors croiser les données : « Sur la base du nouvel article 24 du document envoyé et du fait que le Client X a facturé 400 000 € l'année dernière, il n'est plus éligible à l'avantage fiscal Y ». La fenêtre de contexte a permis à l'IA de voir simultanément le règlement et les données du client pour générer un conseil personnalisé.
Questions fréquentes
Q : Que se passe-t-il lorsque le texte dépasse la fenêtre de contexte ? R : Le modèle commence à supprimer les informations les plus anciennes de la conversation. L'IA peut devenir répétitive ou oublier les instructions données au début de l'interaction.
Q : Est-il préférable d'avoir une grande fenêtre de contexte ou un système RAG ? R : Cela dépend. Pour l'analyse approfondie d'un document unique, une grande fenêtre est préférable. Pour effectuer des recherches dans des milliers de documents d'entreprise, le RAG est plus efficace et économique.
Q : La fenêtre de contexte affecte-t-elle la vitesse de réponse ? R : Oui. Plus vous envoyez d'informations dans la fenêtre de contexte, plus le modèle mettra de temps à traiter les données avant de commencer à écrire la réponse.
Q : Les tokens de sortie comptent-ils pour la fenêtre de contexte ? R : Oui, la limite totale de la fenêtre inclut à la fois ce que vous écrivez (input) et ce que l'IA répond (output).
Exemples pratiques
- 01Analyser cinq contrats de location simultanément pour détecter des clauses contradictoires.
- 02Maintenir l'historique d'une conversation de support technique pendant 30 minutes sans perdre le fil.
- 03Charger le catalogue complet des produits d'une boutique pour aider un client à choisir un cadeau.
- 04Résumer la transcription d'une réunion de direction de trois heures ayant généré 40 pages de texte.
Vous voulez utiliser Context Window dans votre entreprise ?
30 minutes, gratuit, sans engagement. Nous indiquons où l'intégrer.
Diagnostic IA gratuit