Skip to content
Learning Lab · 5 min read

Gestion de la fenêtre de contexte : traiter de longs documents sans perte de données

Les limites de la fenêtre de contexte cassent les systèmes d'IA en production. Découvrez trois techniques concrètes pour traiter de longs documents et conversations sans perdre de données ni alourdir les coûts des API.

Context Window Management for Long Documents & Conversations

Votre appel API se termine. Claude ou GPT-4o renvoie une réponse. Mais quelque part au milieu de votre document de 8 000 mots, il a cessé de faire attention. Non pas parce que le modèle s’est cassé — mais parce que vous avez épuisé la fenêtre de contexte.

La fenêtre de contexte est le nombre maximum de jetons qu’un LLM peut traiter en une seule requête. Claude 3.5 Sonnet gère 200 000 jetons. GPT-4o gère 128 000 jetons. Llama 3 70B gère 8 000 jetons. Dépassez cette limite, votre requête échoue. Restez en dessous mais surchargez trop, l’attention du modèle se dégrade sur le matériel enfoui au milieu — un phénomène appelé problème de « perdu au milieu ».

Ce n’est pas une limitation théorique. Cela casse des systèmes de production réels : des chatbots de support client qui ne peuvent pas se souvenir des premiers échanges de conversation, des pipelines d’analyse de documents qui manquent des sections critiques et des flux de travail de recherche qui s’étouffent sur des PDF.

Comment fonctionne réellement la fenêtre de contexte

Chaque mot, chiffre, signe de ponctuation et espace est converti en jetons avant que le modèle ne le traite. Un jeton ≈ 4 caractères en anglais, mais varie selon la langue et la structure.

Une fenêtre Claude Sonnet de 200 000 jetons se décompose comme suit :

  • Invite système : 500 jetons
  • Entrée utilisateur (votre document) : 150 000 jetons
  • Historique de conversation : 30 000 jetons
  • Réservé pour la sortie : 19 500 jetons

Il vous reste 19 500 jetons pour la réponse du modèle. Si vous avez besoin d’une analyse détaillée, c’est suffisant. Si vous avez besoin de plusieurs étapes de raisonnement, vous êtes à la limite.

Les mathématiques sont rigides : jetons d’entrée + jetons de sortie ≤ fenêtre de contexte. Dépassez-la, et la plupart des fournisseurs d’API rejettent la requête avec une erreur 400. Certains services la mettent en file d’attente. Aucun ne la tronque silencieusement.

Le problème de la perte au milieu est réel

En septembre 2023, des chercheurs du MIT ont testé si les LLM utilisaient réellement tout le contexte qu’ils prétendent prendre en charge. Ils ont inséré un fait clé à différentes positions d’un long document et ont demandé au modèle de le récupérer.

Le constat : les modèles obtiennent les meilleurs résultats sur les informations situées au début et à la fin du contexte. Les informations au milieu — positions 40 à 60 % du document — sont traitées avec une précision inférieure de 25 à 35 % par rapport aux mêmes informations au début.

Ce n’est pas spécifiquement un problème de Claude ou de GPT-4o. Cela affecte tous les modèles basés sur des transformeurs. La raison : les modèles d’attention dans les modèles linguistiques pondèrent plus fortement les jetons précédents par défaut, et le modèle « économise » de la capacité pour le résumé et la réponse finaux.

Impact pratique : si votre bot de support client traite une conversation de 5 messages, les premiers messages reçoivent un traitement dégradé. Si votre analyseur de documents traite un PDF de 50 pages, les pages 20 à 30 deviennent invisibles.

Technique 1 : Résumer avant de traiter

Au lieu d’envoyer le document entier, comprimez-le d’abord.

# Mauvaise approche : envoyer le document complet
Utilisateur : « Analysez ce contrat de 30 pages. Quelles sont les obligations clés ? »
[envoyer le contrat complet de 30 pages en entrée]

Le modèle utilise une précieuse fenêtre de contexte sur des sections standard qui n’ont pas d’importance.

# Approche améliorée : processus en deux étapes
Étape 1 : Résumer le document
Invite : « Résumez ce contrat en 500 jetons. Conservez les obligations, les délais et les modalités de paiement. Supprimez le contenu standard. »
[envoyer le contrat complet]
Sortie : résumé de 500 jetons

Étape 2 : Analyser le résumé
Invite : « Sur la base de ce résumé, listez toutes les obligations des contreparties et quelle partie supporte chaque risque. »
[envoyer le résumé de 500 jetons]
Sortie : analyse structurée

Pourquoi cela fonctionne : vous utilisez la fenêtre de contexte lors du premier appel pour extraire le signal, puis vous traitez uniquement le signal lors du second appel. Le second appel est plus rapide, moins cher et plus précis car le modèle travaille avec des informations distillées.

Économies réelles de jetons : un contrat de 50 pages (≈25 000 jetons) devient un résumé de 500 jetons. Votre deuxième appel d’analyse passe de 25 500 jetons à 1 000.

Technique 2 : Diviser et réorganiser l’historique de conversation

Les conversations longues sont le problème de contexte le plus difficile car chaque nouveau message s’ajoute à l’historique. Après 15 échanges, vous avez consommé 8 000 à 15 000 jetons rien que pour la mémoire de conversation.

# Problème : l'historique de conversation gonfle
Tour de conversation 20 :
Système : [invite système d'origine]
Utilisateur : [tour 1]
Assistant : [réponse]
Utilisateur : [tour 2]
Assistant : [réponse]
... [tours 3–19] ...
Utilisateur : [tour 20] <- nouveau message
Assistant : [le modèle répond]

Au tour 20, le modèle a vu plus de 15 échanges non pertinents avant d'atteindre la question actuelle. Au tour 50, le contexte est principalement un poids mort.

Solution : utiliser une approche de réorganisation.

Après chaque 8 à 10 tours, notez chaque message historique par pertinence par rapport au fil de conversation actuel à l'aide d'embeddings ou d'un modèle linguistique léger. Ne conservez que les 5 à 7 tours passés les plus pertinents, plus les 2 tours les plus récents. Jetez le reste.

import openai
from sklearn.metrics.pairwise import cosine_similarity
import numpy as np

def prune_conversation_history(history, current_message, max_turns=7):
# Intégrer tous les messages utilisateur passés
past_messages = [h[

Batikan
· 5 min read
Topics & Keywords
Learning Lab les des contexte une fenêtre les modèles est votre
Share

Stay ahead of the AI curve

Weekly digest of the most impactful AI breakthroughs, tools, and strategies.

Related Articles

Cursor vs GitHub Copilot vs Claude Code : Lequel choisir pour la production ?
Learning Lab

Cursor vs GitHub Copilot vs Claude Code : Lequel choisir pour la production ?

Trois assistants de codage IA dominent les environnements de production. Ce n'est pas une liste de fonctionnalités. C'est une analyse de ce que chaque outil fait réellement, où il échoue, et lequel utiliser pour l'architecture, le code répétitif et le débogage.

· 14 min read
Analyser des feuilles de calcul avec Claude et GPT-4o
Learning Lab

Analyser des feuilles de calcul avec Claude et GPT-4o

Claude et GPT-4o peuvent analyser vos feuilles de calcul et CSV, mais seulement si vous structurez correctement les données et posez des questions précises. Apprenez à téléverser des fichiers, rédiger des invites d'analyse et éviter les pièges des hallucinations.

· 3 min read
Hallucinations des LLM : pourquoi elles se produisent et 5 façons d’y mettre fin
Learning Lab

Hallucinations des LLM : pourquoi elles se produisent et 5 façons d’y mettre fin

Pourquoi les modèles de langage inventent-ils des faits avec confiance ? Parce qu'ils prédisent des tokens, pas la vérité. Découvrez comment l'ancrage, le prompting par contrainte et les paramètres de température réduisent les taux d'hallucination de plus de 15 % à moins de 5 % dans les systèmes de production.

· 7 min read
Flux de travail IA pour freelances qui augmentent réellement les heures facturables
Learning Lab

Flux de travail IA pour freelances qui augmentent réellement les heures facturables

L'IA peut doubler votre production en freelance sans remplacer votre jugement. Découvrez quatre flux de travail de production qui compressent les tâches administratives et récupèrent plus de 10 heures facturables par mois.

· 8 min read
Arrêtez les hallucinations : comment le RAG ancre réellement les LLM
Learning Lab

Arrêtez les hallucinations : comment le RAG ancre réellement les LLM

Votre LLM vient de citer avec assurance un article de recherche qui n'existe pas. Cela se produit car les modèles génèrent du texte basé sur des modèles dans les données d'entraînement, et non en interrogeant vos informations réelles. La Génération Augmentée par Récupération (RAG) règle ce problème en donnant aux modèles accès à des données réelles avant qu'ils ne génèrent une réponse.

· 10 min read
Où vont vos prompts : Gestion des données dans ChatGPT, Claude et Gemini
Learning Lab

Où vont vos prompts : Gestion des données dans ChatGPT, Claude et Gemini

ChatGPT stocke vos données et les utilise pour l'entraînement par défaut. Claude n'entraîne pas sur les conversations web sauf si vous optez pour cela. Gemini lie vos chats à l'ensemble de votre compte Google. Voici ce que chaque modèle fait de vos prompts et comment protéger les informations sensibles.

· 6 min read

More from Prompt & Learn

Otter vs Fireflies vs tl;dv : Le Match des Transcriptions de Réunion
AI Tools Directory

Otter vs Fireflies vs tl;dv : Le Match des Transcriptions de Réunion

Trois outils promettent de transcrire vos réunions et d'en extraire les points d'action. Un seul s'intègre parfaitement à votre flux de travail. Voici la comparaison réelle : Otter vs Fireflies vs tl;dv — données de précision, détails des prix et avantages/inconvénients honnêtes pour chacun.

· 5 min read
Gamma vs Beautiful.ai vs Tome : Comparatif des générateurs de diapositives
AI Tools Directory

Gamma vs Beautiful.ai vs Tome : Comparatif des générateurs de diapositives

J'ai testé Gamma, Beautiful.ai et Tome sur des présentations de production. Gamma génère le plus rapidement mais a du mal avec la marque. Beautiful.ai offre une cohérence visuelle et une gestion des données. Tome offre flexibilité et collaboration. Voici ce qui fonctionne réellement en pratique — et quand chaque outil gagne.

· 15 min read
Les lancements sur l’App Store explosent en 2026, l’IA en est le catalyseur
AI News

Les lancements sur l’App Store explosent en 2026, l’IA en est le catalyseur

Appfigures rapporte une augmentation mesurable des lancements d'applications en 2026, grâce aux outils de développement IA qui réduisent les délais de plusieurs semaines à quelques jours. Un développeur solo avec Claude ou Mistral peut désormais livrer ce qui nécessitait une équipe d'ingénieurs complète en 2022.

· 4 min read
Julius AI vs ChatGPT vs Claude pour l’analyse de données
AI Tools Directory

Julius AI vs ChatGPT vs Claude pour l’analyse de données

Julius AI, ChatGPT Advanced Data Analysis et Claude Artifacts gèrent tous des tâches de données, mais la vitesse d'exécution, les prix et le flux de travail diffèrent considérablement. Voici comment choisir le bon pour votre cas d'utilisation.

· 6 min read
Perplexity vs Google AI vs Consensus : Lequel choisir pour la recherche académique ?
AI Tools Directory

Perplexity vs Google AI vs Consensus : Lequel choisir pour la recherche académique ?

Perplexity, Google AI et Consensus excellent chacun dans différentes tâches de recherche. Perplexity l'emporte sur les sujets récents avec une synthèse en temps réel. Consensus offre une précision de citation inégalée pour les travaux évalués par des pairs. Google Scholar fournit une profondeur historique. Cette analyse montre exactement quel outil utiliser pour votre prochain document – et pourquoi.

· 8 min read
Les outils de voyage de Google divisent par deux le temps de planification. Voici ce qui fonctionne vraiment
AI Tools Directory

Les outils de voyage de Google divisent par deux le temps de planification. Voici ce qui fonctionne vraiment

Google a lancé sept outils de voyage intégrés ce printemps. Le suivi des prix prédit les fenêtres de réservation optimales, la disponibilité des restaurants récupère des données en temps réel et les cartes hors ligne fonctionnent sans couverture cellulaire. Voici quelles fonctionnalités inspirent confiance et où fixer vos attentes.

· 5 min read

Stay ahead of the AI curve

Weekly digest of the most impactful AI breakthroughs, tools, and strategies. No noise, only signal.

Follow Prompt Builder Prompt Builder