Skip to content
Learning Lab · 6 min read

Gestion de la fenêtre de contexte : intégrer de longs documents dans les LLM

Les limites de la fenêtre de contexte cassent les systèmes de production plus souvent que les mauvais prompts. Apprenez le comptage de tokens, les stratégies d'extraction d'abord, et la synthèse hiérarchique pour gérer de longs documents et conversations sans perdre d'informations ni dépasser les limites du modèle.

Context Window Management: Handle Long Docs in LLMs

Votre document juridique de 50 pages est téléchargé dans Claude, et le modèle renvoie une analyse basée sur la page 3. Le reste existe dans un vide de tokens. Ce n’est pas un problème d’hallucination, c’est un problème de fenêtre de contexte, et cela casse plus de systèmes de production que les mauvais prompts.

La fenêtre de contexte est un espace immobilier. Chaque token que vous utilisez — prompt, documents, historique de conversation, instructions système — occupe un espace qui pourrait servir à votre tâche réelle. Dépasser la limite, et le modèle cesse de répondre ou, pire, commence à ignorer les informations les plus anciennes pour faire place à de nouvelles entrées. Comprendre comment gérer cet espace fait la différence entre un système qui fonctionne et un système qui échoue mystérieusement le jeudi quand votre document s’est allongé.

Comprendre votre budget de contexte

Commencez par savoir exactement ce que vous avez.

Claude 3.5 Sonnet vous offre 200 000 tokens. GPT-4o vous offre 128 000 tokens (ou 4 096 si vous utilisez le modèle de base plus ancien). Mistral Large propose 32 000 tokens. Ces chiffres semblent importants jusqu’à ce que vous commenciez à mesurer le contenu réel.

Une page typique de texte commercial représente environ 250 à 350 tokens. Un document de 50 pages vous coûte 12 500 à 17 500 tokens avant même d’avoir écrit une seule instruction. Une longue conversation avec 20 échanges consomme 4 000 à 8 000 tokens. Il vous reste donc un espace de travail réel mesuré par ce qui reste — votre « budget de traitement ».

Calculez votre coût exact en tokens avant le déploiement. Utilisez le tokenizer du fournisseur du modèle :

# Exemple Python utilisant le tokenizer d'Anthropic
import anthropic

client = anthropic.Anthropic()
with open('document.txt', 'r') as f:
    doc_text = f.read()

response = client.messages.count_tokens(
    model="claude-3-5-sonnet-20241022",
    messages=[{"role": "user", "content": doc_text}]
)

print(f"Tokens du document : {response.input_tokens}")
print(f"Budget restant : {200000 - response.input_tokens}")

Ce n’est pas une option. Les estimations vous coûtent des requêtes échouées et des dépenses API gaspillées.

Les trois techniques de compression qui fonctionnent vraiment

Vous avez trois leviers : extraire ce qui compte, résumer stratégiquement, ou diviser le travail en morceaux. La plupart des gens essaient de passer directement à la synthèse et échouent car ils résument les mauvaises parties.

1. Extraction avant synthèse

Ne résumez pas tout. Extrayez d’abord les sections pertinentes pour votre question réelle.

Si vous analysez un contrat pour les conditions de paiement, vous n’avez pas besoin de résumés de l’historique de l’entreprise ou des spécifications du produit. Récupérez les clauses pertinentes, transmettez-les au LLM, et gardez 80 % de votre fenêtre de contexte libre.

Mauvaise approche :

# Résumer l'intégralité du document de 50 pages
Prompt: "Résume ce document juridique en 500 mots."
[Document de 50 pages]
"Quelles sont les conditions de paiement ?"

Bonne approche :

# Extraire les sections pertinentes, puis répondre
Prompt: "Extrais toutes les sections mentionnant 'paiement', 'facture', 'date d'échéance', 
ou 'termes'. Garde la formulation exacte."
[Document de 50 pages]

# Puis dans un second appel ou le même appel avec le texte extrait :
Prompt: "Basé sur ces sections, quelles sont les conditions de paiement et quand les factures sont-elles dues ?"
[Sections extraites uniquement - ~2000 tokens au lieu de 15000]

Utilisez l’extraction par mots-clés, les expressions régulières, ou un passage de recherche léger (Claude Mini sur les documents plus courts) pour identifier les morceaux pertinents avant de les transmettre à votre modèle d’analyse principal.

2. Synthèse hiérarchique

Si l’extraction n’est pas viable — disons, si vous avez besoin de tout le contexte — résumez en couches. Ne résumez pas 50 pages en 500 mots en une seule passe. Résumez des morceaux en résumés, puis résumez ces résumés.

Divisez le document en morceaux de 5 à 10 pages. Résumez chaque morceau à 150–200 tokens. Ensuite, résumez ces résumés. Vous compressez 15 000 tokens à 500–800 tout en préservant la structure et les relations.

Cela préserve mieux les nuances qu’une seule synthèse agressive car le modèle ne rejette jamais de détails arbitrairement — il condense proportionnellement à chaque couche.

3. Traitement par fenêtre glissante pour les conversations

Les longues conversations remplissent le contexte rapidement. Ne conservez pas tout l’historique. Gardez les échanges récents (les 5–10 derniers) plus les résumés des anciens.

# Gestion du contexte de conversation
conversation = [
    {"role": "user", "content": "Parlez-moi des prix AWS"},
    {"role": "assistant", "content": "Les prix AWS sont..."}
    # ... 15 échanges supplémentaires ...
]

# Avant l'appel API, tronquer et résumer
if conversation_token_count > 100000:
    # Garder les 5 derniers échanges
    recent = conversation[-10:]  # 5 paires utilisateur/assistant
    
    # Résumer tout ce qui précède
    older_summary = summarize_conversation(conversation[:-10])
    
    # Reconstruire avec un marqueur d'historique explicite
    trimmed = [
        {"role": "system", 
         "content": "Plus tôt dans cette conversation : " + older_summary}
    ] + recent

Température et échantillonnage : problèmes de contexte cachés

Vous pouvez également gérer l’efficacité du contexte par le comportement du modèle, pas seulement par la taille de l’entrée.

Une température plus basse (0,3–0,5) amène le modèle à se concentrer sur ce qu’il sait déjà — utile pour l’extraction de faits à partir du contexte fourni. Une température plus élevée (0,7–1,0) augmente le caractère aléatoire, ce qui consomme des tokens pour des sorties moins prévisibles.

Pour les tâches riches en contexte (« répondez uniquement à partir de ce document »), utilisez une température de 0,3–0,4. L’attention du modèle reste sur votre entrée, pas sur l’exploration de formulations alternatives.

Le paramètre max_tokens est également important. Définissez-le délibérément. Si vous extrayez des conditions de paiement, vous n’avez pas besoin de sorties de 4 096 tokens. Définissez max_tokens=500. Cela réserve le budget pour votre tâche réelle au lieu de laisser le modèle divaguer dans un espace vide.

La vraie configuration : un schéma de production

Voici ce qui fonctionne réellement à grande échelle :

  1. Couche d’extraction : Utilisez des expressions régulières, une recherche par mots-clés ou un modèle rapide (Claude 3.5 Haiku) pour extraire les sections pertinentes des grands documents. Coût : minimal.
  2. Vérification du budget de tokens : Comptez les tokens des sections extraites. Si c’est inférieur à 30 000 tokens avec Claude Sonnet, continuez. Sinon, résumez.
  3. Synthétiser si nécessaire : Synthèses hiérarchiques de morceaux, pas une compression agressive en une seule passe.
  4. Interroger avec le contexte : Transmettez le matériel extrait ou résumé plus des instructions explicites : « Répondez uniquement sur la base de ces sections. N’utilisez pas de connaissances externes. »
  5. Troncature de conversation : Après 10 messages utilisateur, enregistrez un instantané de la conversation, résumez-la et démarrez une nouvelle fenêtre.

Le goulot d’étranglement est rarement le modèle. C’est le travail préparatoire avant l’appel API.

Commencez par le comptage de tokens, pas par la synthèse

Aujourd’hui : mesurez vos documents réels. Faites-les passer par le tokenizer du modèle que vous utilisez. Calculez combien de tokens restent après le téléchargement de votre document. Ce nombre restant est votre budget de travail réel.

S’il est inférieur à 30 000 pour Claude Sonnet ou inférieur à 50 000 pour un travail de production, vous devez extraire, pas résumer. S’il est négatif, vous avez besoin d’une approche complètement différente — diviser les documents, utiliser la recherche vectorielle pour récupérer uniquement les sections pertinentes, ou utiliser un modèle avec une fenêtre plus grande.

La plupart des problèmes de contexte ne sont pas résolus par de meilleurs prompts. Ils sont résolus en ne demandant pas au modèle de traiter plus qu’il n’en a besoin.

Batikan
· 6 min read
Topics & Keywords
Learning Lab les tokens vous une des contexte modèle pas
Share

Stay ahead of the AI curve

Weekly digest of the most impactful AI breakthroughs, tools, and strategies.

Related Articles

Cursor vs GitHub Copilot vs Claude Code : Lequel choisir pour la production ?
Learning Lab

Cursor vs GitHub Copilot vs Claude Code : Lequel choisir pour la production ?

Trois assistants de codage IA dominent les environnements de production. Ce n'est pas une liste de fonctionnalités. C'est une analyse de ce que chaque outil fait réellement, où il échoue, et lequel utiliser pour l'architecture, le code répétitif et le débogage.

· 14 min read
Analyser des feuilles de calcul avec Claude et GPT-4o
Learning Lab

Analyser des feuilles de calcul avec Claude et GPT-4o

Claude et GPT-4o peuvent analyser vos feuilles de calcul et CSV, mais seulement si vous structurez correctement les données et posez des questions précises. Apprenez à téléverser des fichiers, rédiger des invites d'analyse et éviter les pièges des hallucinations.

· 3 min read
Hallucinations des LLM : pourquoi elles se produisent et 5 façons d’y mettre fin
Learning Lab

Hallucinations des LLM : pourquoi elles se produisent et 5 façons d’y mettre fin

Pourquoi les modèles de langage inventent-ils des faits avec confiance ? Parce qu'ils prédisent des tokens, pas la vérité. Découvrez comment l'ancrage, le prompting par contrainte et les paramètres de température réduisent les taux d'hallucination de plus de 15 % à moins de 5 % dans les systèmes de production.

· 7 min read
Flux de travail IA pour freelances qui augmentent réellement les heures facturables
Learning Lab

Flux de travail IA pour freelances qui augmentent réellement les heures facturables

L'IA peut doubler votre production en freelance sans remplacer votre jugement. Découvrez quatre flux de travail de production qui compressent les tâches administratives et récupèrent plus de 10 heures facturables par mois.

· 8 min read
Arrêtez les hallucinations : comment le RAG ancre réellement les LLM
Learning Lab

Arrêtez les hallucinations : comment le RAG ancre réellement les LLM

Votre LLM vient de citer avec assurance un article de recherche qui n'existe pas. Cela se produit car les modèles génèrent du texte basé sur des modèles dans les données d'entraînement, et non en interrogeant vos informations réelles. La Génération Augmentée par Récupération (RAG) règle ce problème en donnant aux modèles accès à des données réelles avant qu'ils ne génèrent une réponse.

· 10 min read
Où vont vos prompts : Gestion des données dans ChatGPT, Claude et Gemini
Learning Lab

Où vont vos prompts : Gestion des données dans ChatGPT, Claude et Gemini

ChatGPT stocke vos données et les utilise pour l'entraînement par défaut. Claude n'entraîne pas sur les conversations web sauf si vous optez pour cela. Gemini lie vos chats à l'ensemble de votre compte Google. Voici ce que chaque modèle fait de vos prompts et comment protéger les informations sensibles.

· 6 min read

More from Prompt & Learn

Otter vs Fireflies vs tl;dv : Le Match des Transcriptions de Réunion
AI Tools Directory

Otter vs Fireflies vs tl;dv : Le Match des Transcriptions de Réunion

Trois outils promettent de transcrire vos réunions et d'en extraire les points d'action. Un seul s'intègre parfaitement à votre flux de travail. Voici la comparaison réelle : Otter vs Fireflies vs tl;dv — données de précision, détails des prix et avantages/inconvénients honnêtes pour chacun.

· 5 min read
Gamma vs Beautiful.ai vs Tome : Comparatif des générateurs de diapositives
AI Tools Directory

Gamma vs Beautiful.ai vs Tome : Comparatif des générateurs de diapositives

J'ai testé Gamma, Beautiful.ai et Tome sur des présentations de production. Gamma génère le plus rapidement mais a du mal avec la marque. Beautiful.ai offre une cohérence visuelle et une gestion des données. Tome offre flexibilité et collaboration. Voici ce qui fonctionne réellement en pratique — et quand chaque outil gagne.

· 15 min read
Les lancements sur l’App Store explosent en 2026, l’IA en est le catalyseur
AI News

Les lancements sur l’App Store explosent en 2026, l’IA en est le catalyseur

Appfigures rapporte une augmentation mesurable des lancements d'applications en 2026, grâce aux outils de développement IA qui réduisent les délais de plusieurs semaines à quelques jours. Un développeur solo avec Claude ou Mistral peut désormais livrer ce qui nécessitait une équipe d'ingénieurs complète en 2022.

· 4 min read
Julius AI vs ChatGPT vs Claude pour l’analyse de données
AI Tools Directory

Julius AI vs ChatGPT vs Claude pour l’analyse de données

Julius AI, ChatGPT Advanced Data Analysis et Claude Artifacts gèrent tous des tâches de données, mais la vitesse d'exécution, les prix et le flux de travail diffèrent considérablement. Voici comment choisir le bon pour votre cas d'utilisation.

· 6 min read
Perplexity vs Google AI vs Consensus : Lequel choisir pour la recherche académique ?
AI Tools Directory

Perplexity vs Google AI vs Consensus : Lequel choisir pour la recherche académique ?

Perplexity, Google AI et Consensus excellent chacun dans différentes tâches de recherche. Perplexity l'emporte sur les sujets récents avec une synthèse en temps réel. Consensus offre une précision de citation inégalée pour les travaux évalués par des pairs. Google Scholar fournit une profondeur historique. Cette analyse montre exactement quel outil utiliser pour votre prochain document – et pourquoi.

· 8 min read
Les outils de voyage de Google divisent par deux le temps de planification. Voici ce qui fonctionne vraiment
AI Tools Directory

Les outils de voyage de Google divisent par deux le temps de planification. Voici ce qui fonctionne vraiment

Google a lancé sept outils de voyage intégrés ce printemps. Le suivi des prix prédit les fenêtres de réservation optimales, la disponibilité des restaurants récupère des données en temps réel et les cartes hors ligne fonctionnent sans couverture cellulaire. Voici quelles fonctionnalités inspirent confiance et où fixer vos attentes.

· 5 min read

Stay ahead of the AI curve

Weekly digest of the most impactful AI breakthroughs, tools, and strategies. No noise, only signal.

Follow Prompt Builder Prompt Builder