Skip to content
Learning Lab · 4 min read

Gestion de la fenêtre de contexte : Garder les longues conversations fonctionnelles

Les modèles se dégradent lorsque le contexte se remplit, même si les tokens sont présents. Découvrez trois stratégies éprouvées — résumé, fenêtres glissantes et RAG — pour maintenir la précision des longues conversations sans atteindre les limites de tokens.

Manage Long Conversations Without Token Loss

Votre conversation avec Claude atteint 80 000 tokens. Le modèle commence à se répéter. GPT-4o oublie soudainement le contexte des cinq messages précédents. Mistral 7B sur votre machine locale commence à halluciner des détails qui avaient été mentionnés précédemment.

Ce ne sont pas des échecs aléatoires. Ils sont symptomatiques d’une mauvaise gestion de la fenêtre de contexte — l’écart entre ce qu’un modèle peut théoriquement contenir et ce qu’il utilise réellement efficacement.

Comprendre les limites de la fenêtre de contexte (Et ce qu’elles signifient réellement)

Une fenêtre de contexte est la quantité de texte — mesurée en tokens — qu’un modèle peut prendre en compte lors de la génération d’une réponse. Claude 3.5 Sonnet prend en charge 200 000 tokens. GPT-4o prend en charge 128 000. Llama 3 70B prend en charge 8 000 dans sa version de base.

Mais avoir une fenêtre de 200 000 tokens ne signifie pas que vous devriez utiliser les 200 000 tokens pour votre conversation.

Les modèles performent moins bien sur les tâches lorsque la fenêtre se remplit — en particulier sur les tâches de récupération où ils doivent trouver des informations spécifiques enfouies dans le contexte antérieur. Les tests internes d’Anthropic montrent que la précision de Claude sur les tâches de récupération de type « aiguille dans une botte de foin » (trouver un fait spécifique dans un long document) diminue d’environ 5 à 7 % pour chaque 25 % de la fenêtre que vous remplissez. À 80 % de capacité, vous constatez une dégradation des performances en matière de rappel d’informations, même si les tokens rentrent encore.

La fenêtre pratique — où le modèle fonctionne de manière fiable — est généralement de 60 à 70 % du maximum théorique. Au-delà, la précision diminue sensiblement.

Les trois stratégies qui fonctionnent réellement

1. Résumé avant compression

Ne vous contentez pas de tronquer les anciens messages. Résumez-les.

Lorsque la conversation dépasse 40 000 tokens (pour Claude Sonnet) ou 30 000 tokens (pour GPT-4o), arrêtez-vous et créez un résumé de tout ce qui a été discuté jusqu’à présent. Cela sert deux objectifs : il préserve le sens sémantique sans l’encombrement des tokens, et il oblige le modèle à consolider sa propre compréhension.

# Mauvaise approche : ajouter simplement des messages
Utilisateur : [Message 1]
Assistant : [Réponse 1]
Utilisateur : [Message 2]
Assistant : [Réponse 2]
... répéter 50 fois ...
Utilisateur : [Message 51 - dépasse la fenêtre de contexte]

# Meilleure approche : résumer aux points de contrôle
Utilisateur : [Messages 1-10]
Assistant : [Réponse]
Utilisateur : Veuillez résumer notre conversation jusqu'à présent
Assistant : [Résumé de la discussion, décisions clés, contexte]

# Ajoutez maintenant de nouveaux messages au résumé, pas à l'historique complet
Contexte : [Résumé ci-dessus]
Utilisateur : [Message 11]
Assistant : [Réponse utilisant à la fois le résumé et le nouveau message]

Le résumé devient la nouvelle « base de contexte » pour les messages suivants. Vous avez compressé 10 messages en 200 à 400 tokens tout en conservant 95 % ou plus de la valeur sémantique.

2. Fenêtre glissante avec injection de contexte explicite

Pour les applications où vous ne pouvez pas faire de pause et résumer — comme un chatbot qui doit répondre en temps réel — utilisez une approche de fenêtre glissante. Gardez uniquement les N derniers messages dans le contexte actif, plus une instruction système fixe qui définit le style d’interaction.

# Instruction système (toujours incluse, compte comme contexte)
Vous êtes un conseiller technique. Lorsque l'utilisateur pose des questions sur le déploiement,
n'oubliez pas : nous utilisons AWS. Lorsque vous discutez des tests, faites référence à la
suite de tests existante dans la base de code.

# Fenêtre glissante : garder uniquement les 5 derniers messages
[Messages précédents supprimés]
Utilisateur : [Message N-4]
Assistant : [Réponse]
Utilisateur : [Message N-3]
Assistant : [Réponse]
Utilisateur : [Message N-2]
Assistant : [Réponse]
Utilisateur : [Message N-1]
Assistant : [Réponse]
Utilisateur : [Message N] <- entrant

# Utilisation des tokens : instruction système + 5 derniers messages
# Résultat : environ 4 000 à 6 000 tokens selon la longueur des messages

Le compromis est clair : vous perdez le contexte historique au-delà des 5 derniers messages, mais vous maintenez des performances constantes. Pour les cas d'utilisation où les utilisateurs ne font pas référence à des choses dites il y a 20 messages — support client, revue de code, conception itérative — cela fonctionne bien.

3. Contexte augmenté par récupération (Modèle RAG)

Si vous avez besoin d'accéder à l'ancien contexte sans tout garder dans la conversation, intégrez et indexez les messages ou documents précédents, puis récupérez uniquement ceux qui sont pertinents.

Au lieu de passer les 40 000 tokens complets de la conversation au modèle, vous :

  • Convertissez chaque message ou section en un embedding
  • Stockez les embeddings dans une base de données vectorielle (Pinecone, Weaviate, même SQLite avec extension vectorielle)
  • Lorsque l'utilisateur envoie un nouveau message, récupérez les 3 à 5 messages précédents les plus similaires
  • Injectez-les dans le contexte, avec le message actuel

Cela maintient votre fenêtre de contexte active à 5 000 à 8 000 tokens tout en donnant accès à un historique de conversation virtuellement illimité. Le modèle ne voit que ce qui est pertinent pour la requête actuelle.

# Pseudocode pour la gestion du contexte basé sur RAG
import anthropic
from embedding_service import embed_and_store, retrieve_similar

def chat_with_rag_context(user_message, conversation_id):
# Récupérer les messages passés similaires
similar_messages = retrieve_similar(
query=user_message,
conversation_id=conversation_id,
limit=4
)

# Construire la fenêtre de contexte
context =

Batikan
· 4 min read
Topics & Keywords
Learning Lab les utilisateur message contexte 000 tokens assistant réponse fenêtre messages des
Share

Stay ahead of the AI curve

Weekly digest of the most impactful AI breakthroughs, tools, and strategies.

Related Articles

Cursor vs GitHub Copilot vs Claude Code : Lequel choisir pour la production ?
Learning Lab

Cursor vs GitHub Copilot vs Claude Code : Lequel choisir pour la production ?

Trois assistants de codage IA dominent les environnements de production. Ce n'est pas une liste de fonctionnalités. C'est une analyse de ce que chaque outil fait réellement, où il échoue, et lequel utiliser pour l'architecture, le code répétitif et le débogage.

· 14 min read
Analyser des feuilles de calcul avec Claude et GPT-4o
Learning Lab

Analyser des feuilles de calcul avec Claude et GPT-4o

Claude et GPT-4o peuvent analyser vos feuilles de calcul et CSV, mais seulement si vous structurez correctement les données et posez des questions précises. Apprenez à téléverser des fichiers, rédiger des invites d'analyse et éviter les pièges des hallucinations.

· 3 min read
Hallucinations des LLM : pourquoi elles se produisent et 5 façons d’y mettre fin
Learning Lab

Hallucinations des LLM : pourquoi elles se produisent et 5 façons d’y mettre fin

Pourquoi les modèles de langage inventent-ils des faits avec confiance ? Parce qu'ils prédisent des tokens, pas la vérité. Découvrez comment l'ancrage, le prompting par contrainte et les paramètres de température réduisent les taux d'hallucination de plus de 15 % à moins de 5 % dans les systèmes de production.

· 7 min read
Flux de travail IA pour freelances qui augmentent réellement les heures facturables
Learning Lab

Flux de travail IA pour freelances qui augmentent réellement les heures facturables

L'IA peut doubler votre production en freelance sans remplacer votre jugement. Découvrez quatre flux de travail de production qui compressent les tâches administratives et récupèrent plus de 10 heures facturables par mois.

· 8 min read
Arrêtez les hallucinations : comment le RAG ancre réellement les LLM
Learning Lab

Arrêtez les hallucinations : comment le RAG ancre réellement les LLM

Votre LLM vient de citer avec assurance un article de recherche qui n'existe pas. Cela se produit car les modèles génèrent du texte basé sur des modèles dans les données d'entraînement, et non en interrogeant vos informations réelles. La Génération Augmentée par Récupération (RAG) règle ce problème en donnant aux modèles accès à des données réelles avant qu'ils ne génèrent une réponse.

· 10 min read
Où vont vos prompts : Gestion des données dans ChatGPT, Claude et Gemini
Learning Lab

Où vont vos prompts : Gestion des données dans ChatGPT, Claude et Gemini

ChatGPT stocke vos données et les utilise pour l'entraînement par défaut. Claude n'entraîne pas sur les conversations web sauf si vous optez pour cela. Gemini lie vos chats à l'ensemble de votre compte Google. Voici ce que chaque modèle fait de vos prompts et comment protéger les informations sensibles.

· 6 min read

More from Prompt & Learn

Otter vs Fireflies vs tl;dv : Le Match des Transcriptions de Réunion
AI Tools Directory

Otter vs Fireflies vs tl;dv : Le Match des Transcriptions de Réunion

Trois outils promettent de transcrire vos réunions et d'en extraire les points d'action. Un seul s'intègre parfaitement à votre flux de travail. Voici la comparaison réelle : Otter vs Fireflies vs tl;dv — données de précision, détails des prix et avantages/inconvénients honnêtes pour chacun.

· 5 min read
Gamma vs Beautiful.ai vs Tome : Comparatif des générateurs de diapositives
AI Tools Directory

Gamma vs Beautiful.ai vs Tome : Comparatif des générateurs de diapositives

J'ai testé Gamma, Beautiful.ai et Tome sur des présentations de production. Gamma génère le plus rapidement mais a du mal avec la marque. Beautiful.ai offre une cohérence visuelle et une gestion des données. Tome offre flexibilité et collaboration. Voici ce qui fonctionne réellement en pratique — et quand chaque outil gagne.

· 15 min read
Les lancements sur l’App Store explosent en 2026, l’IA en est le catalyseur
AI News

Les lancements sur l’App Store explosent en 2026, l’IA en est le catalyseur

Appfigures rapporte une augmentation mesurable des lancements d'applications en 2026, grâce aux outils de développement IA qui réduisent les délais de plusieurs semaines à quelques jours. Un développeur solo avec Claude ou Mistral peut désormais livrer ce qui nécessitait une équipe d'ingénieurs complète en 2022.

· 4 min read
Julius AI vs ChatGPT vs Claude pour l’analyse de données
AI Tools Directory

Julius AI vs ChatGPT vs Claude pour l’analyse de données

Julius AI, ChatGPT Advanced Data Analysis et Claude Artifacts gèrent tous des tâches de données, mais la vitesse d'exécution, les prix et le flux de travail diffèrent considérablement. Voici comment choisir le bon pour votre cas d'utilisation.

· 6 min read
Perplexity vs Google AI vs Consensus : Lequel choisir pour la recherche académique ?
AI Tools Directory

Perplexity vs Google AI vs Consensus : Lequel choisir pour la recherche académique ?

Perplexity, Google AI et Consensus excellent chacun dans différentes tâches de recherche. Perplexity l'emporte sur les sujets récents avec une synthèse en temps réel. Consensus offre une précision de citation inégalée pour les travaux évalués par des pairs. Google Scholar fournit une profondeur historique. Cette analyse montre exactement quel outil utiliser pour votre prochain document – et pourquoi.

· 8 min read
Les outils de voyage de Google divisent par deux le temps de planification. Voici ce qui fonctionne vraiment
AI Tools Directory

Les outils de voyage de Google divisent par deux le temps de planification. Voici ce qui fonctionne vraiment

Google a lancé sept outils de voyage intégrés ce printemps. Le suivi des prix prédit les fenêtres de réservation optimales, la disponibilité des restaurants récupère des données en temps réel et les cartes hors ligne fonctionnent sans couverture cellulaire. Voici quelles fonctionnalités inspirent confiance et où fixer vos attentes.

· 5 min read

Stay ahead of the AI curve

Weekly digest of the most impactful AI breakthroughs, tools, and strategies. No noise, only signal.

Follow Prompt Builder Prompt Builder