La fenêtre de contexte est la limite de tokens que Claude peut traiter en une requête. Ces notes couvrent ce qui la remplit, ce qui se passe en cas de dépassement, et comment en optimiser le coût.
Notes détaillées
| Note | Contenu |
|---|---|
| fenêtre-de-contexte | Définition, taille (200K–1M tokens), ce qui compte dedans |
| tokenisation-des-images | Comment les images sont converties en tokens (patchs 28×28) |
| mise-en-cache-des-prompts | Optimisation coût/latence via cache_control, sans effet sur la taille de fenêtre |
| résumé-automatique-claude-ai | Gestion douce du dépassement côté claude.ai (produit grand public) |
| compaction-serveur-api | Équivalent paramétrable côté API, pour agents et workflows long-running |
| dépassement-de-prompt-unique | Ce qui se passe quand UNE requête dépasse déjà la limite à elle seule |
Deux types de dépassement
| Accumulation progressive | Dépassement d’un coup | |
|---|---|---|
| Cause | La conversation grossit tour après tour | Une seule requête (gros document, PDF) dépasse déjà la limite |
| Gestion | résumé-automatique-claude-ai (claude.ai) ou compaction-serveur-api (API) | Aucune — rejet immédiat, 400 invalid_request_error |
| Solution | Automatique, transparente | Réduire manuellement la taille du prompt avant envoi |
| Détail | dépassement-de-prompt-unique | dépassement-de-prompt-unique |
Ce qui optimise le coût vs ce qui repousse la limite
| Mécanisme | Effet sur la taille de fenêtre | Effet sur le coût |
|---|---|---|
| mise-en-cache-des-prompts | Aucun | ~90% moins cher sur les tokens en cache |
| compaction-serveur-api / résumé-automatique-claude-ai | Repousse le seuil pratique (résume l’ancien contexte) | Un appel de résumé en plus, mais moins de tokens à retraiter ensuite |
En relation avec
- Synthèse IA — hub principal
- Agents — Vue d’ensemble — la mémoire d’un agent long-running dépend directement de la gestion de la fenêtre de contexte