La fenêtre de contexte est la limite de tokens que Claude peut traiter en une requête. Ces notes couvrent ce qui la remplit, ce qui se passe en cas de dépassement, et comment en optimiser le coût.


Notes détaillées

NoteContenu
fenêtre-de-contexteDéfinition, taille (200K–1M tokens), ce qui compte dedans
tokenisation-des-imagesComment les images sont converties en tokens (patchs 28×28)
mise-en-cache-des-promptsOptimisation coût/latence via cache_control, sans effet sur la taille de fenêtre
résumé-automatique-claude-aiGestion douce du dépassement côté claude.ai (produit grand public)
compaction-serveur-apiÉquivalent paramétrable côté API, pour agents et workflows long-running
dépassement-de-prompt-uniqueCe qui se passe quand UNE requête dépasse déjà la limite à elle seule

Deux types de dépassement

Accumulation progressiveDépassement d’un coup
CauseLa conversation grossit tour après tourUne seule requête (gros document, PDF) dépasse déjà la limite
Gestionrésumé-automatique-claude-ai (claude.ai) ou compaction-serveur-api (API)Aucune — rejet immédiat, 400 invalid_request_error
SolutionAutomatique, transparenteRéduire manuellement la taille du prompt avant envoi
Détaildépassement-de-prompt-uniquedépassement-de-prompt-unique

Ce qui optimise le coût vs ce qui repousse la limite

MécanismeEffet sur la taille de fenêtreEffet sur le coût
mise-en-cache-des-promptsAucun~90% moins cher sur les tokens en cache
compaction-serveur-api / résumé-automatique-claude-aiRepousse le seuil pratique (résume l’ancien contexte)Un appel de résumé en plus, mais moins de tokens à retraiter ensuite

En relation avec