Fenêtre de contexte
Nombre maximum de tokens que le modèle peut “voir” en une seule requête : system prompt + historique + documents/images + réponse générée, tout compris.
- Taille standard actuelle : 200K tokens
- Modèles récents (4.5+) sur plans payants : jusqu’à 500K, voire 1M tokens
- 1 token ≈ 0,75 mot (anglais)
C’est une contrainte de capacité par requête, propre à chaque modèle. Rien à voir avec le stockage de l’historique de conversation (qui reste sauvegardé indéfiniment côté claude.ai).
Ce qui compte dedans
- Le prompt système
- Tous les messages (texte, images, documents)
- Les définitions d’outils (tool use)
- La réponse générée par Claude (y compris le raisonnement étendu)
Voir aussi
- mise-en-cache-des-prompts — optimisation de coût, pas d’augmentation de la limite
- résumé-automatique-claude-ai — gestion douce du dépassement, côté produit
- compaction-serveur-api — gestion douce du dépassement, côté API
- dépassement-de-prompt-unique — ce qui se passe si UNE requête dépasse la limite d’un coup