Dépassement de prompt unique
Cas différent de l’accumulation progressive sur une conversation : ici, une seule requête dépasse déjà la fenêtre-de-contexte à elle seule.
Comportement
- Rejet immédiat, avant toute génération
- Erreur
400 invalid_request_error, message"prompt is too long" - Vrai sur tous les modèles
{
"type": "error",
"error": {
"type": "invalid_request_error",
"message": "prompt is too long: 208310 tokens > 200000 maximum"
}
}Nuance modèles récents (4.5+)
Si c’est input + max_tokens qui dépasse (mais l’input seul est ok), l’API accepte et commence à générer. Si la génération atteint la limite en cours de route : stop_reason: "model_context_window_exceeded" plutôt qu’un crash immédiat.
Point clé
La compaction-serveur-api ne peut RIEN faire ici — elle anticipe le seuil avant de dépasser, pas après. Seule solution : réduire la taille du prompt avant envoi (tronquer, résumer manuellement, découper en plusieurs appels).
Repère pratique
Un livre standard (80-120k mots ≈ 100-160K tokens) passe généralement dans 200K. Attention aux gros ouvrages, PDF scannés, ou cumul avec beaucoup d’autre contexte.