Mise en cache des prompts (prompt caching)
Optimisation de coût et de latence côté API — n’a aucun effet sur la taille de la fenêtre-de-contexte.
Principe
Quand plusieurs requêtes partagent un long préfixe identique (instructions système, gros document, exemples few-shot), on le marque avec cache_control. L’API le garde en mémoire ; les requêtes suivantes avec le même préfixe exact évitent de le retraiter.
Bénéfices
- Tokens en cache : ~90% moins chers
- Latence de réponse réduite (jusqu’à ~85% sur prompts longs)
- Permet d’inclure plus de contexte/exemples sans pénalité
Durée de vie
- 5 min (standard) ou 1h (étendu) après la dernière utilisation
- Cache invalidé si le contenu en amont change (hiérarchie : tools → system → messages)
- Matching exact requis (texte + images identiques jusqu’au point de coupure)
Lien avec la compaction
Se combine bien avec la compaction-serveur-api : on peut cacher séparément le system prompt et le résumé généré, pour éviter de tout réécrire en cache à chaque compaction.