claude api optimisation

Mise en cache des prompts (prompt caching)

Optimisation de coût et de latence côté API — n’a aucun effet sur la taille de la fenêtre-de-contexte.

Principe

Quand plusieurs requêtes partagent un long préfixe identique (instructions système, gros document, exemples few-shot), on le marque avec cache_control. L’API le garde en mémoire ; les requêtes suivantes avec le même préfixe exact évitent de le retraiter.

Bénéfices

  • Tokens en cache : ~90% moins chers
  • Latence de réponse réduite (jusqu’à ~85% sur prompts longs)
  • Permet d’inclure plus de contexte/exemples sans pénalité

Durée de vie

  • 5 min (standard) ou 1h (étendu) après la dernière utilisation
  • Cache invalidé si le contenu en amont change (hiérarchie : tools → system → messages)
  • Matching exact requis (texte + images identiques jusqu’au point de coupure)

Lien avec la compaction

Se combine bien avec la compaction-serveur-api : on peut cacher séparément le system prompt et le résumé généré, pour éviter de tout réécrire en cache à chaque compaction.

Voir aussi