184 jours chez OpenAI, 61 chez Anthropic, 92 pour un variant Codex. Le préavis de retrait est une clause contractuelle, et vos équipes la subissent.
GPT-5.6 et Kimi K3 généralisent le contexte à 1M tokens. Coût, recall et architecture hybride : ce qui doit vraiment changer dans votre RAG.
Les dépenses LLM enterprise ont doublé en 6 mois. Caching sémantique, routing et quantization peuvent les réduire de 60% sans toucher à la qualité.
Un agent en boucle longue peut multiplier vos coûts d'inférence. Quatre leviers concrets pour reprendre le contrôle du budget token en production.