Fenêtres de 1M tokens : faut-il repenser votre architecture RAG ? 24 juil. 2026 6 min read Contexte long GPT-5.6 et Kimi K3 généralisent le contexte à 1M tokens. Coût, recall et architecture hybride : ce qui doit vraiment changer dans votre RAG.