Dans la Partie 1, nous avons construit un pipeline RAG qui récupère le bon morceau presque à chaque fois. C'est correct — et complètement non expédiable : le pipeline exact qui répond parfaitement dans votre notebook répond en 4 secondes et vous facture 12 000 $/mois en mémoire de base de données vectorielle dès que le trafic réel arrive.
C'est l'autre moitié du RAG en production : prendre ce même pipeline correct et le rendre RAPIDE et ÉCONOMIQUE à 10 millions de documents. Même diagramme, chaque nœud, maintenant optimisé pour la latence, les dollars et la mémoire.
Quatre leviers, soumis aux mêmes trois questions que la Partie 1 (ce qui casse sans cela, ce que cela coûte, ce que vous échangez) :
• COMPRESSER — scalaire/int8 (4× mémoire, ~30 % plus rapide, 99,99 % de qualité), quantification binaire (32× mémoire, jusqu'à 40× plus rapide, suréchantillonnage+re-scoring récupère 98–99,7 % de rappel), quantification de produit, dimensions Matryoshka
• INDEXER — le triangle rappel/latence/mémoire (HNSW M & ef_search, IVF nprobe), et indexation GPU avec NVIDIA cuVS/CAGRA (~12× débit d'indexation)
• METTRE EN CACHE — mise en cache des invites (−90 % de coût, −85 % de latence), mise en cache sémantique (GPTCache −68,8 % d'appels API) et son piège à faux positifs
• ÉCHELONNER — traitement par lots, concurrence, goulet d'étranglement du reranker, pré-filtrage des métadonnées, sharding & réplicas
Puis la boucle qui relie le tout : mesurer P99, tracer le pipeline, corriger l'étape qui consomme votre budget, répéter — et savoir quand s'arrêter.
▶ Regardez d'abord la Partie 1 — "RAG : Débutant à Avancé" — elle construit le pipeline que cette vidéo optimise.
========================================
CHAPITRES
========================================
0:00 Correct, mais non expédiable
0:39 Les quatre leviers
1:27 Tracer le budget de latence
2:14 Quantification — le mur de la mémoire
2:56 Scalaire / int8
3:34 Quantification binaire
4:41 PQ & dimensions Matryoshka
5:39 Le triangle d'index (HNSW/IVF)
6:42 Indexation GPU (cuVS/CAGRA)
7:35 Introduction à la mise en cache
7:51 Mise en cache des invites
8:40 Mise en cache sémantique
9:36 Traitement par lots & concurrence
10:25 Sharding & partitionnement
11:14 Les calculs de coût
12:05 La boucle d'optimisation
UPI : cybercreed@ibl
🤗🤗
Réseaux sociaux :