In Teil 1 haben wir eine RAG-Pipeline erstellt, die fast immer den richtigen Chunk abruft. Sie ist korrekt — und völlig unversendbar: die genaue Pipeline, die perfekt in Ihrem Notizbuch antwortet, benötigt 4 Sekunden und kostet Sie 12.000 $/Monat für den Speicher der Vektordatenbank, sobald echter Verkehr eintrifft.
Das ist die andere Hälfte des Produktions-RAG: dieselbe korrekte Pipeline zu nehmen und sie SCHNELL und GÜNSTIG bei 10 Millionen Dokumenten zu machen. Dasselbe Diagramm, jeder Knoten, jetzt optimiert für Latenz, Kosten und Speicher.
Vier Hebel, die denselben drei Fragen wie Teil 1 unterliegen (was bricht ohne sie, was kostet es, was tauschen Sie ein):
• KOMPRIMIEREN — scalar/int8 (4× Speicher, ~30% schneller, 99,99% Qualität), binäre Quantisierung (32× Speicher, bis zu 40× schneller, Oversampling+Neubewertung erholt 98–99,7% Rückruf), Produktquantisierung, Matroschka-Dimensionen
• INDEXIEREN — das Rückruf-/Latenz-/Speicher-Dreieck (HNSW M & ef_search, IVF nprobe) und GPU-Indexierung mit NVIDIA cuVS/CAGRA (~12× Indexierungsdurchsatz)
• CACHE — Prompt-Caching (−90% Kosten, −85% Latenz), semantisches Caching (GPTCache −68,8% API-Aufrufe) und seine Fehlalarmfalle
• SKALIEREN — Batching, Parallelität, der Reranker-Flaschenhals, Metadaten-Vorfilterung, Sharding & Replikate
Dann der Loop, der alles zusammenbindet: P99 messen, die Pipeline nachverfolgen, die eine Phase, die Ihr Budget frisst, beheben, wiederholen — und wissen, wann man aufhören sollte.
▶ Sehen Sie sich zuerst Teil 1 an — "RAG: Anfänger bis Fortgeschrittene" — es baut die Pipeline, die dieses Video optimiert.
========================================
KAPITEL
========================================
0:00 Korrekt, aber unversendbar
0:39 Die vier Hebel
1:27 Latenzbudget nachverfolgen
2:14 Quantisierung — die Speichermauer
2:56 Scalar / int8
3:34 Binäre Quantisierung
4:41 PQ & Matroschka-Dimensionen
5:39 Das Index-Dreieck (HNSW/IVF)
6:42 GPU-Indexierung (cuVS/CAGRA)
7:35 Einführung in Caching
7:51 Prompt-Caching
8:40 Semantisches Caching
9:36 Batching & Parallelität
10:25 Sharding & Partitionierung
11:14 Die Kostenrechnung
12:05 Der Optimierungsschleifen
UPI : cybercreed@ibl
🤗🤗
Soziale Medien: