En la Parte 1 construimos un pipeline de RAG que recupera el fragmento correcto casi siempre. Es correcto — y completamente inenvió: el pipeline exacto que responde perfectamente en tu cuaderno responde en 4 segundos y te cobra $12,000/mes en memoria de base de datos vectorial en el momento en que el tráfico real llega.
Esta es la otra mitad del RAG en producción: tomar ese mismo pipeline correcto y hacerlo RÁPIDO y BARATO para 10 millones de documentos. Mismo diagrama, cada nodo, ahora optimizado para latencia, dólares y memoria.
Cuatro palancas, sujetas a las mismas tres preguntas que en la Parte 1 (qué se rompe sin ello, cuánto cuesta, qué estás intercambiando):
• COMPRIMIR — escalar/int8 (4× memoria, ~30% más rápido, 99.99% calidad), cuantización binaria (32× memoria, hasta 40× más rápido, sobre-muestreo+recalificación recupera 98–99.7% de recuperación), cuantización de productos, dimensiones Matryoshka
• INDEXAR — el triángulo de recuperación/latencia/memoria (HNSW M & ef_search, IVF nprobe), y indexación GPU con NVIDIA cuVS/CAGRA (~12× rendimiento de indexación)
• CACHE — caché de prompts (−90% costo, −85% latencia), caché semántico (GPTCache −68.8% llamadas a la API) y su trampa de falsos positivos
• ESCALAR — agrupamiento, concurrencia, el cuello de botella del reranker, pre-filtrado de metadatos, fragmentación y réplicas
Luego el ciclo que lo une todo: medir P99, trazar el pipeline, arreglar la etapa que consume tu presupuesto, repetir — y saber cuándo detenerse.
▶ Mira primero la Parte 1 — "RAG: De Principiante a Avanzado" — construye el pipeline que este video optimiza.
========================================
CAPÍTULOS
========================================
0:00 Correcto, pero inenvió
0:39 Las cuatro palancas
1:27 Traza el presupuesto de latencia
2:14 Cuantización — la pared de memoria
2:56 Escalar / int8
3:34 Cuantización binaria
4:41 PQ & dimensiones Matryoshka
5:39 El triángulo de índice (HNSW/IVF)
6:42 Indexación GPU (cuVS/CAGRA)
7:35 Introducción a la caché
7:51 Caché de prompts
8:40 Caché semántico
9:36 Agrupamiento y concurrencia
10:25 Fragmentación y particionamiento
11:14 Las matemáticas del costo
12:05 El ciclo de optimización
UPI : cybercreed@ibl
🤗🤗
Redes Sociales: