Na Parte 1, construímos um pipeline RAG que recupera o pedaço certo quase sempre. Está correto — e completamente inviável para envio: o exato pipeline que responde perfeitamente no seu notebook responde em 4 segundos e custa $12.000/mês em memória de banco de dados vetorial no momento em que o tráfego real chega.
Esta é a outra metade do RAG em produção: pegar esse mesmo pipeline correto e torná-lo RÁPIDO e BARATO para 10 milhões de documentos. Mesmo diagrama, cada nó, agora otimizado para latência, custos e memória.
Quatro alavancas, mantidas às mesmas três perguntas da Parte 1 (o que quebra sem isso, o que custa, o que você está trocando):
• COMPRIMIR — escalar/int8 (4× memória, ~30% mais rápido, 99,99% de qualidade), quantização binária (32× memória, até 40× mais rápido, oversample+rescore recupera 98–99,7% de recall), quantização de produto, dimensões Matryoshka
• INDEXAR — o triângulo de recall/latência/memória (HNSW M & ef_search, IVF nprobe), e indexação em GPU com NVIDIA cuVS/CAGRA (~12× taxa de indexação)
• CACHE — cache de prompt (−90% de custo, −85% de latência), cache semântico (GPTCache −68,8% de chamadas de API) e sua armadilha de falso positivo
• ESCALAR — agrupamento, concorrência, o gargalo do reranker, pré-filtragem de metadados, sharding & réplicas
Então o loop que conecta tudo: medir P99, rastrear o pipeline, corrigir a etapa que está consumindo seu orçamento, repetir — e saber quando parar.
▶ Assista à Parte 1 primeiro — "RAG: Iniciante a Avançado" — ela constrói o pipeline que este vídeo otimiza.
========================================
CAPÍTULOS
========================================
0:00 Correto, mas inviável para envio
0:39 As quatro alavancas
1:27 Rastrear o orçamento de latência
2:14 Quantização — a barreira de memória
2:56 Escalar / int8
3:34 Quantização binária
4:41 PQ & dimensões Matryoshka
5:39 O triângulo de índice (HNSW/IVF)
6:42 Indexação em GPU (cuVS/CAGRA)
7:35 Introdução ao cache
7:51 Cache de prompt
8:40 Cache semântico
9:36 Agrupamento & concorrência
10:25 Sharding & particionamento
11:14 A matemática do custo
12:05 O loop de otimização
UPI : cybercreed@ibl
🤗🤗
Mídias Sociais: