Construindo um Pipeline de Web Scraping Escalável e Custo-Efetivo
Nesta sessão ao vivo, mergulhamos fundo no design de um pipeline de web scraping e extração de dados escalável e eficiente em termos de custo usando a API Zyte, AWS Lambda, Step Functions e LLMs.
🌱 Você aprenderá como:
- Usar a API Zyte e funções Lambda para scraping em larga escala (mais de 10.000 páginas/dia)
- Otimizar custo e computação com processamento em lote e concorrência
- Aplicar scripts de limpeza para reduzir o tamanho dos tokens para LLMs
- Executar a lógica de extração de forma eficiente com modelos de código aberto ou pagos
- Lidar com alucinações, tentativas e verificações de QA para saídas confiáveis
- Construir um fluxo de trabalho pronto para produção com orquestração da AWS
⚠️ Aviso: Sempre verifique os Termos de Serviço de um site e o robots.txt antes de fazer scraping. Este conteúdo é educacional, use eticamente!
Uma comunidade vibrante de mais de 20 mil entusiastas de web scraping, comprometidos em compartilhar insights, aprender e explorar novas tecnologias, e avançar no web scraping.
#awslambda #llm #engenhariadedados #ia #python #StepFunctions #zyteapi #computacaonuvem #aprendizado de máquina #datapipeline #bigdata