¿Cómo diseñas un rastreador web masivamente escalable capaz de procesar 10 mil millones de páginas web en solo cinco días, manteniendo la cortesía, la tolerancia a fallos y la eficiencia? En este video, desglosamos un problema real de diseño de sistemas enfocado en construir un rastreador web específicamente para entrenar Modelos de Lenguaje Grandes (LLMs).
Recorremos una arquitectura de grado de producción utilizando un pipeline de múltiples etapas impulsado por rastreadores distribuidos, colas SQS y almacenamiento en blobs S3 para manejar escalas y rendimientos extremos. Aprenderás a gestionar la programación de rastreos, la deduplicación y la recuperación de fallos mientras respetas los estándares web.
Los puntos clave incluyen:
Cumplimiento de robots.txt y cortesía en el rastreo
Limitación de tasa con jitter para evitar sobrecargar los hosts
Manejo de cuellos de botella DNS a gran escala
Diseño de pipelines de rastreo tolerantes a fallos
Optimización del almacenamiento y flujo de datos para conjuntos de datos de entrenamiento de LLM
También comparamos las expectativas de entrevistas de diseño de sistemas entre ingenieros de nivel medio, senior y staff, ayudándote a entender cuánta profundidad arquitectónica y análisis de compensaciones esperan los entrevistadores en cada nivel.
Este es un video imprescindible para ingenieros que se preparan para entrevistas de infraestructura de LLM, backend o diseño de sistemas a gran escala.
👍 ¡Dale like, 🔔 suscríbete y 📤 comparte para más desgloses de entrevistas de diseño de sistemas!
#diseñodesistemas #entrevistadediseñodesistemas #rastreadorweb #rastreadordistribuido #infraestructurallm #modelosdelenguajeg grandes #infraestructuraia #ingenieríadebackend #ingenieríadesoftware #sistemasdistribuidos
#sistemasescalables #bigdata #pipelinesdedatos #toleranciaafallos #altorendimiento #bajolatencia #arquitecturadecloud #aws #sqs #s3
#trabajadoresdistribuidos #pipeline de rastreo #robotsdotxt #políticadecortesía #limitacióndetasa #jitter #dns #cuellodebotelladns #recoleccióndedatos #webscraping
#deduplicacióndedatos #colasderastreo #fronteradeurl #programador #arquitecturadealmacenamiento #almacenamientoenblobs #arquitecturadeeventos #procesamientodeflujos #procesamientoporlotes #arquitecturadesistemas
#arquitecturadebackend #microservicios #diseñodeingeniería #entrevistasdetecnología #entrevistafaang #preparaciónparaintervistas #ingenierodenivelmedio #ingenierosenior #ingenierostaff #compensacionesdiseño
#sistemasfiables #ingenieríadeproducción #estrategiasecalado #entrenamientolm #pipelinesia #infraestructuraML #carrerasdeingeniería #cienciascomputacionales #sistemasdelmundo real