En esta presentación, cubriremos los conceptos básicos del pipeline de indexación del motor de búsqueda de LinkedIn, centrándonos en cómo aprovechamos Kafka y Samza para ingerir más de 10,000 eventos por segundo de actualizaciones en tiempo real. Además, examinaremos cómo hicimos que el sistema fuera tanto flexible como escalable horizontalmente; nuestro pipeline acepta diferentes flujos de sistemas de entrada y soporta tanto actualizaciones de documentos completas como parciales, pero sigue siendo agnóstico al tipo de documento (por ejemplo, perfil de miembro, publicación de trabajo o página de empresa).