Nesta apresentação, abordaremos os fundamentos do pipeline de indexação do mecanismo de busca do LinkedIn, focando em como utilizamos Kafka e Samza para processar mais de 10 mil eventos por segundo de atualizações em tempo real. Além disso, examinaremos como tornamos o sistema flexível e escalável horizontalmente; nosso pipeline aceita diferentes fluxos de sistemas de entrada e suporta tanto atualizações de documentos completos quanto parciais, mas permanece agnóstico ao tipo de documento (por exemplo, perfil de membro, vaga de emprego ou página de empresa).