Dans cette présentation, nous aborderons les bases du pipeline d'indexation du moteur de recherche de LinkedIn, en nous concentrant sur la manière dont nous utilisons Kafka et Samza pour ingérer plus de 10 000 événements par seconde de mises à jour en temps réel. De plus, nous examinerons comment nous avons rendu le système à la fois flexible et évolutif horizontalement ; notre pipeline accepte différents flux de systèmes d'entrée et prend en charge à la fois les mises à jour de documents complètes et partielles, tout en restant agnostique au type de document (par exemple, profil de membre, offre d'emploi ou page d'entreprise).