In dieser Präsentation werden wir die Grundlagen der Indexierungspipeline der LinkedIn-Suchmaschine behandeln, wobei der Fokus darauf liegt, wie wir Kafka und Samza nutzen, um über 10.000 Ereignisse pro Sekunde an Echtzeit-Updates zu verarbeiten. Darüber hinaus werden wir untersuchen, wie wir das System sowohl flexibel als auch horizontal skalierbar gemacht haben; unsere Pipeline akzeptiert verschiedene Eingabesystemströme und unterstützt sowohl vollständige als auch partielle Dokumentenaktualisierungen, bleibt jedoch unabhängig von der Art des Dokuments (z. B. Mitgliederprofil, Stellenanzeige oder Unternehmensseite).