Kapitel 8. Batch -Feature-Pipelines
Diese Arbeit wurde mithilfe von KI übersetzt. Wir freuen uns über dein Feedback und deine Kommentare: translation-feedback@oreilly.com
In den letzten beiden Kapiteln haben wir uns angesehen, wie man Datentransformationen umsetzt, um wiederverwendbare Features und modellspezifische Features zu erstellen. Jetzt schauen wir uns an, wie man die Erstellung wiederverwendbarer Feature-Daten mithilfe von Batch-Feature-Pipelines in die Produktion überführt. Eine Batch-Feature-Pipeline ist ein Programm, das Daten aus Datenquellen liest, MITs auf die extrahierten Daten anwendet und die berechneten Feature-Daten im Feature-Speicher ablegt. Die Batch-Feature-Pipeline kann nach einem Zeitplan ausgeführt werden, zum Beispiel einmal pro Stunde oder Tag, und neue Daten schrittweise verarbeiten, sobald sie für die Verarbeitung verfügbar sind. Sie kann auch bei Bedarf ausgeführt werden, um große Mengen historischer Daten in Features umzuwandeln, ein Prozess, der als Backfilling bezeichnet wird.
Das Ziel einer Batch-Feature-Pipeline ist es, die Erstellung von Features in einer sogenannten Batch-Verarbeitung zu automatisieren, die im Vergleich zur Verarbeitung einzelner Datensätze ressourceneffizienter ist. Stell dir zum Beispiel vor, du vergleichst die Zeit, die benötigt wird, um einen Geschirrspüler Glas für Glas oder Teller für Teller zu leeren, mit dem Entladen von ganzen Chargen von Tellern und Gläsern. Ähnlich verhält es sich bei der Datenverarbeitung: Die ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access