Diseño de aplicaciones con uso intensivo de datos, 2nd Edición
by Martin Kleppmann, Chris Riccomini
capítulo 11. Procesamiento por lotes
Un sistema no puede tener éxito si está demasiado influenciado por una sola persona. Una vez que el diseño inicial está completo y es bastante robusto, comienza la prueba real, ya que personas con muchos puntos de vista diferentes llevan a cabo sus propios experimentos.
Donald Knuth, “The Errors of TeX” (1989)
Hasta ahora, gran parte de este libro ha tratado sobre solicitudes y consultas y las respuestas o resultados correspondientes. Este estilo de procesamiento de datos se da por sentado en muchos sistemas de datos modernos: tú solicitas algo o envías una instrucción, y el sistema intenta darte una respuesta lo más rápido posible.
Un navegador web que solicita una página, un servicio que llama a una API remota, bases de datos, cachés, índices de búsqueda y muchos otros sistemas funcionan de esta manera. A estos los llamamos sistemas en línea. El tiempo de respuesta suele ser su principal medida de rendimiento y, a menudo, requieren tolerancia a fallos para garantizar una alta disponibilidad.
Sin embargo, a veces necesitas realizar un cálculo más grande o procesar cantidades de datos mayores de las que puedes hacer en una solicitud interactiva. Quizás necesites entrenar un modelo de IA, transformar muchos datos de un formato a otro o calcular análisis sobre un conjunto de datos muy grande. A estas tareas las llamamos trabajos de procesamiento por lotes, y los sistemas que las gestionan se denominan a veces sistemas fuera de línea
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access