Chapitre 9. L'analyse des données génomiqueset le projet BDG
L'avènement de la technologie de séquençage de l'ADN de nouvelle génération (NGS) a rapidement transformé les sciences de la vie en un domaine axé sur les données. Cependant, l'utilisation optimale de ces données se heurte à un écosystème informatique traditionnel qui repose sur des primitives de bas niveau difficiles à utiliser pour l'informatique distribuée et sur une jungle de formats de fichiers textuels semi-structurés.
Ce chapitre a deux objectifs principaux. Tout d'abord, nous présentons un ensemble de formats de sérialisation et de fichiers populaires (Avro et Parquet) qui simplifient de nombreux problèmes de gestion des données. Ces technologies de sérialisation nous permettent de convertir les données en représentations binaires compactes et adaptées aux machines. Cela facilite le déplacement des données sur les réseaux et aide à la compatibilité croisée entre les langages de programmation. Bien que nous utilisions les techniques de sérialisation des données avec les données génomiques, les concepts seront utiles chaque fois que nous traiterons de grandes quantités de données.
Deuxièmement, nous montrons comment effectuer des tâches génomiques typiques sur dans l'écosystème PySpark. Plus précisément, nous utiliserons PySpark et la bibliothèque open source ADAM pour manipuler de ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access