© Dunod – Toute reproduction non autorisée est un délit.
9
2.1 • Les banques de données généralistes
De plus, le volume des données en biologie (en particulier les séquences) croît de
manière exponentielle et double tous les 18 mois imposant au bioinformaticien de
refaire périodiquement les analyses. Cette croissance pourtant déjà considérable est
bien inférieure à celle liée aux séquençages massifs. Tout d’abord, les programmes
de séquençage massif de génomes complets font exploser les volumes acquis. De plus,
les capacités d’obtention de séquences par les nouvelles techniques de séquençage
(NGS ou Next Generation Sequencing) sont telles que les coûts des séquençages ont
été divisés par 10 000 depuis 2008 pour atteindre 1 $ pour 10 Mb séquencés. À titre
de comparaison, en 2001, le coût de 1 Mb était de 8 000 $ ! Les nouvelles méthodes
de séquençages illustrées dans la figure 2.3 présentent des caractéristiques de taille
de séquence, de longueur de lecture (« read »), de temps d’obtention et de degré de
parallélisation différents. Toutes ces méthodes permettent de générer un grand nombre
de fragments de longueur variable selon la technologie qui seront assemblés par bioinformatique pour finalement donner la séquence (cas d’un petit génome) ou pour positionner la séquence sur un génome de référence.
Il faut souligner que ces technologies progressent tant sur le plan de la longueur
des « read » que sur le degré de parallélisation. Les coûts ont aussi chuté au point
que dans un avenir proche, la séquence du génome complet d’un humain coûtera
environ 500 , ce qui ouvre des perspectives de
€
médecine personnalisée mais pose
aussi des questions éthiques importantes. Par ailleurs, de nouvelles approches sont
en cours de développement (Ion Proton ou GridION™) et permettent une miniaturisation encore plus grande du système (MinIOn USB) et une parallélisation par empilement des unités (comme pour les calculateurs). Dans cette course aux génomes, il
ne faut pas perdre de vue que séquencer n’est pas déchiffrer.
Par ailleurs, la sémantique et la représentation d’un concept ou d’une notion
varient selon la culture scientifique, ce qui est une difficulté pour une interdiscipline.
Figure 2.3 – Next Generation Sequencing (NGS).
9
2.1 • Les banques de données généralistes
De plus, le volume des données en biologie (en particulier les séquences) croît de
manière exponentielle et double tous les 18 mois imposant au bioinformaticien de
refaire périodiquement les analyses. Cette croissance pourtant déjà considérable est
bien inférieure à celle liée aux séquençages massifs. Tout d’abord, les programmes
de séquençage massif de génomes complets font exploser les volumes acquis. De plus,
les capacités d’obtention de séquences par les nouvelles techniques de séquençage
(NGS ou Next Generation Sequencing) sont telles que les coûts des séquençages ont
été divisés par 10 000 depuis 2008 pour atteindre 1 $ pour 10 Mb séquencés. À titre
de comparaison, en 2001, le coût de 1 Mb était de 8 000 $ ! Les nouvelles méthodes
de séquençages illustrées dans la figure 2.3 présentent des caractéristiques de taille
de séquence, de longueur de lecture (« read »), de temps d’obtention et de degré de
parallélisation différents. Toutes ces méthodes permettent de générer un grand nombre
de fragments de longueur variable selon la technologie qui seront assemblés par bioinformatique pour finalement donner la séquence (cas d’un petit génome) ou pour positionner la séquence sur un génome de référence.
Il faut souligner que ces technologies progressent tant sur le plan de la longueur
des « read » que sur le degré de parallélisation. Les coûts ont aussi chuté au point
que dans un avenir proche, la séquence du génome complet d’un humain coûtera
environ 500 , ce qui ouvre des perspectives de
€
médecine personnalisée mais pose
aussi des questions éthiques importantes. Par ailleurs, de nouvelles approches sont
en cours de développement (Ion Proton ou GridION™) et permettent une miniaturisation encore plus grande du système (MinIOn USB) et une parallélisation par empilement des unités (comme pour les calculateurs). Dans cette course aux génomes, il
ne faut pas perdre de vue que séquencer n’est pas déchiffrer.
Par ailleurs, la sémantique et la représentation d’un concept ou d’une notion
varient selon la culture scientifique, ce qui est une difficulté pour une interdiscipline.
Figure 2.3 – Next Generation Sequencing (NGS).
