6.4. LA COALESCENCE : DESCRIPTION DES GÉNÉALOGIES
2 1
une loi normale centrée réduite.
Une conséquence immédiate du Théorème 6.4.7 est que que la variable aléatoire
A k
log k
est
un estimateur asymptotiquement normal du paramètre inconnu θ. Nous savons de plus que
sa variance tend très lentement vers 0, à la vitesse de
1
log(k)
. Cela donne une très mauvaise
vitesse de convergence de l’estimateur et nécessite donc de grandes tailles d’échantillons.
Par exemple, si l’on veut estimer θ avec une erreur de 0, 01, on doit utiliser un échantillon
de taille approximativement k = e
100 . (cf. Durrett [31]).
Le dernier résultat de ce chapitre est dû à Ewens (cf. Ewens [34]). Il donne la distribution
complète des allèles dans l’échantillon. Pour j ∈ {1, · · · , k}, appelons N j le nombre d’allèles portés par j individus. Par exemple, N 1 est le nombre d’allèles singletons. Les N j
vérifient en particulier
k
j=1
jN j = k.
(6.4.36)
On a alors le théorème suivant.
Théorème 6.4.9 (Formule d’Ewens). Considérons k entiers n 1 , · · · , n k inférieurs ou
égaux à k avec
k
j=1 jn j = k. Alors on a
P(N 1 = n 1 , · · · , N k = n k ) =
k
j=1
j
j − 1 + θ
θ
j
nj
n j !
=
k!
θ (k)
k
j=1
θ
j
nj
n j !
,
(6.4.37)
où θ (k) = θ(θ + 1) · · · (θ + k − 1).
La formule (6.4.37) s’écrit C k,θ
k
j=1 e
−
θ
j
(
θ
j )
n j
nj !
, où C k,θ est une constante qui dépend de θ
et k, telle que la somme des probabilités vaille 1. La partition allélique a donc même loi que
la distribution de (Y 1 , · · · , Y k ) conditionnellement à
j jY j = k, où les variables aléatoires
Y 1 , · · · , Y j , · · · Y k sont indépendantes et de loi de Poisson de paramètres respectifs
θ
j
. Ce
résultat sera justifié ultérieurement.
Preuve. Il suffit de montrer que la distribution des couleurs dans l’urne de Hoppe au
temps k est donnée par la formule d’Ewens. Nous le montrons par récurrence sur k.
Quand k = 1, la partition N 1 = 1 a la probabilité 1 et le résultat est prouvé. Supposons
maintenant que la propriété soit prouvée pour tout temps inférieur à k − 1. Supposons
qu’au temps k, on ait la distribution N 1 = n 1 , · · · , N k = n k . Notons n = (n 1 , · · · , n k ) et
soit ¯
n l’état de la répartition allélique au temps précédent. Notons
P θ (n) =
k!
θ (k)
k
j=1
θ
j
nj
n j !
.
3
2 1
une loi normale centrée réduite.
Une conséquence immédiate du Théorème 6.4.7 est que que la variable aléatoire
A k
log k
est
un estimateur asymptotiquement normal du paramètre inconnu θ. Nous savons de plus que
sa variance tend très lentement vers 0, à la vitesse de
1
log(k)
. Cela donne une très mauvaise
vitesse de convergence de l’estimateur et nécessite donc de grandes tailles d’échantillons.
Par exemple, si l’on veut estimer θ avec une erreur de 0, 01, on doit utiliser un échantillon
de taille approximativement k = e
100 . (cf. Durrett [31]).
Le dernier résultat de ce chapitre est dû à Ewens (cf. Ewens [34]). Il donne la distribution
complète des allèles dans l’échantillon. Pour j ∈ {1, · · · , k}, appelons N j le nombre d’allèles portés par j individus. Par exemple, N 1 est le nombre d’allèles singletons. Les N j
vérifient en particulier
k
j=1
jN j = k.
(6.4.36)
On a alors le théorème suivant.
Théorème 6.4.9 (Formule d’Ewens). Considérons k entiers n 1 , · · · , n k inférieurs ou
égaux à k avec
k
j=1 jn j = k. Alors on a
P(N 1 = n 1 , · · · , N k = n k ) =
k
j=1
j
j − 1 + θ
θ
j
nj
n j !
=
k!
θ (k)
k
j=1
θ
j
nj
n j !
,
(6.4.37)
où θ (k) = θ(θ + 1) · · · (θ + k − 1).
La formule (6.4.37) s’écrit C k,θ
k
j=1 e
−
θ
j
(
θ
j )
n j
nj !
, où C k,θ est une constante qui dépend de θ
et k, telle que la somme des probabilités vaille 1. La partition allélique a donc même loi que
la distribution de (Y 1 , · · · , Y k ) conditionnellement à
j jY j = k, où les variables aléatoires
Y 1 , · · · , Y j , · · · Y k sont indépendantes et de loi de Poisson de paramètres respectifs
θ
j
. Ce
résultat sera justifié ultérieurement.
Preuve. Il suffit de montrer que la distribution des couleurs dans l’urne de Hoppe au
temps k est donnée par la formule d’Ewens. Nous le montrons par récurrence sur k.
Quand k = 1, la partition N 1 = 1 a la probabilité 1 et le résultat est prouvé. Supposons
maintenant que la propriété soit prouvée pour tout temps inférieur à k − 1. Supposons
qu’au temps k, on ait la distribution N 1 = n 1 , · · · , N k = n k . Notons n = (n 1 , · · · , n k ) et
soit ¯
n l’état de la répartition allélique au temps précédent. Notons
P θ (n) =
k!
θ (k)
k
j=1
θ
j
nj
n j !
.
3
