4.6 Les trois uniques formes de ralentissement
79
4.6 Les trois uniques formes de ralentissement
4.6.1 Introduction
Dans cette section nous allons examiner les vitesses de d´ ecroissance vers 0
de la fonction
β(n) = E
[S n (f ) − S n (f )]
2
1
2
Pour simplifier notre analyse, nous conviendrons que l’individu est initialis´ e
selon la loi η 0 = μ, et la fonction f est choisie telle que
μ(f
2 ) − μ(f )
2 = 1
Ces hypoth` eses permettent les simplifications suivantes
η 0 = μ =⇒ E(f (X n )) = η n (f ) = μ(f ) et E(S n (f )) = S n (f ) = μ(f )
=⇒ E([f (X n )
2
− E(f (X n )
2 )]) = η n (f
2 ) − η n (f )
2 = 1
Dans cette situation, on a donc la formule
β(n) = E
[S n (f ) − μ(f )]
2
1
2 = E
[S n (f ) − S n (f )]
2
1
2
L’objectif de cette section est de d´ emontrer les trois propri´ et´ es suivantes :
1. Lorsque le renforcement est strictement inf´ erieur `
a 1/2, l’individu est plus
souvent tourn´ e vers l’avenir que vers son pass´ e. Dans cette situation, sa vitesse de convergence ` a l’´ equilibre est maximale. Cette derni` ere est donn´ ee
par la vitesse classique de la loi des grands nombres. Autrement dit, nous
avons
<
1
2
=⇒ β(n) cte.
1
√ n
2. Lorsque l’individu subit une fois sur deux l’envie de se retourner sur son
pass´ e, sa vitesse de convergence `
a l’´ equilibre est la mˆ eme que la pr´ ec´ edente,
` a un facteur logarithmique pr` es. Autrement dit, nous avons
=
1
2
=⇒ β(n) cte.
log n
n
Cette correction logarithmique n’est pas tr` es significative. Bien que l’individu se retourne une fois sur deux sur son pass´ e, sa vitesse ` a l’´ equilibre est
` a peu de choses pr` es la mˆ eme que celle qu’il aurait s’il ne subissait aucun
renforcement. On a par exemple pour une dur´ ee d’exploration e
100 ,
n = e
100 =⇒
log n = 10
3. Enfin, lorsque le degr´ e de renforcement est strictement sup´ erieur `
a 1/2,
l’individu est plus souvent attir´ e par ses explorations pass´ ees. Il retourne
79
4.6 Les trois uniques formes de ralentissement
4.6.1 Introduction
Dans cette section nous allons examiner les vitesses de d´ ecroissance vers 0
de la fonction
β(n) = E
[S n (f ) − S n (f )]
2
1
2
Pour simplifier notre analyse, nous conviendrons que l’individu est initialis´ e
selon la loi η 0 = μ, et la fonction f est choisie telle que
μ(f
2 ) − μ(f )
2 = 1
Ces hypoth` eses permettent les simplifications suivantes
η 0 = μ =⇒ E(f (X n )) = η n (f ) = μ(f ) et E(S n (f )) = S n (f ) = μ(f )
=⇒ E([f (X n )
2
− E(f (X n )
2 )]) = η n (f
2 ) − η n (f )
2 = 1
Dans cette situation, on a donc la formule
β(n) = E
[S n (f ) − μ(f )]
2
1
2 = E
[S n (f ) − S n (f )]
2
1
2
L’objectif de cette section est de d´ emontrer les trois propri´ et´ es suivantes :
1. Lorsque le renforcement est strictement inf´ erieur `
a 1/2, l’individu est plus
souvent tourn´ e vers l’avenir que vers son pass´ e. Dans cette situation, sa vitesse de convergence ` a l’´ equilibre est maximale. Cette derni` ere est donn´ ee
par la vitesse classique de la loi des grands nombres. Autrement dit, nous
avons
<
1
2
=⇒ β(n) cte.
1
√ n
2. Lorsque l’individu subit une fois sur deux l’envie de se retourner sur son
pass´ e, sa vitesse de convergence `
a l’´ equilibre est la mˆ eme que la pr´ ec´ edente,
` a un facteur logarithmique pr` es. Autrement dit, nous avons
=
1
2
=⇒ β(n) cte.
log n
n
Cette correction logarithmique n’est pas tr` es significative. Bien que l’individu se retourne une fois sur deux sur son pass´ e, sa vitesse ` a l’´ equilibre est
` a peu de choses pr` es la mˆ eme que celle qu’il aurait s’il ne subissait aucun
renforcement. On a par exemple pour une dur´ ee d’exploration e
100 ,
n = e
100 =⇒
log n = 10
3. Enfin, lorsque le degr´ e de renforcement est strictement sup´ erieur `
a 1/2,
l’individu est plus souvent attir´ e par ses explorations pass´ ees. Il retourne
