4.1 Mod` eles de renforcement
69
Les transitions al´ eatoires X n−1 X n s’expriment sous la forme suivante
P(X n ∈ dx | X n−1 ) = M m(Xn−1) (X n−1 , dx)
o` u m (X n−1 ) d´ esigne la mesure d’occupation du processus historique X n−1
` a l’instant (n − 1)
m (X n−1 ) :=
1
n
n−1
k=0
δ X k
Lorsque les transitions de probabilit´ es M η sont suffisamment r´ eguli` eres, la
mesure d’occupation du marcheur
S n =
1
n
n−1
k=0
δ X k
converge lorsque le temps n tends vers l’infini vers le point fixe μ = μM μ
de l’op´ erateur int´ egral non lin´ eaire d´ ecrit par la formule suivante :
η ∈ P(E) −→ ηM η ∈ P(E)
La mesure de probabilit´ e ηM η sur l’espace d’´ etat E est simplement d´ efinie
par la formule de transport
(ηM η )(dy) =
E
η(dx) M η (x, dy)
Ces mesures d’´ equilibre repr´ esentent la distribution spatiale, en temps
long du marcheur sur l’espace d’´ etat. Ces mesures limites peuvent ˆ etre de
natures tr` es vari´ ees, en fonction du mod` ele physique, ou d’ing´ enierie ´ etudi´ e.
Dans la section 4.2, nous pr´ esenterons une ´ evolution renforc´ ee ´ el´ ementaire
pour laquelle cette mesure limite co¨ ıncide avec la loi uniforme sur un espace
d’´ etat. Dans cet exemple de chaˆ ıne en auto-interaction, nous analyserons la
vitesse avec laquelle la distribution du marcheur converge vers la loi uniforme.
L’objectif de l’individu sera de se d´ efaire des m´ ecanismes de renforcement lui
empˆ echant de visiter tous les sites avec la mˆ eme fr´ equence. Nous montrerons
que notre marcheur subit exactement trois formes de ralentissement, chacune li´ ee au degr´ e de renforcement de l’´ evolution. Ce degr´ e de renforcement
repr´ esente la fr´ equence avec laquelle le marcheur se tourne vers son pass´ e. Les
trois vitesses de convergence `
a l’´ equilibre correspondent aux trois cas o` u l’individu revient sur ses pas avec une fr´ equence ´ egale, sup´ erieure, ou inf´ erieure
` a une sur deux.
69
Les transitions al´ eatoires X n−1 X n s’expriment sous la forme suivante
P(X n ∈ dx | X n−1 ) = M m(Xn−1) (X n−1 , dx)
o` u m (X n−1 ) d´ esigne la mesure d’occupation du processus historique X n−1
` a l’instant (n − 1)
m (X n−1 ) :=
1
n
n−1
k=0
δ X k
Lorsque les transitions de probabilit´ es M η sont suffisamment r´ eguli` eres, la
mesure d’occupation du marcheur
S n =
1
n
n−1
k=0
δ X k
converge lorsque le temps n tends vers l’infini vers le point fixe μ = μM μ
de l’op´ erateur int´ egral non lin´ eaire d´ ecrit par la formule suivante :
η ∈ P(E) −→ ηM η ∈ P(E)
La mesure de probabilit´ e ηM η sur l’espace d’´ etat E est simplement d´ efinie
par la formule de transport
(ηM η )(dy) =
E
η(dx) M η (x, dy)
Ces mesures d’´ equilibre repr´ esentent la distribution spatiale, en temps
long du marcheur sur l’espace d’´ etat. Ces mesures limites peuvent ˆ etre de
natures tr` es vari´ ees, en fonction du mod` ele physique, ou d’ing´ enierie ´ etudi´ e.
Dans la section 4.2, nous pr´ esenterons une ´ evolution renforc´ ee ´ el´ ementaire
pour laquelle cette mesure limite co¨ ıncide avec la loi uniforme sur un espace
d’´ etat. Dans cet exemple de chaˆ ıne en auto-interaction, nous analyserons la
vitesse avec laquelle la distribution du marcheur converge vers la loi uniforme.
L’objectif de l’individu sera de se d´ efaire des m´ ecanismes de renforcement lui
empˆ echant de visiter tous les sites avec la mˆ eme fr´ equence. Nous montrerons
que notre marcheur subit exactement trois formes de ralentissement, chacune li´ ee au degr´ e de renforcement de l’´ evolution. Ce degr´ e de renforcement
repr´ esente la fr´ equence avec laquelle le marcheur se tourne vers son pass´ e. Les
trois vitesses de convergence `
a l’´ equilibre correspondent aux trois cas o` u l’individu revient sur ses pas avec une fr´ equence ´ egale, sup´ erieure, ou inf´ erieure
` a une sur deux.
