le même registre. Cependant, cette idée
montre rapidement ses limites pour plu -
sieurs raisons.
Tout d'abord , un co urri er normal peut
très bien uti I iser ces mots et vous ri squez de les é liminer automatiquement.
Ensuite , ce rtain s po urri e ls ne les utiI isent pas. D ' a utre part , il s uffit de
changer « v ia gra » e n « Via g r a » ,
« VI4GR4 » o u « YIAGRA » pour
conto urne r la difficulté.
Des filtres plus développés ont été mi s
au point pour tenir compte de ces problèmes. Cependant , les tec hniqu es
em ployées par les aute urs de pourriels
évo lue nt sa ns cesse, ce qui nécess ite
une mise à jour permanente des règles
emp lo yées. Et bien qu e ces règ les
so ie nt très efficaces pour se d é barrasser d ' une bonne parti e du spam , le
filtrage des messages restants es t souvent très difficile.
Est-il si diffic ile de distinguer les pourriels des vrais messages ? Po ur un être
hum a in e n ayant déjà reçu quelquesun s, un coup d' œ il suffit. Ce n'est pas
la présence d ' un mot particulier qui les
rend fac ile à identifi er, mai s plutôt l'acc umul ati o n de mot s dan s un mê me
registre. Dans le cas des pourriel s , il
s'agi t souve nt du reg istre pornographique. La différence entre un texte normal même très vulgaire sur le sujet et un
pourriel est l' accumulation . Mê me de
mauvaise qualité , un texte normal respecte certaines contraintes littéraires .
À ! ' heure ac tuelle , les log iciel s les plus
performants se fondent sur ce constat.
Il faut anal y er les mots dans leur contexte
pour savoir si un message est du spam
ou non. La lecture de tous les mots du
message permet en effet d 'avoir une vue
plus globale de son contenu et donc de
sa nature . Pour cela, chaque mot reçoit
une probabilité: celle qu'il fi gure dans
un spam . Lors de l'arrivée d'un mesPOUR L'INFORMATIQUE
sage, tou s ses mots sont lu s ; il est ainsi
transformé en un e nsembl e de probabilités. Ces probabilités sont combinées
pour donner un indi ce indiquant la probabilité que le message so it du spam ou
non. Comme ce calcul de probabilités fait
appel au théorè me de Bayes, ces filtres
sont appel és filtres bayésiens.
Pour calculer la probabilité qu ' un mot
apparai sse dans un pourriel , rien de très
difficile : pre nez un gra nd nombre de
pourriel s, utili sez un log iciel pour trier
les mot s s ' y trouvant e t co mptez le
nombre d 'occurrences de chacun. Faites
la mê me chose avec un ensemble de
message n' étant pas du spam (vos messages personnel s par exemple) et vous
obtenez, pour chaque mot , la probabilité qu ' il apparai sse dans un pourriel et
la probabilité qu'il apparaisse dans un
message norma l. Après l'analyse d ' un
message , vous pouvez , en multipliant
les probabilités que chaque mot apparaisse
dans un pourriel , en déduire la probabilité
que l' e nsemble des mots du message
apparaissent dans un pourriel . Mais attention , la probabilité que l'ensemble des
mots d ' un message apparaissent dans
un pourriel n 'est pas égal à la probabilité que cet ensemble de mots forme un
pourriel !
Appelons P(S) la probabilité qu ' un message soit du spam. Pour chaque mot M ,
il est facile de calculer la probabilité
conditionnelle P(M I S) que le mot M
apparaisse dans un message de spam. Il
est donc facile d 'en déduire la probabilité
qu ' un ensemble de mots M; formant un
courrier électronique C apparaissent
dans du spam :
P(C I S) =IJ P(M; 1 S)
Par contre, pour connaître P(S I C),
c'est-à-dire la probabilité que ce message soit effectivement du spam, il est
indiqué d ' utiliser le théorème de Bayes .
Hor ~ene n 52. Math mat1ques & informatique Tangente
montre rapidement ses limites pour plu -
sieurs raisons.
Tout d'abord , un co urri er normal peut
très bien uti I iser ces mots et vous ri squez de les é liminer automatiquement.
Ensuite , ce rtain s po urri e ls ne les utiI isent pas. D ' a utre part , il s uffit de
changer « v ia gra » e n « Via g r a » ,
« VI4GR4 » o u « YIAGRA » pour
conto urne r la difficulté.
Des filtres plus développés ont été mi s
au point pour tenir compte de ces problèmes. Cependant , les tec hniqu es
em ployées par les aute urs de pourriels
évo lue nt sa ns cesse, ce qui nécess ite
une mise à jour permanente des règles
emp lo yées. Et bien qu e ces règ les
so ie nt très efficaces pour se d é barrasser d ' une bonne parti e du spam , le
filtrage des messages restants es t souvent très difficile.
Est-il si diffic ile de distinguer les pourriels des vrais messages ? Po ur un être
hum a in e n ayant déjà reçu quelquesun s, un coup d' œ il suffit. Ce n'est pas
la présence d ' un mot particulier qui les
rend fac ile à identifi er, mai s plutôt l'acc umul ati o n de mot s dan s un mê me
registre. Dans le cas des pourriel s , il
s'agi t souve nt du reg istre pornographique. La différence entre un texte normal même très vulgaire sur le sujet et un
pourriel est l' accumulation . Mê me de
mauvaise qualité , un texte normal respecte certaines contraintes littéraires .
À ! ' heure ac tuelle , les log iciel s les plus
performants se fondent sur ce constat.
Il faut anal y er les mots dans leur contexte
pour savoir si un message est du spam
ou non. La lecture de tous les mots du
message permet en effet d 'avoir une vue
plus globale de son contenu et donc de
sa nature . Pour cela, chaque mot reçoit
une probabilité: celle qu'il fi gure dans
un spam . Lors de l'arrivée d'un mesPOUR L'INFORMATIQUE
sage, tou s ses mots sont lu s ; il est ainsi
transformé en un e nsembl e de probabilités. Ces probabilités sont combinées
pour donner un indi ce indiquant la probabilité que le message so it du spam ou
non. Comme ce calcul de probabilités fait
appel au théorè me de Bayes, ces filtres
sont appel és filtres bayésiens.
Pour calculer la probabilité qu ' un mot
apparai sse dans un pourriel , rien de très
difficile : pre nez un gra nd nombre de
pourriel s, utili sez un log iciel pour trier
les mot s s ' y trouvant e t co mptez le
nombre d 'occurrences de chacun. Faites
la mê me chose avec un ensemble de
message n' étant pas du spam (vos messages personnel s par exemple) et vous
obtenez, pour chaque mot , la probabilité qu ' il apparai sse dans un pourriel et
la probabilité qu'il apparaisse dans un
message norma l. Après l'analyse d ' un
message , vous pouvez , en multipliant
les probabilités que chaque mot apparaisse
dans un pourriel , en déduire la probabilité
que l' e nsemble des mots du message
apparaissent dans un pourriel . Mais attention , la probabilité que l'ensemble des
mots d ' un message apparaissent dans
un pourriel n 'est pas égal à la probabilité que cet ensemble de mots forme un
pourriel !
Appelons P(S) la probabilité qu ' un message soit du spam. Pour chaque mot M ,
il est facile de calculer la probabilité
conditionnelle P(M I S) que le mot M
apparaisse dans un message de spam. Il
est donc facile d 'en déduire la probabilité
qu ' un ensemble de mots M; formant un
courrier électronique C apparaissent
dans du spam :
P(C I S) =IJ P(M; 1 S)
Par contre, pour connaître P(S I C),
c'est-à-dire la probabilité que ce message soit effectivement du spam, il est
indiqué d ' utiliser le théorème de Bayes .
Hor ~ene n 52. Math mat1ques & informatique Tangente
