1. GÉNÉRALITÉSSUR LE CALCUL NUMÉRIQUE
b - Précision de la représentation - La troncature du nombre porte sur la mantisse seulement. Dans le cas le plus défavorable on aura négligé une suite infinie de F en notation
hexadécimale (ce serait une suite infinie de 9 en notation décimale, ou une suite infinie de
1 en notation binaire). Toujours est-il que cette suite infinie, quelle que soit sa base, a pour
limite l’unité, et par conséquent, représente une erreur absolue de 1 unité sur le dernier chiffre
significatif de la mantisse du nombre stocké; autrement dit, on aura une erreur absolue de 1
unité sur la mantisse considérée comme un nombre entier. Cette façon de concevoir n’est pas
toujours la mieux adaptée au calcul des erreurs, aussi préfère-t-on raisonner en terme d’erreur
relative sur la représentation du nombre, qui se réduit à l’erreur relative sur la mantisse :
1
e, = mantisse
Ici encore le cas le plus défavorable se rencontre lorsque la mantisse est la plus petite possible.
Puisque la représentation est hexadécimale et normalisée, la plus petite mantisse vaut 16”, il
s’ensuit que l’erreur relative la plus défavorable vaut :
e, = 9,54 10e7,
soit environ 1OW.
Compte tenu de la présence d’un digit supplémentaire utilisé en mémoire centrale lors de
l’exécution, on ne réalise pas des troncatures mais des arrondis ce qui a pour conséquence de
diviser les erreurs par deux, soit :
e, = 0,5 10Vj.
Ce type de représentation permet d’obtenir une dynamique s’étendant de 10V78 à 10-75
approximativement.
Il existe également une double précision qui occupe huit octets. Les quatre octets supplémentaires sont uniquement affectés à la mantisse. La dynamique n’est pas affectée tandis que la
précision relative de la représentation est passée à 10-16 environ.
c - Représentation usuelle des nombres flottants dans les Basics - La plupart du temps
la représentation s’effectue sur 5 octets et la base implicite est 2. Cette conception conduit,
comme on va le voir, à une précision plus grande mais aussi à une dynamique plus faible que
celle précédemment étudiée.
L’octet 1 est utilisé pour représenter l’exposant tandis que les 4 derniers octets servent au
stockage de la mantisse. Comme le nombre est normalisé en notation binaire, le premier bit
de l’octet 2 est inévitablement 1. Cela constitue une information sans grand intérêt et certains
constructeurs utilisent ce bit pour y stocker le signe du nombre, soit 0 si le nombre est positif
et 1 si le nombre est négatif. Le premier octet permet de représenter 256 configurations qui se
décomposent de la façon suivante : les exposants négatifs ou nuls sont représentés de 0 à 127 et
les exposants positifs de 128 à 255. La précision relative est majorée par :
e, = 1/231 = 4,710V10.
Le plus petit nombre représentable est de l’ordre de 10V3’, tandis que le plus grand est de
l’ordre de 1038.
29
b - Précision de la représentation - La troncature du nombre porte sur la mantisse seulement. Dans le cas le plus défavorable on aura négligé une suite infinie de F en notation
hexadécimale (ce serait une suite infinie de 9 en notation décimale, ou une suite infinie de
1 en notation binaire). Toujours est-il que cette suite infinie, quelle que soit sa base, a pour
limite l’unité, et par conséquent, représente une erreur absolue de 1 unité sur le dernier chiffre
significatif de la mantisse du nombre stocké; autrement dit, on aura une erreur absolue de 1
unité sur la mantisse considérée comme un nombre entier. Cette façon de concevoir n’est pas
toujours la mieux adaptée au calcul des erreurs, aussi préfère-t-on raisonner en terme d’erreur
relative sur la représentation du nombre, qui se réduit à l’erreur relative sur la mantisse :
1
e, = mantisse
Ici encore le cas le plus défavorable se rencontre lorsque la mantisse est la plus petite possible.
Puisque la représentation est hexadécimale et normalisée, la plus petite mantisse vaut 16”, il
s’ensuit que l’erreur relative la plus défavorable vaut :
e, = 9,54 10e7,
soit environ 1OW.
Compte tenu de la présence d’un digit supplémentaire utilisé en mémoire centrale lors de
l’exécution, on ne réalise pas des troncatures mais des arrondis ce qui a pour conséquence de
diviser les erreurs par deux, soit :
e, = 0,5 10Vj.
Ce type de représentation permet d’obtenir une dynamique s’étendant de 10V78 à 10-75
approximativement.
Il existe également une double précision qui occupe huit octets. Les quatre octets supplémentaires sont uniquement affectés à la mantisse. La dynamique n’est pas affectée tandis que la
précision relative de la représentation est passée à 10-16 environ.
c - Représentation usuelle des nombres flottants dans les Basics - La plupart du temps
la représentation s’effectue sur 5 octets et la base implicite est 2. Cette conception conduit,
comme on va le voir, à une précision plus grande mais aussi à une dynamique plus faible que
celle précédemment étudiée.
L’octet 1 est utilisé pour représenter l’exposant tandis que les 4 derniers octets servent au
stockage de la mantisse. Comme le nombre est normalisé en notation binaire, le premier bit
de l’octet 2 est inévitablement 1. Cela constitue une information sans grand intérêt et certains
constructeurs utilisent ce bit pour y stocker le signe du nombre, soit 0 si le nombre est positif
et 1 si le nombre est négatif. Le premier octet permet de représenter 256 configurations qui se
décomposent de la façon suivante : les exposants négatifs ou nuls sont représentés de 0 à 127 et
les exposants positifs de 128 à 255. La précision relative est majorée par :
e, = 1/231 = 4,710V10.
Le plus petit nombre représentable est de l’ordre de 10V3’, tandis que le plus grand est de
l’ordre de 1038.
29
