8
Analyse num´ erique et ´ equations diff´ erentielles
On notera ε = b
1−N cette pr´ ecision relative.
En Langage C standard (ANSI C), les r´ eels peuvent occuper
– pour le type float , 4 octets de m´ emoire, soit 1 bit de signe, 23 bits de mantisse et
8 bits d’exposant (dont un pour le signe de l’exposant). Ceci permet de repr´ esenter
les r´ eels avec une mantisse de 6 ` a 7 chiffres significatifs apr` es la virgule, dans une
´ echelle allant de 2
−128 ` a 2
127 soit environ de 10
−38 = 1 E − 38 `
a 10
38 = 1 E + 38.
La pr´ ecision relative est de l’ordre de 10
−7 .
– pour le type double , 8 octets de m´ emoire, soit 1 bit de signe, 51 bits de
mantisse et 12 bits d’exposant (dont un pour le signe de l’exposant). Ceci permet
de repr´ esenter les r´ eels avec une mantisse de 15 chiffres significatifs apr` es la virgule,
dans une ´ echelle allant de 2
−2048 ` a 2
2047 soit environ de 10
−616 = 1 E − 616 `
a
10
616 = 1 E + 616. La pr´ ecision relative est de l’ordre de 10
−15 .
½º¾º ÆÓÒ¹¹××ÓÓÓÓØØÚÚØ × ÓÔ ÖÖØØÓÒ× ÖÖØØÑ ØØÕÙÙ×
Supposons par exemple que les r´ eels soient calcul´ ees avec 3 chiffres significatifs et
arrondis `
a la d´ ecimale la plus proche. Soit `
a calculer la somme x + y + z avec
x = 8, 22, y = 0, 00317, z = 0, 00432
(x + y) + z donne : x + y = 8, 22317 8, 22
(x + y) + z 8, 22432 8, 22
x + (y + z) donne : y + z = 0, 00749
x + (y + z) = 8, 22749 8, 23.
L’addition est donc non associative par suite des erreurs d’arrondi !
½º¿º ÖÖÖÙÖ ³³ÖÖÓÒÒÒ ×ÙÖ ÙÒÒ ×ÓÑÑÑ
On se propose d’´ etudier quelques m´ ethodes permettant de majorer les erreurs
d’arrondi dues aux op´ erations arithm´ etiques.
Soient x, y des nombres r´ eels suppos´ es repr´ esent´ es sans erreur avec N chiffres
significatifs :
x = 0, a 1 a 2 . . . a N · b
p , b
−1+p
≤ x < b
p
y = 0, a
1 a
2 . . . a
N · b
q , b
−1+q
≤ y < b
q
Notons ∆(x + y) l’erreur d’arrondi commise sur le calcul de x + y. Supposons par
exemple p ≥ q. S’il n’y a pas d´ ebordement, c’est-` a-dire si x + y < b
p , le calcul de
x + y s’accompagne d’une perte des p − q derniers chiffres de y correspondant aux
puissances b
−k+q < b
−N +p ; donc ∆(x + y) ≤ b
−N +p , alors que x + y ≥ x ≥ b
−1+p .
En cas de d´ ebordement x + y ≥ b
p (ce qui se produit par exemple si p = q et
a 1 + a
1 ≥ b), la d´ ecimale correspondant ` a la puissance b
−N +p est elle aussi perdue,
d’o` u ∆(x + y) ≤ b
1−N +p . Dans les deux cas :
∆(x + y) ≤ ε(|x| + |y|),
o` u ε = b
1−N est la pr´ ecision relative d´ ecrite au §1.1. Ceci reste vrai quel que soit le
signe des nombres x et y.
Précédent

- 10/345

Suivant