Convertisseur texte en binaire

Voyez les bits derrière chaque caractère du texte.

Chaque caractère que vous frappez est stocké en mémoire sous forme de nombres. Ces nombres sont affichés comme binaire (zéros et uns). Une lettre anglaise prend généralement 8 bits. Un émoji en UTF-8 prend 32 bits (4 octets). Voir le binaire derrière le texte vous montre pourquoi certains fichiers sont plus volumineux que d’autres.

Un caractère, huit bits

La lettre ’A’ est le code ASCII 65 en décimal = 01000001 en binaire. Chaque position binaire représente une puissance de 2. 01000001 se lit « 0×128 + 1×64 + 0×32 + 0×16 + 0×8 + 0×4 + 0×2 + 1×1 = 64 + 1 = 65 ». Cela montre pourquoi le binaire est pratique : chaque bit a une place fixe et une valeur définie.

ASCII est un sous-ensemble UTF-8, jusqu’à ce qu’il ne le soit pas

Les caractères ASCII (0-127) prennent 8 bits en UTF-8 : 0 suivi de 7 bits. Les caractères accentués (è, é, ü) prennent 16 bits (2 octets). Les caractères asiatiques prennent 24 bits (3 octets). Les émoji prennent 32 bits (4 octets). Le fichier « café » en UTF-8 pèse donc plus lourd que « cafe » juste à cause du « é ».

Cela explique pourquoi certaines données semblent gonflées quand vous les exportez. Un tweet contenant surtout des caractères ASCII pèse léger. Le même tweet avec des émoji et du chinois pèse cinq fois plus, même s’il a le même nombre de caractères sur l’écran.

Comprendre l’impact de l’encodage sur la taille

  • Un caractère ASCII = 8 bits = 1 octet. Un texte de 100 caractères ASCII = 100 octets.
  • Un caractère accentué en UTF-8 = 16 bits = 2 octets. Un texte français avec accents double quasiment la taille.
  • Un émoji en UTF-8 = 32 bits = 4 octets. Un texte avec beaucoup d’émoji peut être quatre fois plus lourd.
  • C’est pourquoi les développeurs surveillent l’encodage : cela affecte la bande passante et le stockage.

Convertir du texte en binaire à la main

  1. Écrivez votre texte. Prenons « A ».
  2. Trouvez le code ASCII. A = 65.
  3. Convertissez en binaire. 65 = 64 + 1 = 01000001.

Questions sur texte vers binaire

Pourquoi un émoji prend-il tant de bits ?

Les vrais émoji vivent dans les plans Unicode au-delà de 65 536. Pour encoder un nombre si grand, UTF-8 utilise 4 octets (32 bits) : le visage souriant 😀 s’écrit 11110000 10011111 10011000 10000000. Attention, tous les pictogrammes ne sont pas logés à la même enseigne : le cœur ❤ est un symbole plus ancien, resté sous 65 536, et il ne prend que 3 octets (11100010 10011101 10100100). C’est pourquoi les fichiers avec beaucoup d’émoji sont gonflés comparé au texte ASCII pur.

Est-ce que l’UTF-8 gaspille de la place ?

C’est un compromis pratique et étudié. ASCII reste petit (8 bits). Les accents font 16 bits. C’est beaucoup mieux que de forcer chaque caractère à 32 bits, comme le ferait UTF-32, qui gaspillerait de l’espace pour les textes anglais.

Comment je sais combien de bits prend mon texte ?

Comptez les octets (l’outil le montre). Multipliez par 8. Un octet = 8 bits.

Que signifie le « 0 » au début pour les caractères ASCII en UTF-8 ?

C’est un marqueur de préfixe. « 0 » suivi de 7 bits dit « c’est un caractère ASCII simple, seul octet ». « 11 » au début dit « ce caractère occupe plusieurs octets qui suivent ». C’est comment UTF-8 sait combien d’octets lire pour chaque caractère.

Est-ce que tous les textes sont encodés en UTF-8 aujourd’hui ?

Non. Les vieux fichiers peuvent être en Latin-1 ou Windows-1252. Les pages web anciennes en HTML déclaraient l’encodage dans une balise. Mais UTF-8 domine.

Cookie
Nous nous soucions de vos données et aimerions utiliser des cookies pour améliorer votre expérience.