Référence
Glossaire
Définitions claires des termes employés sur HotSymbol, des points de code aux codes Alt. Chaque entrée renvoie vers sa source principale.
B
- Bloc Unicode
Plage continue et nommée de points de code, comme Arrows (U+2190–U+21FF).
Un bloc est une plage nommée de points de code consécutifs, dont la taille est toujours un multiple de 16, comme Arrows ou Mathematical Operators. Les blocs organisent les tables de codes mais ne constituent pas une classification : un bloc peut réunir des caractères sans lien et une même famille peut être répartie entre plusieurs blocs.
Source : Tables de codes Unicode
C
- Caractère
Unité abstraite d’un texte écrit, indépendante de la façon dont une police la dessine.
Dans Unicode, un caractère est une unité abstraite de texte, comme la lettre A, le chiffre 7 ou la flèche vers la droite. Unicode lui attribue un point de code et un nom, mais pas une apparence. La forme visible est un glyphe fourni par une police.
Source : Glossaire Unicode
- Caractère combinatoire
Marque, comme un accent, qui se combine avec le caractère précédent au lieu d’apparaître seule.
Un caractère combinatoire est affiché avec le caractère de base qui le précède. Par exemple, U+0301 COMBINING ACUTE ACCENT placé après « e » produit « é ». Certaines lettres accentuées possèdent donc deux encodages valides : un point de code précomposé ou une lettre suivie d’une marque combinatoire. La normalisation permet de les comparer.
Source : Glossaire Unicode
- Caractère de liaison sans chasse (ZWJ)
Caractère invisible U+200D qui demande de joindre les caractères voisins, par exemple en un seul emoji.
Le caractère de liaison sans chasse, U+200D, n’a pas d’apparence propre. Placé entre des emoji, il forme une séquence ZWJ que les plateformes compatibles affichent comme une seule image, par exemple une famille ou une profession. Si la séquence n’est pas prise en charge, les emoji apparaissent séparément.
Source : Unicode Technical Standard #51 : séquences emoji ZWJ
- Catégorie générale
Propriété Unicode qui classe chaque caractère, par exemple comme lettre, nombre ou symbole.
La catégorie générale est une propriété Unicode à deux lettres attribuée à chaque point de code. La première indique la grande classe : L pour lettre, N pour nombre, P pour ponctuation, S pour symbole et Z pour séparateur. La seconde précise la sous-classe : Sm est un symbole mathématique, Sc un symbole monétaire et So un autre symbole.
Source : Unicode Standard Annex #44 : valeurs de General Category
- Code Alt
Méthode de saisie Windows qui consiste à maintenir Alt et à taper un nombre sur le pavé numérique.
Un code Alt est une méthode de saisie Windows : maintenez Alt, tapez un nombre décimal sur le pavé numérique, puis relâchez Alt. Les nombres précédés d’un zéro utilisent la page Windows-1252 ; ceux sans zéro initial utilisent une page OEM, souvent la page 437 sur un système américain. Les codes Alt dépendent de la page de codes active et ne couvrent pas la plupart des caractères Unicode.
Source : Tables de correspondance des pages de codes Unicode (Microsoft)
É
- Échappement CSS
Barre oblique inverse suivie d’un point de code hexadécimal pour écrire un caractère en CSS.
En CSS, une barre oblique inverse suivie d’un à six chiffres hexadécimaux représente un caractère par son point de code : \2192 est la flèche vers la droite. Cette syntaxe est surtout employée dans la propriété content de ::before et ::after. Si le caractère suivant est aussi un chiffre hexadécimal, terminez l’échappement par une espace ou utilisez six chiffres.
- Échappement JavaScript
Séquence comme \u2192 ou \u{1F600} qui écrit un caractère dans le code source JavaScript.
Les chaînes JavaScript acceptent des échappements Unicode : \u suivi d’exactement quatre chiffres hexadécimaux pour un caractère du plan multilingue de base, ou \u{…} avec un à six chiffres pour n’importe quel point de code. « \u2192 » et « \u{2192} » produisent tous deux une flèche vers la droite.
E
- Entité HTML
Nom abrégé d’un caractère en HTML, par exemple → pour →.
Une entité HTML, officiellement une référence de caractère nommée, écrit un caractère avec une esperluette, un nom et un point-virgule : © donne © et → donne →. Le standard HTML définit une liste fixe de noms ; la plupart des caractères n’en ont aucun. Une référence numérique fonctionne pour tous les caractères.
G
- Glyphe
Forme visuelle qu’une police emploie pour dessiner un caractère.
Un glyphe est l’image dessinée par une police pour un caractère. Un caractère peut avoir des glyphes différents selon les polices, et une police peut réunir plusieurs caractères dans un seul glyphe. Unicode encode les caractères, pas les glyphes : copier un symbole copie le caractère, dont l’apparence dépend de la police.
Source : Glossaire Unicode
N
- Nom de caractère Unicode
Nom permanent en majuscules attribué par Unicode à un caractère, comme RIGHTWARDS ARROW.
Chaque caractère attribué possède un nom officiel en majuscules, comme RIGHTWARDS ARROW ou EM DASH. Une fois publié, ce nom ne change jamais, même s’il contient une erreur ; une correction est ajoutée sous forme d’alias officiel. HotSymbol peut afficher un nom français plus naturel, tout en conservant le nom officiel sur la fiche.
- Normalisation
Conversion d’un texte vers une forme standard afin que des suites de caractères équivalentes puissent être comparées.
La normalisation Unicode réécrit un texte selon l’une de quatre formes standard. NFC compose les caractères lorsque c’est possible : « e » suivi d’un accent aigu combinatoire devient « é » ; NFD les décompose. NFKC et NFKD remplacent aussi des variantes de compatibilité, comme les chiffres en exposant, par leur forme simple, ce qui peut modifier le sens.
Source : Unicode Standard Annex #15 : formes de normalisation
P
- Page de codes
Ancienne table qui associe jusqu’à 256 valeurs d’octet à des caractères, comme Windows-1252 ou la page 437.
Une page de codes est un encodage à un octet utilisé avant la généralisation d’Unicode. Chaque valeur de 0 à 255 correspond à un caractère. Windows-1252 couvre les langues d’Europe occidentale ; la page 437 est le jeu original de l’IBM PC. Les codes Alt Windows sont des nombres issus de ces tables.
Source : Tables de correspondance des pages de codes Unicode
- Paire de demi-zones
Deux unités UTF-16 qui encodent ensemble un caractère situé au-delà de U+FFFF.
UTF-16 stocke les caractères supérieurs à U+FFFF sous la forme de deux unités de 16 bits prises dans une plage réservée : une demi-zone haute suivie d’une demi-zone basse. C’est pourquoi de nombreux emoji comptent pour deux unités dans la longueur d’une chaîne JavaScript tout en ne formant qu’un point de code.
Source : Glossaire Unicode
- Plan multilingue de base (BMP)
Les 65 536 premiers points de code Unicode, de U+0000 à U+FFFF, qui contiennent la plupart des caractères courants.
Unicode divise son espace de codage en 17 plans de 65 536 points de code. Le plan 0, appelé plan multilingue de base, couvre U+0000 à U+FFFF et contient la majorité des écritures modernes, de la ponctuation et de nombreux symboles. Les caractères au-delà de U+FFFF se trouvent dans des plans supplémentaires et utilisent une paire de demi-zones en UTF-16.
Source : Glossaire Unicode
- Point de code
Numéro unique attribué par Unicode à un caractère, écrit U+ suivi de chiffres hexadécimaux.
Un point de code est un nombre de l’espace Unicode, compris entre U+0000 et U+10FFFF. Il s’écrit avec « U+ » suivi d’au moins quatre chiffres hexadécimaux. La flèche vers la droite est U+2192, soit 8594 en décimal. Les échappements HTML, CSS et des langages de programmation expriment ce même nombre sous des syntaxes différentes.
Source : Glossaire Unicode
- Police de remplacement
Lorsqu’une police ne contient pas un caractère, le système emprunte son glyphe à une autre police installée.
Aucune police ne couvre tout Unicode. Si la police choisie ne possède pas le glyphe d’un caractère, le navigateur ou le système en cherche un dans une autre police. Si aucune police installée ne le contient, un rectangle vide ou un autre caractère de remplacement apparaît. Un même symbole peut donc changer d’aspect selon l’appareil.
- Présentation emoji
Choix d’afficher un caractère comme un emoji coloré ou comme un symbole de texte.
Certains caractères, comme ❤ et ☺, peuvent être affichés comme un symbole monochrome ou un emoji coloré. Chacun possède une présentation par défaut qu’un sélecteur de variante peut modifier : U+FE0E demande le style texte et U+FE0F le style emoji. Le rendu final dépend aussi de la plateforme et de la police.
- Propriété Script
Système d’écriture auquel appartient un caractère, comme Latin ou Greek, ou Common pour les symboles partagés.
La propriété Unicode Script attribue chaque caractère à un système d’écriture, comme Latin, Greek ou Devanagari. La ponctuation, les chiffres et la plupart des symboles servent dans plusieurs écritures et portent donc la valeur Common. Les marques combinatoires partagées ont la valeur Inherited.
R
- Référence de caractère hexadécimale
Référence HTML qui écrit le point de code en hexadécimal, par exemple →.
Une référence numérique hexadécimale écrit un caractère HTML ou XML sous la forme &#x, suivie du point de code en hexadécimal et d’un point-virgule. → représente la flèche vers la droite. Elle équivaut à la forme décimale → et reprend directement les chiffres de la notation U+2192.
- Référence numérique de caractère (code HTML)
Référence HTML qui écrit le point de code en décimal, par exemple →.
Une référence numérique écrit un caractère HTML ou XML par son point de code : &# suivi du nombre décimal et d’un point-virgule, comme → pour →. Elle fonctionne pour tous les caractères Unicode. La forme hexadécimale utilise &#x.
S
- Sélecteur de variante
Point de code invisible qui demande une variante visuelle précise du caractère précédent.
Un sélecteur de variante suit un caractère pour demander une forme particulière. Les plus courants sont U+FE0E, qui demande une présentation texte, et U+FE0F, qui demande une présentation emoji. Ces sélecteurs étant invisibles, deux chaînes d’apparence identique peuvent différer d’un caractère.
Source : Glossaire Unicode
U
- Unicode
Standard universel qui attribue un numéro unique aux caractères de tous les systèmes d’écriture.
Unicode est le standard international d’encodage du texte. Il attribue à chaque caractère un point de code, un nom officiel et des propriétés comme sa catégorie et son écriture afin que le texte circule entre appareils et logiciels sans changer. Les propriétés affichées par HotSymbol proviennent d’une version figée de la base de données Unicode.
Source : Le standard Unicode
- UTF-16
Encodage Unicode en unités de 16 bits, utilisé en interne par JavaScript, Java et Windows.
UTF-16 encode chaque point de code avec une ou deux unités de 16 bits. Les caractères du plan multilingue de base occupent une unité ; ceux au-delà de U+FFFF en occupent deux, appelées paire de demi-zones. Les chaînes JavaScript, Java et l’API Windows utilisent UTF-16 en interne.
Source : Glossaire Unicode
- UTF-8
Encodage Unicode dominant sur le Web, qui utilise un à quatre octets par caractère.
UTF-8 encode chaque point de code sur un à quatre octets et coïncide avec ASCII pour les 128 premiers caractères. Il est obligatoire pour les nouveaux documents HTML. Lorsqu’une page est en UTF-8, vous pouvez coller un symbole directement dans le code source sans employer de référence HTML.
Source : RFC 3629 : UTF-8
Mis à jour .