Sprache

Referenz

Glossar

Verständliche Erklärungen der auf HotSymbol verwendeten Begriffe, vom Codepunkt bis zum Alt-Code. Jeder Eintrag verlinkt seine wichtigste Quelle.

A

Allgemeine Kategorie

Unicode-Eigenschaft, die jedes Zeichen etwa als Buchstaben, Zahl oder Symbol klassifiziert.

General Category ist eine zweibuchstabige Unicode-Eigenschaft. Der erste Buchstabe nennt die Hauptklasse, etwa L für Buchstaben, N für Zahlen, P für Satzzeichen, S für Symbole und Z für Trenner. Der zweite verfeinert sie: Sm ist ein mathematisches und Sc ein Währungssymbol.

Quelle: Unicode Standard Annex #44: General Category Values

Alt-Code

Windows-Eingabemethode: Alt halten und eine Zahl auf dem Ziffernblock tippen.

Ein Alt-Code ist eine Windows-Eingabemethode. Halte Alt, tippe eine Dezimalzahl auf dem Ziffernblock und lasse Alt los. Zahlen mit führender Null verwenden Windows-1252; Zahlen ohne führende Null eine OEM-Codepage, auf US-Systemen meist 437. Alt-Codes hängen von der aktiven Codepage ab und erreichen die meisten Unicode-Zeichen nicht.

Quelle: Unicode-Codepage-Zuordnungen von Microsoft

B

Basic Multilingual Plane (BMP)

Die ersten 65.536 Unicode-Codepunkte von U+0000 bis U+FFFF mit den meisten gebräuchlichen Zeichen.

Unicode teilt seinen Coderaum in 17 Ebenen mit je 65.536 Codepunkten. Ebene 0, die Basic Multilingual Plane, reicht von U+0000 bis U+FFFF und enthält die meisten modernen Schriften, Satzzeichen und viele Symbole. Zeichen darüber benötigen in UTF-16 ein Surrogatpaar.

Quelle: Unicode-Glossar

Breitenloser Verbinder (ZWJ)

Unsichtbares Zeichen U+200D, das benachbarte Zeichen etwa zu einem Emoji verbinden soll.

Der Zero Width Joiner U+200D hat keine eigene sichtbare Form. Zwischen Emoji bildet er eine ZWJ-Sequenz, die unterstützende Plattformen als ein Bild darstellen. Ohne Unterstützung erscheinen die einzelnen Emoji nebeneinander.

Quelle: Unicode Technical Standard #51: Emoji ZWJ sequences

C

Codepage

Ältere Tabelle, die bis zu 256 Bytewerte Zeichen zuordnet, etwa Windows-1252 oder Codepage 437.

Eine Codepage ist eine Einbyte-Zeichencodierung aus der Zeit vor Unicode. Jeder Wert von 0 bis 255 steht für ein Zeichen. Windows-1252 deckt westeuropäische Sprachen ab; Codepage 437 ist der ursprüngliche IBM-PC-Zeichensatz. Windows-Alt-Codes sind Nummern aus solchen Tabellen.

Quelle: Unicode-Codepage-Zuordnungen

Codepunkt

Eindeutige Unicode-Nummer eines Zeichens, geschrieben als U+ mit Hex-Ziffern.

Ein Codepunkt ist eine Zahl im Unicode-Coderaum von U+0000 bis U+10FFFF. Die Schreibweise besteht aus U+ und mindestens vier Hex-Ziffern. Der Rechtspfeil ist U+2192, dezimal 8594. HTML-, CSS- und Programmiersprachen-Escapes drücken dieselbe Zahl anders aus.

Quelle: Unicode-Glossar

CSS-Escape

Umgekehrter Schrägstrich mit hexadezimalem Codepunkt zur Darstellung eines Zeichens in CSS.

In CSS stellt ein umgekehrter Schrägstrich mit einer bis sechs Hex-Ziffern ein Zeichen dar. \2192 ist der Rechtspfeil. Die Syntax wird häufig in content für ::before und ::after verwendet. Folgt eine weitere Hex-Ziffer, beendet ein Leerzeichen den Escape oder es werden sechs Ziffern genutzt.

Quelle: CSS Syntax Module Level 3: Escaping

E

Emoji-Darstellung

Ob ein Zeichen als farbiges Emoji oder als schlichtes Textsymbol gezeigt wird.

Einige Zeichen wie ❤ und ☺ können einfarbig oder als farbiges Emoji erscheinen. U+FE0E fordert Textdarstellung, U+FE0F Emoji-Darstellung an. Plattform und Schrift beeinflussen das Ergebnis zusätzlich.

Quelle: Unicode Technical Standard #51: Unicode Emoji

G

Glyph

Sichtbare Form, mit der eine Schrift ein Zeichen zeichnet.

Ein Glyph ist das Bild eines Zeichens in einer Schrift. Ein Zeichen kann in verschiedenen Schriften viele Glyphen haben; eine Schrift kann mehrere Zeichen als ein Glyph verbinden. Unicode codiert Zeichen, nicht ihre Zeichnung.

Quelle: Unicode-Glossar

H

Hexadezimale Zeichenreferenz

HTML-Referenz mit hexadezimalem Codepunkt, zum Beispiel →.

Eine hexadezimale numerische Zeichenreferenz schreibt ein HTML- oder XML-Zeichen als &#x, Hex-Codepunkt und Semikolon. → ist der Rechtspfeil. Sie entspricht der Dezimalform → und der Zahl aus U+2192.

Quelle: HTML Standard: Character references

HTML-Entity

Benannter Kurzbefehl für ein HTML-Zeichen, etwa → für →.

Eine HTML-Entity, formal benannte Zeichenreferenz, besteht aus kaufmännischem Und, Name und Semikolon: © ergibt © und → ergibt →. Der HTML-Standard definiert eine feste Liste; für die meisten Zeichen gibt es keinen Namen. Numerische Referenzen funktionieren immer.

Quelle: HTML Standard: Named character references

J

JavaScript-Escape

String-Escape wie \u2192 oder \u{1F600} für ein Zeichen im JavaScript-Quelltext.

JavaScript-Strings akzeptieren Unicode-Escapes: \u mit genau vier Hex-Ziffern für Zeichen der BMP oder \u{…} mit einer bis sechs Ziffern für jeden Codepunkt. „\u2192“ und „\u{2192}“ ergeben beide den Rechtspfeil.

Quelle: ECMAScript Language Specification: String literals

K

Kombinierendes Zeichen

Markierung wie ein Akzent, die sich mit dem vorherigen Grundzeichen verbindet.

Ein kombinierendes Zeichen wird zusammen mit dem vorangehenden Grundzeichen dargestellt. U+0301 COMBINING ACUTE ACCENT nach e ergibt é. Manche Akzentbuchstaben besitzen deshalb eine vorkomponierte und eine zerlegte Codierung. Normalisierung macht sie vergleichbar.

Quelle: Unicode-Glossar

N

Normalisierung

Umformung von Text in eine Standardform, damit gleichwertige Zeichenfolgen vergleichbar sind.

Unicode-Normalisierung schreibt Text in eine von vier Standardformen. NFC setzt Zeichen möglichst zusammen; NFD zerlegt sie. NFKC und NFKD falten außerdem Kompatibilitätsvarianten wie hochgestellte Ziffern in Grundformen, was in manchen Zusammenhängen Bedeutung ändert.

Quelle: Unicode Standard Annex #15: Normalization Forms

Numerische Zeichenreferenz (HTML-Code)

HTML-Referenz mit dezimalem Codepunkt, zum Beispiel →.

Eine numerische Zeichenreferenz schreibt ein HTML- oder XML-Zeichen als &#, Dezimalzahl und Semikolon, etwa → für →. Sie funktioniert für jedes Unicode-Zeichen. Die Hex-Form verwendet &#x.

Quelle: HTML Standard: Character references

S

Schriftersatz

Fehlt einer Schrift ein Zeichen, nutzt das System dessen Glyph aus einer anderen installierten Schrift.

Keine einzelne Schrift deckt ganz Unicode ab. Fehlt ein Glyph, wählen Browser und Betriebssysteme eines aus einer anderen Schrift. Findet sich keines, erscheint ein Platzhalter. Darum kann dasselbe Symbol auf Geräten unterschiedlich aussehen.

Quelle: CSS Fonts Module Level 4: Font matching

Script-Eigenschaft

Schriftsystem eines Zeichens, etwa Latin oder Greek, beziehungsweise Common für gemeinsam verwendete Symbole.

Die Unicode-Eigenschaft Script ordnet Zeichen einem Schriftsystem wie Latin, Greek oder Devanagari zu. Satzzeichen, Ziffern und viele Symbole werden in mehreren Schriften genutzt und haben den Wert Common. Gemeinsame kombinierende Zeichen haben Inherited.

Quelle: Unicode Standard Annex #24: Script Property

Surrogatpaar

Zwei UTF-16-Codeeinheiten, die gemeinsam ein Zeichen über U+FFFF codieren.

UTF-16 speichert Zeichen über U+FFFF als zwei 16-Bit-Einheiten aus einem reservierten Bereich: ein hohes und ein niedriges Surrogat. Daher zählen viele Emoji in JavaScripts Stringlänge als zwei Einheiten, obwohl sie einen Codepunkt bilden.

Quelle: Unicode-Glossar

U

Unicode

Universeller Zeichenstandard, der jedem Zeichen aller Schriftsysteme eine eindeutige Nummer gibt.

Unicode ist der internationale Standard für Textcodierung. Er weist jedem Zeichen einen Codepunkt, offiziellen Namen und Eigenschaften wie Kategorie und Schriftsystem zu. HotSymbols Fakten stammen aus einer festgelegten Version der Unicode Character Database.

Quelle: The Unicode Standard

Unicode-Block

Benannter zusammenhängender Codepunktbereich, etwa Arrows (U+2190–U+21FF).

Ein Block ist ein benannter Bereich aufeinanderfolgender Codepunkte, dessen Größe ein Vielfaches von 16 ist. Blöcke ordnen Codetabellen, sind aber keine Klassifikation: Ein Block kann Unverwandtes enthalten und verwandte Zeichen können auf mehrere Blöcke verteilt sein.

Quelle: Unicode-Codetabellen

Unicode-Zeichenname

Dauerhafter Name in Großbuchstaben, den Unicode einem Zeichen gibt, etwa RIGHTWARDS ARROW.

Jedes zugewiesene Zeichen besitzt einen offiziellen Namen in Großbuchstaben. Ein veröffentlichter Name wird nicht geändert; Korrekturen erscheinen als formale Namensalias. HotSymbol kann einen natürlicheren deutschen Anzeigenamen verwenden, zeigt aber den offiziellen Namen auf jeder Symbolseite.

Quelle: Unicode Character Encoding Stability Policies

UTF-16

Unicode-Codierung mit 16-Bit-Einheiten, intern in JavaScript, Java und Windows verwendet.

UTF-16 codiert jeden Codepunkt als eine oder zwei 16-Bit-Einheiten. Zeichen der BMP brauchen eine Einheit; Zeichen über U+FFFF zwei, ein Surrogatpaar. JavaScript-Strings, Java und die Windows-API verwenden intern UTF-16.

Quelle: Unicode-Glossar

UTF-8

Vorherrschende Unicode-Codierung im Web mit einem bis vier Bytes pro Zeichen.

UTF-8 codiert jeden Codepunkt mit einem bis vier Bytes und entspricht bei den ersten 128 Zeichen ASCII. Neue HTML-Dokumente müssen UTF-8 verwenden. Dann lässt sich ein Symbol direkt in den Quelltext einfügen.

Quelle: RFC 3629: UTF-8

V

Variationsselektor

Unsichtbarer Codepunkt, der eine bestimmte Darstellungsvariante des vorherigen Zeichens anfordert.

Ein Variationsselektor folgt einem Zeichen und fordert eine Form an. U+FE0E steht meist für Text-, U+FE0F für Emoji-Darstellung. Weil Selektoren unsichtbar sind, können gleich aussehende Strings intern verschieden sein.

Quelle: Unicode-Glossar

Z

Zeichen

Abstrakte Einheit geschriebenen Textes, unabhängig von ihrer Darstellung durch eine Schrift.

In Unicode ist ein Zeichen eine abstrakte Texteinheit wie A, 7 oder der Rechtspfeil. Unicode weist ihm Codepunkt und Namen zu, aber kein Aussehen. Sichtbar wird ein von einer Schrift gewähltes Glyph.

Quelle: Unicode-Glossar

Aktualisiert .