Idioma

Referencia

Glosario

Definiciones claras de los términos que usa HotSymbol, de los puntos de código a los códigos Alt. Cada entrada enlaza a su fuente principal.

B

Bloque Unicode

Un rango de puntos de código consecutivos con nombre, como Arrows (U+2190–U+21FF).

Un bloque es un rango con nombre de puntos de código consecutivos, siempre con un tamaño múltiplo de 16, como Arrows (flechas) o Mathematical Operators (operadores matemáticos). Los bloques organizan las tablas de códigos, pero no son una clasificación: un bloque puede contener caracteres sin relación entre sí, y los caracteres relacionados pueden repartirse entre varios bloques.

Fuente: Unicode code charts

C

Carácter

La unidad mínima de texto escrito con significado, independiente de cómo la dibuje cada fuente.

En Unicode, un carácter es una unidad abstracta de texto, como la letra A, el dígito 7 o la flecha hacia la derecha. Unicode asigna a cada carácter un punto de código y un nombre, pero no un aspecto. Lo que ves en pantalla es un glifo elegido por una fuente.

Fuente: Unicode Glossary

Carácter combinable

Una marca, como un acento, que se une al carácter anterior en lugar de aparecer sola.

Un carácter combinable se muestra junto con el carácter base que lo precede. Por ejemplo, U+0301 COMBINING ACUTE ACCENT después de «e» se muestra como «é». Por eso algunas letras acentuadas tienen dos codificaciones válidas: un punto de código precompuesto, o una letra base más una marca combinable. La normalización permite compararlas.

Fuente: Unicode Glossary

Categoría general

Una propiedad de Unicode que clasifica cada carácter, por ejemplo como letra, número o símbolo.

La categoría general es una propiedad Unicode de dos letras asignada a cada punto de código. La primera letra indica la clase principal, como L para letras, N para números, P para puntuación, S para símbolos y Z para separadores. La segunda la precisa: Sm es un símbolo matemático, Sc un símbolo de moneda y So otro símbolo.

Fuente: Unicode Standard Annex #44: General Category values

Código Alt

Un método de teclado de Windows que introduce un carácter manteniendo pulsada Alt y escribiendo su número en el teclado numérico.

Un código Alt es un método de entrada de Windows: mantén pulsada la tecla Alt, escribe un número decimal en el teclado numérico y suelta Alt. Los números con cero inicial (Alt+0128 a Alt+0255) seleccionan caracteres de la página de códigos Windows-1252. Los números sin cero inicial (Alt+1 a Alt+255) seleccionan caracteres de la página de códigos OEM, que es la página de códigos 437 en los sistemas en inglés de EE. UU. Los códigos Alt no funcionan con la fila de números, dependen de la página de códigos activa y no llegan a la mayoría de los caracteres Unicode.

Fuente: Unicode code page mappings (Microsoft vendor tables)

E

Entidad HTML

Un atajo con nombre para un carácter en HTML, como → para →.

Una entidad HTML, formalmente una referencia de carácter con nombre, escribe un carácter como un signo &, un nombre y un punto y coma: © es © y → es →. El estándar HTML define una lista cerrada de 2125 nombres que cubren 1511 caracteres, así que la mayoría de los caracteres no tienen entidad. Las referencias numéricas funcionan con cualquier carácter.

Fuente: HTML Standard: Named character references

Escape CSS

Una barra invertida seguida de un punto de código hexadecimal, que sirve para escribir un carácter dentro de CSS.

En CSS, una barra invertida seguida de uno a seis dígitos hexadecimales representa un carácter por su punto de código, así que \2192 es la flecha hacia la derecha. Se usa sobre todo en la propiedad content de ::before y ::after. Si el carácter siguiente también es un dígito hexadecimal o un espacio, termina el escape con un único espacio o usa los seis dígitos.

Fuente: CSS Syntax Module Level 3: Escaping

Escape de JavaScript

Un escape de cadena como \u2192 o \u{1F600} que escribe un carácter en el código fuente de JavaScript.

Las cadenas de JavaScript aceptan escapes Unicode: \u seguido de exactamente cuatro dígitos hexadecimales para los caracteres del plano multilingüe básico, o \u{…} con uno a seis dígitos para cualquier punto de código. "\u2192" y "\u{2192}" producen la flecha hacia la derecha.

Fuente: ECMAScript Language Specification: String literals

F

Fuente de reserva

Cuando una fuente no tiene un carácter, el sistema toma el glifo de otra fuente instalada.

Ninguna fuente cubre todo Unicode. Cuando la fuente elegida no tiene glifo para un carácter, los navegadores y los sistemas operativos lo sustituyen por el de otra fuente. Si ninguna fuente instalada lo tiene, aparece un marcador, como un cuadro vacío. Por eso el mismo símbolo puede verse distinto en dispositivos diferentes.

Fuente: CSS Fonts Module Level 4: Font matching

G

Glifo

La forma visual que usa una fuente para dibujar un carácter.

Un glifo es la imagen que una fuente dibuja para un carácter. Un mismo carácter puede tener muchos glifos en distintas fuentes, y una fuente puede combinar varios caracteres en un solo glifo. Unicode codifica caracteres, no glifos, así que al copiar un símbolo copias el carácter; su aspecto depende de la fuente que lo muestre.

Fuente: Unicode Glossary

N

Nombre de carácter Unicode

El nombre permanente y en mayúsculas que Unicode da a un carácter, como RIGHTWARDS ARROW.

Cada carácter asignado tiene un nombre oficial en inglés escrito en mayúsculas, como RIGHTWARDS ARROW o EM DASH. Los nombres no cambian nunca una vez publicados, aunque contengan errores; las correcciones se añaden como alias formales. HotSymbol puede mostrar un nombre más claro en español, pero el nombre oficial figura siempre en cada página de símbolo.

Fuente: Unicode Character Encoding Stability Policies

Normalización

Convertir un texto a una forma estándar para que las secuencias de caracteres equivalentes se consideren iguales.

La normalización de Unicode reescribe un texto en una de cuatro formas estándar. NFC compone los caracteres cuando es posible, así que «e» más un acento agudo combinable se convierte en «é»; NFD los descompone. NFKC y NFKD además reducen las variantes de compatibilidad, como los dígitos en superíndice, a su forma simple, lo que cambia el significado en algunos contextos.

Fuente: Unicode Standard Annex #15: Normalization Forms

P

Página de códigos

Una tabla antigua que asigna hasta 256 valores de byte a caracteres, como Windows-1252 o la página de códigos 437.

Una página de códigos es una codificación de caracteres de un solo byte que se usaba antes de que Unicode se generalizara. Cada valor de byte de 0 a 255 corresponde a un carácter. Windows-1252 es la predeterminada en Windows para Europa occidental; la página de códigos 437 es el juego original del IBM PC, con caracteres de dibujo de cuadros y símbolos como ☺ y ♥. Los códigos Alt de Windows son números de estas tablas.

Fuente: Unicode code page mappings

Par sustituto

Dos unidades de código UTF-16 que juntas codifican un carácter por encima de U+FFFF.

UTF-16 guarda los caracteres por encima de U+FFFF como dos unidades de código de 16 bits de un rango reservado: un sustituto alto seguido de un sustituto bajo. Por eso muchos emojis cuentan como dos caracteres en la longitud de una cadena de JavaScript aunque sean un solo punto de código.

Fuente: Unicode Glossary

Plano multilingüe básico (BMP)

Los primeros 65 536 puntos de código Unicode, de U+0000 a U+FFFF, donde están la mayoría de los caracteres comunes.

Unicode divide su espacio de códigos en 17 planos de 65 536 puntos de código cada uno. El plano 0, el plano multilingüe básico, abarca de U+0000 a U+FFFF y contiene la mayoría de los caracteres de las escrituras modernas, los signos de puntuación y muchos símbolos. Los caracteres por encima de U+FFFF, incluida la mayoría de los emojis, están en planos suplementarios y necesitan un par sustituto en UTF-16.

Fuente: Unicode Glossary

Presentación emoji

Si un carácter se muestra como un emoji en color o como un símbolo de texto simple.

Algunos caracteres, como ❤ y ☺, pueden mostrarse como un símbolo de texto monocromo o como un emoji en color. Cada uno tiene una presentación predeterminada que un selector de variación puede cambiar: U+FE0E pide estilo de texto y U+FE0F pide estilo emoji. El aspecto final también depende de la plataforma y de la fuente.

Fuente: Unicode Technical Standard #51: Unicode Emoji

Propiedad de escritura

El sistema de escritura al que pertenece un carácter, como latino o griego, o Común para los símbolos compartidos.

La propiedad Script de Unicode asigna cada carácter a un sistema de escritura, como el latino, el griego o el devanagari. Los signos de puntuación, los dígitos y la mayoría de los símbolos se usan en muchos sistemas de escritura, así que tienen el valor Common (común). Las marcas combinables que comparten varias escrituras tienen el valor Inherited (heredado).

Fuente: Unicode Standard Annex #24: Script Property

Punto de código

El número único que Unicode asigna a un carácter, escrito como U+ seguido de dígitos hexadecimales.

Un punto de código es un número del espacio de códigos de Unicode, de U+0000 a U+10FFFF. Se escribe como «U+» seguido de al menos cuatro dígitos hexadecimales; la flecha hacia la derecha es U+2192, que es 8594 en decimal. HTML, CSS y los escapes de los lenguajes de programación expresan el mismo punto de código con notaciones distintas.

Fuente: Unicode Glossary

R

Referencia de carácter hexadecimal

Una referencia HTML que escribe el punto de código en hexadecimal, como →.

Una referencia numérica de carácter hexadecimal escribe un carácter en HTML o XML como &#x, el punto de código en hexadecimal y un punto y coma. → es la flecha hacia la derecha. Equivale a la forma decimal → y coincide con la notación U+2192, lo que facilita leerla junto a las tablas de Unicode.

Fuente: HTML Standard: Character references

Referencia numérica de carácter (código HTML)

Una referencia HTML que escribe el punto de código en decimal, como →.

Una referencia numérica de carácter escribe un carácter en HTML o XML por su punto de código: &# seguido del número decimal y un punto y coma, como → para →. Funciona con cualquier carácter Unicode, por lo que es la forma más fiable de incluir un símbolo cuando la codificación del documento no es segura. La forma hexadecimal usa &#x.

Fuente: HTML Standard: Character references

S

Selector de variación

Un punto de código invisible que pide una variante visual concreta del carácter anterior.

Un selector de variación va detrás de un carácter para pedir una forma concreta. La pareja más habitual es U+FE0E (presentación de texto) y U+FE0F (presentación emoji). Los selectores son invisibles, así que dos cadenas que parecen idénticas pueden diferir en uno; esto importa al comparar o buscar texto.

Fuente: Unicode Glossary

U

Unicode

El estándar universal de caracteres que da un número único a cada carácter de cada sistema de escritura.

Unicode es el estándar internacional para codificar texto. Asigna a cada carácter un punto de código, un nombre oficial y propiedades como su categoría y su escritura, para que el texto pase entre dispositivos y programas sin cambiar. Los datos de los caracteres de HotSymbol proceden de una versión fija de la base de datos de caracteres Unicode.

Fuente: The Unicode Standard

Unión de ancho cero (ZWJ)

Un carácter invisible, U+200D, que pide que los caracteres contiguos se unan, por ejemplo en un solo emoji.

La unión de ancho cero, U+200D, no tiene aspecto propio. Entre emojis forma una secuencia ZWJ que las plataformas compatibles muestran como una sola imagen, como una familia o una profesión. Donde la secuencia no es compatible, los emojis aparecen uno al lado del otro.

Fuente: Unicode Technical Standard #51: Emoji ZWJ sequences

UTF-16

Una codificación Unicode con unidades de 16 bits, usada internamente por JavaScript, Java y Windows.

UTF-16 codifica cada punto de código con una o dos unidades de código de 16 bits. Los caracteres del plano multilingüe básico ocupan una unidad; los caracteres por encima de U+FFFF ocupan dos, lo que se llama par sustituto. Las cadenas de JavaScript, Java y la API de Windows usan UTF-16 internamente.

Fuente: Unicode Glossary

UTF-8

La codificación Unicode dominante en la web, que usa de uno a cuatro bytes por carácter.

UTF-8 codifica cada punto de código con uno a cuatro bytes y es idéntica a ASCII en los primeros 128 caracteres. Es la codificación obligatoria para los documentos HTML nuevos. Si una página está en UTF-8, puedes pegar un símbolo directamente en el código fuente en lugar de usar un código HTML.

Fuente: RFC 3629: UTF-8

Actualizado el .