Capítulo 4. Texto Unicode frente a Bytes
Este trabajo se ha traducido utilizando IA. Agradecemos tus opiniones y comentarios: translation-feedback@oreilly.com
Los humanos usamos texto. Los ordenadores hablan bytes.
Esther Nam y Travis Fischer, "Codificación de caracteres y Unicode en Python"1
Python 3 introdujo una clara distinción entre cadenas de texto humano y secuencias de bytes sin procesar. La conversión implícita de secuencias de bytes a texto Unicode es cosa del pasado. Este capítulo trata de las cadenas Unicode, las secuencias binarias y las codificaciones utilizadas para convertir entre ellas.
Dependiendo del tipo de trabajo que hagas con Python, puedes pensar que entender Unicode no es importante. Es poco probable, pero de todos modos no hay forma de escapar a la división entre str y byte. Como extra, descubrirás que los tipos de secuencia binaria especializados proporcionan características que el tipo "multiuso" de Python 2 str no tenía.
En este capítulo, visitaremos los siguientes temas:
-
Caracteres, puntos de código y representaciones de bytes
-
Características únicas de las secuencias binarias:
bytes,bytearray, ymemoryview -
Codificaciones para Unicode completo y conjuntos de caracteres heredados
-
Evitar y tratar los errores de codificación
-
Buenas prácticas en el manejo de archivos de texto
-
La trampa de codificación por defecto y los problemas de E/S estándar
-
Comparaciones de texto Unicode seguras con normalización
-
Funciones útiles para normalizar, ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access