python 编码为什么那么蛋疼？-mile米乐体育

tangjin python 2020年05月31日 21:26

据说，每个做 python 开发的都被字符编码的问题搞晕过，最常见的错误就是 unicodeencodeerror、unicodedecodeerror，你好像知道怎么解决，遗憾的是，错误又出现在其它地方，问题总是重蹈覆辙，str 到 unicode 之间的转换用 decode 还是 encode 方法还特不好记，老是混淆，问题究竟出在哪里？

为了弄清楚这个问题，我决定从 python 字符串的构成以及字符编码的细节上进行深入浅出的分析

字节与字符

计算机存储的一切数据，文本字符、图片、视频、音频、软件都是由一串01的字节序列构成的，一个字节等于8个比特位。

而字符就是一个符号，比如一个汉字、一个英文字母、一个数字、一个标点都可以称为一个字符。

字节方便存储和网络传输，而字符用于显示，方便阅读。例如字符 “p” 存储到硬盘是一串二进制数据 01110000，占用一个字节的长度

编码与解码

我们用编辑器打开的文本，看到的一个个字符，最终保存在磁盘的时候都是以二进制字节序列形式存起来的。那么从字符到字节的转换过程就叫做编码（encode），反过来叫做解码（decode），两者是一个可逆的过程。编码是为了存储传输，解码是为了方便显示阅读。

例如字符 “p” 经过编码处理保存到硬盘是一串二进制字节序列 01110000 ，占用一个字节的长度。字符 “禅” 有可能是以 “11100111 10100110 10000101″ 占用3个字节的长度存储，为什么说是有可能呢？这个放到后面再说。

python 的编码为什么那么蛋疼？当然，这不能怪开发者。

这是因为 python2 使用 ascii 字符编码作为默认编码方式，而 ascii 不能处理中文，那么为什么不用 utf-8 呢？因为 guido 老爹为 python 编写第一行代码是在1989年的冬天，1991年2月正式开源发布了第一个版本，而 unicode 是1991年10月发布的，也就是说 python 这门语言创立的时候 utf-8 还没诞生，这是其一。

python 把字符串的类型还搞成两种，unicode 和 str ，以至于把开发者都弄糊涂了，这是其二。python3 彻底把字符串重新改造了，只保留一种类型，这是后话，以后再说。

str与unicode

python2 把字符串分为 unicode 和 str 两种类型。本质上 str 是一串二进制字节序列，下面的示例代码可以看出 str 类型的 “禅” 打印出来是十六进制的 \xec\xf8 ，对应的二进制字节序列就是 ’11101100 11111000′。

>>> s = '禅' >>> s '\xec\xf8' >>> type(s)

而 unicode 类型的 u”禅” 对应的 unicode 符号是 u’\u7985′

>>> u = u"禅" >>> u u'\u7985' >>> type(u)

我们要把 unicode 符号保存到文件或者传输到网络就需要经过编码处理转换成 str 类型，于是 python 提供了 encode 方法，从 unicode 转换到 str，反之亦然。

encode

>>> u = u"禅" >>> u u'\u7985' >>> u.encode("utf-8") '\xe7\xa6\x85'

decode

>>> s = "禅" >>> s.decode("utf-8") u'\u7985' >>>

不少初学者怎么也记不住 str 与 unicode 之间的转换用 encode 还是 decode，如果你记住了 str 本质上其实是一串二进制数据，而 unicode 是字符（符号），编码（encode）就是把字符（符号）转换为二进制数据的过程，因此 unicode 到 str 的转换要用 encode 方法，反过来就是用 decode 方法。

encoding always takes a unicode string and returns a bytes sequence, and decoding always takes a bytes sequence and returns a unicode string”.

清楚了 str 与 unicode 之间的转换关系之后，我们来看看什么时候会出现 unicodeencodeerror、unicodedecodeerror 错误。

unicodeencodeerror

unicodeencodeerror 发生在 unicode 字符串转换成 str 字节序列的时候，来看一个例子，把一串 unicode 字符串保存到文件

# -*- coding:utf-8 -*- def main():     name = u'python之禅'     f = open("output.txt", "w")     f.write(name)

错误日志

unicodeencodeerror: ‘ascii’ codec can’t encode characters in position 6-7: ordinal not in range(128)

为什么会出现 unicodeencodeerror？

因为调用 write 方法时，python 会先判断字符串是什么类型，如果是 str，就直接写入文件，不需要编码，因为 str 类型的字符串本身就是一串二进制的字节序列了。

如果字符串是 unicode 类型，那么它会先调用 encode 方法把 unicode 字符串转换成二进制形式的 str 类型，才保存到文件，而 encode 方法会使用 python 默认的 ascii 码来编码

相当于：

>>> u"python之禅".encode("ascii")

但是，我们知道 ascii 字符集中只包含了128个拉丁字母，不包括中文字符，因此出现了 ‘ascii’ codec can’t encode characters 的错误。要正确地使用 encode ，就必须指定一个包含了中文字符的字符集，比如：utf-8、gbk。

>>> u"python之禅".encode("utf-8") 'python\xe4\xb9\x8b\xe7\xa6\x85'  >>> u"python之禅".encode("gbk") 'python\xd6\xae\xec\xf8'

所以要把 unicode 字符串正确地写入文件，就应该预先把字符串进行 utf-8 或 gbk 编码转换。

def main():     name = u'python之禅'     name = name.encode('utf-8')     with open("output.txt", "w") as f:         f.write(name)

当然，把 unicode 字符串正确地写入文件不止一种方式，但原理是一样的，这里不再介绍，把字符串写入数据库，传输到网络都是同样的原理

unicodedecodeerror

unicodedecodeerror 发生在 str 类型的字节序列解码成 unicode 类型的字符串时

>>> a = u"禅" >>> a u'\u7985' >>> b = a.encode("utf-8") >>> b '\xe7\xa6\x85' >>> b.decode("gbk") traceback (most recent call last):   file "", line 1, in  unicodedecodeerror: 'gbk' codec can't decode byte 0x85 in position 2: incomplete multibyte sequence

把一个经过 utf-8 编码后生成的字节序列 ‘\xe7\xa6\x85′ 再用 gbk 解码转换成 unicode 字符串时，出现 unicodedecodeerror，因为（对于中文字符）gbk 编码只占用两个字节，而 utf-8 占用3个字节，用 gbk 转换时，还多出一个字节，因此它没法解析。避免 unicodedecodeerror 的关键是保持编码和解码时用的编码类型一致。

这也回答了文章开头说的字符 “禅”，保存到文件中有可能占3个字节，有可能占2个字节，具体处决于 encode 的时候指定的编码格式是什么。

再举一个 unicodedecodeerror 的例子

>>> x = u"python" >>> y = "之禅" >>> x   y traceback (most recent call last):   file "", line 1, in  unicodedecodeerror: 'ascii' codec can't decode byte 0xe4 in position 0: ordinal not in range(128) >>>

str 与 unicode 字符串执行操作是，python 会把 str 类型的字节序列隐式地转换成（解码）成和 x 一样的 unicode 类型，但python是使用默认的 ascii 编码来转换的，而 ascii 中不包含中文，所以报错了。

>>> y.decode('ascii') traceback (most recent call last):   file "", line 1, in  unicodedecodeerror: 'ascii' codec can't decode byte 0xe4 in position 0: ordinal not in range(128)

正确地方式应该是显示地把 y 用 utf-8 或者 gbk 进行解码。

>>> x = u"python" >>> y = "之禅" >>> y = y.decode("utf-8") >>> x   y u'python\u4e4b\u7985'

以上内容都是基于 python2 来讲的，关于 python3 的字符和编码将会另开一篇文章来写，保持关注。

展开全文

python web开发 编程开发

内容来源于互联网和用户投稿,文章中一旦含有米乐app官网登录的联系方式务必识别真假，本站仅做信息展示不承担任何相关责任，如有侵权或涉及法律问题请联系米乐app官网登录删除

mile米乐体育-米乐app官网登录

python 编码为什么那么蛋疼？-mile米乐体育

字节与字符

编码与解码

str与unicode

unicodeencodeerror

unicodedecodeerror

python web开发 编程开发

每个 python 高手都应该知道的内置函数

python 中 requests 库的用法

最新文章

10种象征爱情的花(寓意爱情的花？)

邢台十大美食有哪些(邢台特色美食？)

越南下龙湾简介(越南的下龙湾风景怎么样？)

国家加班费(怎么计算加班费？)

字节与字符

编码与解码

str与unicode

unicodeencodeerror

unicodedecodeerror

每个 python 高手都应该知道的内置函数

python 中 requests 库的用法

最新文章

手机扫一扫关注mile米乐体育