Python2和Python3中的字符串编码问题解决
2018-01-02 20:30
525 查看
Python2和Python3在字符串编码上是有明显的区别。
在Python2中,字符串无法完全地支持国际字符集和Unicode编码。为了解决这种限制,Python2对Unicode数据使用了单独的字符串类型。要输入Unicode字符串字面量,要在第一个引号前加上’u’。Python2中普通字符串实际上就是已经编码(非Unicode)的字节字符串。
在Python3中,不必加入这个前缀字符,否则是语法错误,这是因为所有的字符串默认已经是Unicode编码了。
$ python2实例:
>>> ‘张三’ #python2 会自动将字符串转换为合适编码的字节字符串
‘\xe5\xbc\xa0\xe4\xbf\x8a’ #自动转换为utf-8编码的字节字符串
>>> u’张三’ #显式指定字符串类型为unicode类型, 此类型字符串没有编码,保存的是字符在unicode字符集中的代码序号
u’\u5f20\u4fca’
>>> ‘张三’.encode(‘utf-8’) #python2 已经自动将其转化为utf-8类型编码,因此再次编码(python2会将该字符串当作用ascii或unicode编码过)会出现错误。
Traceback (most recent call last):
File “<stdin>”, line 1, in <module>
UnicodeDecodeError: ‘ascii’ codec can’t decode byte 0xe5 in position 0: ordinal not in range(128)
>>> ‘张三’.decode(‘utf-8′) #python2 可以正常解码,返回的字符串类是无编码的unicode类型
u’\u5f20\u4fca’
>>> b’张三’ # ‘张三’ 已被python2转换为utf-8编码,因此已为字节字符串
‘\xe5\xbc\xa0\xe4\xbf\x8a’
>>> print ‘张三’
张三
>>> print u’张三’
张三
>>> print b’张三’
张三
$ python3实例:
>>> ‘张三’ #python3的字符串默认为unicode格式(无编码)
‘张三’
>>> u’张三’ #由于默认为unicode格式,因此字符串不用像python2一样显式地指出其类型,否则是语法错误。
File “<stdin>”, line 1
u’张三’
^
SyntaxError: invalid syntax
>>> type(‘张三’) #python3中文本字符串和字节字符串是严格区分的,默认为unicode格式的文本字符串
<class ‘str’>
>>> ‘张三’.decode(‘utf-8’) #因为默认的文本字符串为unicode格式,因此文本字符串没有decode方法
Traceback (most recent call last):
File “<stdin>”, line 1, in <module>
AttributeError: ‘str’ object has no attribute ‘decode’
>>> ‘张三’.encode(‘utf-8′) #将文本字符串编码,转换为已编码的字节字符串类型
b’\xe5\xbc\xa0\xe4\xbf\x8a’
>>> type(‘张三’.encode(‘utf-8’))
<class ‘bytes’>
>>> print (‘张三’.encode(‘utf-8′)) #对于已编码的字节字符串,文本字符串的许多特性和方法已经不能使用。
b’\xe5\xbc\xa0\xe4\xbf\x8a’
>>>print (‘张三’.encode(‘utf-8′))
b’\xe5\xbc\xa0\xe4\xbf\x8a’
>>> print (‘张三’.encode(‘utf-8’).decode(‘utf-8’)) #必须将字节字符串解码后才能打印出来
张三
转载请注明:Python2和Python3中的字符串编码问题解决
在Python2中,字符串无法完全地支持国际字符集和Unicode编码。为了解决这种限制,Python2对Unicode数据使用了单独的字符串类型。要输入Unicode字符串字面量,要在第一个引号前加上’u’。Python2中普通字符串实际上就是已经编码(非Unicode)的字节字符串。
在Python3中,不必加入这个前缀字符,否则是语法错误,这是因为所有的字符串默认已经是Unicode编码了。
$ python2实例:
>>> ‘张三’ #python2 会自动将字符串转换为合适编码的字节字符串
‘\xe5\xbc\xa0\xe4\xbf\x8a’ #自动转换为utf-8编码的字节字符串
>>> u’张三’ #显式指定字符串类型为unicode类型, 此类型字符串没有编码,保存的是字符在unicode字符集中的代码序号
u’\u5f20\u4fca’
>>> ‘张三’.encode(‘utf-8’) #python2 已经自动将其转化为utf-8类型编码,因此再次编码(python2会将该字符串当作用ascii或unicode编码过)会出现错误。
Traceback (most recent call last):
File “<stdin>”, line 1, in <module>
UnicodeDecodeError: ‘ascii’ codec can’t decode byte 0xe5 in position 0: ordinal not in range(128)
>>> ‘张三’.decode(‘utf-8′) #python2 可以正常解码,返回的字符串类是无编码的unicode类型
u’\u5f20\u4fca’
>>> b’张三’ # ‘张三’ 已被python2转换为utf-8编码,因此已为字节字符串
‘\xe5\xbc\xa0\xe4\xbf\x8a’
>>> print ‘张三’
张三
>>> print u’张三’
张三
>>> print b’张三’
张三
$ python3实例:
>>> ‘张三’ #python3的字符串默认为unicode格式(无编码)
‘张三’
>>> u’张三’ #由于默认为unicode格式,因此字符串不用像python2一样显式地指出其类型,否则是语法错误。
File “<stdin>”, line 1
u’张三’
^
SyntaxError: invalid syntax
>>> type(‘张三’) #python3中文本字符串和字节字符串是严格区分的,默认为unicode格式的文本字符串
<class ‘str’>
>>> ‘张三’.decode(‘utf-8’) #因为默认的文本字符串为unicode格式,因此文本字符串没有decode方法
Traceback (most recent call last):
File “<stdin>”, line 1, in <module>
AttributeError: ‘str’ object has no attribute ‘decode’
>>> ‘张三’.encode(‘utf-8′) #将文本字符串编码,转换为已编码的字节字符串类型
b’\xe5\xbc\xa0\xe4\xbf\x8a’
>>> type(‘张三’.encode(‘utf-8’))
<class ‘bytes’>
>>> print (‘张三’.encode(‘utf-8′)) #对于已编码的字节字符串,文本字符串的许多特性和方法已经不能使用。
b’\xe5\xbc\xa0\xe4\xbf\x8a’
>>>print (‘张三’.encode(‘utf-8′))
b’\xe5\xbc\xa0\xe4\xbf\x8a’
>>> print (‘张三’.encode(‘utf-8’).decode(‘utf-8’)) #必须将字节字符串解码后才能打印出来
张三
转载请注明:Python2和Python3中的字符串编码问题解决
相关文章推荐
- Python字符串的encode与decode研究心得乱码问题解决方法(很多的编码问题都可以从此得出答案)
- 解决ruby 1.9字符串不兼容编码的问题
- Python字符串的encode与decode研究心得——解决乱码问题
- 安装python-mutagen 批量修改mp3字符编码格式,解决Amarok播放器乱码问题
- python常见编码问题解决方法
- Python字符串的encode与decode研究心得——解决乱码问题
- (转)Python字符串的encode与decode研究心得——解决乱码问题
- Mysql 字符串编码,解决各种乱码问题
- 这篇文章讲得比较清楚python的字符串编码问题
- python字符串编码问题
- Mysql 字符串编码,解决各种乱码问题
- python字符串编码常见问题
- Python字符串的encode与decode研究心得乱码问题解决方法
- linux下QT程序与windows程序中文字符串传输编码问题的一点解决,utf8转gbk
- 8.python中字符串的编码和解码问题——decode/encode
- python中文字符串数组编码的问题
- Python字符串的encode与decode研究心得乱码问题解决方法
- Python解决文件编码问题
- 8.python中字符串的编码和解码问题——decode/encode
- 在VS2005/2008中字符串编码问题的解决及字符串和数值类型常用的转换方法