• 字符串与编码


    在最新的Python 3版本中,字符串是以Unicode编码的,即Python的字符串支持多语言

    编码和解码
      字符串在内存中以Unicode表示,在操作字符串时,经常需要str和bytes互相转换
      字符串是可以直接在内存上进行处理的,但如果要将其传输到网络或磁盘上,需要将其编码,反过来则需要解码,因为str是不可以直接存储在磁盘上或在网络上传输的
      如果将字符串从内存传输到网络或保存到磁盘,则要把str转换为以字节为单位的bytes,称为编码
      如果要从网络或磁盘上获取字符串,则要从网络上或者磁盘上读取字节流,并把bytes转换为str,称为解码
      为避免乱码问题,应当始终坚持使用UTF-8编码对str和bytes进行转换,关于编码,请参照字符编码

    使用示例: 

      单个字符的编码

    print(ord('A')) #输出:65,获取字符的整数表示
    print(chr(66)) #输出:B,把编码转换为对应的字符

      十六进制表示

    print('中文') #输出:'中文',
    print('u4e2du6587') #输出:'中文','u4e2du6587'和'中文'完全对等,如果知道字符的整数编码,还可以用十六进制这么写str

      bytes类型的数据表示

    x = b'ABC' #Python对bytes类型的数据用带b前缀的单引号或双引号表示,'ABC'和b'ABC'在显示上完全一样,但bytes的每个字符都只占用一个字节

      编码

    print('ABC'.encode('ascii')) #输出:b'ABC',以Unicode表示的str通过encode()方法可以编码为指定的bytes
    print('中文'.encode('utf-8')) #输出:b'xe4xb8xadxe6x96x87',
    print('中文'.encode('ascii')) #输出:报错,因为中文字符在ascii编码范围外,所以导致编码失败

      解码

    print(b'ABC'.decode('ascii')) #输出:'ABC'
    print(b'xe4xb8xadxe6x96x87'.decode('ascii')) #输出:'中文'
    print(b'xe4xb8xadxff'.decode('utf-8', errors='ignore')) #输出:'中',如果bytes中只有一小部分无效的字节,可以传入errors='ignore'忽略错误的字节

      计算长度

    #len(a)函数返回a的长度,如果a是字符串则返回字符数,如果a是字节表示则返回字节数
    print(len('中文')) #输出:2,共2个字符
    print(len('ABC')) #输出:3,共3个字符
    print(len(b'ABC')) #输出:3,共是3个字节
    print(len(b'xe4xb8xadxe6x96x87')) #输出:6,共是6个字节
    print(len('中文'.encode('utf-8'))) #输出:6, 1个中文字符经过UTF-8编码后通常会占用3个字节,因此两个汉字的字节数是6

      源码文件开头与编码

    #!/usr/bin/env python3       告诉Linux/OS X系统,这是一个Python可执行程序,Windows系统会忽略这个注释
    # -*- coding: utf-8 -*-      告诉Python解释器,按照UTF-8编码读取源代码,否则在源代码中写的中文输出可能会有乱码
    
    #注意:告诉编译器使用UTF-8编码的同时,.py文件也要保存为UTF-8 without BOM编码,两者统一了,才可确保文件中的中文正常显示
  • 相关阅读:
    线程锁lock&rlock
    threading.local
    threading Event
    python中的eval 和 exec 和 execfile
    cloud-init 常见问题
    systemd
    cloud-init 的命令行
    原生js实现Promise
    js 指定位置插入html标签(可编辑div)
    js 实现复制粘贴文本过滤(保留文字和图片)
  • 原文地址:https://www.cnblogs.com/shiliye/p/10893939.html
Copyright © 2020-2023  润新知