python 读取带BOM的utf-8格式文件

简言：

在windows上使用open打开utf-8编码的txt文件时开头会有一个多余的字符
它叫BOM,是用来声明编码等信息的,但python会把它当作文本解析

解决办法:open的encoding参数

for line in open('data.txt', encoding='utf-8-sig' ):

UTF有哪些分类？

UTF-8分为两种，一种是不带BOM的，一种是带BOM的。其中第一种不带BOM的是标准形式，第二种带BOM的主要是微软的习惯。

为什么有BOM的UTF-8？

微软在UTF-8中使用BOM（Byte order mark）是因为这样可以将UTF-8和ASCII等编码明确区分开。
windows对于utf-8格式的文件存储默认是带有BOM的格式

为什么BOM不受欢迎？

因为在UNIX环境下，很多的UNIX程序不认识BOM。主要是在UNIX所有脚本语言首行为#！标示，它依赖于shell解析，而很多shell出于兼容的考虑不检测BOM，所以加进BOM时shell会把它解释为某个普通字符输入导致破坏#！标示。比如很多现代脚本语言，例如python，其解释器本身是能处理BOM的，但是shell卡在这里。
因此我们在linux服务器上读取这些txt文件时，会遇到如下报错：
xefxbbxbf…

怎么解决？

使用codecs库，将文件转换为utf-8-sig格式

import codecs

with open("xx.txt",'r','utf-8-sig') as file:
line = file.readlines();

相关阅读:
[Istio]流量管理API v1alpha3路由规则
[Istioc]Istio部署sock-shop时rabbitmq出现CrashLoopBackOff
[Go]指针操作
[Go]接口的运用
[Go]结构体及其方法
[Kubernetes]Volume
[Kubernetes]kubectl命令补全出错
[Docker]容器镜像
[Docker]容器的隔离与限制
[Go]通道（channel）的基本操作

原文地址：https://www.cnblogs.com/yinhaiping/p/10711110.html