utf8与utf8mb4的区别

　　　　最近在写一个爬虫的多线程脚本，在异步插入数据库的时候总有部分数据插入失败，原因竟然是编码的问题。扪心自问，mysql最通用的中文字符编码就是utf-8了，通常情况下，utf-8作为中文编码是司空见惯的，但是还是一如既往的写入数据库失败。

　　　　原来MySQL在5.5.3版本之后增加了这个utf8mb4的编码，mb4就是most bytes 4的意思，专门用来兼容四字节的unicode。其实，utf8mb4是utf8的超集，理论上原来使用utf8，然后将字符集修改为utf8mb4，也会不会对已有的utf8编码读取产生任何问题。当然，为了节省空间，一般情况下使用utf8也就够了。低版本的MySQL支持的utf8编码，最大字符长度为 3 字节，如果遇到 4 字节的字符就会出现错误了。

　　　　UTF-8 最大能编码的 Unicode 字符是 0xFFFF，也就是 Unicode 中的基本多文平面（BMP）。也就是说，任何不在基本多文平面的 Unicode字符，都无法使用MySQL原有的 utf8 字符集存储。这些不在BMP中的字符包括哪些呢？最常见的就是Emoji 表情（Emoji 是一种特殊的 Unicode 编码，常见于 ios 和 android 手机上），和一些不常用的汉字，以及任何新增的 Unicode 字符等等。理论上讲， UTF-8 格式使用一至六个字节，最大能编码 31 位字符。最新的 UTF-8 规范只使用一到四个字节，最大能编码21位，正好能够表示所有的 17个 Unicode 平面。为了获取更好的兼容性，应该总是使用 utf8mb4 而非 utf8，事实上，最新版的phpmyadmin默认字符集就是utf8mb4。诚然，对于 CHAR 类型数据，使用utf8mb4 存储会多消耗一些空间。

相关阅读:
[考试反思]0421省选模拟76：学傻
[考试反思]0420省选模拟75：安在
[考试反思]0418省选模拟74：杂枝
[考试反思]0417省选模拟73：纠结
[考试反思]0416省选模拟72：停滞
[考试反思]0415省选模拟71：限制
[考试反思]0414省选模拟70：阻塞
[考试反思]0413省选模拟69：遗弃
[考试反思]0411省选模拟68：毒瘤
[考试反思]0410省选模拟67：迷惑

原文地址：https://www.cnblogs.com/dubin382460/p/9132297.html