MySQL 5.7 中文全文检索使用教程

MySQL 5.7 中文全文检索使用教程
在MySQL 5.7.6之前，全文索引只支持英文全文索引，不支持中文全文索引，需要利用分词器把中文段落预处理拆分成单词，然后存入数据库。
从MySQL 5.7.6开始，MySQL内置了ngram全文解析器，用来支持中文、日文、韩文分词。
本文使用的MySQL 版本是5.7.22，InnoDB数据库引擎。

ngram全文解析器

ngram就是一段文字里面连续的n个字的序列。ngram全文解析器能够对文本进行分词，每个单词是连续的n个字的序列。例如，用ngram全文解析器对“生日快乐”进行分词:

n=1: '生', '日', '快', '乐' n=2: '生日', '日快', '快乐' n=3: '生日快', '日快乐' n=4: '生日快乐'

MySQL 中使用全局变量ngram_token_size来配置ngram中n的大小，它的取值范围是1到10，默认值是2。通常ngram_token_size设置为要查询的单词的最小字数。如果需要搜索单字，就要把ngram_token_size设置为1。在默认值是2的情况下，搜索单字是得不到任何结果的。因为中文单词最少是两个汉字，推荐使用默认值2。

全局变量ngram_token_size的两种设置方法：
1、启动mysqld命令时

mysqld --ngram_token_size=2

2、修改MySQL配置文件

[mysqld] ngram_token_size=2

创建全文索引

1、创建表的同时创建全文索引

CREATE TABLE articles ( id INT UNSIGNED AUTO_INCREMENT NOT NULL PRIMARY KEY, title VARCHAR (200), body TEXT, FULLTEXT (title, body) WITH PARSER ngram ) ENGINE = INNODB;

2、通过 alter table 的方式来添加

ALTER TABLE articles ADD FULLTEXT INDEX ft_index (title,body) WITH PARSER ngram;

3、直接通过create index的方式

CREATE FULLTEXT INDEX ft_index ON articles (title,body) WITH PARSER ngram;

全文检索模式

常用的全文检索模式有两种：
1、自然语言模式(NATURAL LANGUAGE MODE) ，
自然语言模式是MySQL 默认的全文检索模式。自然语言模式不能使用操作符，不能指定关键词必须出现或者必须不能出现等复杂查询。
2、BOOLEAN模式(BOOLEAN MODE)
BOOLEAN模式可以使用操作符，可以支持指定关键词必须出现或者必须不能出现或者关键词的权重高还是低等复杂查询。

示例

SELECT * FROM articles WHERE MATCH (title,body) AGAINST ('一路一带' IN NATURAL LANGUAGE MODE); // 不指定模式，默认使用自然语言模式 SELECT * FROM articles WHERE MATCH (title,body) AGAINST ('一路一带');

示例

上面的示例返回结果会自动按照相关性排序，相关性高的在前面。相关性的值是一个非负浮点数，0表示无相关性。

// 获取相关性的值 SELECT id,title, MATCH (title,body) AGAINST ('手机' IN NATURAL LANGUAGE MODE) AS score FROM articles ORDER BY score DESC;

示例

// 获取匹配结果记录数 SELECT COUNT(*) FROM articles WHERE MATCH (title,body) AGAINST ('一路一带' IN NATURAL LANGUAGE MODE);

可以使用BOOLEAN模式执行高级查询。

// 必须包含"腾讯" SELECT * FROM articles WHERE MATCH (title,body) AGAINST ('+腾讯' IN BOOLEAN MODE);

示例

// 必须包含"腾讯"，但是不能包含"通讯工具" SELECT * FROM articles WHERE MATCH (title,body) AGAINST ('+腾讯 -通讯工具' IN BOOLEAN MODE);

示例

下面的例子演示了BOOLEAN模式下运算符的使用方式：

'apple banana' 无操作符，表示或，要么包含apple，要么包含banana '+apple +juice' 必须同时包含两个词 '+apple macintosh' 必须包含apple，但是如果也包含macintosh的话，相关性会更高。 '+apple -macintosh' 必须包含apple，同时不能包含macintosh。 '+apple ~macintosh' 必须包含apple，但是如果也包含macintosh的话，相关性要比不包含macintosh的记录低。 '+apple +(>juice <pie)' 查询必须包含apple和juice或者apple和pie的记录，但是apple juice的相关性要比apple pie高。 'apple*' 查询包含以apple开头的单词的记录，如apple、apples、applet。 '"some words"' 使用双引号把要搜素的词括起来，效果类似于like '%some words%'，例如“some words of wisdom”会被匹配到，而“some noise words”就不会被匹配。

注意

只能在类型为CHAR、VARCHAR或者TEXT的字段上创建全文索引。

全文索引只支持InnoDB和MyISAM引擎。

MATCH (columnName) AGAINST ('keywords')。MATCH()函数使用的字段名，必须要与创建全文索引时指定的字段名一致。如上面的示例，MATCH (title,body)使用的字段名与全文索引ft_articles(title,body)定义的字段名一致。如果要对title或者body字段分别进行查询，就需要在title和body字段上分别创建新的全文索引。

MATCH()函数使用的字段名只能是同一个表的字段，因为全文索引不能够跨多个表进行检索。

如果要导入大数据集，使用先导入数据再在表上创建全文索引的方式要比先在表上创建全文索引再导入数据的方式快很多，所以全文索引是很影响TPS的。
作者：jessehua
链接：https://www.jianshu.com/p/c48106149b6a
來源：简书
简书著作权归作者所有，任何形式的转载都请联系作者获得授权并注明出处。
相关阅读:
银行类题目
 Java基础-继承-编写一个Java应用程序，设计一个汽车类Vehicle，包含的属性有车轮个数 wheels和车重weight。小车类Car是Vehicle的子类，其中包含的属性有载人数 loader。卡车类Truck是Car类的子类，其中包含的属性有载重量payload。每个类都有构造方法和输出相关数据的方法。最后，写一个测试类来测试这些类的功能。
Java-set集合
 Java——List集合
 java异常处理：建立exception包，建立Bank类，类中有变量double balance表示存款,Bank类的构造方法能增加存款，Bank类中有取款的发方法withDrawal(double dAmount),当取款的数额大于存款时,抛出InsufficientFundsException,取款数额为负数，抛出NagativeFundsException,如new Bank(100),
java基础-继承：矩形体积类问题
 类的继承和多态性-编写Java应用程序，定义Animal类，此类中有动物的属性：名称 name,腿的数量legs，统计动物的数量 count;方法：设置动物腿数量的方法 void setLegs(),获得腿数量的方法 getLegs(),设置动物名称的方法 setKind(),获得动物名称的方法 getKind(),获得动物数量的方法 getCount()。定义Fish类，是Animal类的子类，
实验三类的继承和多态性
 java基础—继承题目：编写一个Animal类，具有属性：种类；具有功能：吃、睡。定义其子类Fish
java基础，继承类题目：编写一个Java应用程序，该程序包括3个类：Monkey类、People类和主类 E
原文地址：https://www.cnblogs.com/li-sx/p/10141191.html

MySQL 5.7 中文全文检索使用教程

ngram全文解析器

创建全文索引

全文检索模式

示例

注意