Python用re正则化模块在字符串查找特定字符串

实验需要，在一个含有几亿个字符的txt文件中查找特定的字符串，首先用re模块进行查找

 1 from time import clock
 2 import re
 3 start=clock()
 4 label_file = open("/home/ying/data/google_streetview_train_test1/label.txt")
 5 label_str = label_file.read()
 6 label_file.close()
 7 filename = "2_0_pitch_95_yaw_95_lat_41.8975137_lng_-87.6268723.jpg"
 8 start=clock()
 9 for match in re.finditer(filename, label_str):
10     s = match.start()
11     e = match.end()
12     print(s)
13     print(e)
14 end=clock()
15 print(end-start)

re.finditer(filename, label_str)可以在label_str中查找filename的位置，s=match.start()返回字符串开始的索引，e=match.end()，返回字符串结束的索引。程序运行的结果是

304091635
304091689
304096479
304096533
1.003844

耗时1s左右

同样的，由于txt文件中为一行一行的数据，可以用readlines进行遍历读取比较，程序如下

 1 from time import clock
 2 start=clock()
 3 data_label="/home/ying/data/google_streetview_train_test1/label.txt"
 4 filename = "2_0_pitch_95_yaw_95_lat_41.8975137_lng_-87.6268723.jpg"
 5 file = open(data_label)
 6 lines = file.readlines()
 7 print(len(lines))
 8 for line in lines:
 9     cls = line.split()
10     fn = cls.pop(0)
11     if fn==filename:
12        break
13 end=clock()
14 print(end-start)

运行结果如下：

1
3.335657

可见耗时有3s多，用正则化模块要快的多

另外，由于label_str中存在1.2_0_pitch_95_yaw_95_lat_41.8975137_lng_-87.6268723.jpg，所以用re模块寻找时会返回两个结果，而用逐行读取的方式则返回一个值

相关阅读:
oracle 11g 执行先决条件检查失败的解决方法
Oracle 11g 详细安装步骤
Github的使用
Git的配置与基本操作
Git安装教程（windows）
robot framework 自动化框架环境搭建
Windows下jenkins环境搭建
Windows 下搭建 SVN服务器
fiddler配置及使用教程
逆序链表

原文地址：https://www.cnblogs.com/yongjieShi/p/7509543.html