从学习Python至今,发现很多时候是将Python作为一种工具。特别在文本处理方面,使用起来更是游刃有余。
说到文本处理,那么正则表达式必然是一个绝好的工具,它能将一些繁杂的字符搜索或者替换以非常简洁的方式完成。
我们在处理文本的时候,或是查询抓取,或是替换.
一.查找
如果你想自己实现这样的功能模块,输入某一个ip地址,得到这个ip地址所在地区的详细信息.
然后你发现http://ip138.com
可以查出很详细的数据
但是人家没有提供api供外部调用,但是我们可以通过代码模拟查询然后对结果进行抓取.
通过查看这个相应页面的源码,我们可以发现,结果是放在三个<li></li>中的
<table width="80%" border="0" align="center" cellpadding="0" cellspacing="0">
<tr>
<td align="center"><h3>ip138.com IP查询(搜索IP地址的地理位置)</h3></td>
</tr>
<tr>
<td align="center"><h1>您查询的IP:121.0.29.231</h1></td>
</tr>
<tr>
<td align="center"><ul class="ul1"><li>本站主数据:浙江省杭州市 阿里巴巴</li><li>参考数据一:浙江省杭州市 阿里巴巴</li><li>参考数据二:浙江省杭州市 阿里巴巴</li></ul></td>
</tr>
<tr>
<td align="center">如果您发现查询结果不详细或不正确,请使用<a href="ip_add.asp?ip=121.0.29.231"><font color="#006600"><b>IP数据库自助添加</b></font></a>功能进行修正<br/><br/>
<iframe src="/jss/bd_460x60.htm" frameborder="no" width="460" height="60" border="0" marginwidth="0" marginheight="0" scrolling="no"></iframe><br/><br/></td>
</tr>
<form method="get" action="ips8.asp" name="ipform" onsubmit="return checkIP();">
<tr>
<td align="center">IP地址或者域名:<input type="text" name="ip" size="16"> <input type="submit" value="查询"><input type="hidden" name="action" value="2"></td>
</tr><br>
<br>
</form>
</table>
如果你了解正则表达式你可能会写出
正则表达式
(?<=<li>).*?(?=</li>)
这里使用了前瞻:lookahead 后顾: lookbehind,这样的好处就是匹配的结果中就不会包含html的li标签了.
如果你对自己写的正则表达式不是很自信的话,可以在一些在线或者本地的正则测试工具进行一些测试,以确保正确.
接下来的工作就是如果用Python实现这样的功能,首先我们得将正则表达式表示出来:
r"(?<=<li>).*?(?=</li>)"
Python中字符串前面加上前导r这个字符,代表这个字符串是R
aw String(原始字符串),也就是说Python字符串本身不会对字符串中的字符进行转义.这是因为正则表达式也有转义字符之说,如果双重转义的话,易读性很差.
这样的串在Python中我们把它叫做"regular expression pattern"
如果我们对pattern进行编译的话
prog = re.compile(r"(?<=<li>).*?(?=</li>)")
我们便可以得到一个正则表达式对象regular expression object,通过这个对象我们可以进行相关操作.
比如
result=prog.match(string)
##这个等同于
result=re.match(r"(?<=<li>).*?(?=</li>)",string)
##但是如果这个正则需要在程序匹配多次,那么通过正则表达式对象的方式效率会更高
接下来就是查找了,假设我们的html结果已经以html的格式存放在text中,那么通过
result_list = re.findall(r"(?<=<li>).*?(?=</li>)",text)
便可以取得所需的结果列表.
二.替换
使用正则表达式进行替换非常的灵活.
比如之前我在阅读Trac这个系统中wiki模块的源代码的时候,就发现其wiki语法的实现就是通过正则替换进行的.
在使用替换的时候会涉及到正则表达式中的Group分组的概念.
假设wiki语法中使用!表示转义字符即感叹号后面的功能性字符会原样输出,粗体的语法为
写道
'''这里显示为粗体'''
那么有正则表达式为
r"(?P<bold>!?''')"
这里的?P<bold>是Python正则语法中的一部分,表示其后的group的名字为"bold"
下面是替换时的情景,其中sub函数的第一个参数是pattern,第二个参数可以是字符串也可以是函数,如果是字符串的话,那么就是将目标匹配的结果替换成指定的结果,而如果是函数,那么函数会接受一个match object的参数,并返回替换后的字符串,第三个参数便是源字符串.
result = re.sub(r"(?P<bold>!?''')", replace, line)
每当匹配到一个三单引号,replace函数便运行一次,可能这时候需要一个全局变量记录当前的三单引号是开还是闭,以便添加相应的标记.
在实际的trac wiki的实现的时候,便是这样通过一些标记变量,来记录某些语法标记的开闭,以决定replace函数的运行结果.
--------------------
写的有点粗,改日补详细.
分享到:
相关推荐
Python之正则表达式基础知识
这是一个关于python正则的常用方法的py文件,内含re.match,sub,search,findall,compile等方法。使用python3.6
模块是Python中用于处理正则表达式的标准库。在Python中,正则表达式主要用于文本匹配和处理,例如数据提取、验证输入等。下面将详细解释正则表达式中的各个知识点。 1. 元字符 元字符是具有特殊含义的字符,它们在...
本文实例讲述了Python使用正则表达式抓取网页图片的方法。分享给大家供大家参考,具体如下: #!/usr/bin/python import re import urllib #获取网页信息 def getHtml(url): page = urllib.urlopen(url) ...
Python正则表达式是Python编程语言中的一个强大工具,它用于处理字符串,执行模式匹配和文本提取。在Python中,正则表达式主要用于处理文本数据,例如从日志文件中提取特定信息,验证用户输入,或者从网页内容中抓取...
python requests re 正则 爬虫 精简 万能,理论上可以下载任何网页的图片,可以试试看,简单易懂
Python字正则表达式案例
Python 通过正则表达式快速获取电影的下载地址 Python源码Python 通过正则表达式快速获取电影的下载地址 Python源码Python 通过正则表达式快速获取电影的下载地址 Python源码Python 通过正则表达式快速获取电影的...
在Python中,正则表达式的功能通过re模块实现,它提供了一系列方法来支持正则表达式操作。 首先,我们来看如何利用Python实现匹配特定邮箱地址,比如163邮箱。在这里,我们使用了正则表达式r'[0-9a-zA-Z_]{0,19}@**...
总结,`re.compile()`是Python正则表达式的重要工具,它使得我们可以预先编译正则表达式模式,提高程序的效率和可读性。通过创建正则表达式对象,我们可以灵活地执行多种正则操作,如查找、替换和分割字符串,从而在...
本文实例讲述了python使用正则表达式提取网页URL的方法。分享给大家供大家参考。具体实现方法如下: import re import urllib url=//www.jb51.net s=urllib.urlopen(url).read() ss=s.replace( ,) urls=re.findall...
本文将深入探讨L2正则化的概念、原理,并通过Python代码实例进行详细解析。 首先,我们理解一下L2正则化。L2正则化,也称为Ridge回归,是在损失函数中添加了模型参数的平方和的系数λ(正则化参数)的项。这会使得...
首先是正则表示的验证,先画出NFA的图,在进行NFA转DFA之后,形成闭包,然后将输入的正则表达式进行验证。
一个描述全部python正则方法,正则表达式,又称规则表达式。(英语:Regular Expression,在代码中常简写为regex、regexp或RE),计算机科学的一个概念。正则表通常被用来检索、替换那些符合某个模式(规则)的文本。 ...
python-正则表达式知识汇总
本文将分享如何使用Python正则表达式来匹配不包含特定字符集的字符串。 首先,我们来看一个基本的正则表达式匹配例子。假设我们要从一个字符串中找出所有以“https?”开头,后面跟着“://”,然后再以“.jpg”、“....
python的正则表达式资源包
在"正则指引_panoi9_python_正则指引_正则_"这个主题下,我们将深入探讨Python中的正则表达式使用方法和技巧。 1. **导入re模块** Python中,正则表达式的操作集中在`re`模块,首先要通过`import re`引入该模块。 ...
python正则表达式详细图 python正则表达式详细图 python正则表达式详细图
python语言正则表达式的详细整理,可以更加简单的看懂python正则表达式的使用规则