您的位置:首页 > 其它

正则表达式注意事项

2015-08-17 15:46 351 查看
1.所谓组。您检查一次,你可以选择多个比赛结果,每个结果是指一组

eg.
import re
pattern = re.compile(r'<div(.*?

>)(.*?)</div>')
match = pattern.match('<div class="test">Hello <div>wa haha<div>test xxx</div></div>world</div>')
if match:
print match.group(2)
print match.group(1)
print match.group(0)

>>> ================================ RESTART ================================
>>>
Hello <div>wa haha<div>test xxx
class="test">
<div class="test">Hello <div>wa haha<div>test xxx</div>
>>>
当中group(0)比較特殊,全部组的合集

2.查找一个文件里全部的http(url)地址

import re
import urllib2
f = open('url.txt','r')
string = ""
while 1:
line = f.readline()
if not line:break
string += line

f.close()

urls = re.findall('http[s]?://(?:[a-zA-Z]|[0-9]|[$-_@.&+]|[!*\(\),]|(?:%[0-9a-fA-F][0-9a-fA-F]))+', string)


3.正则表达式空格含有\t\r\n\f\v如几个字符
内容来自用户分享和网络整理,不保证内容的准确性,如有侵权内容,可联系管理员处理 点击这里给我发消息
标签: