Python 爬虫&正则
Python 爬虫&正则
爬虫
正则
正则
| [正则表达式 – 语法 | 菜鸟教程 (runoob.com)](https://www.runoob.com/regexp/regexp-syntax.html) |
| 较常用字符 | 描述 |
|---|---|
| [ABC] | 匹配字符串中所有的 A B C 字母 |
| [^ABC] | 匹配字符串中所有的非 A B C 字母 |
| [A-Z] | [A-Z] 表示一个区间,匹配所有大写字母,[a-z] 表示所有小写字母。 |
. |
匹配除换行符(\n、\r)之外的任何单个字符,相等于[^\n\r]。 |
| \s | 匹配任何空白字符,包括空格、制表符、换页符等等。\S匹配任何非空白字符。 |
| ^ | 匹配输入字符串的开始位置 |
| $ | 匹配输入字符串的结尾位置。 |
| ? | 匹配前面的子表达式零次或一次,或指明一个非贪婪限定符。 |
| * | 匹配前面的子表达式零次或多次。 |
| + | 匹配前面的子表达式一次或多次。 |
| {n,m} | m 和 n 均为非负整数,其中n <= m。最少匹配 n 次且最多匹配 m 次。例如,”o{1,3}” 将匹配 “fooooood” 中的前三个 o。’o{0,1}’ 等价于 ‘o?’。请注意在逗号和两个数之间不能有空格。 |
| ( ) | 标记一个子表达式的开始和结束位置。子表达式可以获取供以后使用。如(?P<函数名>匹配正则)函数名> |
| 贪婪与非贪婪模式 | 在正则表达式中,”*“,”+“,”?“都是贪婪地,使用他们时,会尽可能多的匹配内容,所以,<.*>中的星号(表示任意次数的重复)匹配到了字符串最后的 >,解决这个问题,就需要使用非贪婪模式,也就是在星号后面加上 ?,变成这样 <.*?> |
python正则:
| [Python 正则表达式 | 菜鸟教程 (runoob.com)](https://www.runoob.com/python/python-reg-expressions.html) |
1
2
3
4
5
6
7
8
9
import re
re.match(pattern, string, flags=0)
re.search(pattern, string, flags=0)
# 匹配成功 re.match 方法返回一个匹配的对象,否则返回 None。
# 我们可以使用 group(num) 或 groups() 匹配对象函数来获取匹配表达式。
'''
re.match与re.search的区别
re.match只匹配字符串的开始,如果字符串开始不符合正则表达式,则匹配失败,函数返回None;而re.search匹配整个字符串,直到找到一个匹配。
'''
| 参数 | 描述 |
|---|---|
| pattern | 匹配的正则表达式 |
| string | 要匹配的字符串。 |
| flags | 标志位,用于控制正则表达式的匹配方式,如:是否区分大小写,多行匹配等等。 |
| flags 修饰符 | 描述 |
|---|---|
| re.I | 使匹配对大小写不敏感 |
| re.L | 做本地化识别(locale-aware)匹配 |
| re.M | 多行匹配,影响 ^ 和 $ |
| re.S | 使 . 匹配包括换行在内的所有字符 |
| re.U | 根据Unicode字符集解析字符。这个标志影响 \w, \W, \b, \B. |
| re.X | 该标志通过给予你更灵活的格式以便你将正则表达式写得更易于理解。 |
1
2
3
4
5
6
7
8
re.compile
compile 函数用于编译正则表达式,生成一个正则表达式( Pattern )对象,供 match() 和 search() 这两个函数使用。
语法格式为:
re.compile(pattern[, flags])
pattern : 一个字符串形式的正则表达式
flags : 可选,表示匹配模式,比如忽略大小写,多行模式等.
1
2
3
4
5
6
7
re.sub(pattern, repl, string, count=0, flags=0)
'''
pattern : 正则中的模式字符串。
repl : 替换的字符串,也可为一个函数。
string : 要被查找替换的原 始字符串。
count : 模式匹配后替换的最大次数,默认 0 表示替换所有的匹配。
'''
This post is licensed under
CC BY 4.0
by the author.