百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 编程网 > 正文

python入门教程爬虫基础(十二)正则表达式 regular expression

yuyutoo 2024-10-18 12:14 1 浏览 0 评论

一 正则表达式

正则表达式是各种字符串操作的强大工具.

它们对于以下两种主要任务是有用的:

--验证字符串是否匹配模式(pattern)例如:字符串具有电子邮件地址的格式

--对字符串中某些字符进行替换(例如:将所有美式拼写改为英式拼写)

正则表达式是一个高度专业化的迷你编程语言.与SQL(用于数据库操作)类似,适用于多种编程环境.

正则表达式可以使用re模块来访问,它是标准库的一部分

定义正则表达式之后,可以使用re.match函数来确定字符串的开头是否匹配.

如果匹配,match返回匹配的对象,否则返回None.

为了避免在处理正则表达式时出现混淆,我们使用原始字符串r"expression"

原始字符串不会转义任何东西,这使得使用正则表达式更容易.

r取自raw(原始的,未加处理的)

●其他的正则函数:

re.search和re.findall

re.search函数在字符串中的任何位置找到匹配模式.

re.findall函数返回一个与模式匹配的所有子串的列表.

例如:

●函数re.finditer和re.findall类似,不过它返回一个迭代器,而不是一个列表.

正则表达式搜索(search)使用多个方法返回一个对象,提供有关它的详细信息.

这些方法包括返回搜索到的字符串,返回第一个搜索到的模式在原始字符串中开始和结束下标索引,以及将开始和结束下标索引作为元组返回的索引.

例如:

搜索和替换:

使用正则表达式的最重要的re方法是sub

语法:

re.sub(pattern,repl,string)

此方法用repl(replace)替换字符串中所有出现的模式(pattern),

sub方法返回修改后的字符串.

例如:

二 简单的元字符

元字符使正则表达式比普通的字符串方法更强大.

它们允许你创建正则表达式来表示像"一个或多个元音的重复"这样的概念([aeiou]+)

如果要创建与元字符(例如$)匹配的正则表达式,则元字符的存在会造成问题,你可以通过在它们前面加一个反斜杠来转义元字符.

但是,这可能导致问题,因为反斜杠在正常的python字符串中也有一个转义的功能.

这可能意味着需要连续放置三到四个反斜杠来完成所有的转义.

为了避免这种情况,你可以使用一个原始字符串,这是一个前面带有"r"的普通字符串.

元字符

.(点)它匹配任何字符,但不匹配新的行(\n).

例如:

^和$:分别匹配字符串的开头和结尾

例如:

三 字符类

字符类:通过将匹配的字符放在方括号内来创建字符类,这样可以实现只匹配特定字符集中的一个.

字符类也可以匹配字符的范围:

[a-z]匹配任何小写字母字符

[G-P]匹配从G到P的任何大写字符

[0-9]匹配任何数字

一个字符类可以包含多个范围.例如,[A-Za-z]匹配任何一个字母

例如:

在字符类的开头放置一个^来反转它

这使得它匹配除包含的字符之外的任何字符.其他元字符(.和$)在字符类中没有意义

元字符^是字符类中的第一个字符时,才有意义

例如:

r"[^A-Z]"":表示匹配不包括大写字母的所有字符.(即不能全是大写字母)

四 更多的元字符

元字符(*):表示零次或多次重复.*前可以是一个单独的字符,一个类或一组括在括号中的字符

例如:

上面的例子,匹配以"egg"开头的字符串,并跟随零个或多个"spam"

[a^]*:表示匹配零个或多个"a"或"^"

元字符+和*非常相似.+表示一个或多个重复

例如:

*:匹配0个或多个前面的表达式

+:匹配1个或多个前面的表达式

?:匹配0个或一个前面的表达式

例如:

大括号可以用来表示两个数字之间的重复次数

正则表达式{x,y}表示重复x次-y次之间

因此{0,1}与?相同

大括号如果第一个数字缺失,则将其视为零.如果第二个数字丢失,则被认为是无限的.

例如:

"9{1,3}$"匹配具有1到3个9的字符串

关注小编不迷路,下节我们继续介绍正则表达式!

相关推荐

Google Chrome 100 Beta发布 用户代理字符串作用开始逐渐降低

GoogleChrome和MozillaFirefox都在迅速接近100版本,这有可能破坏一些错误识别浏览器版本的网站(可能导致访问不正常,这有点类似于众所周知的千年虫)。两种浏览器都在研究可能的...

如何在Chrome,Edge,Safari和Firefox中更改用户代理

无论您是SEO,营销人员还是Web开发人员,通常都可能需要更改浏览器的用户代理以测试其他内容。例如,您正在运行特定于MAC-OS的活动。要确定您的广告系列是否正常运行并且未针对Linux用户,更改浏览...

Mozilla正在测试新的浏览器UserAgent

Mozilla最近发布了一个实验项目来测试3位数的UserAgent版本“Firefox/100.0”会不会让一些网站停止正常工作。浏览器UserAgent是一串字符串,里面包含了浏览器的软件信息,版...

爬虫与User-Agent

什么是User-Agent呢?User-Agent是一个特殊字符串头,被广泛用来标示浏览器客户端的信息,使得服务器能识别客户机使用的操作系统和版本,CPU类型,浏览器及版本,浏览器的渲染引擎,浏览器...

让你的浏览器充满魔性——User Agent Switche

对于前端人员,闲暇时就会研究各种插件,今天我就分享UserAgentSwitcher在Firefox和Chrome的使用情况。一、Firefox浏览器UserAgentSwitcher作为火...

亚马逊账号运营安全-浏览器指纹识别之User-Agent开篇

UA包含了一个约定的特征字符串。主要是面向受访问网络表明自己的操作系统,软件开发商,版本,应用类型等信息。这是一种主动暴露信息的方式。我们来看关于UA的简单语法定义:User-Agent:<p...

【每日学习】Python爬虫之伪装浏览器User-Agent

【主题】Python爬虫之伪装浏览器原理【分析】1.创建自定义请求对象的目的,对抗网站的反爬虫机制2.反爬虫机制1:判断用户是否是浏览器访问(User-Agent)3.对抗措施1:伪装浏览器进行访问【...

亚马逊账号运营安全-浏览器指纹识别之User-Agent二篇

大家好,上一篇亚马逊账号运营安全-浏览器指纹识别之User-Agent开篇为大家阐述了原理。下面是作者为大家整理的其他几个主流浏览器的UA配置。一下都是Windows1064X系统下整理。Chrom...

常见的爬虫UserAgent

通过前面的文章我们知道,UserAgent(用户代理)是HTTP请求的一部分,用于告诉服务器发起请求的客户端类型和属性等信息。同时,也了解了常见的UserAgent。...

HTTP请求头之User-Agent

什么是User-AgentUser-Agent中文名为用户代理,简称UA,...

你想不到的浏览器流氓史!那些奇怪的User-Agent,是这么来的...

平时我们用chrome浏览器做开发测试。Chrome的Useragent字段怎么这么奇怪?...

谷歌宣布 Chrome 将逐步停止支持 User Agent

谷歌近日宣布将放弃对Chrome浏览器中用户代理字符串(User-AgentString)的支持。取而代之的是,Chrome将提供一个名为“客户端提示(ClientHints)”的新API...

数据采集-用户代理(useragent)

UserAgent分类:PC端的UserAgent。移动端UserAgent。使用UserAgent的必要性:在写python网络爬虫程序的时候,经常需要修改UserAgent,有很多原因,罗列几个如...

如何获取当前浏览器的useragent

有时候,我们需要得到浏览器的useragent,从而再进行后面的一系列判断,返回不同的值。网上有说,在浏览器地址栏输入:javascript:alert(navigator.userAgent)这种方...

User Agent 解析:它是什么以及如何修改

什么是UserAgent?UserAgent,简称UA,是一个使服务器能够识别用户使用的浏览器类型、版本以及运行浏览器的操作系统等信息的字符串。它作为浏览器请求头部信息的一部分发送给服务器,以便服务...

取消回复欢迎 发表评论: