Python爬虫实战:批量下载网站图片
yuyutoo 2024-12-19 17:34 2 浏览 0 评论
前言
本文的文字及图片来源于网络,仅供学习、交流使用,不具有任何商业用途,版权归原作者所有,如有问题请及时联系我们以作处理。
作者: GitPython
PS:如有需要Python学习资料的小伙伴可以加点击下方链接自行获取
http://note.youdao.com/noteshare?id=3054cce4add8a909e784ad934f956cef
1.获取图片的url链接
首先,打开百度图片首页,注意下图url中的index
接着,把页面切换成传统翻页版(flip),因为这样有利于我们爬取图片!
对比了几个url发现,pn参数是请求到的数量。通过修改pn参数,观察返回的数据,发现每页最多只能是60个图片。
注:gsm参数是pn参数的16进制表达,去掉无妨
然后,右键检查网页源代码,直接(ctrl+F)搜索 objURL
这样,我们发现了需要图片的url了。
2.把图片链接保存到本地
现在,我们要做的就是将这些信息爬取出来。
注:网页中有objURL,hoverURL…但是我们用的是objURL,因为这个是原图
那么,如何获取objURL?用正则表达式!
那我们该如何用正则表达式实现呢?其实只需要一行代码…
results = re.findall('"objURL":"(.*?)",', html)
核心代码:
1.获取图片url代码:
# 获取图片url连接
def get_parse_page(pn,name):
? ?for i in range(int(pn)):
? ? ? ?# 1.获取网页
? ? ? ?print('正在获取第{}页'.format(i+1))
? ? ? ?# 百度图片首页的url
? ? ? ?# name是你要搜索的关键词
? ? ? ?# pn是你想下载的页数
? ? ? ?url = 'https://image.baidu.com/search/flip?tn=baiduimage&ie=utf-8&word=%s&pn=%d' %(name,i*20)
? ? ? ?headers = {
? ? ? ? ? ?'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/53.0.2785.104 Safari/537.36 Core/1.53.4843.400 QQBrowser/9.7.13021.400'}
? ? ? ?# 发送请求,获取相应
? ? ? ?response = requests.get(url, headers=headers)
? ? ? ?html = response.content.decode()
? ? ? ?# print(html)
? ? ? ?# 2.正则表达式解析网页
? ? ? ?# "objURL":"http://n.sinaimg.cn/sports/transform/20170406/dHEk-fycxmks5842687.jpg"
? ? ? ?results = re.findall('"objURL":"(.*?)",', html) # 返回一个列表
? ? ? ?# 根据获取到的图片链接,把图片保存到本地
? ? ? ?save_to_txt(results, name, i)
2.保存图片到本地代码:
# 保存图片到本地
def save_to_txt(results, name, i):
? ?j = 0
? ?# 在当目录下创建文件夹
? ?if not os.path.exists('./' + name):
? ? ? ?os.makedirs('./' + name)
? ?# 下载图片
? ?for result in results:
? ? ? ?print('正在保存第{}个'.format(j))
? ? ? ?try:
? ? ? ? ? ?pic = requests.get(result, timeout=10)
? ? ? ? ? ?time.sleep(1)
? ? ? ?except:
? ? ? ? ? ?print('当前图片无法下载')
? ? ? ? ? ?j += 1
? ? ? ? ? ?continue
? ? ? ?# 可忽略,这段代码有bug
? ? ? ?# file_name = result.split('/')
? ? ? ?# file_name = file_name[len(file_name) - 1]
? ? ? ?# print(file_name)
? ? ? ?#
? ? ? ?# end = re.search('(.png|.jpg|.jpeg|.gif)#39;, file_name)
? ? ? ?# if end == None:
? ? ? ?# ? ? file_name = file_name + '.jpg'
? ? ? ?# 把图片保存到文件夹
? ? ? ?file_full_name = './' + name + '/' + str(i) + '-' + str(j) + '.jpg'
? ? ? ?with open(file_full_name, 'wb') as f:
? ? ? ? ? ?f.write(pic.content)
? ? ? ?j += 1
3.主函数代码:
# 主函数
if __name__ == '__main__':
? ?name = input('请输入你要下载的关键词:')
? ?pn = input('你想下载前几页(1页有60张):')
? ?get_parse_page(pn, name)
使用说明:
# 配置以下模块
import requests
import re
import os
import time
# 1.运行 py源文件
# 2.输入你想搜索的关键词,比如“柯基”、“泰迪”等
# 3.输入你想下载的页数,比如5,那就是下载 5 x 60=300 张图片
相关推荐
- 二十三种设计模式之-模板方法模式
-
这是我写二十三种设计模式第二篇文章。这个系列我将持续写下去,欢迎大家关注,点赞和收藏。模板方法模式1.模板方法模式(TemplateMethodPattern)又叫模板模式,在一个抽象的类中,公开...
- 从 Java 代码逆向工程生成 UML 类图和序列图
-
前言本文面向于那些软件架构师,设计师和开发人员,他们想使用IBM?Rational?SoftwareArchitect从Java?源代码来逆向工程生成UML类和序列图。逆向工程经常...
- 作为程序员,还在手动画流程图、类图?看看这个神器
-
老板看不懂你写的代码,要求你补充流程图。。。客户看不懂你的代码,要求画流程图。。。新同事看不懂你的代码,要求画流程图。。。此时此刻,你的内心是崩溃的。。。曾几何时,我也和你一样崩溃。。。...
- 使用 seaborn 绘制 12 类图
-
你好,我是zhenguo今晚分享一个很不错的seaborn可视化实战入门材料,这个实战教程来自于kaggle,使用的是美国警察开枪数据集,大小1M,一共5个csv文件使用seaborn作...
- 分享一个从源码快速生成UML类图的插件——PlantUML Parser
-
前言相信每一位程序员都分析过源码,在分析源码过程中,除了了解代码实现的功能(业务逻辑),还需要深入下去了解程序代码的执行过程以及结构,往往在了解代码执行过程(动态模型)前,先对代码的结构(静态模型)有...
- 需求分析-类图建模
-
...
- 还能这么玩?用VsCode画类图、流程图、时序图、...不要太爽
-
软件设计中,有好几种图需要画,比如流程图、类图、组件图等,我知道大部分人画流程图一般都会用微软的viso绘制,我之前也是这个习惯。viso画图有个不好的地方是需要时刻去调整线条和边框已达到简洁美观,今...
- UML:类图关系总结
-
UML类图几种关系的总结,泛化=实现>组合>聚合>关联>依赖在UML类图中,常见的有以下几种关系:泛化(Generalization),实现(Reali...
- 小白进阶之路:一文读懂UML-类图
-
UML类图(UnifiedModelingLanguageClassDiagram)是一种用于可视化和描述系统中类、属性、方法以及它们之间关系的图形化表示方法。我在大学时,学习这个知识总是容易...
- 餐饮系统大拆解:用类图拆解员工结构与工作职责(1)
-
编辑导语:利用类图这一方式,产品经理可以更清晰地梳理设计思路,进而推动后续方案的迭代优化,同时结合类图梳理,团队内也能降低沟通成本。具体应该如何拆解?本篇文章里,作者结合餐饮系统,对类图拆解和梳理做了...
- 软件开发设计文档之「类图」
-
对象是系统中用来描述客观事物的一个实体,它由对象标识(名称)、属性(状态、数据、成员变量)和服务(操作、行为、方法)三个要素组成,它们被封装为一个整体,以接口的形式对外提供服务。而类则是对具有相同属性...
- 如何绘制「UML类图」?附内容详解和优质实例分析!
-
下面这篇文章是笔者整理分析的关于如何绘制「UML类图」的相关内容,大家一起来看看吧!UML图有很多种,但是并非必须掌握所有的UML图,才能完整系统分析和设计工作。一般说来,在UML图中,只要掌握类图、...
- UML统一建模语言系列二:类图设计方法及最佳实践
-
一、前言...
- 类图(Class Diagram)
-
类图(ClassDiagram):类(Class)封装了数据和行为,是面向对象的重要组成部分,它是具有相同属性、操作、关系的对象集合的总称。类一般由三部分组成:类名(Class):每个类都必须有一个...
- 类图怎么画?简单快速绘制类图的软件
-
类图是显示模型中的类、类的内部结构和其他类的关系的图表,用来描述系统的结构化设计。类图是由类、包等元素和内容相互连接组成,是最常用的UML图。类图是描述系统中的类以及它们之间的关系的图表,它的主要作用...
你 发表评论:
欢迎- 一周热门
- 最近发表
- 标签列表
-
- mybatis plus (70)
- scheduledtask (71)
- css滚动条 (60)
- java学生成绩管理系统 (59)
- 结构体数组 (69)
- databasemetadata (64)
- javastatic (68)
- jsp实用教程 (53)
- fontawesome (57)
- widget开发 (57)
- vb net教程 (62)
- hibernate 教程 (63)
- case语句 (57)
- svn连接 (74)
- directoryindex (69)
- session timeout (58)
- textbox换行 (67)
- extension_dir (64)
- linearlayout (58)
- vba高级教程 (75)
- iframe用法 (58)
- sqlparameter (59)
- trim函数 (59)
- flex布局 (63)
- contextloaderlistener (56)