百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 编程网 > 正文

Python爬虫实战:批量下载网站图片

yuyutoo 2024-12-19 17:34 2 浏览 0 评论

前言

本文的文字及图片来源于网络,仅供学习、交流使用,不具有任何商业用途,版权归原作者所有,如有问题请及时联系我们以作处理。

作者: GitPython

PS:如有需要Python学习资料的小伙伴可以加点击下方链接自行获取

http://note.youdao.com/noteshare?id=3054cce4add8a909e784ad934f956cef

1.获取图片的url链接

首先,打开百度图片首页,注意下图url中的index

接着,把页面切换成传统翻页版(flip),因为这样有利于我们爬取图片!

对比了几个url发现,pn参数是请求到的数量。通过修改pn参数,观察返回的数据,发现每页最多只能是60个图片。

注:gsm参数是pn参数的16进制表达,去掉无妨

然后,右键检查网页源代码,直接(ctrl+F)搜索 objURL

这样,我们发现了需要图片的url了。

2.把图片链接保存到本地

现在,我们要做的就是将这些信息爬取出来。

注:网页中有objURL,hoverURL…但是我们用的是objURL,因为这个是原图

那么,如何获取objURL?用正则表达式!

那我们该如何用正则表达式实现呢?其实只需要一行代码…

results = re.findall('"objURL":"(.*?)",', html) 

核心代码:

1.获取图片url代码:

# 获取图片url连接
def get_parse_page(pn,name):
 ? ?for i in range(int(pn)):
 ? ? ? ?# 1.获取网页
 ? ? ? ?print('正在获取第{}页'.format(i+1))
 ? ? ? ?# 百度图片首页的url
 ? ? ? ?# name是你要搜索的关键词
 ? ? ? ?# pn是你想下载的页数
 ? ? ? ?url = 'https://image.baidu.com/search/flip?tn=baiduimage&ie=utf-8&word=%s&pn=%d' %(name,i*20)
 ? ? ? ?headers = {
 ? ? ? ? ? ?'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/53.0.2785.104 Safari/537.36 Core/1.53.4843.400 QQBrowser/9.7.13021.400'}
 ? ? ? ?# 发送请求,获取相应
 ? ? ? ?response = requests.get(url, headers=headers)
 ? ? ? ?html = response.content.decode()
 ? ? ? ?# print(html)
 ? ? ? ?# 2.正则表达式解析网页
 ? ? ? ?# "objURL":"http://n.sinaimg.cn/sports/transform/20170406/dHEk-fycxmks5842687.jpg"
 ? ? ? ?results = re.findall('"objURL":"(.*?)",', html) # 返回一个列表
 ? ? ? ?# 根据获取到的图片链接,把图片保存到本地
 ? ? ? ?save_to_txt(results, name, i)

2.保存图片到本地代码:

# 保存图片到本地
def save_to_txt(results, name, i):
 ? ?j = 0
 ? ?# 在当目录下创建文件夹
 ? ?if not os.path.exists('./' + name):
 ? ? ? ?os.makedirs('./' + name)
 ? ?# 下载图片
 ? ?for result in results:
 ? ? ? ?print('正在保存第{}个'.format(j))
 ? ? ? ?try:
 ? ? ? ? ? ?pic = requests.get(result, timeout=10)
 ? ? ? ? ? ?time.sleep(1)
 ? ? ? ?except:
 ? ? ? ? ? ?print('当前图片无法下载')
 ? ? ? ? ? ?j += 1
 ? ? ? ? ? ?continue
 ? ? ? ?# 可忽略,这段代码有bug
 ? ? ? ?# file_name = result.split('/')
 ? ? ? ?# file_name = file_name[len(file_name) - 1]
 ? ? ? ?# print(file_name)
 ? ? ? ?#
 ? ? ? ?# end = re.search('(.png|.jpg|.jpeg|.gif)#39;, file_name)
 ? ? ? ?# if end == None:
 ? ? ? ?# ? ? file_name = file_name + '.jpg'
 ? ? ? ?# 把图片保存到文件夹
 ? ? ? ?file_full_name = './' + name + '/' + str(i) + '-' + str(j) + '.jpg'
 ? ? ? ?with open(file_full_name, 'wb') as f:
 ? ? ? ? ? ?f.write(pic.content)
 ? ? ? ?j += 1

3.主函数代码:

# 主函数
if __name__ == '__main__':
 ? ?name = input('请输入你要下载的关键词:')
 ? ?pn = input('你想下载前几页(1页有60张):')
 ? ?get_parse_page(pn, name)

使用说明:

# 配置以下模块
import requests 
import re
import os
import time
# 1.运行 py源文件
# 2.输入你想搜索的关键词,比如“柯基”、“泰迪”等
# 3.输入你想下载的页数,比如5,那就是下载 5 x 60=300 张图片

相关推荐

二十三种设计模式之-模板方法模式

这是我写二十三种设计模式第二篇文章。这个系列我将持续写下去,欢迎大家关注,点赞和收藏。模板方法模式1.模板方法模式(TemplateMethodPattern)又叫模板模式,在一个抽象的类中,公开...

从 Java 代码逆向工程生成 UML 类图和序列图

前言本文面向于那些软件架构师,设计师和开发人员,他们想使用IBM?Rational?SoftwareArchitect从Java?源代码来逆向工程生成UML类和序列图。逆向工程经常...

作为程序员,还在手动画流程图、类图?看看这个神器

老板看不懂你写的代码,要求你补充流程图。。。客户看不懂你的代码,要求画流程图。。。新同事看不懂你的代码,要求画流程图。。。此时此刻,你的内心是崩溃的。。。曾几何时,我也和你一样崩溃。。。...

使用 seaborn 绘制 12 类图

你好,我是zhenguo今晚分享一个很不错的seaborn可视化实战入门材料,这个实战教程来自于kaggle,使用的是美国警察开枪数据集,大小1M,一共5个csv文件使用seaborn作...

分享一个从源码快速生成UML类图的插件——PlantUML Parser

前言相信每一位程序员都分析过源码,在分析源码过程中,除了了解代码实现的功能(业务逻辑),还需要深入下去了解程序代码的执行过程以及结构,往往在了解代码执行过程(动态模型)前,先对代码的结构(静态模型)有...

需求分析-类图建模

...

还能这么玩?用VsCode画类图、流程图、时序图、...不要太爽

软件设计中,有好几种图需要画,比如流程图、类图、组件图等,我知道大部分人画流程图一般都会用微软的viso绘制,我之前也是这个习惯。viso画图有个不好的地方是需要时刻去调整线条和边框已达到简洁美观,今...

UML:类图关系总结

UML类图几种关系的总结,泛化=实现>组合>聚合>关联>依赖在UML类图中,常见的有以下几种关系:泛化(Generalization),实现(Reali...

小白进阶之路:一文读懂UML-类图

UML类图(UnifiedModelingLanguageClassDiagram)是一种用于可视化和描述系统中类、属性、方法以及它们之间关系的图形化表示方法。我在大学时,学习这个知识总是容易...

餐饮系统大拆解:用类图拆解员工结构与工作职责(1)

编辑导语:利用类图这一方式,产品经理可以更清晰地梳理设计思路,进而推动后续方案的迭代优化,同时结合类图梳理,团队内也能降低沟通成本。具体应该如何拆解?本篇文章里,作者结合餐饮系统,对类图拆解和梳理做了...

软件开发设计文档之「类图」

对象是系统中用来描述客观事物的一个实体,它由对象标识(名称)、属性(状态、数据、成员变量)和服务(操作、行为、方法)三个要素组成,它们被封装为一个整体,以接口的形式对外提供服务。而类则是对具有相同属性...

如何绘制「UML类图」?附内容详解和优质实例分析!

下面这篇文章是笔者整理分析的关于如何绘制「UML类图」的相关内容,大家一起来看看吧!UML图有很多种,但是并非必须掌握所有的UML图,才能完整系统分析和设计工作。一般说来,在UML图中,只要掌握类图、...

UML统一建模语言系列二:类图设计方法及最佳实践

一、前言...

类图(Class Diagram)

类图(ClassDiagram):类(Class)封装了数据和行为,是面向对象的重要组成部分,它是具有相同属性、操作、关系的对象集合的总称。类一般由三部分组成:类名(Class):每个类都必须有一个...

类图怎么画?简单快速绘制类图的软件

类图是显示模型中的类、类的内部结构和其他类的关系的图表,用来描述系统的结构化设计。类图是由类、包等元素和内容相互连接组成,是最常用的UML图。类图是描述系统中的类以及它们之间的关系的图表,它的主要作用...

取消回复欢迎 发表评论: