首页 / 知识
python爬虫学习基础教程,批量抓取
2023-04-11 14:45:00

其中用到urllib2模块和正则表达式模块。下面直接上代码:
1 用python批量抓取
2
3 #!/usr/bin/env python
4 #-*- coding: utf-8 -*-
5 #通过urllib(2)模块下载网络内容
6 import urllib,urllib2,gevent
7 #引入正则表达式模块,时间模块
8 import re,time
9 from gevent import monkey
10
11 '''
12 在学习过程中有什么不懂得可以加我的python学习交流扣扣qun,934109170,群里有不错的学习教程、开发工具与电子书籍。
13 与你分享python企业当下人才需求及怎么从零基础学习好python,和学习什么内容。
14 '''
15 monkey.patch_all()
16
17 def geturllist(url):
18 url_list=[]
19 print url
20 s = urllib2.urlopen(url)
21 text = s.read()
22 #正则匹配,匹配其中的图片
23 html = re.search(r'<ol.*</ol>', text, re.S)
24 urls = re.finditer(r'<p><img src="(.+?)jpg" /></p>',html.group(),re.I)
25 for i in urls:
26 url=i.group(1).strip()+str("jpg")
27 url_list.append(url)
28 return url_list
29
30 def download(down_url):
31 name=str(time.time())[:-3]+"_"+re.sub('.+?/','',down_url)
32 print name
33 urllib.urlretrieve(down_url, "D:\\TEMP\\"+name)
34
35 def getpageurl():
36 page_list = []
37 #进行列表页循环
38 for page in range(1,700):
39 url="http://jandan.net/ooxx/page-"+str(page)+"#comments"
40 #把生成的url加入到page_list中
41 page_list.append(url)
42 print page_list
43 return page_list
44 if __name__ == '__main__':
45 jobs = []
46 pageurl = getpageurl()[::-1]
47 #进行图片下载
48 for i in pageurl:
49 for (downurl) in geturllist(i):
50 jobs.append(gevent.spawn(download, downurl))
51 gevent.joinall(jobs)
|
最新内容
相关内容
python爬虫和数据分析有哪些第三方
python爬虫和数据分析有哪些第三方库?,培训,爬虫,和数,python爬虫框架有哪些?
python爬虫框架有哪些?,网站,数据,工具,信息,系统,网络,主体,实时,历史数据,工作,Python被称为爬虫首选语言的主要原因是Python拥有众多的爬虫用于批量发送电子邮件的良好电子邮
用于批量发送电子邮件的良好电子邮件服务,用于批量发送电子邮件的良好电子邮件服务,电子邮件,托管,公司,发现,Good email service foHTML抓取的选项?
HTML抓取的选项?,HTML抓取的选项?,用于,抓取,很想,上也,Options for HTML scraping?
我正在考虑尝试漂亮的汤,一个用于HTML抓取的pythohtml快速入门基础教程推荐
html快速入门基础教程推荐,html,快速,入门,基础,教程,推荐,1.html,究竟,, 1.html究竟是什么? 从字面上理解,html是超文本标记语HTML5基础教程,从入门到精通知识分
HTML5基础教程,从入门到精通知识分享,HTML5,基础,教程,从,入门,到,精通,知识,分享,, 随着互联网的快速发展,对前端开发方面的人才html+css基础教程笔记总结分享
html+css基础教程笔记总结分享,html+css,基础,教程,笔记,总结,分享,HTML,称为,, HTML称为超文本标记语言,是一种标识性的语言。它