欧美一区二区三区老妇人-欧美做爰猛烈大尺度电-99久久夜色精品国产亚洲a-亚洲福利视频一区二区

python批量抓取的方法

今天小編給大家分享一下python批量抓取的方法的相關知識點,內容詳細,邏輯清晰,相信大部分人都還太了解這方面的知識,所以分享這篇文章給大家參考一下,希望大家閱讀完這篇文章后有所收獲,下面我們一起來了解一下吧。

創(chuàng)新互聯(lián)專注于樺南網(wǎng)站建設服務及定制,我們擁有豐富的企業(yè)做網(wǎng)站經(jīng)驗。 熱誠為您提供樺南營銷型網(wǎng)站建設,樺南網(wǎng)站制作、樺南網(wǎng)頁設計、樺南網(wǎng)站官網(wǎng)定制、重慶小程序開發(fā)公司服務,打造樺南網(wǎng)絡公司原創(chuàng)品牌,更為您提供樺南網(wǎng)站排名全網(wǎng)營銷落地服務。

其中用到urllib2模塊和正則表達式模塊。下面直接上代碼:

 1 用python批量抓取

 2  

 3 #!/usr/bin/env python

 4 #-*- coding: utf-8 -*-

 5 #通過urllib(2)模塊下載網(wǎng)絡內容

 6 import urllib,urllib2,gevent

 7 #引入正則表達式模塊,時間模塊

 8 import re,time

 9 from gevent import monkey

15 monkey.patch_all()

16  

17 def geturllist(url):

18     url_list=[]

19     print url       

20     s = urllib2.urlopen(url)

21     text = s.read()

22     #正則匹配,匹配其中的圖片

23     html = re.search(r'<ol.*</ol>', text, re.S)

24     urls = re.finditer(r'<p><img src="(.+?)jpg" /></p>',html.group(),re.I)

25     for i in urls:

26         url=i.group(1).strip()+str("jpg")

27         url_list.append(url)

28     return url_list

29  

30 def download(down_url):

31     name=str(time.time())[:-3]+"_"+re.sub('.+?/','',down_url)

32     print name

33     urllib.urlretrieve(down_url, "D:\\TEMP\\"+name)

34  

35 def getpageurl():

36     page_list = []

37     #進行列表頁循環(huán)

38     for page in range(1,700):

39         url="http://jandan.net/ooxx/page-"+str(page)+"#comments"

40         #把生成的url加入到page_list中

41         page_list.append(url)

42     print page_list

43     return page_list

44 if __name__ == '__main__':

45     jobs = []

46     pageurl = getpageurl()[::-1]

47     #進行圖片下載

48     for i in pageurl:

49         for (downurl) in geturllist(i):

50             jobs.append(gevent.spawn(download, downurl))

51     gevent.joinall(jobs)

以上就是“python批量抓取的方法”這篇文章的所有內容,感謝各位的閱讀!相信大家閱讀完這篇文章都有很大的收獲,小編每天都會為大家更新不同的知識,如果還想學習更多的知識,請關注創(chuàng)新互聯(lián)行業(yè)資訊頻道。

網(wǎng)站名稱:python批量抓取的方法
網(wǎng)址分享:http://www.chinadenli.net/article26/gisecg.html

成都網(wǎng)站建設公司_創(chuàng)新互聯(lián),為您提供App開發(fā)標簽優(yōu)化關鍵詞優(yōu)化品牌網(wǎng)站制作外貿網(wǎng)站建設品牌網(wǎng)站設計

廣告

聲明:本網(wǎng)站發(fā)布的內容(圖片、視頻和文字)以用戶投稿、用戶轉載內容為主,如果涉及侵權請盡快告知,我們將會在第一時間刪除。文章觀點不代表本網(wǎng)站立場,如需處理請聯(lián)系客服。電話:028-86922220;郵箱:631063699@qq.com。內容未經(jīng)允許不得轉載,或轉載時需注明來源: 創(chuàng)新互聯(lián)

商城網(wǎng)站建設