亚洲香蕉成人av网站在线观看_欧美精品成人91久久久久久久_久久久久久久久久久亚洲_热久久视久久精品18亚洲精品_国产精自产拍久久久久久_亚洲色图国产精品_91精品国产网站_中文字幕欧美日韩精品_国产精品久久久久久亚洲调教_国产精品久久一区_性夜试看影院91社区_97在线观看视频国产_68精品久久久久久欧美_欧美精品在线观看_国产精品一区二区久久精品_欧美老女人bb

首頁 > 編程 > Python > 正文

Python常用的爬蟲技巧總結

2020-01-04 17:34:40
字體:
來源:轉載
供稿:網友
本文給大家匯總介紹了Python編寫爬蟲的時候經常需要用到的一些技巧,非常的實用,有需要的小伙伴可以參考下
 

用python也差不多一年多了,python應用最多的場景還是web快速開發、爬蟲、自動化運維:寫過簡單網站、寫過自動發帖腳本、寫過收發郵件腳本、寫過簡單驗證碼識別腳本。

爬蟲在開發過程中也有很多復用的過程,這里總結一下,以后也能省些事情。

1、基本抓取網頁

get方法

import urllib2 url = "http://www.baidu.com"response = urllib2.urlopen(url)print response.read()

post方法

import urllibimport urllib2 url = "http://abcde.com"form = {'name':'abc','password':'1234'}form_data = urllib.urlencode(form)request = urllib2.Request(url,form_data)response = urllib2.urlopen(request)print response.read()

2、使用代理IP

    在開發爬蟲過程中經常會遇到IP被封掉的情況,這時就需要用到代理IP;

在urllib2包中有ProxyHandler類,通過此類可以設置代理訪問網頁,如下代碼片段:

import urllib2 proxy = urllib2.ProxyHandler({'http': '127.0.0.1:8087'})opener = urllib2.build_opener(proxy)urllib2.install_opener(opener)response = urllib2.urlopen('http://www.baidu.com')print response.read()

3、Cookies處理

    cookies是某些網站為了辨別用戶身份、進行session跟蹤而儲存在用戶本地終端上的數據(通常經過加密),python提供了cookielib模塊用于處理cookies,cookielib模塊的主要作用是提供可存儲cookie的對象,以便于與urllib2模塊配合使用來訪問Internet資源.

代碼片段:

import urllib2, cookielib cookie_support= urllib2.HTTPCookieProcessor(cookielib.CookieJar())opener = urllib2.build_opener(cookie_support)urllib2.install_opener(opener)content = urllib2.urlopen('http://XXXX').read()

    關鍵在于CookieJar(),它用于管理HTTP cookie值、存儲HTTP請求生成的cookie、向傳出的HTTP請求添加cookie的對象。整個cookie都存儲在內存中,對CookieJar實例進行垃圾回收后cookie也將丟失,所有過程都不需要單獨去操作。

  手動添加cookie

cookie = "PHPSESSID=91rurfqm2329bopnosfu4fvmu7; kmsign=55d2c12c9b1e3; KMUID=b6Ejc1XSwPq9o756AxnBAg="request.add_header("Cookie", cookie)

4、偽裝成瀏覽器

    某些網站反感爬蟲的到訪,于是對爬蟲一律拒絕請求。所以用urllib2直接訪問網站經常會出現HTTP Error 403: Forbidden的情況

對有些 header 要特別留意,Server 端會針對這些 header 做檢查

  1.User-Agent 有些 Server 或 Proxy 會檢查該值,用來判斷是否是瀏覽器發起的 Request

  2.Content-Type 在使用 REST 接口時,Server 會檢查該值,用來確定 HTTP Body 中的內容該怎樣解析。

這時可以通過修改http包中的header來實現,代碼片段如下:

import urllib2 headers = {  'User-Agent':'Mozilla/5.0 (Windows; U; Windows NT 6.1; en-US; rv:1.9.1.6) Gecko/20091201 Firefox/3.5.6'}request = urllib2.Request(  url = 'http://my.oschina.net/jhao104/blog?catalog=3463517',  headers = headers)print urllib2.urlopen(request).read()

5、頁面解析

    對于頁面解析最強大的當然是正則表達式,這個對于不同網站不同的使用者都不一樣,就不用過多的說明,附兩個比較好的網址:

 

其次就是解析庫了,常用的有兩個lxml和BeautifulSoup,對于這兩個的使用介紹兩個比較好的網站:

 

對于這兩個庫,我的評價是,都是HTML/XML的處理庫,Beautifulsoup純python實現,效率低,但是功能實用,比如能用通過結果搜索獲得某個HTML節點的源碼;lxmlC語言編碼,高效,支持Xpath

6、驗證碼的處理

對于一些簡單的驗證碼,可以進行簡單的識別。本人也只進行過一些簡單的驗證碼識別。但是有些反人類的驗證碼,比如12306,可以通過打碼平臺進行人工打碼,當然這是要付費的。

7、gzip壓縮

    有沒有遇到過某些網頁,不論怎么轉碼都是一團亂碼。哈哈,那說明你還不知道許多web服務具有發送壓縮數據的能力,這可以將網絡線路上傳輸的大量數據消減 60% 以上。這尤其適用于 XML web 服務,因為 XML 數據 的壓縮率可以很高。

但是一般服務器不會為你發送壓縮數據,除非你告訴服務器你可以處理壓縮數據。

于是需要這樣修改代碼:

import urllib2, httplibrequest = urllib2.Request('http://xxxx.com')request.add_header('Accept-encoding', 'gzip')    1opener = urllib2.build_opener()f = opener.open(request)

這是關鍵:創建Request對象,添加一個 Accept-encoding 頭信息告訴服務器你能接受 gzip 壓縮數據

然后就是解壓縮數據:

import StringIOimport gzip compresseddata = f.read() compressedstream = StringIO.StringIO(compresseddata)gzipper = gzip.GzipFile(fileobj=compressedstream) print gzipper.read()

8、多線程并發抓取

    單線程太慢的話,就需要多線程了,這里給個簡單的線程池模板 這個程序只是簡單地打印了1-10,但是可以看出是并發的。

雖然說python的多線程很雞肋,但是對于爬蟲這種網絡頻繁型,還是能一定程度提高效率的。

from threading import Threadfrom Queue import Queuefrom time import sleep# q是任務隊列#NUM是并發線程總數#JOBS是有多少任務q = Queue()NUM = 2JOBS = 10#具體的處理函數,負責處理單個任務def do_somthing_using(arguments):  print arguments#這個是工作進程,負責不斷從隊列取數據并處理def working():  while True:    arguments = q.get()    do_somthing_using(arguments)    sleep(1)    q.task_done()#fork NUM個線程等待隊列for i in range(NUM):  t = Thread(target=working)  t.setDaemon(True)  t.start()#把JOBS排入隊列for i in range(JOBS):  q.put(i)#等待所有JOBS完成q.join()
 

發表評論 共有條評論
用戶名: 密碼:
驗證碼: 匿名發表
亚洲香蕉成人av网站在线观看_欧美精品成人91久久久久久久_久久久久久久久久久亚洲_热久久视久久精品18亚洲精品_国产精自产拍久久久久久_亚洲色图国产精品_91精品国产网站_中文字幕欧美日韩精品_国产精品久久久久久亚洲调教_国产精品久久一区_性夜试看影院91社区_97在线观看视频国产_68精品久久久久久欧美_欧美精品在线观看_国产精品一区二区久久精品_欧美老女人bb
国产精品国产亚洲伊人久久| 国产suv精品一区二区三区88区| 亚洲美女又黄又爽在线观看| 亚洲精品成人网| 欧美日韩国产成人高清视频| 97在线精品视频| 亚洲精品视频网上网址在线观看| 欧美性做爰毛片| 国产成人精品日本亚洲专区61| 国模吧一区二区三区| 久久人人爽亚洲精品天堂| 国内精品伊人久久| 欧美第一黄网免费网站| 成人国产精品av| 北条麻妃一区二区在线观看| 亚洲二区在线播放视频| 中文字幕自拍vr一区二区三区| 日产日韩在线亚洲欧美| 欧美性xxxx极品hd满灌| 成人羞羞国产免费| 亚洲午夜未满十八勿入免费观看全集| 日本成人免费在线| 亚洲白虎美女被爆操| 精品国产福利在线| 国产成人一区二| 国产精品日韩在线观看| 国产mv久久久| 欧美激情中文网| 亚洲一级黄色av| 国产精品视频免费观看www| 日韩亚洲第一页| 91中文精品字幕在线视频| 国产日韩欧美在线观看| 国产亚洲精品久久久久久牛牛| 日韩av不卡在线| 亚洲国产另类久久精品| 日日噜噜噜夜夜爽亚洲精品| 精品久久在线播放| 欧美精品激情blacked18| 久久成人这里只有精品| 久久精品99国产精品酒店日本| 亚洲男人的天堂在线| 亚洲天堂男人天堂女人天堂| 亚洲精品www久久久| 色香阁99久久精品久久久| 美乳少妇欧美精品| 久久91亚洲精品中文字幕奶水| 日韩毛片在线观看| 欧洲成人性视频| 国产视频观看一区| 亚洲高清在线观看| 久久精品美女视频网站| 国内精品模特av私拍在线观看| 日韩视频免费大全中文字幕| 九九精品在线播放| 亚洲成人精品久久| 国产成人久久久精品一区| 精品国产一区二区三区久久狼黑人| 国产精品美女无圣光视频| 国产噜噜噜噜噜久久久久久久久| 欧美高清不卡在线| 国产精品毛片a∨一区二区三区|国| 久久久久久久久电影| 国产欧美日韩中文| 一本大道久久加勒比香蕉| 亚洲福利在线看| 国产成人精品免费视频| 日韩在线视频一区| xxxxx成人.com| 国产精品成人一区二区三区吃奶| 欧美激情奇米色| 97精品国产aⅴ7777| 日韩中文字幕视频在线观看| 精品久久久久久久久国产字幕| 久久久亚洲国产天美传媒修理工| 国产精品h在线观看| 国产一区二区av| 精品久久久在线观看| 欧美日韩性视频在线| 国产精品爽爽爽| 日韩色av导航| 91在线视频精品| 亚州精品天堂中文字幕| 精品久久久在线观看| 国产精品久久久久久久久久小说| 亚洲第一av网| 久久久久久久色| 亚洲国产精品久久精品怡红院| 亚洲字幕在线观看| 日韩免费av片在线观看| 国产精品久久不能| 国产精品免费视频xxxx| 欧美视频中文字幕在线| 欧美成人午夜免费视在线看片| 久久艳片www.17c.com| 亚洲性av在线| 亚洲国产小视频在线观看| 在线a欧美视频| 青青草精品毛片| 色综合天天狠天天透天天伊人| 日韩中文在线中文网三级| 91欧美视频网站| 日韩成人中文字幕在线观看| 国产精品香蕉在线观看| 日韩在线观看视频免费| 国产精品h在线观看| 欧美日韩免费看| 午夜精品久久久久久久久久久久久| 日韩高清av在线| 久久久久久成人| 日韩有码在线视频| 久久免费高清视频| 久久久国产精品视频| 亚洲精品视频播放| 97超级碰在线看视频免费在线看| 欧美激情免费视频| 久久久999精品视频| 精品久久久视频| 国产精品wwww| 韩国国内大量揄拍精品视频| 日本免费久久高清视频| 久久综合久久美利坚合众国| 欧美特黄级在线| 中文字幕久精品免费视频| 久久久久久久久久亚洲| 国产精品一区二区三| 国产欧美一区二区三区视频| 日本sm极度另类视频| 亚洲精品综合久久中文字幕| 久久亚洲国产精品成人av秋霞| 国模视频一区二区| 欧美极品少妇xxxxⅹ免费视频| 成人av在线天堂| 亚洲第一福利网| 久久久国产精品一区| 亚洲国产欧美一区二区三区久久| 久久人人爽人人爽人人片av高清| 久青草国产97香蕉在线视频| 国产精品美女午夜av| 国产美女久久精品香蕉69| 精品无人区乱码1区2区3区在线| 亚洲人精选亚洲人成在线| 正在播放亚洲1区| 成人黄在线观看| 精品久久久久久久久久久久| 日韩国产中文字幕| 国产精品看片资源| 国产精品自产拍在线观| 亚洲欧美综合区自拍另类| 国产日本欧美在线观看| 高清视频欧美一级| 一个色综合导航| 国产性猛交xxxx免费看久久| 国产精品黄页免费高清在线观看| 精品少妇v888av| 欧美性xxxx极品高清hd直播| 色噜噜久久综合伊人一本| 中国人与牲禽动交精品| 精品国产欧美一区二区三区成人| 九九视频直播综合网| 久久久久久久久国产| 国产精品久久久久久av福利| 国产精品日韩在线一区| 在线观看欧美日韩国产|