本篇為基礎爬蟲的模板,使用urllib庫。 代碼功能:爬取百度貼吧的圖片。 代碼如下:
import reimport urllibdef getHtml(url): page=urllib.urlopen(url) html=page.read() return htmldef getImg(html): reg=r'src="(.+?/.jpg)" size=' imgre=re.compile(reg) imglist=re.findall(imgre,html) x=0 for imgurl in imglist: urllib.urlretrieve(imgurl,'%s.jpg'%x) #urllib.urlretrieve()方法,直接將遠程數據下載到本地。 x+=1name='http://tieba.baidu.com/p/4859088308'html=getHtml(name)getImg(html)注釋:1、re是正則庫,詳細可看 http://www.49028c.com/fnng/archive/2013/05/20/3089816.html
新聞熱點
疑難解答