Python大數據之使用lxml庫解析html網頁文件示例

2024-09-09 19:02:33

字體：大中小

來源：轉載

供稿：網友

本文實例講述了Python大數據之使用lxml庫解析html網頁文件。分享給大家供大家參考，具體如下：

lxml是Python的一個html/xml解析并建立dom的庫，lxml的特點是功能強大，性能也不錯，xml包含了ElementTree ，html5lib ，beautfulsoup 等庫。

使用lxml前注意事項：先確保html經過了utf-8解碼，即code =html.decode('utf-8', 'ignore')，否則會出現解析出錯情況。因為中文被編碼成utf-8之后變成 '/u2541'　之類的形式，lxml一遇到　"/"就會認為其標簽結束。

具體用法：元素節點操作

1、解析HTMl建立DOM

from lxml import etreedom = etree.HTML(html)

2、查看dom中子元素的個數 len(dom)

3、查看某節點的內容：etree.tostring(dom[0])

4、獲取節點的標簽名稱：dom[0].tag

5、獲取某節點的父節點：dom[0].getparent()

6、獲取某節點的屬性節點的內容：dom[0].get("屬性名稱")

對xpath路徑的支持：

XPath即為XML路徑語言，是用一種類似目錄樹的方法來描述在XML文檔中的路徑。比如用"/"來作為上下層級間的分隔。第一個"/"表示文檔的根節點（注意，不是指文檔最外層的tag節點，而是指文檔本身）。比如對于一個HTML文件來說，最外層的節點應該是"/html"。

xpath選取元素的方式：

1、絕對路徑，如page.xpath("/html/body/p")，它會找到body這個節點下所有的p標簽

2、相對路徑，page.xpath("http://p"),它會找到整個html代碼里的所有p標簽。

xpath篩選方式：

1、選取元素時一個列表，可通過索引查找[n]

2、通過屬性值篩選元素p =page.xpath("http://p[@]")

3、如果沒有屬性可以通過text()（獲取元素中文本）、position()（獲取元素位置）、last()等進行篩選

獲取屬性值

dom.xpath(.//a/@href)

獲取文本

dom.xpath(".//a/text()")

示例代碼：

#!/usr/bin/python# -*- coding:utf-8 -*-from scrapy.spiders import Spiderfrom lxml import etreefrom jredu.items import JreduItemclass JreduSpider(Spider):  name = 'tt' #爬蟲的名字，必須的，唯一的  allowed_domains = ['sohu.com']  start_urls = [    'http://www.sohu.com'  ]  def parse(self, response):    content = response.body.decode('utf-8')    dom = etree.HTML(content)    for ul in dom.xpath("http://div[@class='focus-news-box']/div[@class='list16']/ul"):      lis = ul.xpath("./li")      for li in lis:        item = JreduItem() #定義對象        if ul.index(li) == 0:          strong = li.xpath("./a/strong/text()")          li.xpath("./a/@href")          item['title']= strong[0]          item['href'] = li.xpath("./a/@href")[0]        else:          la = li.xpath("./a[last()]/text()")          item['title'] = la[0]          item['href'] = li.xpath("./a[last()]/href")[0]        yield item

更多關于Python相關內容可查看本站專題：《Python Socket編程技巧總結》、《Python正則表達式用法總結》、《Python數據結構與算法教程》、《Python函數使用技巧總結》、《Python字符串操作技巧匯總》、《Python入門與進階經典教程》及《Python文件與目錄操作技巧匯總》

上一篇：Python遠程視頻監控程序的實例代碼

下一篇：python2與python3爬蟲中get與post對比解析