真实的国产乱ⅩXXX66竹夫人,五月香六月婷婷激情综合,亚洲日本VA一区二区三区,亚洲精品一区二区三区麻豆

成都創(chuàng)新互聯(lián)網(wǎng)站制作重慶分公司

Python爬蟲開發(fā)之xpath使用

在進行爬蟲開發(fā)中,需要的頁面信息進行解析處理,獲取到需要的關(guān)鍵數(shù)據(jù)??梢岳脁path進行對頁面的xml文件進行解析處理,獲取到需要的關(guān)鍵數(shù)據(jù)。
XPath使用:
XPath 可用來在 XML 文檔中對元素和屬性進行遍歷.
from lxml import etree
import urllib2
req = urllib2.Request(url)
req.add_header('User-Agent', 'Mozilla/4.0 (compatible; MSIE 5.5; Windows NT)')
web_info = urllib2.urlopen(req).read()
html = etree.HTML(web_info)
result = etree.tostring(html) #tostring 是補全缺失的html標(biāo)簽
html_data = result.xpath('/html/body/div/ul/li/a/text()') 獲取某個標(biāo)簽的數(shù)據(jù),返回的是對象,可以通過遍歷得到具體的數(shù)據(jù)
html_data = html.xpath('/html/body/div/ul/li/a/@href') 獲取某個標(biāo)簽的屬性獲取屬性值用@
html_data = html.xpath('/html/body/div/ul/li/a[@href="link2.html"]/text()') 獲取a表現(xiàn)屬性為link2.html的內(nèi)容
html_data = html.xpath('//li/a/text()') 使用相對路徑獲取a標(biāo)簽的內(nèi)容
html_data = html.xpath('//li/a//@href') 使用相對路徑獲取a標(biāo)簽的屬性值

成都創(chuàng)新互聯(lián)一直通過網(wǎng)站建設(shè)和網(wǎng)站營銷幫助企業(yè)獲得更多客戶資源。 以"深度挖掘,量身打造,注重實效"的一站式服務(wù),以成都網(wǎng)站設(shè)計、網(wǎng)站制作、移動互聯(lián)產(chǎn)品、成都全網(wǎng)營銷服務(wù)為核心業(yè)務(wù)。十多年網(wǎng)站制作的經(jīng)驗,使用新網(wǎng)站建設(shè)技術(shù),全新開發(fā)出的標(biāo)準網(wǎng)站,不但價格便宜而且實用、靈活,特別適合中小公司網(wǎng)站制作。網(wǎng)站管理系統(tǒng)簡單易用,維護方便,您可以完全操作網(wǎng)站資料,是中小公司快速網(wǎng)站建設(shè)的選擇。


當(dāng)前標(biāo)題:Python爬蟲開發(fā)之xpath使用
網(wǎng)站URL:http://weahome.cn/article/iiecog.html

其他資訊

在線咨詢

微信咨詢

電話咨詢

028-86922220(工作日)

18980820575(7×24)

提交需求

返回頂部