Python爬蟲如何正則表達式-創(chuàng)新互聯(lián)

創(chuàng)新互聯(lián)www.cdcxhl.cn八線動態(tài)BGP香港云服務器提供商，新人活動買多久送多久，劃算不套路！

創(chuàng)新互聯(lián)長期為上千多家客戶提供的網(wǎng)站建設服務，團隊從業(yè)經(jīng)驗10年，關注不同地域、不同群體，并針對不同對象提供差異化的產(chǎn)品和服務；打造開放共贏平臺，與合作伙伴共同營造健康的互聯(lián)網(wǎng)生態(tài)環(huán)境。為赫章企業(yè)提供專業(yè)的成都網(wǎng)站建設、成都網(wǎng)站設計，赫章網(wǎng)站改版等技術服務。擁有十余年豐富建站經(jīng)驗和眾多成功案例,為您定制開發(fā)。

今天就跟大家聊聊有關Python爬蟲如何正則表達式，可能很多人都不太了解，為了讓大家更加了解，小編給大家總結了以下內容，希望大家根據(jù)這篇文章可以有所收獲。

爬蟲——爬蟲中使用正則表達式

下面我們嘗試爬取內涵段子網(wǎng)站：http://www.neihan8.com/article/list_5_1.html

打開之后，當你進行翻頁的時候，不難注意到，url地址的變化：

第一頁url: http: //www.neihan8.com/article/list_5_1 .html

第二頁url: http: //www.neihan8.com/article/list_5_2 .html

第三頁url: http: //www.neihan8.com/article/list_5_3 .html

第四頁url: http: //www.neihan8.com/article/list_5_4 .html

這樣，我們把url規(guī)律找到了，要想爬取所有的段子，只需要修改一個參數(shù)即可。下面，我們就開始一步一步將所有的段子爬取下來。

第一步：獲取網(wǎng)頁數(shù)據(jù)（網(wǎng)頁上全部內容）

1.按照我們之前的用法，我們需要寫一個加載頁面的方法。

這里我們定義一個類，將url請求作為一個成員方法處理。

我們創(chuàng)建一個duanzi_spider.py文件。

然后定義一個Spider類，并且添加一個加載頁面的成員方法。

#!/usr/bin/python3
# -*- coding:utf-8 -*-
 
import requests
 
class Spider(object):
    """
    一個爬蟲類
    """
    def loadPage(self, url):
        """
        下載指定url頁面的內容
        :return:
        """
        # User-Agent頭
        header = {'User-Agent':'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) 
        Chrome/39.0.2171.71 Safari/537.36'}
        response = requests.get(url = url, headers = header)
        html = response.content.decode("gb18030")
         
        # 打印頁面內容
        print(html)
         
        # 返回頁面內容
        return html

2.寫main函數(shù)測試loadPage()方法

if __name__ == '__main__':
    # 實例化類對象
    my_spider = Spider()
    # 讓用戶輸入需爬取頁面的頁碼
    page = int(input("請輸入你需要爬取的頁碼："))
    # 拼接用戶需爬取頁面的url地址
    url = "http://www.neihan8.com/article/list_5_{}.html".format(page)
    html = my_spider.loadPage(url)

第二步：篩選數(shù)據(jù)

我們已經(jīng)得到了整個頁面的數(shù)據(jù)。但是，里面有很多內容我們并不需要，所以下一步我們需要對上面爬取的內容進行篩選。如果篩選，這里就用到了我們前面講到的正則表達式。

首先

import re

然后：在我們得到的html中進行篩選匹配。

我們需要一個匹配規(guī)則：

我們可以打開內涵段子的網(wǎng)頁，鼠標點擊右鍵“查看源代碼”，你會發(fā)現(xiàn)，我們需要的每個段子的內容都是在一個

標簽中，而且每個div都有一個屬性class="f18 mb20"。

所以，我們只需要匹配到網(wǎng)頁中所有

到

的數(shù)據(jù)就可以了。

根據(jù)正則表達式，我們可以推算出一個公式是：

(.*?)

這個表達式實際上就是匹配到所有div中class="f18 mb20"里面的內容

然后將這個正則應用到代碼中，我們會得到以下代碼：

#!/usr/bin/python3
# -*- coding:utf-8 -*-
 
import requests
import re
 
class Spider(object):
    """
    一個爬蟲類
    """
    def loadPage(self, url):
        """
        下載指定url頁面的內容
        :return:
        """
        # User-Agent頭
        header = {'User-Agent':'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) 
        Chrome/39.0.2171.71 Safari/537.36'}
        response = requests.get(url = url, headers = header)
        html = response.content
 
        return html.decode("gb18030")
 
    def screenPage(self, html):
        """
        篩選html內容，返回列表
        :param html:
        :return:
        """
        # ...

pattern = re.compile(r'(.*?)

', re.S) item_list = pattern.findall(html) return item_list if __name__ == '__main__': # 實例化類對象 my_spider = Spider() # 讓用戶輸入需爬取頁面的頁碼 page = int(input("請輸入你需要爬取的頁碼：")) # 拼接用戶需爬取頁面的url地址 url = "http://www.neihan8.com/article/list_5_{}.html".format(page) # 下載網(wǎng)頁內容 html = my_spider.loadPage(url) # 篩選數(shù)據(jù) item_list = my_spider.screenPage(html)

這里需要注意的是re.S是正則表達式中匹配的一個參數(shù)。

如果沒有re.S，則是只匹配一行中有沒有符合規(guī)則的字符串，如果沒有則下一行重新匹配。

如果加上re.S則是將所有的字符串作為一個整體進行匹配，findall將所有匹配到的結果返回列表中。

第三步：保存數(shù)據(jù)

我們可以將所有的段子存放在文件中。

def writePage(self, list):
    """
    以追加的形式存儲篩選后的內容
    :param list: 篩選后的數(shù)據(jù)，列表形式
    :return:
    """
    with open(self.file_name, "a", encoding = "utf-8") as f:
        for content in list:
            # 段子內容：因為段子中有很多，
，。。。，還有一些轉義字符。在這里作下替換
            content = content.replace("…", "…").replace("“", "“").replace("”", "”")
            content = content.replace("　", "").replace("\t", "").replace(":", "：")
            content = content.replace("", "").replace("
", "").replace("", "").replace(" ", "")
            content = content.replace("\u3000", "").replace("\r\n\r\n", "\r\n")
            content = content.strip()
 
            # 寫入一個段子的內容
            f.write(content)
            # 我是分割線
            f.write("*" * 30)

第四步：完整的程序

#!/usr/bin/python3
# -*- coding:utf-8 -*-
 
import requests
import re
 
class Spider(object):
    """
    一個爬蟲類
    """
    def __init__(self, start_page, end_page):
        """
        類的初始化函數(shù)
        :param start_page:
        :param end_page:
        :return:
        """
        self.start_page = start_page
        self.end_page = end_page
        self.file_name = "duanzi.txt"
 
    def loadPage(self, url):
        """
        下載指定url頁面的內容
        :return:
        """
        # User-Agent頭
        header = {'User-Agent':'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) 
        Chrome/39.0.2171.71 Safari/537.36'}
        response = requests.get(url = url, headers = header)
        html = response.content
 
        return html.decode("gb18030")
 
    def screenPage(self, html):
        """
        篩選html內容，返回列表
        :param html:
        :return:
        """
        # ...

真实的国产乱ⅩXXX66竹夫人,五月香六月婷婷激情综合,亚洲日本VA一区二区三区,亚洲精品一区二区三区麻豆

Python爬蟲如何正則表達式-創(chuàng)新互聯(lián)

其他資訊

網(wǎng)站制作

企業(yè)服務

網(wǎng)站建設

服務器托管