python爬蟲入門教程：爬取網頁圖片-有解無憂

在現在這個資訊爆炸的時代，要想高效的獲取資料，爬蟲是非常好用的，而用python做爬蟲也十分簡單方便，下面通過一個簡單的小爬蟲程式來看一看寫爬蟲的基本程序：

首先是要用到的庫，因為是剛入門最簡單的程式，我們主要就用到下面這兩：

import requests //用于請求網頁
import re  //正則運算式，用于決議篩選網頁中的資訊

其中re是python自帶的，requests庫需要我們自己安裝，在命令列中輸入pip install requests即可，

然后隨便找一個網站，注意不要嘗試爬取隱私敏感資訊，這里找了個表情包網站：

注：此處表情包網站中的內容本來就可以免費下載，所以爬蟲只是簡化了我們一個個點的流程，注意不能去爬取付費資源，

我們要做的就是通過爬蟲把這些表情包下載到我們電腦里，

撰寫爬蟲程式

首先肯定要通過python訪問這個網站，代碼如下：

headers = {
    'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64; rv:98.0) Gecko/20100101 Firefox/98.0'
    }
response = requests.get('https://qq.yh31.com/zjbq/',headers=headers)  //請求網頁

其中之所以要加headers這一段是因為有些網頁會識別到你是通過python請求的然后把你拒絕，所以我們要換個正常的請求頭，可以隨便找一個或者f12從網路資訊里復制一個，

然后我們要找到我們要爬取的圖片在網頁代碼里的位置，f12查看源代碼，找到表情包如下：

然后建立匹配規則，用正則運算式把中間那串替換掉，最簡單的就是.*?

t = '<img src="https://www.cnblogs.com/tuixiulaozhou/p/(.*?)" alt="(.*?)"  height="120">'

像這樣，

然后就可以呼叫re庫里的findall方法把相關內容爬下來了：

result = re.findall(t, response.text)

回傳的內容是由字串組成的串列，最后我們經由爬到的地址通過python陳述句把圖片下下來保存到檔案夾里就行了，

程式代碼

import requests
import re
import os
 
image = '表情包'
if not os.path.exists(image):
    os.mkdir(image)
headers = {
    'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64; rv:98.0) Gecko/20100101 Firefox/98.0'
    }
response = requests.get('https://qq.yh31.com/zjbq/',headers=headers)
response.encoding = 'GBK'
response.encoding = 'utf-8'
print(response.request.headers)
print(response.status_code)
t = '<img src="https://www.cnblogs.com/tuixiulaozhou/p/(.*?)" alt="(.*?)"  height="120">'
result = re.findall(t, response.text)
for img in result:
    print(img)
    res = requests.get(img[0])
    print(res.status_code)
    s = img[0].split('.')[-1]  #截取圖片后綴，得到表情包格式，如jpg ，gif
    with open(image + '/' + img[1] + '.' + s, mode='wb') as file:
        file.write(res.content)

最后結果就是這個樣子：

轉載請註明出處，本文鏈接：https://www.uj5u.com/houduan/509769.html

標籤：Python

上一篇：aardio + PHP 可視化快速開發獨立 EXE 桌面程式

下一篇：Python自動化辦公：讓程式自動分析資料制作報表，并發送郵箱