前言

本文的文字及圖片來源于網路,僅供學習、交流使用,不具有任何商業用途,著作權歸原作者所有,如有問題請及時聯系我們以作處理，

以下文章來源于csdn，作者王延領

轉載地址

https://www.cnblogs.com/kmonkeywyl/p/8409715.html

對于一個net開發者爬蟲真真的以前沒有寫過，這段時間開始學習python爬蟲，今天周末無聊寫了一段代碼爬取上海租房圖片，其實很簡短就是利用爬蟲的第三方庫Requests與BeautifulSoup，python 版本：python3.6 ,IDE ：pycharm，

第三方庫

首先安裝

我是用的pycharm所以另外的腳本安裝我這就不介紹了，

如上圖打開默認設定選擇Project Interprecter，雙擊pip或者點擊加號，搜索要安裝的第三方庫，其中如果建立的專案多記得Project Interprecter要選擇正確的安裝位置不然無法匯入，

Requests庫

requests庫的官方定義：Requests 唯一的一個非轉基因的 Python HTTP 庫，人類可以安全享用，其實他就是請求網路獲取網頁資料的，

import requests
header={'User-Agent':'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/55.0.2883.87 Safari/537.36'}
res=requests.get('http://sh.58.com/zufang/',headers=header)
try:
    print(res.text);
except  ConnectionError:
    print('訪問被拒絕！！！')

結果如下：

其中Request Headers的引數如下：

headers的一些屬性：
Accept:指定客戶端能夠接收的內容型別，內容型別的先后次序表示客戶端接收的先后次序
Accept-Lanuage:指定HTTP客戶端瀏覽器用來展示回傳資訊優先選擇的語言
Accept-Encoding指定客戶端瀏覽器可以支持的web服務器回傳內容壓縮編碼型別，表示允許服務器在將輸出內容發送到客戶端以前進行壓縮，以節約帶寬，而這里設定的就是客戶端瀏覽器所能夠支持的回傳壓縮格式，
Accept-Charset:HTTP客戶端瀏覽器可以接受的字符編碼集
User-Agent : 有些服務器或 Proxy 會通過該值來判斷是否是瀏覽器發出的請求
Content-Type : 在使用 REST 介面時，服務器會檢查該值，用來確定 HTTP Body 中的內容該怎樣決議，
application/xml ：在 XML RPC，如 RESTful/SOAP 呼叫時使用
application/json ：在 JSON RPC 呼叫時使用
application/x-www-form-urlencoded ：瀏覽器提交 Web 表單時使用
在使用服務器提供的 RESTful 或 SOAP 服務時， Content-Type 設定錯誤會導致服務器拒絕服務

BeautifulSoup庫

BeautifulSoup可以輕松的決議Requests庫請求的頁面，并把頁面源代碼決議為Soup檔案，一邊過濾提取資料，這是bs4.2的檔案，
Beautiful Soup支持Python標準庫中的HTML決議器,還支持一些第三方的決議器，如果我們不安裝它，則 Python 會使用 Python默認的決議器，其中lxml 據說是相對而言比較強大的我下面的暗示是python 標準庫的，

選擇器select

案例：爬取上海租房圖片

import requests
import urllib.request
import os
import time
from bs4 import BeautifulSoup
header={'User-Agent':'Mozilla/5.0 (Windows NT 6.1; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/62.0.3202.62 Safari/537.36'}
url=['http://sh.58.com/zufang/pn{}/?ClickID=2'.format(number) for number in range(6,51)]#分頁抓取
adminCout=6
for arurl in url:
    adminCout=adminCout+1
    res=requests.get(arurl,headers=header)
    soup=BeautifulSoup(res.text,'html.parser')
    arryImg=soup.select('.img_list img')
    print(arryImg)
    count = 0;
    for img in arryImg:
        print(img['lazy_src'])
        _url = img['lazy_src']
        pathName = "E:\\2333\\" + str(adminCout)+"_"+str(count) + ".jpg"  # 設定路徑和檔案名
        result = urllib.request.urlopen(_url)  # 打開鏈接，和python2.x不同請注意了
        data = https://www.cnblogs.com/hhh188764/archive/2020/09/28/result.read()  # 否則開始下載到本地
        with open(pathName, "wb") as code:
            code.write(data)
            code.close()
            count = count + 1  # 計數+1
            print("正在下載第：", count)
        time.sleep(30)

轉載請註明出處，本文鏈接：https://www.uj5u.com/houduan/134880.html

標籤：其他

上一篇：Scala Types 2

下一篇：爬取拉勾網資料并進行資料可視化

租房子，光看資料怎么夠，Python爬取某站租房圖片

前言

第三方庫

案例：爬取上海租房圖片