本文的文字及圖片來源于網路,僅供學習、交流使用,不具有任何商業用途,著作權歸原作者所有,如有問題請及時聯系我們以作處理,
最近有同學的爬蟲代碼出了bug,給問我怎么改
于是就發現了這個好看的手機壁紙網站,
看到那么多好看的壁紙,我的爬蟲已經饑渴難耐了
受害網址
http://m.bcoderss.com/
為了良性爬取,這個代碼就不完整的展示出來了
部分爬蟲代碼
匯入工具
from urllib import parse import requests import parsel import re
決議網站,爬取資料
for page in range(1, 10): print('正在爬取第{}頁壁紙'.format(page)) url = 'http://m.bcoderss.com/tag/{}/page/{}/'.format(name, page) headers = { 'Cookie': 'UM_distinctid=1747c5616688f-0da459aa281e74-3962420d-1fa400-1747c56166982d; CNZZDATA1278590218=744878758-1599811024-%7C1599811024', 'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/81.0.4044.138 Safari/537.36' } response = requests.get(url=url, headers=headers) selector = parsel.Selector(response.text) img_url = selector.css('#main a::attr(href)').getall()
設定爬取類目
string = input('請輸入你要爬取的類目:') name = parse.unquote(string)
保存圖片
path = 'C:\\Users\\Administrator\\Desktop\\手機壁紙\\' + new_title + '.jpg' with open(path, mode='wb') as f: f.write(data_response.content) print(title)
運行代碼,效果如下圖
轉載請註明出處,本文鏈接:https://www.uj5u.com/houduan/16189.html
標籤:Python
