我是整個抓取的新手,我試圖通過 python 從網站上抓取一些資訊,但是在檢查 HTML 回應(即 200)時,我沒有在終端上得到任何結果。下面是我的代碼。感謝各種幫助!編輯:我已經在下面的列印部分修復了我的菜鳥錯誤 xD 謝謝大家的更正!
import requests
url = "https://www.sephora.ae/en/shop/makeup-c302/"
page = requests.get(url)
print(page.status_code)
uj5u.com熱心網友回復:
一方面,您不會使用語法在 Python 中列印到控制臺Print = (page)。該代碼將page變數分配給名為 的變數Print,這可能不是一個好主意,因為print它是 Python 中的關鍵字。為了輸出到控制臺,請將您的代碼更改為:
print(page)
其次,列印page只是response在發出 GET 請求后列印您收到的物件,這不是很有幫助。該response物件具有許多您可以訪問的屬性,您可以在Python 庫的檔案中了解這些屬性。requests
要獲取回應的狀態代碼,請嘗試:
print(page.status_code)
uj5u.com熱心網友回復:
問題是您嘗試抓取的頁面通過忽略來自例外用戶代理的請求來防止抓取。
將用戶代理設定為一些眾所周知的字串,如下所示
import requests
url = "https://www.sephora.ae/en/shop/makeup-c302/"
headers = {
'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/102.0.5005.63 Safari/537.36'
}
response = requests.get(url, headers=headers)
print(response.status_code)
轉載請註明出處,本文鏈接:https://www.uj5u.com/shujuku/489020.html
標籤:Python python-3.x 网页抓取
上一篇:使用Python進行Selenium報廢中的FindAll
下一篇:將html腳本變數提取為JSON
