我是一名新手程式員,試圖創建一個網路抓取程式,最終目標是加快 NASA EarthData 程式的 .ict 和 .csv 檔案之間的轉換速度。我計劃使用 BeautifulSoup Python 庫從網頁中收集資料,然后將其轉換為表格,然后將其轉換為 .csv 檔案。我計劃轉換的第一個鏈接是:https : //asdc.larc.nasa.gov/data/AJAX/O3_1/2018/02/28/AJAX-O3_ALPHA_20180228_R1_F220.ict
打開Chrome的DevTools,找到列后面的HTML代碼,驚訝地發現缺少代碼: Lack of HTML Data
有人可以幫我理解決議 .ict 檔案然后獲取這些資料以轉換為表格的方式嗎?
理想情況下,我打算有 7 列('Int_Start'、'Int_End'、'TIME'、'G_Lat'、'G_Lon'、'G_Alt'、'O3')。在每一列下,我計劃將影像中看到的七列中的所有值分配給它們各自的列,然后將其匯出到 .csv 檔案。
該網站位于 NASA EarthData 身份驗證墻后面,我已使用以下代碼登錄該墻:
link = 'https://urs.earthdata.nasa.gov/login'
with requests.Session() as s:
s.headers['User-Agent'] = 'Mozilla/5.0 (Windows NT 6.1) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/88.0.4324.104 Safari/537.36'
r = s.get(url)
soup = BeautifulSoup(r.text,"lxml")
payload = {i['name']:i.get('value','') for i in soup.select('input[name]')}
payload['username'] = 'username'
payload['password'] = 'password'
# For the program to work, each user will need to input their username and password in the lines above.
res = s.post(link,data=payload)
res = s.get(url)
print(res.text)
我在其中插入我的個人資訊作為有效負載用戶名和密碼。任何其他圖書館利用或如何訪問資料的 HTML 的建議將不勝感激。謝謝你。
uj5u.com熱心網友回復:
我能夠通過添加代碼來解決問題:
html_data = res.text
soup = BeautifulSoup(html_data, 'lxml')
print(soup.prettify())
在下一個單元格中。有三個標簽:<HTML>,<body>,和<p>。
轉載請註明出處,本文鏈接:https://www.uj5u.com/caozuo/392390.html
標籤:Python 文件 网页抓取 html-table
