主頁 > .NET開發 > 清理網路抓取資料并組合在一起?

清理網路抓取資料并組合在一起?

2022-06-02 16:47:31 .NET開發

該網站URLhttps://www.justia.com/lawyers/criminal-law/maine

我只想抓取律師的姓名和他們的辦公室在哪里。

response = requests.get(url)
soup= BeautifulSoup(response.text,"html.parser")
Lawyer_name= soup.find_all("a","url main-profile-link")
for i in Lawyer_name:
    print(i.find(text=True))
address= soup.find_all("span","-address -hide-landscape-tablet")
for x in address:
    print(x.find_all(text=True))

名稱列印出來只是 find 但地址正在列印出我想洗掉的額外內容:

['\n\t\t\t\t\t\t\t\t\t\t\t\t\t\t\t88 Hammond Street', '\n\t\t\t\t\t\t\t\t\t\t\t\t\t\t\tBangor,\t\t\t\t\tME 04401\t\t\t\t\t\t    ']

所以我試圖為每個律師得到的輸出是這樣的(第一個例子):

Hunter J Tzovarras
88 Hammond Street
Bangor, ME 04401

我試圖弄清楚的兩個問題

  1. 如何清理地址以便于閱讀?
  1. 如何保存匹配的律師姓名和地址,以免混淆。

uj5u.com熱心網友回復:

使用x.get_text()代替x.find_all

for x in address:
    print(x.get_text(strip=True))

完整的作業代碼:

import pandas as pd
import requests
from bs4 import BeautifulSoup
url = 'https://www.justia.com/lawyers/criminal-law/maine'
response = requests.get(url)
soup= BeautifulSoup(response.text,"html.parser")


n=[]
ad=[]
Lawyer_name= [x.get('title').strip() for x in soup.select('a.lawyer-avatar')]
n.extend(Lawyer_name)
#print(Lawyer_name)
address= [x.get_text(strip=True).replace('\t','').strip() for x in soup.find_all("span",class_="-address -hide-landscape-tablet")]
#print(address)
ad.extend(address)


df = pd.DataFrame(data=list(zip(n,ad)),columns=[['Lawyer_name','address']])

print(df)

輸出:

             Lawyer_name                              address
0              William T. Bly Esq                  119 Main StreetKennebunk,ME 04043
1                    John S. Webb                    949 Main StreetSanford,ME 04073
2              William T. Bly Esq                    20 Oak StreetEllsworth,ME 04605
3          Christopher Causey Esq                          16 Middle StSaco,ME 04072
4                 Robert Van Horn                   88 Hammond StreetBangor,ME 04401
5                    John S. Webb       37 Western Ave., Unit #307Kennebunk,ME 04043
6              Hunter J Tzovarras                  4 Union Park RoadTopsham,ME 04086
7      Michael Stephen Bowser Jr.            241 Main StreetP.O. Box 57Saco,ME 04072
8                   Richard Regan            6 City CenterSuite 301Portland,ME 04101
9             Robert Guillory Esq            75 Pearl St. Suite 400Portland,ME 04101
10                  Dylan R. Boyd      160 Capitol StreetP.O. Box 79Augusta,ME 04332
11                 Luke Rioux Esq                 10 Stoney Brook LaneLyman,ME 04002
12               David G. Webbert        15 Columbia Street, Ste. 301Bangor,ME 04401
13                  Amy Fairfield              32 Saco AveOld Orchard Beach,ME 04064
14      Mr. Richard Lyman Hartley         62 Portland Rd., Ste. 44Kennebunk,ME 04043      
15           Neal L Weinstein Esq                647 U.S. Route One#203York,ME 03909      
16                  Albert Hansen      76 Tandberg Trail (Route 115)Windham,ME 04062      
17          Russell Goldsmith Esq        Two Canal PlazaPO Box 4600Portland,ME 04112      
18            Miklos Pongratz Esq           18 Market Square Suite 5Houlton,ME 04730      
19       Bradford Pattershall Esq       5 Island View DrCumberland Foreside,ME 04110      
20             Michele D L Kenney    12 Silver StreetP.O. Box 559Waterville,ME 04903      
21                   John Simpson                 344 Mount Hope Ave.Bangor,ME 04402      
22         Mariah America Gleaton                  192 Main StreetEllsworth,ME 04605      
23                Wayne Foote Esq                85 Brackett StreetPortland,ME 04102      
24                      Will Ashe                  16 Union StreetBrunswick,ME 04011      
25                Peter J Cyr Esq     482 Congress Street Suite 402Portland,ME 04101      
26  Jonathan Steven Handelman Esq                            PO Box 335York,ME 03909      
27            Richard Smith Berne                 36 Ossipee Trl W.Standish,ME 04084      
28             Meredith G. Schmid             75 Pearl St.Suite 216Portland,ME 04101      
29                Gregory LeClerc           28 Long Sands Road, Suite 5York,ME 03909      
30                   Cory McKenna                      20 Mechanic StCamden,ME 04843      
31                Thomas P. Elias  P.O. Box 1049304 Hancock St. Suite 1KBangor,ME...      
32           Christopher  MacLean        1250 Forest Avenue, Ste 3APortland,ME 04103      
33               Zachary J. Smith      415 Congress StreetSuite 202Portland,ME 04101      
34                 Stephen Sweatt      919 Ridge RoadP.O. BOX 119Bowdoinham,ME 04008      
35           Michael Turndorf Esq        1250 Forest Avenue, Ste 3APortland,ME 04103      
36     Andrews Bruce Campbell Esq                   133 State StreetAugusta,ME 04330      
37                Timothy Zerillo               110 Portland StreetFryeburg,ME 04037      
38               Walter McKee Esq          440 Walnut Hill RdNorth Yarmouth,ME 04097      
39                 Shelley Carter                  70 State StreetEllsworth,ME 04605      

uj5u.com熱心網友回復:

對于您的第二個查詢,您可以將它們保存到這樣的字典中 -

url = 'https://www.justia.com/lawyers/criminal-law/maine'
response = requests.get(url)
soup= BeautifulSoup(response.text,"html.parser")

# parse all names and save them in a list
lawyer_names = soup.find_all("a","url main-profile-link")
lawyer_names = [name.find(text=True).strip() for name in lawyer_names]

# parse all addresses and save them in a list
lawyer_addresses = soup.find_all("span","-address -hide-landscape-tablet")
lawyer_addresses = [re.sub('\s ',' ', address.get_text(strip=True)) for address in lawyer_addresses]

# map names with addresses
lawyer_dict = dict(zip(lawyer_names, lawyer_addresses))

print(lawyer_dict)

輸出字典 -

{'Albert Hansen': '62 Portland Rd., Ste. 44Kennebunk, ME 04043',
 'Amber Lynn Tucker': '415 Congress St., Ste. 202P.O. Box 7542Portland, ME 04112',
 'Amy Fairfield': '10 Stoney Brook LaneLyman, ME 04002',
 'Andrews Bruce Campbell Esq': '919 Ridge RoadP.O. BOX 119Bowdoinham, ME 04008',
 'Bradford Pattershall Esq': 'Two Canal PlazaPO Box 4600Portland, ME 04112',
 'Christopher Causey Esq': '949 Main StreetSanford, ME 04073',
 'Cory McKenna': '75 Pearl St.Suite 216Portland, ME 04101',
 'David G. Webbert': '160 Capitol StreetP.O. Box 79Augusta, ME 04332',
 'David Nelson Wood Esq': '120 Main StreetSuite 110Saco, ME 04072',
 'Dylan R. Boyd': '6 City CenterSuite 301Portland, ME 04101',
 'Gregory LeClerc': '36 Ossipee Trl W.Standish, ME 04084',
 'Hunter J Tzovarras': '88 Hammond StreetBangor, ME 04401',
 'John S. Webb': '16 Middle StSaco, ME 04072',
 'John Simpson': '5 Island View DrCumberland Foreside, ME 04110',
 'Jonathan Steven Handelman Esq': '16 Union StreetBrunswick, ME 04011',
 'Luke Rioux Esq': '75 Pearl St. Suite 400Portland, ME 04101',
 'Mariah America Gleaton': '12 Silver StreetP.O. Box 559Waterville, ME 04903',
 'Meredith G. Schmid': 'PO Box 335York, ME 03909',
 'Michael Stephen Bowser Jr.': '37 Western Ave., Unit #307Kennebunk, ME 04043',
 'Michael Turndorf Esq': '415 Congress StreetSuite 202Portland, ME 04101',
 'Michele D L Kenney': '18 Market Square Suite 5Houlton, ME 04730',
 'Miklos Pongratz Esq': '76 Tandberg Trail (Route 115)Windham, ME 04062',
 'Mr. Richard Lyman Hartley': '15 Columbia Street, Ste. 301Bangor, ME 04401',
 'Neal L Weinstein Esq': '32 Saco AveOld Orchard Beach, ME 04064',
 'Peter J Cyr Esq': '85 Brackett StreetPortland, ME 04102',
 'Richard Regan': '4 Union Park RoadTopsham, ME 04086',
 'Richard Smith Berne': '482 Congress Street Suite 402Portland, ME 04101',
 'Robert Guillory Esq': '241 Main StreetP.O. Box 57Saco, ME 04072',
 'Robert Van Horn': '20 Oak StreetEllsworth, ME 04605',
 'Russell Goldsmith Esq': '647 U.S. Route One#203York, ME 03909',
 'Shelley Carter': '110 Portland StreetFryeburg, ME 04037',
 'Thaddeus Day Esq': '440 Walnut Hill RdNorth Yarmouth, ME 04097',
 'Thomas P. Elias': '28 Long Sands Road, Suite 5York, ME 03909',
 'Timothy Zerillo': '1250 Forest Avenue, Ste 3APortland, ME 04103',
 'Todd H Crawford Jr': '1288 Roosevelt Trl, Ste #3P.O. Box 753Raymond, ME 04071',
 'Walter McKee Esq': '133 State StreetAugusta, ME 04330',
 'Wayne Foote Esq': '344 Mount Hope Ave.Bangor, ME 04402',
 'Will Ashe': '192 Main StreetEllsworth, ME 04605',
 'William T. Bly Esq': '119 Main StreetKennebunk, ME 04043',
 'Zachary J. Smith': 'P.O. Box 1049304 Hancock St. Suite 1KBangor, ME 04401'}

轉載請註明出處,本文鏈接:https://www.uj5u.com/net/484931.html

標籤:Python 数据框 网页抓取 美丽的汤

上一篇:在另一個資料框的列中添加值

下一篇:使用pd資料框從包含字典串列的列中提取組織

標籤雲
其他(157675) Python(38076) JavaScript(25376) Java(17977) C(15215) 區塊鏈(8255) C#(7972) AI(7469) 爪哇(7425) MySQL(7132) html(6777) 基礎類(6313) sql(6102) 熊猫(6058) PHP(5869) 数组(5741) R(5409) Linux(5327) 反应(5209) 腳本語言(PerlPython)(5129) 非技術區(4971) Android(4554) 数据框(4311) css(4259) 节点.js(4032) C語言(3288) json(3245) 列表(3129) 扑(3119) C++語言(3117) 安卓(2998) 打字稿(2995) VBA(2789) Java相關(2746) 疑難問題(2699) 细绳(2522) 單片機工控(2479) iOS(2429) ASP.NET(2402) MongoDB(2323) 麻木的(2285) 正则表达式(2254) 字典(2211) 循环(2198) 迅速(2185) 擅长(2169) 镖(2155) 功能(1967) .NET技术(1958) Web開發(1951) python-3.x(1918) HtmlCss(1915) 弹簧靴(1913) C++(1909) xml(1889) PostgreSQL(1872) .NETCore(1853) 谷歌表格(1846) Unity3D(1843) for循环(1842)

熱門瀏覽
  • WebAPI簡介

    Web體系結構: 有三個核心:資源(resource),URL(統一資源識別符號)和表示 他們的關系是這樣的:一個資源由一個URL進行標識,HTTP客戶端使用URL定位資源,表示是從資源回傳資料,媒體型別是資源回傳的資料格式。 接下來我們說下HTTP. HTTP協議的系統是一種無狀態的方式,使用請求/ ......

    uj5u.com 2020-09-09 22:07:47 more
  • asp.net core 3.1 入口:Program.cs中的Main函式

    本文分析Program.cs 中Main()函式中代碼的運行順序分析asp.net core程式的啟動,重點不是剖析原始碼,而是理清程式開始時執行的順序。到呼叫了哪些實體,哪些法方。asp.net core 3.1 的程式入口在專案Program.cs檔案里,如下。ususing System; us ......

    uj5u.com 2020-09-09 22:07:49 more
  • asp.net網站作為websocket服務端的應用該如何寫

    最近被websocket的一個問題困擾了很久,有一個需求是在web網站中搭建websocket服務。客戶端通過網頁與服務器建立連接,然后服務器根據ip給客戶端網頁發送資訊。 其實,這個需求并不難,只是剛開始對websocket的內容不太了解。上網搜索了一下,有通過asp.net core 實作的、有 ......

    uj5u.com 2020-09-09 22:08:02 more
  • ASP.NET 開源匯入匯出庫Magicodes.IE Docker中使用

    Magicodes.IE在Docker中使用 更新歷史 2019.02.13 【Nuget】版本更新到2.0.2 【匯入】修復單列匯入的Bug,單元測驗“OneColumnImporter_Test”。問題見(https://github.com/dotnetcore/Magicodes.IE/is ......

    uj5u.com 2020-09-09 22:08:05 more
  • 在webform中使用ajax

    如果你用過Asp.net webform, 說明你也算是.NET 開發的老兵了。WEBform應該是2011 2013左右,當時還用visual studio 2005、 visual studio 2008。后來基本都用的是MVC。 如果是新開發的專案,估計沒人會用webform技術。但是有些舊版 ......

    uj5u.com 2020-09-09 22:08:50 more
  • iis添加asp.net網站,訪問提示:由于擴展配置問題而無法提供您請求的

    今天在iis服務器配置asp.net網站,遇到一個問題,記錄一下: 問題:由于擴展配置問題而無法提供您請求的頁面。如果該頁面是腳本,請添加處理程式。如果應下載檔案,請添加 MIME 映射。 WindowServer2012服務器,添加角色安裝完.netframework和iis之后,運行aspx頁面 ......

    uj5u.com 2020-09-09 22:10:00 more
  • WebAPI-處理架構

    帶著問題去思考,大家好! 問題1:HTTP請求和回傳相應的HTTP回應資訊之間發生了什么? 1:首先是最底層,托管層,位于WebAPI和底層HTTP堆疊之間 2:其次是 訊息處理程式管道層,這里比如日志和快取。OWIN的參考是將訊息處理程式管道的一些功能下移到堆疊下端的OWIN中間件了。 3:控制器處理 ......

    uj5u.com 2020-09-09 22:11:13 more
  • 微信門戶開發框架-使用指導說明書

    微信門戶應用管理系統,采用基于 MVC + Bootstrap + Ajax + Enterprise Library的技術路線,界面層采用Boostrap + Metronic組合的前端框架,資料訪問層支持Oracle、SQLServer、MySQL、PostgreSQL等資料庫。框架以MVC5,... ......

    uj5u.com 2020-09-09 22:15:18 more
  • WebAPI-HTTP編程模型

    帶著問題去思考,大家好!它是什么?它包含什么?它能干什么? 訊息 HTTP編程模型的核心就是訊息抽象,表示為:HttPRequestMessage,HttpResponseMessage.用于客戶端和服務端之間交換請求和回應訊息。 HttpMethod類包含了一組靜態屬性: private stat ......

    uj5u.com 2020-09-09 22:15:23 more
  • 部署WebApi隨筆

    一、跨域 NuGet參考Microsoft.AspNet.WebApi.Cors WebApiConfig.cs中配置: // Web API 配置和服務 config.EnableCors(new EnableCorsAttribute("*", "*", "*")); 二、清除默認回傳XML格式 ......

    uj5u.com 2020-09-09 22:15:48 more
最新发布
  • C#多執行緒學習(二) 如何操縱一個執行緒

    <a href="https://www.cnblogs.com/x-zhi/" target="_blank"><img width="48" height="48" class="pfs" src="https://pic.cnblogs.com/face/2943582/20220801082530.png" alt="" /></...

    uj5u.com 2023-04-19 09:17:20 more
  • C#多執行緒學習(二) 如何操縱一個執行緒

    C#多執行緒學習(二) 如何操縱一個執行緒 執行緒學習第一篇:C#多執行緒學習(一) 多執行緒的相關概念 下面我們就動手來創建一個執行緒,使用Thread類創建執行緒時,只需提供執行緒入口即可。(執行緒入口使程式知道該讓這個執行緒干什么事) 在C#中,執行緒入口是通過ThreadStart代理(delegate)來提供的 ......

    uj5u.com 2023-04-19 09:16:49 more
  • 記一次 .NET某醫療器械清洗系統 卡死分析

    <a href="https://www.cnblogs.com/huangxincheng/" target="_blank"><img width="48" height="48" class="pfs" src="https://pic.cnblogs.com/face/214741/20200614104537.png" alt="" /&g...

    uj5u.com 2023-04-18 08:39:04 more
  • 記一次 .NET某醫療器械清洗系統 卡死分析

    一:背景 1. 講故事 前段時間協助訓練營里的一位朋友分析了一個程式卡死的問題,回過頭來看這個案例比較經典,這篇稍微整理一下供后來者少踩坑吧。 二:WinDbg 分析 1. 為什么會卡死 因為是表單程式,理所當然就是看主執行緒此時正在做什么? 可以用 ~0s ; k 看一下便知。 0:000> k # ......

    uj5u.com 2023-04-18 08:33:10 more
  • SignalR, No Connection with that ID,IIS

    <a href="https://www.cnblogs.com/smartstar/" target="_blank"><img width="48" height="48" class="pfs" src="https://pic.cnblogs.com/face/u36196.jpg" alt="" /></a>...

    uj5u.com 2023-03-30 17:21:52 more
  • 一次對pool的誤用導致的.net頻繁gc的診斷分析

    <a href="https://www.cnblogs.com/dotnet-diagnostic/" target="_blank"><img width="48" height="48" class="pfs" src="https://pic.cnblogs.com/face/3115652/20230225090434.png" alt=""...

    uj5u.com 2023-03-28 10:15:33 more
  • 一次對pool的誤用導致的.net頻繁gc的診斷分析

    <a href="https://www.cnblogs.com/dotnet-diagnostic/" target="_blank"><img width="48" height="48" class="pfs" src="https://pic.cnblogs.com/face/3115652/20230225090434.png" alt=""...

    uj5u.com 2023-03-28 10:13:31 more
  • C#遍歷指定檔案夾中所有檔案的3種方法

    <a href="https://www.cnblogs.com/xbhp/" target="_blank"><img width="48" height="48" class="pfs" src="https://pic.cnblogs.com/face/957602/20230310105611.png" alt="" /></a&...

    uj5u.com 2023-03-27 14:46:55 more
  • C#/VB.NET:如何將PDF轉為PDF/A

    <a href="https://www.cnblogs.com/Carina-baby/" target="_blank"><img width="48" height="48" class="pfs" src="https://pic.cnblogs.com/face/2859233/20220427162558.png" alt="" />...

    uj5u.com 2023-03-27 14:46:35 more
  • 武裝你的WEBAPI-OData聚合查詢

    <a href="https://www.cnblogs.com/podolski/" target="_blank"><img width="48" height="48" class="pfs" src="https://pic.cnblogs.com/face/616093/20140323000327.png" alt="" /><...

    uj5u.com 2023-03-27 14:46:16 more