主頁 > 後端開發 > 實際的網路爬蟲系統通常是幾種爬蟲技術相結合實作的。

實際的網路爬蟲系統通常是幾種爬蟲技術相結合實作的。

2020-10-26 20:57:35 後端開發

分類

網路爬蟲按照系統結構和實作技術,大致可以分為以下幾種型別:通用網路爬蟲(General Purpose Web Crawler)、聚焦網路爬蟲(Focused Web Crawler)、增量式網路爬蟲(Incremental Web Crawler)、深層網路爬蟲(Deep Web Crawler), 實際的網路爬蟲系統通常是幾種爬蟲技術相結合實作的,

 


 

通用網路爬蟲

通用網路爬蟲又稱全網爬蟲(Scalable Web Crawler),爬行物件從一些種子 URL 擴充到整個 Web,主要為門戶站點搜索引擎和大型 Web 服務提供商采集資料, 由于商業原因,它們的技術細節很少公布出來, 這類網路爬蟲的爬行范圍和數量巨大,對于爬行速度和存盤空間要求較高,對于爬行頁面的順序要求相對較低,同時由于待重繪的頁面太多,通常采用并行作業方式,但需要較長時間才能重繪一次頁面, 雖然存在一定缺陷,通用網路爬蟲適用于為搜索引擎搜索廣泛的主題,有較強的應用價值,

通用網路爬蟲的結構大致可以分為頁面爬行模塊 、頁面分析模塊、鏈接過濾模塊、頁面資料庫、URL 佇列、初始 URL 集合幾個部分,為提高作業效率,通用網路爬蟲會采取一定的爬行策略, 常用的爬行策略有:深度優先策略、廣度優先策略,

1) 深度優先策略:其基本方法是按照深度由低到高的順序,依次訪問下一級網頁鏈接,直到不能再深入為止, 爬蟲在完成一個爬行分支后回傳到上一鏈接節點進一步搜索其它鏈接, 當所有鏈接遍歷完后,爬行任務結束, 這種策略比較適合垂直搜索或站內搜索, 但爬行頁面內容層次較深的站點時會造成資源的巨大浪費,

2) 廣度優先策略:此策略按照網頁內容目錄層次深淺來爬行頁面,處于較淺目錄層次的頁面首先被爬行, 當同一層次中的頁面爬行完畢后,爬蟲再深入下一層繼續爬行, 這種策略能夠有效控制頁面的爬行深度,避免遇到一個無窮深層分支時無法結束爬行的問題,實作方便,無需存盤大量中間節點,不足之處在于需較長時間才能爬行到目錄層次較深的頁面,

 


 

聚焦網路爬蟲

聚焦網路爬蟲(Focused Crawler),又稱主題網路爬蟲(Topical Crawler),是指選擇性地爬行那些與預先定義好的主題相關頁面的網路爬蟲[8], 和通用網路爬蟲相比,聚焦爬蟲只需要爬行與主題相關的頁面,極大地節省了硬體和網路資源,保存的頁面也由于數量少而更新快,還可以很好地滿足一些特定人群對特定領域資訊的需求,

聚焦網路爬蟲和通用網路爬蟲相比,增加了鏈接評價模塊以及內容評價模塊,聚焦爬蟲爬行策略實作的關鍵是評價頁面內容和鏈接的重要性,不同的方法計算出的重要性不同,由此導致鏈接的訪問順序也不同,

1) 基于內容評價的爬行策略:DeBra將文本相似度的計算方法引入到網路爬蟲中,提出了 Fish Search 演算法,它將用戶輸入的查詢詞作為主題,包含查詢詞的頁面被視為與主題相關,其局限性在于無法評價頁面與主題相關 度 的 高 低 , Herseovic對 Fish Search 算 法 進 行 了 改 進 ,提 出 了 Sharksearch 演算法,利用空間向量模型計算頁面與主題的相關度大小,

2) 基于鏈接結構評價的爬行策略 :Web 頁面作為一種半結構化檔案,包含很多結構資訊,可用來評價鏈接重要性, PageRank 演算法最初用于搜索引擎資訊檢索中對查詢結果進行排序,也可用于評價鏈接重要性,具體做法就是每次選擇 PageRank 值較大頁面中的鏈接來訪問, 另一個利用 Web結構評價鏈接價值的方法是 HITS 方法,它通過計算每個已訪問頁面的 Authority 權重和 Hub 權重,并以此決定鏈接的訪問順序,

3) 基于增強學習的爬行策略:Rennie 和 McCallum 將增強學習引入聚焦爬蟲,利用貝葉斯分類器,根據整個網頁文本和鏈接文本對超鏈接進行分類,為每個鏈接計算出重要性,從而決定鏈接的訪問順序,

4) 基于語境圖的爬行策略:Diligenti 等人提出了一種通過建立語境圖(Context Graphs)學習網頁之間的相關度,訓練一個機器學習系統,通過該系統可計算當前頁面到相關 Web 頁面的距離,距離越近的頁面中的鏈接優先訪問,印度理工大學(IIT)和 IBM 研究中心的研究人員開發了一個典型的聚焦網路爬蟲, 該爬蟲對主題的定義既不是采用關鍵詞也不是加權矢量,而是一組具有相同主題的網頁, 它包含兩個重要模塊:一個是分類器,用來計算所爬行的頁面與主題的相關度,確定是否與主題相關;另一個是凈化器,用來識別通過較少鏈接連接到大量相關頁面的中心頁面,

 


 

增量式網路爬蟲

增量式網路爬蟲(Incremental Web Crawler)是 指 對 已 下 載 網 頁 采 取 增 量式更新和只爬行新產生的或者已經發生變化網頁的爬蟲,它能夠在一定程度上保證所爬行的頁面是盡可能新的頁面, 和周期性爬行和重繪頁面的網路爬蟲相比,增量式爬蟲只會在需要的時候爬行新產生或發生更新的頁面 ,并不重新下載沒有發生變化的頁面,可有效減少資料下載量,及時更新已爬行的網頁,減小時間和空間上的耗費,但是增加了爬行演算法的復雜度和實作難度,增量式網路爬蟲的體系結構[包含爬行模塊、排序模塊、更新模塊、本地頁面集、待爬行 URL 集以及本地頁面URL 集,

增量式爬蟲有兩個目標:保持本地頁面集中存盤的頁面為最新頁面和提高本地頁面集中頁面的質量, 為實作第一個目標,增量式爬蟲需要通過重新訪問網頁來更新本地頁面集中頁面內容,常用的方法有:1) 統一更新法:爬蟲以相同的頻率訪問所有網頁,不考慮網頁的改變頻率;2) 個體更新法:爬蟲根據個體網頁的改變頻率來重新訪問各頁面;3) 基于分類的更新法:爬蟲根據網頁改變頻率將其分為更新較快網頁子集和更新較慢網頁子集兩類,然后以不同的頻率訪問這兩類網頁,

為實作第二個目標,增量式爬蟲需要對網頁的重要性排序,常用的策略有:廣度優先策略、PageRank 優先策略等,IBM 開發的 WebFountain是一個功能強大的增量式網路爬蟲,它采用一個優化模型控制爬行程序,并沒有對頁面變化程序做任何統計假設,而是采用一種自適應的方法根據先前爬行周期里爬行結果和網頁實際變化速度對頁面更新頻率進行調整,北京大學的天網增量爬行系統旨在爬行國內 Web,將網頁分為變化網頁和新網頁兩類,分別采用不同爬行策略, 為緩解對大量網頁變化歷史維護導致的性能瓶頸,它根據網頁變化時間區域性規律,在短時期內直接爬行多次變化的網頁 ,為盡快獲取新網頁,它利用索引型網頁跟蹤新出現網頁,

 


 

Deep Web 爬蟲

Web 頁面按存在方式可以分為表層網頁(Surface Web)和深層網頁(Deep Web,也稱 Invisible Web Pages 或 Hidden Web), 表層網頁是指傳統搜索引擎可以索引的頁面,以超鏈接可以到達的靜態網頁為主構成的 Web 頁面,Deep Web 是那些大部分內容不能通過靜態鏈接獲取的、隱藏在搜索表單后的,只有用戶提交一些關鍵詞才能獲得的 Web 頁面,例如那些用戶注冊后內容才可見的網頁就屬于 Deep Web, 2000 年 Bright Planet 指出:Deep Web 中可訪問資訊容量是 Surface Web 的幾百倍,是互聯網上最大、發展最快的新型資訊資源,

Deep Web 爬蟲體系結構包含六個基本功能模塊 (爬行控制器、決議器、表單分析器、表單處理器、回應分析器、LVS 控制器)和兩個爬蟲內部資料結構(URL 串列、LVS 表), 其中 LVS(Label Value Set)表示標簽/數值集合,用來表示填充表單的資料源,

Deep Web 爬蟲爬行程序中最重要部分就是表單填寫,包含兩種型別:

1) 基于領域知識的表單填寫:此方法一般會維持一個本體庫,通過語意分析來選取合適的關鍵詞填寫表單, Yiyao Lu[25]等人提出一種獲取 Form 表單資訊的多注解方法,將資料表單按語意分配到各個組中 ,對每組從多方面注解,結合各種注解結果來預測一個最終的注解標簽;鄭冬冬等人利用一個預定義的領域本體知識庫來識別 Deep Web 頁面內容, 同時利用一些來自 Web 站點導航模式來識別自動填寫表單時所需進行的路徑導航,

2) 基于網頁結構分析的表單填寫: 此方法一般無領域知識或僅有有限的領域知識,將網頁表單表示成 DOM 樹,從中提取表單各欄位值, Desouky 等人提出一種 LEHW 方法,該方法將 HTML 網頁表示為DOM 樹形式,將表單區分為單屬性表單和多屬性表單,分別進行處理;孫彬等人提出一種基于 XQuery 的搜索系統,它能夠模擬表單和特殊頁面標記切換,把網頁關鍵字切換資訊描述為三元組單元,按照一定規則排除無效表單,將 Web 檔案構造成 DOM 樹,利用 XQuery 將文字屬性映射到表單欄位,

Raghavan 等人提出的 HIWE 系統中,爬行管理器負責管理整個爬行程序,分析下載的頁面,將包含表單的頁面提交表單處理器處理,表單處理器先從頁面中提取表單,從預先準備好的資料集中選擇資料自動填充并提交表單,由爬行控制器下載相應的結果頁面,

 


 

抓取目標分類

抓取目標的描述和定義是決定網頁分析演算法與URL搜索策略如何制訂的基礎,而網頁分析演算法和候選URL排序演算法是決定搜索引擎所提供的服務形式和爬蟲網頁抓取行為的關鍵所在,這兩個部分的演算法又是緊密相關的,

現有聚焦爬蟲對抓取目標的描述可分為基于目標網頁特征、基于目標資料模式和基于領域概念3種,

基于目標網頁特征

基于目標網頁特征的爬蟲所抓取、存盤并索引的物件一般為網站或網頁,根據種子樣本獲取方式可分為:

(1) 預先給定的初始抓取種子樣本;

(2) 預先給定的網頁分類目錄和與分類目錄對應的種子樣本,如Yahoo!分類結構等;

(3) 通過用戶行為確定的抓取目標樣例,分為:

(a) 用戶瀏覽程序中顯示標注的抓取樣本;

(b) 通過用戶日志挖掘得到訪問模式及相關樣本,

其中,網頁特征可以是網頁的內容特征,也可以是網頁的鏈接結構特征,等等,

基于目標資料模式

基于目標資料模式的爬蟲針對的是網頁上的資料,所抓取的資料一般要符合一定的模式,或者可以轉化或映射為目標資料模式,

基于領域概念

另一種描述方式是建立目標領域的本體或詞典,用于從語意角度分析不同特征在某一主題中的重要程度,

網頁搜索策略

 

網頁的抓取策略可以分為深度優先、廣度優先和最佳優先三種,深度優先在很多情況下會導致爬蟲的陷入(trapped)問題,目前常見的是廣度優先和最佳優先方法,

廣度優先搜索

廣度優先搜索策略是指在抓取程序中,在完成當前層次的搜索后,才進行下一層次的搜索,該演算法的設計和實作相對簡單,在目前為覆寫盡可能多的網頁,一般使用廣度優先搜索方法,也有很多研究將廣度優先搜索策略應用于聚焦爬蟲中,其基本思想是認為與初始URL在一定鏈接距離內的網頁具有主題相關性的概率很大,另外一種方法是將廣度優先搜索與網頁過濾技術結合使用,先用廣度優先策略抓取網頁,再將其中無關的網頁過濾掉,這些方法的缺點在于,隨著抓取網頁的增多,大量的無關網頁將被下載并過濾,演算法的效率將變低,

最佳優先搜索

最佳優先搜索策略按照一定的網頁分析演算法,預測候選URL與目標網頁的相似度,或與主題的相關性,并選取評價最好的一個或幾個URL進行抓取,它只訪問經過網頁分析演算法預測為“有用”的網頁,存在的一個問題是,在爬蟲抓取路徑上的很多相關網頁可能被忽略,因為最佳優先策略是一種區域最優搜索演算法,因此需要將最佳優先結合具體的應用進行改進,以跳出區域最優點,將在第4節中結合網頁分析演算法作具體的討論,研究表明,這樣的倍訓調整可以將無關網頁數量降低30%~90%,

深度優先搜索

深度優先搜索策略從起始網頁開始,選擇一個URL進入,分析這個網頁中的URL,選擇一個再進入,如此一個鏈接一個鏈接地抓取下去,直到處理完一條路線之后再處理下一條路線,深度優先策略設計較為簡單,然而門戶網站提供的鏈接往往最具價值,PageRank也很高,但每深入一層,網頁價值和PageRank都會相應地有所下降,這暗示了重要網頁通常距離種子較近,而過度深入抓取到的網頁卻價值很低,同時,這種策略抓取深度直接影響著抓取命中率以及抓取效率,對抓取深度是該種策略的關鍵,相對于其他兩種策略而言,此種策略很少被使用,

轉載請註明出處,本文鏈接:https://www.uj5u.com/houduan/192505.html

標籤:其他

上一篇:C語言為何不會過時?你需要掌握多少種語言?

下一篇:獲取和設定pdf目錄

標籤雲
其他(157675) Python(38076) JavaScript(25376) Java(17977) C(15215) 區塊鏈(8255) C#(7972) AI(7469) 爪哇(7425) MySQL(7132) html(6777) 基礎類(6313) sql(6102) 熊猫(6058) PHP(5869) 数组(5741) R(5409) Linux(5327) 反应(5209) 腳本語言(PerlPython)(5129) 非技術區(4971) Android(4554) 数据框(4311) css(4259) 节点.js(4032) C語言(3288) json(3245) 列表(3129) 扑(3119) C++語言(3117) 安卓(2998) 打字稿(2995) VBA(2789) Java相關(2746) 疑難問題(2699) 细绳(2522) 單片機工控(2479) iOS(2429) ASP.NET(2402) MongoDB(2323) 麻木的(2285) 正则表达式(2254) 字典(2211) 循环(2198) 迅速(2185) 擅长(2169) 镖(2155) 功能(1967) .NET技术(1958) Web開發(1951) python-3.x(1918) HtmlCss(1915) 弹簧靴(1913) C++(1909) xml(1889) PostgreSQL(1872) .NETCore(1853) 谷歌表格(1846) Unity3D(1843) for循环(1842)

熱門瀏覽
  • 【C++】Microsoft C++、C 和匯編程式檔案

    ......

    uj5u.com 2020-09-10 00:57:23 more
  • 例外宣告

    相比于斷言適用于排除邏輯上不可能存在的狀態,例外通常是用于邏輯上可能發生的錯誤。 例外宣告 Item 1:當函式不可能拋出例外或不能接受拋出例外時,使用noexcept 理由 如果不打算拋出例外的話,程式就會認為無法處理這種錯誤,并且應當盡早終止,如此可以有效地阻止例外的傳播與擴散。 示例 //不可 ......

    uj5u.com 2020-09-10 00:57:27 more
  • Codeforces 1400E Clear the Multiset(貪心 + 分治)

    鏈接:https://codeforces.com/problemset/problem/1400/E 來源:Codeforces 思路:給你一個陣列,現在你可以進行兩種操作,操作1:將一段沒有 0 的區間進行減一的操作,操作2:將 i 位置上的元素歸零。最終問:將這個陣列的全部元素歸零后操作的最少 ......

    uj5u.com 2020-09-10 00:57:30 more
  • UVA11610 【Reverse Prime】

    本人看到此題沒有翻譯,就附帶了一個自己的翻譯版本 思考 這一題,它的第一個要求是找出所有 $7$ 位反向質數及其質因數的個數。 我們應該需要質數篩篩選1~$10^{7}$的所有數,這里就不慢慢介紹了。但是,重讀題,我們突然發現反向質數都是 $7$ 位,而將它反過來后的數字卻是 $6$ 位數,這就說明 ......

    uj5u.com 2020-09-10 00:57:36 more
  • 統計區間素數數量

    1 #pragma GCC optimize(2) 2 #include <bits/stdc++.h> 3 using namespace std; 4 bool isprime[1000000010]; 5 vector<int> prime; 6 inline int getlist(int ......

    uj5u.com 2020-09-10 00:57:47 more
  • C/C++編程筆記:C++中的 const 變數詳解,教你正確認識const用法

    1、C中的const 1、區域const變數存放在堆疊區中,會分配記憶體(也就是說可以通過地址間接修改變數的值)。測驗代碼如下: 運行結果: 2、全域const變數存放在只讀資料段(不能通過地址修改,會發生寫入錯誤), 默認為外部聯編,可以給其他源檔案使用(需要用extern關鍵字修飾) 運行結果: ......

    uj5u.com 2020-09-10 00:58:04 more
  • 【C++犯錯記錄】VS2019 MFC添加資源不懂如何修改資源宏ID

    1. 首先在資源視圖中,添加資源 2. 點擊新添加的資源,復制自動生成的ID 3. 在解決方案資源管理器中找到Resource.h檔案,編輯,使用整個專案搜索和替換的方式快速替換 宏宣告 4. Ctrl+Shift+F 全域搜索,點擊查找全部,然后逐個替換 5. 為什么使用搜索替換而不使用屬性視窗直 ......

    uj5u.com 2020-09-10 00:59:11 more
  • 【C++犯錯記錄】VS2019 MFC不懂的批量添加資源

    1. 打開資源頭檔案Resource.h,在其中預先定義好宏 ID(不清楚其實ID值應該設定多少,可以先新建一個相同的資源項,再在這個資源的ID值的基礎上遞增即可) 2. 在資源視圖中選中專案資源,按F7編輯資源檔案,按 ID 型別 相對路徑的形式添加 資源。(別忘了先把檔案拷貝到專案中的res檔案 ......

    uj5u.com 2020-09-10 01:00:19 more
  • C/C++編程筆記:關于C++的參考型別,專供新手入門使用

    今天要講的是C++中我最喜歡的一個用法——參考,也叫別名。 參考就是給一個變數名取一個變數名,方便我們間接地使用這個變數。我們可以給一個變數創建N個參考,這N + 1個變數共享了同一塊記憶體區域。(參考型別的變數會占用記憶體空間,占用的記憶體空間的大小和指標型別的大小是相同的。雖然參考是一個物件的別名,但 ......

    uj5u.com 2020-09-10 01:00:22 more
  • 【C/C++編程筆記】從頭開始學習C ++:初學者完整指南

    眾所周知,C ++的學習曲線陡峭,但是花時間學習這種語言將為您的職業帶來奇跡,并使您與其他開發人員區分開。您會更輕松地學習新語言,形成真正的解決問題的技能,并在編程的基礎上打下堅實的基礎。 C ++將幫助您養成良好的編程習慣(即清晰一致的編碼風格,在撰寫代碼時注釋代碼,并限制類內部的可見性),并且由 ......

    uj5u.com 2020-09-10 01:00:41 more
最新发布
  • Rust中的智能指標:Box<T> Rc<T> Arc<T> Cell<T> RefCell<T> Weak

    Rust中的智能指標是什么 智能指標(smart pointers)是一類資料結構,是擁有資料所有權和額外功能的指標。是指標的進一步發展 指標(pointer)是一個包含記憶體地址的變數的通用概念。這個地址參考,或 ” 指向”(points at)一些其 他資料 。參考以 & 符號為標志并借用了他們所 ......

    uj5u.com 2023-04-20 07:24:10 more
  • Java的值傳遞和參考傳遞

    值傳遞不會改變本身,參考傳遞(如果傳遞的值需要實體化到堆里)如果發生修改了會改變本身。 1.基本資料型別都是值傳遞 package com.example.basic; public class Test { public static void main(String[] args) { int ......

    uj5u.com 2023-04-20 07:24:04 more
  • [2]SpinalHDL教程——Scala簡單入門

    第一個 Scala 程式 shell里面輸入 $ scala scala> 1 + 1 res0: Int = 2 scala> println("Hello World!") Hello World! 檔案形式 object HelloWorld { /* 這是我的第一個 Scala 程式 * 以 ......

    uj5u.com 2023-04-20 07:23:58 more
  • 理解函式指標和回呼函式

    理解 函式指標 指向函式的指標。比如: 理解函式指標的偽代碼 void (*p)(int type, char *data); // 定義一個函式指標p void func(int type, char *data); // 宣告一個函式func p = func; // 將指標p指向函式func ......

    uj5u.com 2023-04-20 07:23:52 more
  • Django筆記二十五之資料庫函式之日期函式

    本文首發于公眾號:Hunter后端 原文鏈接:Django筆記二十五之資料庫函式之日期函式 日期函式主要介紹兩個大類,Extract() 和 Trunc() Extract() 函式作用是提取日期,比如我們可以提取一個日期欄位的年份,月份,日等資料 Trunc() 的作用則是截取,比如 2022-0 ......

    uj5u.com 2023-04-20 07:23:45 more
  • 一天吃透JVM面試八股文

    什么是JVM? JVM,全稱Java Virtual Machine(Java虛擬機),是通過在實際的計算機上仿真模擬各種計算機功能來實作的。由一套位元組碼指令集、一組暫存器、一個堆疊、一個垃圾回收堆和一個存盤方法域等組成。JVM屏蔽了與作業系統平臺相關的資訊,使得Java程式只需要生成在Java虛擬機 ......

    uj5u.com 2023-04-20 07:23:31 more
  • 使用Java接入小程式訂閱訊息!

    更新完微信服務號的模板訊息之后,我又趕緊把微信小程式的訂閱訊息給實作了!之前我一直以為微信小程式也是要企業才能申請,沒想到小程式個人就能申請。 訊息推送平臺🔥推送下發【郵件】【短信】【微信服務號】【微信小程式】【企業微信】【釘釘】等訊息型別。 https://gitee.com/zhongfuch ......

    uj5u.com 2023-04-20 07:22:59 more
  • java -- 緩沖流、轉換流、序列化流

    緩沖流 緩沖流, 也叫高效流, 按照資料型別分類: 位元組緩沖流:BufferedInputStream,BufferedOutputStream 字符緩沖流:BufferedReader,BufferedWriter 緩沖流的基本原理,是在創建流物件時,會創建一個內置的默認大小的緩沖區陣列,通過緩沖 ......

    uj5u.com 2023-04-20 07:22:49 more
  • Java-SpringBoot-Range請求頭設定實作視頻分段傳輸

    老實說,人太懶了,現在基本都不喜歡寫筆記了,但是網上有關Range請求頭的文章都太水了 下面是抄的一段StackOverflow的代碼...自己大修改過的,寫的注釋挺全的,應該直接看得懂,就不解釋了 寫的不好...只是希望能給視頻網站開發的新手一點點幫助吧. 業務場景:視頻分段傳輸、視頻多段傳輸(理 ......

    uj5u.com 2023-04-20 07:22:42 more
  • Windows 10開發教程_編程入門自學教程_菜鳥教程-免費教程分享

    教程簡介 Windows 10開發入門教程 - 從簡單的步驟了解Windows 10開發,從基本到高級概念,包括簡介,UWP,第一個應用程式,商店,XAML控制元件,資料系結,XAML性能,自適應設計,自適應UI,自適應代碼,檔案管理,SQLite資料庫,應用程式到應用程式通信,應用程式本地化,應用程式 ......

    uj5u.com 2023-04-20 07:22:35 more