主頁 > 軟體設計 > Python爬取全網文字并詞云分析(全程一鍵化!)

Python爬取全網文字并詞云分析(全程一鍵化!)

2020-12-30 12:08:40 軟體設計

前景引入

最近Python很火,確實很火,好像一直都比較火,哈哈哈哈,如果你也覺得很火,那么就請看完這篇文章吧,看看Python的熱度到底能不能使我這篇文章火起來,

那么作為后起之秀的編程語言——Python,它到底能夠做些什么了,網上一直在“炒作”Python:一鍵化辦公,學好Python薪資翻一番,讓你的生活多一點money,讓你的老板對你刮目相看,讓你從此找到自信!這不是吹捧,也不是浮夸,從云計算、大資料到人工智能,Python無處不在,百度、阿里巴巴、騰訊等一系列大公司都在使用Python完成各種任務,讓Python越來越接地氣了,它的功能也不用我說了,它的優勢和特點我也不再贅述了,畢竟本篇是一個技術文章,話不多說,開干!

如果你是科研黨,請看完文章!文末有驚喜喲!

原始碼點擊這里下載,直接可以運行

專案簡介

近期收到CSDN上的小粉私信,說之前一篇文章Python爬取網站小說并可視化分析,那個網站比較的好,說想要這個網站的所有書籍,自己拿去好好地研讀,出于對粉絲的關心,再加上我個人也是比較喜歡文學作品的,無聊閑暇之余,看一本書陶冶一下自己的情操也不是不可的,哈哈哈,收到請求之后,我馬上就開始架構思路了,我通過觀察網頁結構發現了它的特點,最后我加上自己的設計思路,增加詞云分析這個功能,多次測驗,最終達到了一鍵化!!!!!!!

專案思路與功能介紹

1.用戶輸入該網站里面的任何一本書籍的網頁鏈接,輸入儲存路徑回車即可,后臺及運行爬蟲,之后再去運行智能分詞,最后利用強大的pyecharts庫,來展示詞云圖,

在這里插入圖片描述
2.這么多的書籍,夠你看了吧,如果你不想看,想知道這本書主要講的是什么,出現哪些高頻詞,最終也會幫助你理解和了解這篇文章的主要內容,

3.本期專案依靠資料分析庫和Python原生態的庫,進行文本分詞,智能切割,智能詞云演算法和智能爬蟲演算法,有反爬技術的書寫,也有資料分析的亮點,

專案實作

1.首先你必須要安裝好這幾個庫

在這里插入圖片描述
不會的請看這篇文章,有詳細的介紹,要是看不懂我給你安裝!絕對可以安裝好的~

2.實作爬蟲演算法

提前定義好全域變數

from pyecharts import options as opts
from pyecharts.charts import WordCloud
from pyecharts.globals import SymbolType
import jieba  # jieba用于分詞,中文字典及其強大
from fake_useragent import UserAgent
import requests
from lxml import etree
import time
ll = []
lg = []
lk = []
lj = []
lp = []
li = []
d = {}  # 定義好相應的存盤變數

def get_data(title,page,url,num):#title代表檔案路徑 page代表爬取的章節數 url為修訂后網址 num為標簽頁數
    with open(r"{}.txt".format(title), "w", encoding="utf-8") as file:
        ua = UserAgent()  # 解決了我們平時自己設定偽裝頭的繁瑣,此庫自動為我們彈出一個可用的模擬瀏覽器

        def get_page(url):
            headers = {"User-Agent": ua.random}
            res = requests.get(url=url, headers=headers)
            res.encoding = 'GBK'
            html = res.text
            html_ = etree.HTML(html)
            text = html_.xpath('//div[@class="panel-body content-body content-ext"]//text()')
            num = len(text)
            for s in range(num):
                file.write(text[s] + '\n')

        for i in range(page):
            # time.sleep(2)
            file.write("第{}章".format(i + 1))#寫入文本資料
            get_page(url+"{}.html".format(num + i))#爬蟲標簽頁移動,資料輸出爬取程序
            print("正在爬取第{}章!".format(i + 1))
        print("爬取完畢!!!!")

3.實作智能分詞

我自己寫了一個智能詞云演算法,包括各種小功能的實作,設計不易,拒絕白嫖喲,有需要的可以私信我或者自己下載!!!

4.主函式

def main():
    try:
        print("\t\t本小程式只針對:<https://www.cz2che.com/>網址有效,里面有大量的古今中外名著小說!!!\n\n")
        print("C:\\Users\\48125\\Desktop\\")
        title = input("請輸入儲存文本的路徑及名稱如桌面:(C:\\Users\\48125\\Desktop\\文本)不需要加.txt!\n")
        urll  = str(input("請輸入您要爬取的網站(請將鍵盤游標移動到網址前面在回車!):"))
        url   = str(urll[:urll.rindex('/') + 1])
        num   = int(urll[urll.rindex('/') + 1:len(urll) - 5])
        print(url,num)
        page  = int(input("請輸入本次您要爬取的章節數:\n"))
        get_data(title,page,url,num)
        Open(title)
        print("\n分詞完畢!")
        print('''\n\n\t\t一鍵詞云演算法生成器
        \t0--退出詞云系統
        \t1--生成一詞組的詞云圖
        \t2--生成二詞組的詞云圖
        \t3--生成三詞組的詞云圖
        \t4--生成四詞組的詞云圖
        \t5--生成大于1詞組的詞云圖(研究常用)
        \t6--生成全部詞組的詞云圖(包含所有型別的詞組)
        ''')
        num = int(input("請輸入本次展示的詞語數量(最好不超過100):"))
        data = sort()[:num]
        Str = input("請輸入這個詞云圖的標題:")
        print("詞云圖已經生成完畢,請查收!")
        print("感謝您對本程式的使用,歡迎下次光臨!!")
        c = (
            WordCloud()
                .add(
                "",
                data,  # 資料集
                word_size_range=[20, 100],  # 單詞字體大小范圍
                shape=SymbolType.DIAMOND)  # 詞云圖輪廓,有以下的輪廓選擇,但是對于這個版本的好像只有在提示里面選
                # circl,cardioid,diamond,triangle-forward,triangle,start,pentagon
                .set_global_opts(title_opts=opts.TitleOpts(title="{}".format(Str)),
                                 toolbox_opts=opts.ToolboxOpts())  # 工具選項
                .render("{}詞云制作{}詞組.html".format(title, choice))
        )
        return c
    except:
        print("無法找到,請檢查你的輸入!")

專案實作

1.輸入網址和保存路徑,以及爬取的章節數
在這里插入圖片描述2.智能爬蟲開啟運行

在這里插入圖片描述

在這里插入圖片描述

3.智能演算法開啟

在這里插入圖片描述在這里插入圖片描述
4.效果展示

桌面自動出現,點擊網頁HTML即可展示詞云,還可以自己下載,這就是pyecharts庫的特點
在這里插入圖片描述在這里插入圖片描述
在這里插入圖片描述

看起來還不錯吧,我也覺得效果還可以,主要是這個一鍵化太讓我省心了,以后還可以做知網上面的,幫助科研人員做科研方面的研究,還有各個電商網站的評論,來解決老板對商品的評估,這樣的一鍵化可以幫助我們減少浪費的時間,當然老板也會喜歡的,

原始碼私信我!!!!設計著實不易!!!

專案拓展

我還自己設計另一個國家社科基金資料庫的詞云一鍵化分析

科研寶寶的最愛,有需要的可以直接私信我喲,把握好大家的研究方向才是開始最正確的選擇
在這里插入圖片描述這個程式涉及到一個網頁解碼和轉碼的功能
在這里插入圖片描述
在這里插入圖片描述在這里插入圖片描述在這里插入圖片描述

里面的輸入類別都可以自己設計的,所有的輸入框都可以自己設定篩選條件!!!!

如果你是科研黨,不要它可惜了,哈哈哈哈!!!!!!

每文一語

無法預測的未來,才會充滿期待

轉載請註明出處,本文鏈接:https://www.uj5u.com/ruanti/242421.html

標籤:其他

上一篇:Linux下的工程管理——CMake學習指南,手把手教你入門【建議新手收藏】

下一篇:回首2020,是成長,亦是挑戰(學生版)

標籤雲
其他(157675) Python(38076) JavaScript(25376) Java(17977) C(15215) 區塊鏈(8255) C#(7972) AI(7469) 爪哇(7425) MySQL(7132) html(6777) 基礎類(6313) sql(6102) 熊猫(6058) PHP(5869) 数组(5741) R(5409) Linux(5327) 反应(5209) 腳本語言(PerlPython)(5129) 非技術區(4971) Android(4554) 数据框(4311) css(4259) 节点.js(4032) C語言(3288) json(3245) 列表(3129) 扑(3119) C++語言(3117) 安卓(2998) 打字稿(2995) VBA(2789) Java相關(2746) 疑難問題(2699) 细绳(2522) 單片機工控(2479) iOS(2429) ASP.NET(2402) MongoDB(2323) 麻木的(2285) 正则表达式(2254) 字典(2211) 循环(2198) 迅速(2185) 擅长(2169) 镖(2155) 功能(1967) .NET技术(1958) Web開發(1951) python-3.x(1918) HtmlCss(1915) 弹簧靴(1913) C++(1909) xml(1889) PostgreSQL(1872) .NETCore(1853) 谷歌表格(1846) Unity3D(1843) for循环(1842)

熱門瀏覽
  • 面試突擊第一季,第二季,第三季

    第一季必考 https://www.bilibili.com/video/BV1FE411y79Y?from=search&seid=15921726601957489746 第二季分布式 https://www.bilibili.com/video/BV13f4y127ee/?spm_id_fro ......

    uj5u.com 2020-09-10 05:35:24 more
  • 第三單元作業總結

    1.前言 這應該是本學期最后一次寫作業總結了吧。總體來說,對作業的節奏也差不多掌握了,作業做起來的效率也更高了。雖然和之前的作業一樣,作業中都要用到新的知識,但是相比之前,更加懂得了如何利用工具以及資料。雖然之間卡過殼,但總體而言,這幾次作業還算完成的比較好。 2.作業程序總結 相比前兩個單元,此單 ......

    uj5u.com 2020-09-10 05:35:41 more
  • 北航OO(2020)第四單元博客作業暨課程總結博客

    北航OO(2020)第四單元博客作業暨課程總結博客 本單元作業的架構設計 在本單元中,由于UML圖具有比較清晰的樹形結構,因此我對其中需要進行查詢操作的元素進行了包裝,在樹的父節點中存盤所有孩子的參考。考慮到性能問題,我采用了快取機制,一次查詢后盡可能快取已經遍歷過的資訊,以減少遍歷次數。 本單元我 ......

    uj5u.com 2020-09-10 05:35:48 more
  • BUAA_OO_第四單元

    一、UML決議器設計 ? 先看下題目:第四單元實作一個基于JDK 8帶有效性檢查的UML(Unified Modeling Language)類圖,順序圖,狀態圖分析器 MyUmlInteraction,實際上我們要建立一個有向圖模型,UML中的物件(元素)可能與同級元素連接,也可與低級元素相連形成 ......

    uj5u.com 2020-09-10 05:35:54 more
  • 6.1邏輯運算子

    邏輯運算子 1. && 短路與 運算式1 && 運算式2 01.運算式1為true并且運算式2也為true 整體回傳為true 02.運算式1為false,將不會執行運算式2 整體回傳為false 03.只要有一個運算式為false 整體回傳為false 2. || 短路或 運算式1 || 運算式2 ......

    uj5u.com 2020-09-10 05:35:56 more
  • BUAAOO 第四單元 & 課程總結

    1. 第四單元:StarUml檔案決議 本單元采用了圖模型決議UML。 UML檔案可以抽象為圖、子圖、邊的邏輯結構。 在實作中,圖的節點包括類、介面、屬性,子圖包括狀態圖、順序圖等。 采用了三次遍歷UML元素的方法建圖,第一遍遍歷建點,第二、三次遍歷設定屬性、連邊,實作圖物件的初始化。這里借鑒了一些 ......

    uj5u.com 2020-09-10 05:36:06 more
  • 談談我對C# 多型的理解

    面向物件三要素:封裝、繼承、多型。 封裝和繼承,這兩個比較好理解,但要理解多型的話,可就稍微有點難度了。今天,我們就來講講多型的理解。 我們應該經常會看到面試題目:請談談對多型的理解。 其實呢,多型非常簡單,就一句話:呼叫同一種方法產生了不同的結果。 具體實作方式有三種。 一、多載 多載很簡單。 p ......

    uj5u.com 2020-09-10 05:36:09 more
  • Python 資料驅動工具:DDT

    背景 python 的unittest 沒有自帶資料驅動功能。 所以如果使用unittest,同時又想使用資料驅動,那么就可以使用DDT來完成。 DDT是 “Data-Driven Tests”的縮寫。 資料:http://ddt.readthedocs.io/en/latest/ 使用方法 dd. ......

    uj5u.com 2020-09-10 05:36:13 more
  • Python里面的xlrd模塊詳解

    那我就一下面積個問題對xlrd模塊進行學習一下: 1.什么是xlrd模塊? 2.為什么使用xlrd模塊? 3.怎樣使用xlrd模塊? 1.什么是xlrd模塊? ?python操作excel主要用到xlrd和xlwt這兩個庫,即xlrd是讀excel,xlwt是寫excel的庫。 今天就先來說一下xl ......

    uj5u.com 2020-09-10 05:36:28 more
  • 當我們創建HashMap時,底層到底做了什么?

    jdk1.7中的底層實作程序(底層基于陣列+鏈表) 在我們new HashMap()時,底層創建了默認長度為16的一維陣列Entry[ ] table。當我們呼叫map.put(key1,value1)方法向HashMap里添加資料的時候: 首先,呼叫key1所在類的hashCode()計算key1 ......

    uj5u.com 2020-09-10 05:36:38 more
最新发布
  • 【中介者設計模式詳解】C/Java/JS/Go/Python/TS不同語言實作

    * 中介者模式是一種行為型設計模式,它可以用來減少類之間的直接依賴關系,
    * 將物件之間的通信封裝到一個中介者物件中,從而使得各個物件之間的關系更加松散。
    * 在中介者模式中,物件之間不再直接相互互動,而是通過中介者來中轉訊息。 ......

    uj5u.com 2023-04-20 08:20:47 more
  • 露天煤礦現場調研和交流案例分享

    他們集團的資訊化公司及研究院在一個礦區正在做智能礦山的統一平臺的 試點,專案投資大概1億,包括了礦山的各方面的內容,顯示得我們這次交流有點多余。他們2年前開始做智能礦山的規劃,有很多煤礦行業專家的加持,他們的描述是非常完美,但是去年底應該上線的平臺,現在還沒有看到影子。他們確實有很多場景需求,但是被... ......

    uj5u.com 2023-04-20 08:20:25 more
  • 《社區人員管理》實戰案例設計&個人案例分享

    設計是一個讓人夢想成真程序,開始編碼、測驗、除錯之前進行需求分析和架構設計,才能保證關鍵方面都做正確 ......

    uj5u.com 2023-04-20 08:20:17 more
  • 軟體架構生態化-多角色交付的探索實踐

    作為一個技術架構師,不僅僅要緊跟行業技術趨勢,還要結合研發團隊現狀及痛點,探索新的交付方案。在日常中,你是否遇到如下問題 “ 業務需求排期長研發是瓶頸;非研發角色感受不到研發技改提效的變化;引入ISV 團隊又擔心質量和安全,培訓周期長“等等,基于此我們探索了一種新的技術體系及交付方案來解決如上問題。 ......

    uj5u.com 2023-04-20 08:20:10 more
  • 【中介者設計模式詳解】C/Java/JS/Go/Python/TS不同語言實作

    * 中介者模式是一種行為型設計模式,它可以用來減少類之間的直接依賴關系,
    * 將物件之間的通信封裝到一個中介者物件中,從而使得各個物件之間的關系更加松散。
    * 在中介者模式中,物件之間不再直接相互互動,而是通過中介者來中轉訊息。 ......

    uj5u.com 2023-04-20 08:19:44 more
  • 露天煤礦現場調研和交流案例分享

    他們集團的資訊化公司及研究院在一個礦區正在做智能礦山的統一平臺的 試點,專案投資大概1億,包括了礦山的各方面的內容,顯示得我們這次交流有點多余。他們2年前開始做智能礦山的規劃,有很多煤礦行業專家的加持,他們的描述是非常完美,但是去年底應該上線的平臺,現在還沒有看到影子。他們確實有很多場景需求,但是被... ......

    uj5u.com 2023-04-20 08:19:07 more
  • 《社區人員管理》實戰案例設計&個人案例分享

    設計是一個讓人夢想成真程序,開始編碼、測驗、除錯之前進行需求分析和架構設計,才能保證關鍵方面都做正確 ......

    uj5u.com 2023-04-20 08:18:57 more
  • 軟體架構生態化-多角色交付的探索實踐

    作為一個技術架構師,不僅僅要緊跟行業技術趨勢,還要結合研發團隊現狀及痛點,探索新的交付方案。在日常中,你是否遇到如下問題 “ 業務需求排期長研發是瓶頸;非研發角色感受不到研發技改提效的變化;引入ISV 團隊又擔心質量和安全,培訓周期長“等等,基于此我們探索了一種新的技術體系及交付方案來解決如上問題。 ......

    uj5u.com 2023-04-20 08:18:49 more
  • 05單件模式

    #經典的單件模式 public class Singleton { private static Singleton uniqueInstance; //一個靜態變數持有Singleton類的唯一實體。 // 其他有用的實體變數寫在這里 //構造器宣告為私有,只有Singleton可以實體化這個類! ......

    uj5u.com 2023-04-19 08:42:51 more
  • 【架構與設計】常見微服務分層架構的區別和落地實踐

    軟體工程的方方面面都遵循一個最基本的道理:沒有銀彈,架構分層模型更是如此,每一種都有各自優缺點,所以請根據不同的業務場景,并遵循簡單、可演進這兩個重要的架構原則選擇合適的架構分層模型即可。 ......

    uj5u.com 2023-04-19 08:42:41 more