
圖1 大賽產業命題賽道部分命題
如圖1所示,產業命題賽道就好比命題作文,選題都是一些真實企業(如華為)提前定好的,參賽選手必須在命題要求的范圍內按照要求進行準備,
這些命題直觀上令人感覺到十分前沿,大部分都要求應用新技術,如區塊鏈等,頗具難度,
作者對命題方向的分布十分感興趣,于是爬取了所有命題題目,并對其進行分詞,然后計算詞頻,并進行可視化呈現,直觀準確地獲得了命題方向的大概分布情況,
1 整體思路

圖2 整體思路流程圖
2 專案實施
2.1 爬取題目
import requests
from lxml import etree
import pandas as pd
import jieba
import matplotlib.pyplot as plt
word_list = [] # 用來儲存分好的詞
stopword_list = [] # 停用詞串列,用來排除分好的詞中虛詞等無意義的詞
for i in range(8):
url = 'https://cy.ncss.cn/mtcontest/mingtilist?pageIndex='+str(i)+'&pageSize=30&companyName=&name='
headers={
'User-Agent':'Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/80.0.3987.100 Safari/537.36',
'Host':'cy.ncss.cn'
}
text = requests.get(url = url, headers = headers).text
html = etree.HTML(text)
title = html.xpath('//div[@class="cyyq-title"]//text()')
需要注意的是,目標網頁通過ajax加載資料,需要通過chrome瀏覽器分析出發送ajax請求后的新url進行請求,不然無法獲得目標資料,
2.2 分詞操作
for item in title: # 接上面的代碼段
for word in jieba.lcut(item,cut_all = False, HMM=True):
word_list.append(word)
with open('stopword.txt', encoding='utf-8') as f:
for line in f.readlines():
stopword_list.append(line.strip('\n'))
word_list = [w for w in word_list if w not in stopword_list]
利用jieba庫進行中文分詞,分詞后匯入停用詞表洗掉無效的虛詞、標點符號等無意義詞,
2.3 詞頻統計
df = pd.DataFrame(word_list)
table = pd.DataFrame(df.iloc[:,0].value_counts())
轉化為DataFrame格式,利用其自帶的方法進行詞頻統計,
2.4 畫條形圖
plt.rcParams['font.sans-serif'] = ['SimHei']
plt.rcParams['axes.unicode_minus'] = False
plt.bar(range(50),table.iloc[0:50,0].values.tolist(), align='center', color='b')
plt.xticks(range(50),table.iloc[0:50,0].index, rotation=45,fontsize=13)
plt.xlabel('關鍵詞',labelpad=10)
plt.ylabel('頻次',labelpad=20)
plt.title('產業賽道命題關鍵詞頻次',pad=30)
plt.show()
最后進行可視化操作,以條形圖展現詞頻最高的前五十個詞,
3 結果展示
3.1 詞頻最高的前五十個詞條形圖

圖3 詞頻最高的前五十個詞條形圖
如圖所示,詞頻超過20頻次的詞分別是智能、智慧、技術、AI,由此可見產業命題賽道非常重視技術,尤其是人工智能方向的新技術,現階段具體而言包括但不限于自然語言處理,知識表現,智能搜索,推理,規劃,機器學習,知識獲取,組合調度問題,感知問題,模式識別,邏輯程式設計軟計算,不精確和不確定的管理,人工生命,神經網路,復雜系統,遺傳演算法等,
詞頻在10到20之間的詞分別是系統、平臺、創新、新、設計、解決方案、方案、工業、開發、識別、材料,首先,系統、平臺、解決方案、方案是結果形式,這說明產業命題賽道大多要求參賽選手最終結果以這些方式呈現,創新、新是原則要求,說明參賽選手最終結果應該要有創新點,設計、開發是方法,指設計程式,開發系統、平臺等,對應結果形式,工業、識別、材料是方向,其中識別屬于人工智能技術中的深度學習領域,工業主要指工業4.0,主要內容一是“智能工廠”,重點研究智能化生產系統及程序,以及網路化分布式生產設施的實作;二是“智能生產”,主要涉及整個企業的生產物流管理、人機互動以及3D技術在工業生產程序中的應用等,該計劃將特別注重吸引中小企業參與,力圖使中小企業成為新一代智能化生產技術的使用者和受益者,同時也成為先進工業生產技術的創造者和供應者;三是“智能物流”,主要通過互聯網、物聯網、物流網,整合物流資源,充分發揮現有物流資源供應方的效率,而需求方,則能夠快速獲得服務匹配,得到物流支持,也指向新技術,重點在于技術的遷移和應用,材料是材料科學與工程方向,主要研究一是粉末冶金新理論、新技術;二是相圖研究與材料設計;三是粉末冶金特種新材料;四是有色、稀有金屬材料的合金化理論及新材料開發;五是現代高性能符合材料;六是有色金屬功能材料, 六個研究方向的共同特色是:研究內容隸屬學科前沿課題和國際熱點研究課題,具有創新性;緊密結合國民經濟建設主戰場,實用性強;每個研究方向都有國家級或省部委級重點專案的支撐,實施程序可靠性高;有一支結構合理的高水平學術隊伍和良好的研究條件,可實作預期研究目標,并具有可持續發展的良好前景
10以下詞頻較高的詞中,資料、云、互聯網等均體現大賽對資訊技術的要求,區塊鏈作為近年來比較火的領域也榜上有名,此外鄉村振興作為關鍵詞也占據一席之地,可以體現國家政策的作用,而振興鄉村的最有利武器仍然是新技術,因為新技術具有高效率,往往成本低,
3.2 詞頻最高的前三十個詞表格
表1
| 詞頻 | |
| 智能 | 26 |
| 智慧 | 24 |
| 技術 | 23 |
| AI | 20 |
| 系統 | 19 |
| 平臺 | 19 |
| 創新 | 18 |
| 新 | 16 |
| 設計 | 16 |
| 解決方案 | 16 |
| 方案 | 14 |
| 工業 | 11 |
| 開發 | 11 |
| 識別 | 10 |
| 材料 | 10 |
| 檢測 | 9 |
| 資料 | 9 |
| 場景 | 8 |
| 云 | 7 |
| 研發 | 7 |
| 互聯網 | 7 |
| 管理 | 7 |
| 鄉村 | 6 |
| 區塊 | 6 |
| 產業化 | 6 |
| 鏈 | 6 |
| 能力 | 6 |
| 方向 | 6 |
| 自動 | 6 |
轉載請註明出處,本文鏈接:https://www.uj5u.com/qukuanlian/292562.html
標籤:區塊鏈
