目錄
1.資料匯入
1.1使用標準Python類別庫匯入資料
1.2使用Numpy匯入資料
1.3使用Pandas匯入資料
2.資料理解
2.1資料基本屬性
2.2資料相關性和分布分析
3.資料可視化
3.1單一圖表
3.2多重圖表
總結
統計學是什么?概率與數學,用概率與數學來分析人,分析的永遠不是人,用永遠不是人的結論指匯入實在是一種偏誤,在這個意義上講,解讀強于技術,
——劉德寰
1.資料匯入
在訓練機器學習的模型時,需要大量的資料,最常用的方法是利用歷史資料來訓練模型,這些歷史資料通常是以csv檔案儲存,或者能夠方便地轉化為csv檔案,在開始機器學習時,我們首先要匯入csv資料檔案,
csv檔案是用逗號(,)分隔的文本檔案,在csv檔案中注釋是以(#)開頭,
在接下來的文章中,將使用Pima Indians資料集,它是從UCI機器學習倉庫(https://archive.ics.uci.edu/ml/index.php)中獲取的,也可到網盤中下載(https://pan.baidu.com/s/18KyCx4LjV4dZMs8H-vmkxg)提取碼:m7bl,
Pima Indians是一個分類問題的資料集,主要記錄了印第安人最近五年內是否患有糖尿病的醫療資料,
1.1使用標準Python類別庫匯入資料
Python提供了一個標準的類別庫CSV,用來處理CSV檔案,
from csv import reader
#python標準庫匯入資料
filename = 'pima_data.csv'
with open(filename, 'rt') as raw_data:
readers = reader(raw_data, delimiter=",")
x = list(readers)
data = np.array(x).astype('float')
print(data.shape)
代碼比較簡單,此處不做過多贅述,
運行結果:
(768, 9)
1.2使用Numpy匯入資料
使用numpy的loadtxt()方法匯入資料,使用這個函式處理的資料沒有檔案頭,并且所有的資料結構都一樣,也就是說,資料型別都一樣,
import numpy as np
#使用Numpy匯入資料
from numpy import loadtxt
filename = 'pima_data.csv'
with open(filename, 'rt') as raw_data:
data = loadtxt(raw_data, delimiter=',')
print(data.shape)
loadtxt中的第一個引數為資料實體,第二個引數為分隔符,
輸出結果同上
(768, 9)
1.3使用Pandas匯入資料
通過Pandas來匯入CSV檔案要使用pandas.read_csv()函式,這個函式的回傳值使Data Frame,在機器學習的專案中,經常利用pandas來做資料處理和準備作業,因此,推薦使用Pandas來匯入資料,
#推薦使用!!!!
#使用Pandas匯入資料
from pandas import read_csv
filename = 'pima_data.csv'
names = ['preg', 'plas', 'pres', 'skin', 'test', 'mass', 'pedi', 'age', 'class']
#設定檔案頭
data = read_csv(filename, names=names)
print(data.shape)
print(data.head(10))
使用Pandas匯入資料可以設定檔案頭,便于后續資料理解,read_csv()方法有兩個引數,一個是檔案名,一個是檔案頭陣列,
輸出結果同上
(768, 9)
2.資料理解
為了得到更準確的結果,必須理解資料的特征、分布情況,以及需要解決的問題,一邊建立相關的演算法模型并進行優化,
2.1資料基本屬性
對資料的簡單審視,是加強對資料理解最有效的方法之一,通過對資料的觀察,可以發現資料的內在關系,這些發現有助于對資料進行整理,
2.1.1查看前10行資料,使用的資料集依然是Pima Indians資料集:
from pandas import read_csv
filename = 'pima_data.csv'
names = ['preg','plas','pres','skin','test','mass', 'pedi','age','class']
data = read_csv(filename,names=names)
#查看前十行資料
print(data.head(10))
先使用pandas匯入資料集,再使用print函式資料data的head屬性以查看前10行資料,
輸出結果:
preg plas pres skin test mass pedi age class
0 6 148 72 35 0 33.6 0.63 50 1
1 1 85 66 29 0 26.6 0.35 31 0
2 8 183 64 0 0 23.3 0.67 32 1
3 1 89 66 23 94 28.1 0.17 21 0
4 0 137 40 35 168 43.1 2.29 33 1
5 5 116 74 0 0 25.6 0.20 30 0
6 3 78 50 32 88 31.0 0.25 26 1
7 10 115 0 0 0 35.3 0.13 29 0
8 2 197 70 45 543 30.5 0.16 53 1
9 8 125 96 0 0 0.0 0.23 54 1
2.1.2查看資料維度,資料屬性和型別:
'''
資料維度
'''
#查看資料維度
#通過DATa Frame的shape屬性來查看資料集中有多少行多少列
print(data.shape)
'''
資料屬性和型別
'''
#查看資料屬性和型別
#通過DATa Frame的Type屬性來查看每一個欄位的資料型別
print(data.dtypes)
運行結果:
(768, 9)
preg int64
plas int64
pres int64
skin int64
test int64
mass float64
pedi float64
age int64
class int64
dtype: object
2.1.3查看資料描述性統計
通過DataFrame的describe()方法來查看描述性統計的內容,包括:資料數量、平均值、標準方差、最小值、下四分位數、中位數、上四分位數、最大值,(省略前方讀取資料部分)
from pandas import set_option
'''
描述性統計
'''
#通過DATa frame的describe()方法來查看描述性統計
#資料記錄數、平均住、標準方差、最小值、下四分位數、中位數、上四分位數、最大值
set_option('display.width',100)
#設定資料的精確度
set_option('precision',2)
print("資料描述性分析:")
print(data.describe())
運行結果:
資料描述性分析:
preg plas pres skin test mass pedi age class
count 768.00 768.00 768.00 768.00 768.00 768.00 768.00 768.00 768.00
mean 3.85 120.89 69.11 20.54 79.80 31.99 0.47 33.24 0.35
std 3.37 31.97 19.36 15.95 115.24 7.88 0.33 11.76 0.48
min 0.00 0.00 0.00 0.00 0.00 0.00 0.08 21.00 0.00
25% 1.00 99.00 62.00 0.00 0.00 27.30 0.24 24.00 0.00
50% 3.00 117.00 72.00 23.00 30.50 32.00 0.37 29.00 0.00
75% 6.00 140.25 80.00 32.00 127.25 36.60 0.63 41.00 1.00
max 17.00 199.00 122.00 99.00 846.00 67.10 2.42 81.00 1.00
2.2資料相關性和分布分析
2.2.1資料相關矩陣
資料屬性的相關性是指資料的兩個屬性是否相互影響,以及這種影響是何種方式,常用皮爾遜相關系數來表示兩個屬性之間的關聯性,它介于(-1,1),當資料的關聯性比較高時,有些演算法(如Liner、邏輯回歸演算法等)的性能會降低,所以需要查看一下演算法的關聯性,使用Data Frame的corr()方法來計算資料屬性之間的相關矩陣,
print("資料屬性的相關性:")
print(data.corr(method='pearson'))
結果如下:
資料屬性的相關性:
preg plas pres skin test mass pedi age class
preg 1.00 0.13 0.14 -0.08 -0.07 0.02 -0.03 0.54 0.22
plas 0.13 1.00 0.15 0.06 0.33 0.22 0.14 0.26 0.47
pres 0.14 0.15 1.00 0.21 0.09 0.28 0.04 0.24 0.07
skin -0.08 0.06 0.21 1.00 0.44 0.39 0.18 -0.11 0.07
test -0.07 0.33 0.09 0.44 1.00 0.20 0.19 -0.04 0.13
mass 0.02 0.22 0.28 0.39 0.20 1.00 0.14 0.04 0.29
pedi -0.03 0.14 0.04 0.18 0.19 0.14 1.00 0.03 0.17
age 0.54 0.26 0.24 -0.11 -0.04 0.04 0.03 1.00 0.24
class 0.22 0.47 0.07 0.07 0.13 0.29 0.17 0.24 1.00
2.2.2資料分布分析
通過分析資料的高斯分布情況來確認資料的偏離情況,使用Data Frame的skew()方法來計算所有資料屬性的高斯分布偏離情況,
print("資料的高斯分布偏離情況:")
print(data.skew())
結果如下:
資料的高斯分布偏離情況:
preg 0.90
plas 0.17
pres -1.84
skin 0.11
test 2.27
mass -0.43
pedi 1.92
age 1.13
class 0.64
dtype: float64
3.資料可視化
對資料進行理解最快、最有效的方式是通過資料的可視化,我們將使用Matplotlib來可視化資料以更好地理解資料,
3.1單一圖表
3.1.1直方圖
直方圖使用較多,此處不做過多介紹,
from pandas import read_csv
import matplotlib.pyplot as plt
filename = 'pima_data.csv'
names = ['preg','plas','pres','skin','test','mass', 'pedi','age','class']
data = read_csv(filename,names=names)
'''
直方圖
'''
data.hist()
plt.show()

3.1.2密度圖
密度圖是一種表現與資料值對應的邊界或域物件的圖形表示方法,一般用于呈現連續變數,密度圖類似于對直方圖進行抽象,用平滑的線來描述資料的分布,
'''
密度圖
'''
data.plot(kind='density',subplots=True,layout=(3,3),sharex=False,sharey=False)
plt.show()

3.1.3箱線圖
箱線圖又稱盒須圖、盒式圖或箱行圖,是一種用于顯示一組資料分散情況的統計圖,
'''
箱線圖
'''
data.plot(kind='box',subplots=True,layout=(3,3),sharex=False,sharey=False)
plt.show()

3.2多重圖表
3.2.1相關矩陣圖
from pandas import read_csv
import matplotlib.pyplot as plt
import numpy as np
filename = 'pima_data.csv'
names = ['preg','plas','pres','skin','test','mass','pedi','age','class']
data = read_csv(filename,names=names)
#相關矩陣圖
correlations = data.corr()
fig = plt.figure()
ax = fig.add_subplot(111)
cax = ax.matshow(correlations, vmin=-1, vmax=1)
fig.colorbar(cax)
ticks = np.arange(0,9,1)
ax.set_xticks(ticks)
ax.set_yticks(ticks)
ax.set_xticklabels(names)
ax.set_yticklabels(names)
plt.show()

3.2.2散點矩陣圖
from pandas import read_csv
import matplotlib.pyplot as plt
import numpy as np
from pandas.plotting import scatter_matrix
filename = 'pima_data.csv'
names = ['preg','plas','pres','skin','test','mass','pedi','age','class']
data = read_csv(filename,names=names)
scatter_matrix(data)
plt.show()

總結
本文主要講了機器學習專案開始前的一些準備作業:匯入資料,資料理解和資料可視化,匯入資料有三種方法:Python庫函式,Numpy和Pandas匯入,推薦使用Panads匯入CSV檔案,資料理解包括查看資料的一些基本屬性以及查看資料相關矩陣和高斯分布情況,資料可視化主要介紹了Matplotlib的一些常用方法,
轉載請註明出處,本文鏈接:https://www.uj5u.com/qita/295315.html
標籤:AI
上一篇:圖解CNN十大演算法架構
