
現有的方法通常將色情影像的識別作為一種二分類或多類分類任務,通過提取多種特征來實作, 但是,這些方法忽略了負樣本中固有型別的問題,忽略了分類任務中不確定性的影響,導致負資料集不足,對不在訓練集中的樣本識別錯誤, 為了解決這一難題,本文提出了一種名為Deep One-Class with Attention for porn (DOCAPorn)的方法,該方法通過基于神經網路的一類分類模型對色情影像進行識別,并引入視覺注意機制來提高識別性能, 另外,由于現有的基于深度卷積神經網路(cnn)的方法需要一個固定尺寸(如224 x224)的輸入影像,因此現有的方法沒有考慮影像縮放引起的幾何失真,降低了色情影像的識別精度, 為了解決這一問題,本文提出了規模約束池(Scale Constraint Pooling, SCP),將不同維度的輸入轉換為相同維度的輸出, 此外,現有的色情影像識別方法均忽略了領域的對抗性攻擊, 為了解決這一問題,本文提出了壓縮重構預處理(Preprocessing for compression and reconstruction,簡稱prer)方法,該方法通過對影像進行壓縮來減少影像的微小擾動,然后重構出完整的影像進行識別, 通過使用自定義資料集進行對比實驗,驗證了該方法的有效性, 實驗結果表明,該演算法在資料集上的準確率為98.419%, 該方法在NPDI資料集上的識別準確率為95.632%, 實驗結果驗證了該方法的有效性 ,
在現代社會,互聯網已經成為全球資訊中心, 全世界互聯網用戶的數量每天都在增加, 根據“We Are Social and Hootsuite”在2019年[1]發布的最新全球數字套件報告,全球45%的人口現在是互聯網用戶, 各種資訊工具的快速發展和推廣,使得互聯網上的資訊共享和資源的網路傳播更加活躍, 人們可以隨時輕松地在互聯網上發布或分享資訊和資源, 另一方面,濫用互聯網傳播色情資訊也被廣泛報道[2][7], 網路色情日益影響人們特別是青少年的正常生活,引發許多社會問題和道德問題[7][9], 此外,不斷有研究報告稱,網路色情的增長與性犯罪的上升有關,如性虐待、家庭暴力和兒童色情[10], 因此,識別網路色情對網路資源和網路文化的健康發展具有重要意義, 設計一種實用、有效的色情影像識別方法勢在必行, 網路色情的發現和消除一直是網路資訊安全領域關注的話題,[11][15], 色情影像是網路色情的重要組成部分,隨著計算機視覺技術的發展,基于內容的色情影像識別得到了廣泛的研究,
在過去的幾十年里,許多研究試圖解決這個問題, 然而,現有的色情影像檢測方法仍然存在許多挑戰,
首先,傳統的二元分類的目標任務是分類的類別A和類別B,例如,對于貓狗分類任務,如果貓形象被認為是一類,狗的形象被認為是類別B,在這種情況下,功能空間的A類和B類都是明確的, 色情影像識別任務通常被認為是一種二值分類任務, 如果將色情圖片歸為A類,則將正常圖片歸為b類, 在負類中,樣本型別之間不可能存在相關性, 例如,在正常的影像中,貓和車是完全不同的型別, 在這種情況下,由于B類的特征空間不明確,B類本質上等同于非A類,由于非A類包含無限種,我們將這種情況定義為“負樣本中無限種”, 因此,色情影像的識別被認為是一種特殊的二值或三值分類任務, 最直接的解決方法是在陰性樣本中包含盡可能多的物種, 這意味著識別色情影像的訓練集需要不同類別的影像, 然而,在現實的互聯網環境中,正常影像的類別例外的多樣化,使得構建訓練集變得困難, 另外,由于色情影像識別中存在無限種的負樣本,導致特征空間不清晰, 一些不在負樣本訓練集中的正常影像,如臉部特寫,會被分類器誤判, 這是因為負樣本的特征空間不清晰,導致分類邊界模糊, 由于不能指定負樣本的特征空間,降低了分類的準確性,
其次,當色情影像被添加了微小的資料擾動,人類無法觀察到細微的擾動,這些影像仍然是色情的, 但現有的主流識別方法將無法識別它們, 例如,一個簡單的例子是,在添加了不易察覺的噪聲[17]后,神經網路將熊貓圖片分類為長臂猿,
第三,現有的識別方法需要固定尺寸(如224 224)的輸入影像, 這一要求改變了影像的原始比例,通過神經網路的卷積層導致一些資訊的放大或減少, 這會導致色情影像的幾何失真, 影像資訊丟失或失真會影響識別精度, 另外,縮放造成的幾何失真會在一定程度上改變色情影像的關鍵資訊, 例如,一個胖男人的胸部被縮放,在視覺上變得與女性乳房相似, 資訊的這種變化導致分類器的錯誤判斷,
為了解決上述問題,本文提出了一種新的色情影像識別框架, 本文的具體貢獻總結如下:
- 為了避免負樣本中型別無限的問題,最大限度地減少分類任務中不確定性的影響,提出了一種基于神經網路的色情影像單類分類方法, 就筆者所知,單類影像分類檢測色情影像的文獻報道甚少,
- 為了提高深度一類分類的性能,將視覺注意機制引入到深度一類分類模型中, 本文將一類分類與視覺注意機制相結合的系統命名為Deep one-class with attention for porn (DOCAPorn), 該系統能夠更加注重目標物體的識別,從而減少影像中復雜背景的干擾, 此外,DOCAPorn可以捕獲影像中的小補丁的色情內容,
- 為了在色情影像識別應用中防止對抗攻擊,提出了一種壓縮重建預處理方法,即壓縮重建預處理(Preprocessing for compression and reconstruction, PreCR), prer提高了FGSM、DeepFool和C&W攻擊方法的防御性能, 據作者所知,本文首次考慮了色情影像識別領域的對抗性攻擊,
- 為了適應互聯網上不同規模的色情圖片,提出了規模約束池(Scale Constraint Pooling, SCP),使輸入影像在保持自身規模比例的同時,在全連接層獲取固定尺寸, 本文充分考慮了原始影像比例對色情影像識別的影響,
本文的其余部分組織如下, 第二節簡要回顧了相關作業, 第三部分解釋了區分色情和非色情影像的程序, 第四節介紹了本文提出的色情影像識別方法, 第五節給出實驗結果,第六節給出結論,
II. RELATED WORKS
識別色情圖片是一個極具挑戰性的問題[19], 在過去的幾十年中,人們提出了各種方法來處理這個問題, 一般來說,這些方法可以分為三類:基于人體皮膚的、基于手工特征的和基于神經網路的, 在本節中,我們將對這三個類別進行回顧,
Traditionally, the human skin-based approaches to recognize the pornographic images are natural and simple. These approaches determine the nude body through detecting the human skin [11], [20], and then dene appropriate thresholds of human skin regions in the entire image to recognize the pornography [21]. The human skin-based approaches are highly dependent on the detection of human skin color [22]. For instance, many researchers focused on the color space model to improve the accuracy of the detection of human skin [12], [21][24]. Marcial et al. [21] and Basilio et al. [25] converted the RGB color model into the YCbCr color model in order to improve the accuracy of skin color recognition. Although, the human skin-based approaches are intuitive, they are unable to obtain satisfactory performance. Many normal images may show large regions of human skin (e.g., face close-ups), leading to a large number of false positives. On the other hand, many images with a small amount of human skin may be pornographic. In addition, the appearance of the human skin area signicantly varies with various lighting conditions and backgrounds, which make it extremely difcult to dene an exact threshold of human skin for pornography.
The handcraft feature-based approaches are better than the human skin-based approaches because they consider various types of pornographic image features. The feature selection and extraction in pornographic images are emphasized in these approaches. Wang et al. [26] proposed an approach based on the navel and many-body features to recognize the nudity. Sevimli et al. [27] ltered many face close-ups through face detection and then extracted visual descriptors using four different methods. Zhu et al. [28] proposed an approach based on human skin detection and extracted 31- dimensional features (global image features, human body parts, faces, breasts, vulvas, etc.) to be fed into a random forest classier in order to improve the accuracy of pornography recognition. Tian et al. [29] combined color and shape features to represent the sexual organs for detecting pornographic images. In order to reduce the impact of various colors similar to human skin color such as a beach or aquatic sports in the context, many researchers utilized the visual Bag-of-Visual-Words (BoVW) to extract the feature for recognizing the pornographic images [30], [31]. Moreira et al. [32] extracted features from human skin regions and classied them using machine learning algorithms. In addition, Moreira et al. mitigated false positives in portrait photos by detecting faces. Although the handcraft feature-based approaches usually achieve better detection accuracy, these approaches rely on the accuracy of features recognition. Moreover, the complexity of handcraft featurebased approaches depends on the relevant experience and knowledge of the researchers
2012年,由Krizhevsky等人[33]提出的卷積神經網路模型AlexNet通過將classication錯誤記錄從26%降低到15%贏得了ImageNet競賽[34], 這一驚人的進步使得神經網路成為近年來計算機視覺領域的研究熱點, 許多研究人員使用神經網路在影像識別和分類cation [35][37]中實作了顯著的增強, 最近,許多研究人員采用基于神經網路的方法來識別色情作品[38],[39], Moustafa等人結合AlexNet[33]和GoogleNet[40],率先采用神經網路檢測色情影像和視頻, 2016年,雅虎提出了一種基于ResNet-50架構[41]的深度學習解決方案,用于色情影像檢測, 該方案基于強大的ResNet神經網路模型,并通過ImageNet資料集進行預訓練, 該方法可以為每個輸入影像輸出0到1之間的概率,以檢測色情, 此外,研究人員采用卷積神經網路從幀中提取特征,檢測色情視頻[15],[42], Wehrmann等人[15]在考慮視頻幀間關系的基礎上,提出了一種新的深度神經網路結構,將ConvNet與LSTM相結合,用于色情視頻的識別, 為了緩解皮膚暴露于色情資訊的映射問題,Perez et al.[42]通過光流位移場和MPEG運動矢量將運動資訊納入神經網路模型,提高色情資訊自動識別的準確性, 由于關鍵的色情資訊大多位于影像的區域區域,許多研究者認為區域背景關系資訊對識別色情資訊是有用的[43],[44], Wang et al.[43]采用卷積神經網路同時獲取影像的全域和區域資訊,提高色情檢測的準確性, 但是Wang等人[43]提出的方法并沒有利用區域背景關系資訊, 為了克服這一問題,Cheng等人[45]提出了一種基于多任務學習方案的成人影像分類的全域和區域背景關系集成DCNN, DCNN可以對端到端網路進行端到端訓練,同時考慮區域區域檢測和全域分類來優化網路權值, 色情影像的識別是一項具有挑戰性的任務,因為影像中關鍵的色情內容往往位于較小的區域區域, 為了解決這一難題,Jin等人[46]將每個影像建模為一個區域包,并采用多實體學習(MIL)方法訓練了基于泛域的神經網路識別模型,
然而,對于負樣本中無限型別的問題,以及識別色情影像的分類任務中不確定性的影響,一直沒有得到足夠的重視, 此外,之前沒有研究在_x001D_上調查對抗性攻擊對識別色情圖片的影響, 研究了影像大小對分類的影響,特別是對色情影像的識別, 因此,色情影像識別還需要進一步的研究,
III. BACKGROUND
本節介紹了背景知識,并給出了基于神經網路技術的色情影像識別的通用模型,
基于神經網路的色情影像識別采用輸入影像并輸出類(色情、正常等)或最能描述該影像的類的概率,
像素值, 根據影像的解析度和大小,計算機將看到一個W x H xC的矢量,其中w、h和c分別表示影像的寬度、高度和通道數量, 向量中的每個數字被分配一個從0到255的值,該值描述了點的像素強度, 這些數字是計算機唯一可用的輸入, 一般情況下,JPG或PNG格式的彩色影像中的c值為3,即RGB值, 將這些輸入向量輸入到神經網路模型中,在前向傳播訓練步驟中通過卷積操作提取影像的邊緣特征以及區域和全域特征, 然后通過反向傳播和梯度更新策略進行訓練,不斷優化神經網路模型的引數, 最后,通過這種方法自動提取色情影像的特征,并在模型引數的解空間中確定適合于色情影像到色情類標簽或概率的映射,
IV. THE PROPOSED APPROACH
在本節中,將詳細介紹所提出的方法,
該方法的總體架構包括一個基于注意力的但分類色情模型(Deep One-Class with Attention for porn, DOCAPorn)、一個壓縮與重構預處理(Preprocessing for compression and reconstruction, prer)和規模約束池(Scale Constraint Pooling, SCP), DOCAPorn專注于色情影像的識別,利用基于神經網路的單分類, 由于神經網路具有良好的特征提取能力,DOCAPorn演算法提高了分類性能, 將視覺注意機制引入深度一類分類中,使得神經網路在忽略無關資訊的同時,將注意力集中在目標物件上, 此外,還避免了由于負樣本型別或數量不足而導致泛化能力低的問題, 此外,由于單分類方法更關注目標物件的識別,添加視覺注意機制有助于減少分類任務中不確定性的影響, 該演算法通過對原始影像進行壓縮后重建得到的影像來減少干擾,以抵御對抗性攻擊, 影像壓縮受到影像區域結構中相鄰像素之間強相似性和相關性的啟發,可以在保留影像主導資訊的同時減少冗余資訊, 壓縮后的影像重建可以抑制對抗擾動的影響, SCP是提議的最大池化層,用于將不同維度的輸入轉換為相同維度的輸出, SCP消除了將不同大小的輸入影像預處理為相同大小的要求, 這種方法可以最大限度地保留原始影像的尺度資訊,避免不必要的幾何失真,
所建議的方法的體系結構概述如圖1所示, 首先,將原始影像變換為在最短邊具有統一的固定長度的影像,并根據影像的大小自適應縮放影像的另一邊, 在此基礎上,利用該演算法對影像進行預處理,通過對影像進行壓縮和重構來減少干擾,從而達到防御對抗性攻擊的目的,
最后,利用該演算法對影像進行識別

- SCP
從本質上說,所使用的SCP是最大池化的一種變體, 它將不同比例尺的特征約束為同一比例尺特征圖, 假設輸入影像的原始大小為w0;H0, 為了避免影像之間像素數的較大差異,將輸入影像的最短邊固定為Sf, 同時,輸入影像的另一側根據影像的比例進行縮放,

經過上述處理后,將輸入影像的大小重塑為Wf;Hf, 它確保輸入影像的比例不改變, 然后,通過神經網路的卷積操作,更新各層的feature map大小,如下所示:

其中Wl和Hl分別為當前層的寬度和高度l, Fl和Pl分別為當前層的卷積核大小和填充大小,Sl為當前層的步長,
通過神經網路對特征圖進行一系列變換,得到(WL;HL)大小的資料,

其中 (Wo;Ho) -> (WL;HL)為神經網路進行特征融合前,利用式(3)、(4)連續計算從輸入層到隱含層L的特征映射變換而得到的映射函式, 具體的映射取決于所使用的神經網路模型的結構, 理論上,該演算法可以代替神經網路中任意一層的最大池化演算法,
對于不同比例尺的輸入影像,其對應的特征圖(WL、HL)是不同的, 提出的SCP最大池化演算法的目標是將(WL;HL)特征映射劃分為(w; H)統一的網格尺度, 即通過SCP max pooling得到一個寬度為w高度為h的feature map網格, 網格中每個子視窗的大小為:

其中gw和g’ w分別表示網格行的前(w - 1)子視窗和最后一個子視窗的寬度, 其中,gh和g’ h分別表示網格列中的前(h-1)子視窗和最后一個子視窗的高度,
然后,在網格的相應區域執行最大池化, 圖2顯示了所提議的SCP的核心演算法的一個實體,

- PreCR
提出的preRC的動機是消除對人類來說極難檢測到的干擾, prer的總體架構如圖3所示, 假設輸入是
, PreRC的目標是輸出純化的
值得注意的是,根據公式(1)和(2),資料X的大小被重塑為(Wf;Hf),PreRC由子網路PreC和PreR組成,

子網路PreC的目的是壓縮影像,其框架是完全卷積的, 為了避免壓縮影像中關鍵細節的丟失,提出的子網路PreC中不存在池化層, 子網路PreC由卷積核大小為 3x3的11個卷積層組成, 每一層的輸入通道數等于前一層的輸出通道數, 前10個卷積層包含ReLU激活功能, 第11層包含s形激活函式, 這個sigmoid輸出允許輸入影像xi通過子網路PreC獲得不同灰度資訊所代表的特征, 利用第一至第六層提取輸入影像xi的特征,生成512個特征圖, 第一層的輸入通道數為3,輸出通道數為16, 之后,每層的輸出通道數分別為32、64、128、256和512, 在提取特征時,利用剩余的五層構造影像xi的緊湊表示, 第七層的輸入通道數為512,輸出通道數為256, 之后,每層的輸出通道數分別為128、64、32和12, 當原始影像xi通過子網路PreC傳播時,在消除擾動的同時提取xi的主要特征,
為了提高重構模型的性能,對子網路PreC的輸出進行了隨機高斯噪聲攻擊, 子網PreC受攻擊后的輸出如下:

其中PreC()表示子網路PreC的輸出,是原始輸入影像xi的緊湊表示的特征,表示子網路PreC的學習引數,表示均值和方差值分別為 和 的高斯噪聲, 這里,and分別設為0.00和20.00,
為了在重建純影像時利用子網路進行細節補償,將反卷積作為子網路PreR的框架, 子網路PreR由11個反卷積層組成,其層的大小為 3, 與子網路PreC一樣,每一層的輸入通道數等于前一層的輸出通道數, rst的10個反卷積層包含ReLU激活函式, 第一層的輸入和輸出通道數分別為12和32, 之后,每層的輸出通道數分別為64、128、256、512、256、128、64、32、16、3, 最后,對輸出的Oxi進行重塑,使其大小與原始輸入影像Oxi相同,
壓縮后的原始影像到重構后的影像的端到端映射需要通過子網路PreC和PreR的權值共同學習, 通過最小化preCR輸出和輸入影像Oxi之間的均方誤差(MSE)來實作映射, 因此,preR的優化目標為:

此外,由于所提出的preCR不涉及全連接層,本質上是對像素的預測,因此原始輸入影像的大小可以是任意的, 這保留了原始影像的比例資訊,
- DOCAPorn
神經網路由輸入層、隱藏層和輸出層組成,其中隱藏層是主要成分,
為了實作網路的有效設計,本文采用了模塊化設計的方法, 建議的DOCAPorn的概述如圖4所示,是輸入層的資料,經過預處理后,利用該預處理方法重構為純凈的影像, 提出的模塊化設計方法將隱層根據不同的功能劃分為不同的子網路,
在圖4中,E是將原始資料映射到復雜高維特征空間的特征提取子網路, 子網路E的輸出可以看作是神經網路從資料中學習到的分布式特征表示, 子網路E可以靈活地融入現有神經網路的任何特征提取體系中, 此外,為了將視覺注意機制融入到所提出的深度單類分類模型中,我們將卷積塊注意模塊[47]融合到子網路E中,具體來說,在中間feature map之后是CBAM,如圖5所示, 由通道注意模塊
和空間注意模塊
組成, 通道注意模塊專注于認為輸入影像重要的資訊, Mc模塊的定義如下:


其中AvgPf()和MaxPf()分別表示該層中每個feature map的全域平均池操作和全域最大池操作, MLP()表示一個帶有隱藏層的多層感知器, 具體為,其權重為
和
,其中r為還原比例, 此外,隱含層有一個ReLU激活函式,
表示s形函式,
空間注意模塊決定了輸入影像的資訊部分, 首先,對輸入特征的通道維度進行平均池和最大池操作, 然后結合輸入特征得到二維特征; 最后,利用帶有單個卷積核的隱層進行卷積運算, 模型Ms的定義如下:

其中
表示卷積核大小是k x k卷積運算,這里,k被設為7,
和
分別表示該層中所有通道的平均池操作和最大池操作,
假設輸入特征映射
通過CBAM依次傳播,中間輸出F’通過一維通道注意映射
得到, 然后,通過二維空間注意圖
將特征圖F重新輸出為F'', 以下是CBAM的整體模型:

其中
表示元素的乘法,
為特征融合子網路, 子網路F1的功能是融合子網路E學習到的深度特征,所提出的DOCAPorn框架包含兩個子網路F1和F2, 在這種模塊化設計方法中,子網F可以由全連接層或全域平均池(Global Average Pooling, GAP)組成, 特別地,子網E和F1是通過所提出的SCP連接的, 當輸入資料
通過子網路F1時,將其轉換為d維特征向量vi,SCP保證了對不同尺度的輸入影像獲得相同維d的特征向量, 輸出層C是一個分類器,
在圖4的分支(1)中,G為生成器子網路, 子網路G的本質是帶有反卷積模塊的解碼器網路, 它的輸出
是根據與
相同維數的子網路F1生成的特征向量vi重建的影像, 這是為了讓神經網路學習獲取輸入資料的特征表示,并用它來重構輸入資料, 分支(1)的目的是約束由子網路E生成的單分類資料表示,事實上,子網G和RreR試圖根據不同的目的重構影像, PreR利用高斯噪聲攻擊后的資料進行訓練,重建純資料, 子網G主要采用子網E學習到的特征表示,并嘗試重構輸入,這實際上限制了子網路E學習具有自表示特性的表示, 從結構上看,子網路G以及子網路E和子網路F1可以被視為一個“自編碼網路”, 分支(1)產生的損耗函式L1定義為:
在圖4的分支(2)中,N是一個與vi維數相同的零中心高斯噪聲,將其附加到特征向量vi上,形成偽類特征向量pi,

生成偽類pi的動機來自以原始為參考尋找單類分類的決策邊界的思想, 基于此思想,我們利用潛在特征空間中的零中心高斯噪聲作為偽類,利用交叉熵等損失函式訓練神經網路,學習給定類的更好的表示作為決策邊界, 偽類資料可以用來確定深度類的決策邊界, 此外,生成偽類可以避免使用普通影像作為負類, 這樣,利用偽類避免了負樣本無窮種的問題,
分類器C的功能是區分偽負資料集
目標資料集
學習決策邊界的, 由于在偽類資料中加入了原始特征,分類器C觀察批大小2的輸入, 因此,分類器C可以是輸出量為2的softmax回歸層, 偽類和色情類的數量均為n,因此損失函式的輸入樣本總數為2n, 分支(2)產生的損耗函式L2定義為:
式中
,
,
表示特征向量被歸為目標資料,否則(yj =0)為偽負資料, 這里,qj和1-qj分別表示yj=1和yj=0的概率,
最后,將分支(1)和(2)的損失函式合成為所提DOCAPorn的整體損失函式L, 定義為:

其和均為常系數,均設為0.50,以簡化整體損失函式L,
- EXPERIMENTS
- EXPERIMENTAL ENVIRONMENT AND DATASET
在實驗中,研究人員從網上收集了62500張色情圖片,包括各種姿勢、大小、動作和特寫鏡頭, 為了適應人類膚色的差異,收集的影像包括白人、黑人和亞洲人, 為了解決由于資料不足而導致的過擬合問題,對收集到的資料采用了資料增廣的方法, 通過一定的先驗知識,在保留影像中的色情資訊的同時,對原始資料進行適當的操作,如_x001D_翻轉影像,改變影像的亮度和銳度, 通過這種方式,資料集獲得了50萬張色情圖片, 訓練集、驗證集和測驗集分別為資料集的80%、10%和10%, 此外,還收集了來自互聯網和ImageNet資料集的50萬張正常影像作為非目標類進行對比分析, 非目標類的訓練集、驗證集和測驗集分別占資料集的80%、10%和10%, 此外,使用NPDI[48]色情資料庫作為實驗的測驗, NPDI包含近80個小時的400個正常視頻和400個色情視頻, 該資料庫由不同種族的人組成,包括黑人、白人和黃種人, 因此,NPDI資料庫中含有符合真實互聯網環境的色情圖片, 對于普通類,它包括兩個子類:一半的視頻是隨機選擇的(稱為“簡單”),而另一半是從文本搜索查詢中選擇的,如游泳、海灘和摔跤, 后半部分的視頻包含大量的人類皮膚,但沒有色情內容(稱為“困難”),這對識別器來說是一個特別的挑戰, 從色情視頻和普通視頻中分別提取了10000幀關鍵幀, 這些關鍵幀被用來測驗提出的框架的準確性,
- IMPLEMENTATION DETAILS AND EVALUATION METRICS
在實驗中,將輸入影像的固定最短邊設定為224(即Sf D 224), 本文參考VGG19[49]神經網路模型設計了所提出的DOCAPorn, 子網E采用VGG19最后一次最大池前的結構, 在本框架中,VGG19的最后一個最大池被提議的SCP替換, SCP的網格大小為7x 7(即,(w; h) = (7; 7)),與VGG19的最后一個最大池相同, 子網路F1是VGG19中的第一個全連接層(即FC-4096), 子網路F2由VGG19中除第一全連接層外的其余全連接層組成, 另外,在子網路F2的最后一層增加了一個具有二維矢量輸出的全連通層, 子網路G由四個完全卷積層(懷疑這里應該是反卷積層)組成, 它采用子網路E學習的特征表示,并嘗試在DOCAPorn中重構輸入,
超引數值的選擇是基于使用驗證集在向量空間上的網格搜索, preCR設定的超引數為:batchsize= 500, epoch =101, Learning Rate = 0.0001, DOCAPorn設定的超引數為:batch-size = 1000, epoch =101, Learning Rate = 0.0001, 圖6和圖7分別顯示了訓練時的損失和驗證集中色情影像識別的準確性,


如圖6和7所示,在6000步的初始階段,識別準確率從60.72%迅速提高到87.63%左右,這與初始學習階段有關, 在初始階段識別率也相對較低, 由于學習剛剛開始,準確率相當低,但提高得很快, 同時,如圖7所示,loss的值在此期間從1.56急劇下降到0.34, 從步驟6000到16000,識別準確率從87.63%逐漸提高到95.59%, 同時,隨著loss值從0.34減小到約0.16,訓練程序逐漸趨于穩定, 從16000步到24000步,正確率從95.59%提高到96.43%左右,而識別正確率的提高比較緩慢, loss值保持在0.13左右,說明學習程序基本完成, 最終,培訓在第40,400步結束, 在實際應用中,為了克服模型的過擬合問題,當epoch達到60時停止訓練,
- EXPERIMENTS AND ANALYSIS
為了評價該方法的性能,將其與基于人體皮膚、基于手工特征和基于神經網路的色情影像識別方法進行比較:
(1) 基于皮膚的:采用Marcial et al.[21]的方法進行對比實驗, 它是基于人體膚色識別的代表性方法之一,
(2) 基于BoVW的方法:將Deselaers等人[30]提出的基于BoVW的方法進行實作,與所提方法進行比較, 鑒于BoVW方法是手工設計特征中比較有優勢的演算法,本文將此方法作為基于手工特征的一種代表性方法,
(3) 基于cnn的:采用Moustafa等人[13]提出的簡單卷積神經網路進行色情影像識別對比實驗, 本文以基于神經網路的方法為代表,
(4) 基于resnet的:將NSFW[50]專案與所提出的方法進行比較, 這是一個基于ResNet-50的雅虎色情圖片識別的開源神經網路模型, 它是識別色情影像的最先進的方法之一, 本文將它作為基于神經網路方法的另一個代表,
(5) 基于例外的:Xception[51]是谷歌開發的功能強大的神經網路模型, 本文設計了一種基于例外的神經網路,并與該方法進行了比較, 與(3)和(4)相比,本實驗只是對神經網路模型的一個改變, 本研究旨在探討不同神經網路模型對色情影像識別的影響,
表1顯示了本文方法與上述方法的對比結果, 這些實驗在相同的資料集下進行比較, 圖9顯示了該方法與其他方法的混淆矩陣,


如表1所示,基于皮膚的方法的性能不如其他方法, 基于skin的方法將許多膚色比例較大的正常圖片(如比基尼)誤認定為色情圖片,導致誤報率較高, 基于cnn的方法在性能上優于基于skin和bovw的方法, 這是因為cnn能夠完全提取復雜、高維和抽象的影像特征, 這些特征比手工特征更有代表性, 此外,精心設計的神經網路模型(如基于resnet、基于exception和我們的方法)優于簡單的神經網路模型(如基于cnn), 從表1可以看出,本文提出的方法比五種方法中的任何一種都具有最高的性能, 由于所提出的深度單類分類方法避免了負樣本無窮和分類不確定性的問題,降低了FNR, 此外,圖10將本文提出的方法與使用NPDI資料庫的其他色情影像識別方法的準確率進行了比較, 可以看出,本文提出的方法在NPDI資料庫中仍然具有最高的精度,
轉載請註明出處,本文鏈接:https://www.uj5u.com/qita/296286.html
標籤:其他
