【知識圖譜】知識表示
- 前言
- 1. 概述
- 知識定義
- 知識分類
- 知識表示
- 知識表示準則
- 2. 一階謂詞邏輯表示法
- 基本概念:命題與聯結詞
- 基本概念:個體詞、謂詞與量詞
- 謂詞邏輯表示法
- 謂詞邏輯表示法特性
- 3. 產生式規則表示法
- 基本概念:事實與規則
- 產生式系統結構
- 正向推理的產生式系統
- 產生式規則表示法特性
- 4. 框架表示法
- 框架示例
- 框架系統
- 框架表示法特性
- 代表性知識庫:FrameNet
- 5. 腳本表示法
- 腳本
- 腳本組成
- 腳本示例
- 腳本表示法特性
- 6. 語意網表示法
- 語意網
- 語意網體系結構
- XML
- XML:屬性
- XML:特性
- RDF
- RDF資料模型
- RDF描述示例
- RDF Schema
- RDFS詞匯表
- RDF(S)特性
- 為什么需要Ontology
- 本體的定義
- 本體的組成:𝑂={𝐶,𝑅,𝐹,𝐴,𝐼}
- OWL
- OWL建模原語
- 語意網知識描述語言體系
- 7. 知識圖譜中的知識表示
- 物體、關系和事實
- 狹義知識圖譜
- 知識圖譜特性
- 8. 分布式知識表示
- 位移距離模型
- 語意匹配模型
- 模型訓練
- 9. 本章小結
前言

提綱:
- 概述
- 一階謂詞邏輯表示法
- 產生式規則表示法
- 框架表示法
- 腳本表示法
- 語意網表示法
- 知識圖譜中的知識表示
- 分布式知識表示
- 本章小結
1. 概述
知識定義
-
Feigenbaum
知識是經過削減、塑造、解釋和轉換的資訊,簡單地說, 知識是經過加工的資訊, -
Bernstein
知識是由特定領域的描述、關系和程序組成的, -
Hayes-Roth
知識是事實、信念和啟發式規則,從知識庫的觀點看,知識是某領域中所涉及的各有關方面的一種符號表示,
知識分類
-
陳述性知識 (declarative knowledge):用于描述領域內有關概念、事實、事物的屬性和狀態等,
- 太陽從東方升起
- 一年有春夏秋冬四個季節
-
程序性知識 (procedural knowledge): 用于指出如何處理與領域相關的資訊,以求得問題的解,
- 菜譜中的炒菜步驟
- 如果信道暢通,請發綠色信號
-
元知識 (meta knowledge):關于知識的知識,包括怎樣使用規則、解釋規則、校驗規則、解釋程式結構等知識,
知識表示
知識表示:把人類知識表示成機器能處理的資料結構,對
知識進行表示的程序就是把知識編碼成某種資料結構的過
程,
知識表示方法:
- 陳述性知識表示:將知識表示與知識的運用分開處理,在知識表示時,并不涉及如何運用知識的問題,是一種靜態的描述方法,
- 程序性知識表示:將知識表示與知識的運用相結合,知識寓于程式中,是一種動態的描述方法,
知識表示準則
- 表示知識的范圍是否廣泛
- 是否適于推理
- 是否適于加入啟發資訊
- 是否適于計算機處理
- 是否有高效的求解演算法
- 陳述性表示還是程序性表示
- 能否表示不精確知識
- 能否在同一層次上和不同層次上模塊化
- 知識和元知識能否用統一的形式表示
- 表示方法是否自然
2. 一階謂詞邏輯表示法
基本概念:命題與聯結詞
一階謂詞邏輯是最早用在人工智能領域的知識表示方法之一,它以數理邏輯為基礎,是到目前為止能夠表達人類思維和推理的一種最精確的形式語言,其表現方式和人類自然語言也非常接近,容易為計算機理解和操作, 并支持精確推理,
命題 (proposition):具有真偽意義的陳述句,
- 太陽從東方升起
- 一年有春夏秋冬四個季節
邏輯聯結詞 (logical connective):用于將多個原子命題
組合成復合命題,
- ?:否定聯結詞,?𝑃表示對原命題的否定,
- ∨:析取聯結詞,𝑃 ∨ 𝑄表示兩個命題存在“或”的關系,
- ∧:合取聯結詞,𝑃 ∧ 𝑄表示兩個命題存在“與”的關系,
- →:蘊含聯結詞,𝑃 → 𝑄表示“如果𝑃,則𝑄”,
- ?:等價聯結詞,𝑃 ? 𝑄表示“𝑃當且僅當𝑄”,
復合命題與原子命題的真值關系表

基本概念:個體詞、謂詞與量詞
個體詞:領域內可以獨立存在的具體或抽象的客體,
- 太陽從東方升起:太陽
- 小王與小張同歲:小王、小張
在謂詞邏輯中,個體可以是常量也可以是變數(變元),
- 個體常量:表示具體的或特定的個體,
- 個體變數:表示抽象的或泛指的個體,
- 個體域(論域):個體變數的取值范圍,可以是有限集合,也可以是無窮集合,
謂詞(predicate):用來刻畫個體性質以及個體之間相
互關系的詞,
- 命題:𝑥是有理數
𝑥是個體變數,“…是有理數”是謂詞,記為Rational,命題符號:Rational(𝑥) , - 命題:小王與小張同歲
小王和小張是個體常量,“…與…同歲”是謂詞,記為SameAge, 命題符號:SameAge(小王, 小張) ,
n元謂詞:含有n個個體符號的謂詞P(𝑥1, 𝑥2, ? , 𝑥𝑛) ,
- 一元謂詞(𝑛 = 1):表示𝑥1具有性質P,
- 多元謂詞(𝑛 ≥ 2):表示𝑥1, 𝑥2, ? , 𝑥𝑛具有關系P,
函式:又稱函詞,是從若干個個體到某個個體的映射,
- Father(小張):小張的父親
- Sum(1,2) :1與2的加和
謂詞與函式的區別:
- 謂詞實作的是從個體域中的個體到真或假的映射,而函式實作的是從個體域中的一個(或若干)個體到另一個個體的映射,無真值可言,
- 在謂詞邏輯中,函式本身不能單獨使用,它必須嵌入到謂詞中,
量詞(quantifier):是表示個體數量屬性的詞,
- 全稱量詞:符號化為 ?(All)
- 日常生活和數學中所用的“一切的”、“所有的”、“每一 個”、“任意的”、“凡”、“都”等詞可統稱為全稱量詞,
- 𝑥表示個體域里的某個個體,?𝑥 P( 𝑥) 表示個體域里所有個體都具有性質P,
- 存在量詞:符號化為 ?(Exist)
- 日常生活和數學中所用的“存在”、“有一個”、“有的”、 “至少有一個”等詞可統稱為存在量詞,
- 𝑦表示個體域里的某個個體,?𝑦 Q( 𝑦 ) 表示個體域里存在個體𝑦 具有性質Q,
謂詞邏輯表示法
用謂詞邏輯既可以表示事物的狀態、屬性、概念等事實性
知識,也可以表示事物間具有因果關系的規則性知識,
謂詞邏輯表示知識的一般步驟:
- 定義謂詞及個體,確定每個謂詞及個體的確切含義,
- 根據所要表達的事物或概念,為每個謂詞中的變數賦以特定的值,
- 根據所要表達的知識的語意,用適當的邏輯聯結詞將各個謂詞連接起來形成謂詞公式,
謂詞邏輯表示法示例
用謂詞邏輯表示下列知識:
- 北京是一個美麗的城市,但她不是一個沿海城市,
- 北京是中國的首都,
- 每一個國家的首都都必定位于這個國家,
① 定義謂詞和個體域如下:
- BCity 𝑥 :𝑥是一個美麗的城市
- CCity 𝑥 :𝑥是一個沿海城市
- CapitalOf 𝑥, 𝑦 : 𝑥是𝑦的首都
- LocatedIn 𝑥, 𝑦 : 𝑥位于y
- 𝑥 ∈ {城市}, 𝑦 ∈ {國家}
② 將個體帶入謂詞中,得到:
- BCity (Beijing)
- CCity (Beijing)
- CapitalOf (Beijing,China)
- CapitalOf (𝑥, y)
- LocatedIn (𝑥, 𝑦)
③ 根據語意,用邏輯聯結詞連接:
- BCity (Beijing) ∧ ?CCity (Beijing)
- CapitalOf (Beijing,China)
- ?x, y CapitalOf (𝑥, 𝑦) → LocatedIn (𝑥, y)
謂詞邏輯表示法特性
優點:
- 精確性:可以較準確地表示知識并支持精確推理,
- 通用性:擁有通用的邏輯演算方法和推理規則,
- 自然性:是一種接近于人類自然語言的形式語言系統,
- 模塊化:各條知識相對獨立,它們之間不直接發生聯系,便于知識的添加、洗掉和修改,
缺點:
- 表示能力差:只能表示確定性知識,不能表示非確定
性知識、程序性知識和啟發式知識, - 管理困難:缺乏知識的組織原則,知識庫管理困難,
- 效率低:把推理演算與知識含義截然分開,往往使推
理程序冗長,降低了系統效率,
3. 產生式規則表示法
基本概念:事實與規則
產生式系統是用規則序列的形式來描述問題的思維程序, 形成求解問題的思維模式,系統中的每一條規則稱為一個產生式,目前產生式規則表示法已成為專家系統首選的知識表示方式,也是人工智能中應用最多的一種知識表示方式
事實:斷言一個語言變數的值或斷言多個語言變數之間關系的陳述句,
- 雪是白的
語言變數:雪;語言變數的值:白 - 小王與小張同歲
語言變數:小王、小張;語言變數之間的關系:同歲
確定性事實:一般用三元組的形式表示為
- (物件,屬性,值)或(關系,物件1,物件2)
不確定性事實:一般用四元組的形式表示為
- (物件,屬性,值,置信度)
- (關系,物件1,物件2,置信度)
規則:也稱為產生式,通常用于表示事物之間的因果關系,
確定性規則:通常表示為𝑃 → 𝑄 或 IF 𝑃 THEN 𝑄
- 𝑃是產生式的前提或條件;
- 𝑄是一組結論或操作,用于指出前提𝑃所指示的條件被滿足時,應該得出的結論或應該執行的操作,
不確定性規則:通常表示為𝑃 → 𝑄 (置信度) 或 IF 𝑃 THEN 𝑄(置信度)
- 𝑃是產生式的前提或條件,𝑄是一組結論或操作,
- 已知事實與前提條件不能精確匹配時,只要按照置信度的要求模糊匹配,再按特定演算法將不確定性傳遞到結論,
產生式系統結構
產生式系統(production system)由資料庫、規則庫和推理機三部分組成,

資料庫:用來存放問題的初始狀態、已知事實、推理的中間結果和最終結論等,
規則庫:用來存放與求解問題有關的所有規則,
推理機:用來控制整個系統的運行,決定問題求解的線路,包括匹配、沖突消解、路徑解釋等,
正向推理的產生式系統
正向推理:從已知事實出發,通過規則求得結論,
資料驅動方式或自底向上的方式,
推理程序:
- 規則庫中的規則前件與資料庫中的事實進行匹配,得 到匹配的規則集合;
- 使用沖突消解演算法,從匹配規則集合中選擇一條規則 作為啟用規則;
- 執行啟用規則的后件,并將該規則的后件送入資料庫; 重復上述程序直至達到目標,
正向推理的產生式系統示例
動物識別產生式系統:目標 = A是獵豹?
- 已有知識(規則庫):

已知事實(事實庫)
- A有爪子; A有前視眼;
- A有毛發; A有尖利的牙齒;
- A毛發是深褐色; A有花斑點

反向推理:從目標出發,反向使用規則,求得已知事實,
目標驅動方式或自頂向下的方式,
推理程序:
- 規則庫中的規則后件與目標事實進行匹配,得到匹配 的規則集合;
- 使用沖突消解演算法,從匹配規則集合中選擇一條規則作為啟用規則;
- 將啟用規則的前件作為子目標;
重復上述程序直至各子目標均為已知事實,

產生式規則表示法特性
優點:
- 有效性:既可以表示確定性知識,又可以表示不確定性知識,有利于啟發性和程序性知識的表達,
- 自然性:用“如果…,則…”表示知識,直觀、自然,
- 一致性:所有規則具有相同的格式,并且資料庫可被所有規則訪問,便于統一處理,
- 模塊化:各條規則之間只能通過資料庫發生聯系,不能相互呼叫,便于知識的添加、洗掉和修改,
缺點:
- 效率低:求解是反復進行的“匹配—沖突消解—執行” 程序,執行效率低,
- 表示的局限性:不能表示結構性或層次性知識,
4. 框架表示法
框架表示法是以框架理論為基礎發展起來的一種結構化知識表示方式,適用于表達多種型別的知識,框架理論認為人們對現實世界中各種事物的認識都是以一種類似于框架的結構存盤在記憶當中,當面臨一個新事物時, 就從記憶中找出一個適合的框架,并根據實際情況對其 細節加以修改補充,從而形成對當前事物的認識,
框架(frame):是一種描述所論物件屬性的資料結構,
- 框架名:用來指代某一類或某一個物件,
- 槽:用來表示物件的某個方面的屬性,
- 側面:有時一個屬性還要從不同側面來描述,
- 值:槽/側面的取值,可以為原子型,也可以為集合型,

框架分為兩種型別:
- 類框架(class frame)用于描述一個概念或一類物件,
- 實體框架(instance frame)用于描述一個具體的物件,
框架的層次結構:
- 子類-subclass of->父類:類框架之間的包含關系,
- 實體-instance of->類:實體框架和類框架的從屬關系, 下層框架可以從上層框架繼承某些屬性和值,后文對兩者不做區分,統稱為“類屬”關系,
框架示例
汶川地震是中華人民共和國自建國以來影響最大的一次地震, 發生于2008年5月12日14時28分04秒,里氏震級8.0級,直接 嚴重受災地區達10萬平方公里,這次地震危害極大,共遇難 69227人,受傷374643人,失蹤17923人,其中四川省68712名同胞遇難,17921名同 胞失蹤,共有5335名學生遇難,1000多 名失蹤,直接經濟損失8452億元,

框架系統

框架表示法特性
優點:
- 結構化:分層次嵌套式結構,既可以表示知識的內部 結構,又可以表示知識之間的聯系,
- 繼承性:下層框架可以從上層框架繼承某些屬性或值, 也可以進行補充修改,減少冗余資訊并節省存盤空間,
- 自然性:框架理論符合人類認知的思維程序,
- 模塊化:每個框架是相對獨立的資料結構,便于知識 的添加、洗掉和修改,
缺點:
- 不能表示程序性知識
- 缺乏明確的推理機制,
代表性知識庫:FrameNet
針對詞匯的概念進行框架形式的建模

https://framenet.icsi.berkeley.edu/fndrupal/
針對詞匯的概念進行框架形式的建模


針對詞匯的概念進行框架形式的建模

5. 腳本表示法
腳本
腳本由一組槽組成, 用來表示特定領域內一些事件的發生序列,類似于電影劇本,腳本表示的知識有明確的時間或因果順序,必須是前一個動作完成后才會觸發下一個動作,與框架相比, 腳本用來描述一個程序而非靜態知識,
- Winston
一個腳本(script)是一個事件序列,包含了緊密相關的 動作及改變狀態的框架,
- Luger-Stubblfield
一個腳本是一個描述特定背景關系中的原型事件序列(ste- reotyped eventsequence)的結構化表示,
腳本組成
- 進入條件:給出腳本中所描述事件的前提條件,
- 角色:用來描述事件中可能出現的人物,
- 道具:用來描述事件中可能出現的相關物體,
- 場景:用來描述事件發生的真實順序,一個事件可以由多個場景組成,而每個場景又可以是其他事件的腳本,
- 結果:給出在腳本所描述事件發生以后所產生的結果,
腳本示例
例:用腳本表示去餐廳吃飯
(1) 進入條件:① 顧客餓了,需要進餐;② 顧客有足夠的錢,
(2) 角色:顧客,服務員,廚師,老板,
(3) 道具:食品,桌子,選單,賬單,錢,
(4) 場景:
場景1:進入—— ① 顧客進入餐廳;② 尋找桌子;③ 在桌子旁坐下,
場景2:點菜—— ① 服務員給顧客選單;② 顧客點菜;
③ 顧客把選單還給服務員;④ 顧客等待服務員送菜,
場景3:等待—— ① 服務員告訴廚師顧客所點的菜;②廚師做菜,顧客等待,
場景4:吃飯—— ① 廚師把做好的送給服務員;② 服務員把菜送給顧客;
③ 顧客吃菜,
場景5:離開—— ① 服務員拿來賬單;② 顧客付錢給服務員;
③ 顧客離開餐廳,
(5) 結果:① 顧客吃了飯,不餓了;② 顧客花了錢;③ 老板賺了錢;④ 餐廳食品少了,
腳本表示法特性
缺點:
相較于框架表示,腳本表示表達能力更受約束,表示范圍更窄,不具備對于物件基本屬性的描述能力,也難以描述復雜事件發展的可能方向,
優點:
在非常狹小的領域內,腳本表示卻可以更細致地刻畫步驟和時序關系,適合于表達預先構思好的特定知識或順序性動作及事件,如故事情節理解、智能對話系統、機票酒店預訂等,
6. 語意網表示法
語意網的概念來源于萬維網(world wide web),是萬維網的變革與延伸,是Web of documents向Web of data的轉變,其目標是讓機器或設備能夠自動識別和理解萬維網上的內容,使得高效的資訊共享和機器智能協同成為可能,
語意網(semantic web)≠ 語意網路(semantic network)
起源:傳統萬維網中HTML所表達的頁面資訊和組織方法, 主要面向用戶直接閱讀,沒有將資訊的表現形式、內在結構和表達內容分離,沒有提供機器可讀的語意資訊,因而非常不利于機器的理解和處理,
貧訓:XML的出現將資料的內容與布局區分開來,為語意更豐富、更自然的Web內容表達打開了新局面,
目標:為Web資訊提供機器可以理解的語意,實作Web 資訊資源在語意層上的全方位互聯,從而幫助機器對Web 上異構、分布式資訊進行有效檢索和訪問,
語意網
本質:以Web資料的內容(即語意)為核心,用機器能夠理解和處理的方式鏈接起來的海量分布式資料庫,
特征:
- Web上的事物擁有唯一的URI
- 事物之間由鏈接關聯(如人物 地點、事件、建筑物)
- 事物之間鏈接顯式存在并擁有不同型別
- Web上事物的結構顯式存在

語意網體系結構
語意網提供了一套為描述資料而設計的表示語言和工具, 用于形式化的描述一個知識領域內的概念、術語和關系,

第一層:Unicode和URI (uniform resource identifier, 通用資源識別符號),是整個語意網的基礎,Unicode處理資源的編碼,實作網上資訊的統一編碼;URI 負責標識資源, 支持網上物件和資源的精細標識,
第二層:XML+NS+XML Schema,用于表示資料的內容 和結構,通過XML標記語言將網上資源資訊的結構、內容和資料的表現形式進行分離,
第三層:RDF+RDF Schema,用于描述網上資源及其型別,為網上資源描述提供一種通用框架和實作資料集成的元資料解決方案,
第四層:Ontology Vocabulary,用于描述各種資源之間的聯系,揭示資源本身及資源之間更為復雜和豐富的語意聯系,明確定義描述屬性或類的術語語意及術語間關系,
第五層:邏輯層,主要提供公理和推理規則,為智能推理提供基礎,該層用來產生規則,
第六層:證明層,執行邏輯層產生的規則,并結合信任層的應用機制來評判是否能夠信賴給定的證明,
第七層:信任層,注重于提供信任機制,以保證用戶代理在網上進行個性化服務和彼此間互動合作時更安全可靠,
核心層為XML、RDF、ONTOLOGY,用于表示資訊的語意,
XML
XML(eXtensible Markup Language,可擴展標記語言) 是最早的語意網表示語言,它取消了HTML的顯示樣式和布局描述能力,突出了資料的語意和元素結構描述能力,

用于顯示資料,側重于如何表現資訊

用于存盤和傳輸資料,側重于如何結構化地描述資訊
3## XML:元素
XML的元素代表XML檔案所描述的“事件”,比如書籍、 作者和出版商,
一個元素由起始標簽、元素內容和結尾標簽構成,
<author>Thomas B. Passin</author>
用戶可以隨意地選擇標簽名,只有很少的限制,
元素具有嵌套結構,并且沒有約束嵌套的深度,
<author>
<name>Thomas B. Passin</name>
<gender>Male</gender>
<phone>+61-7-3875 507</phone>
</author>
XML:屬性
與HTML類似,XML也可擁有屬性,即元素名稱-值對, 可以表達與元素相同的語意,
<author name=“Thomas B. Passin” gender=“Male” phone=“+61-7-3875 507”/>
屬性也可以與元素混合使用,但是不能嵌套,
<author name=“Thomas B. Passin” gender=“Male” >
<phone>+61-7-3875 507</phone>
</author>
XML:特性
優點:
- 結構化的資料表示方式,使得資料內容與其形式分離,
- 良好的可擴展性,使用者可創建和使用自己的標記,可定義行業領域特殊的標記語言,進行資料共享和交換,
- 包含檔案型別宣告,其資料可被任何XML決議器提取、 分析、處理,可以輕松地跨平臺應用,
缺點:
- XML是一種元標記語言,任何組織或個人都可以用它來定義新的標記和標準,容易產生沖突和混亂,
- XML檔案作為資料集合使用時,相當于一個資料庫, 確不具備資料庫管理系統那樣完備的功能,
- 資料是以樹狀結構存盤的,插入和修改比較困難,
RDF
RDF(Resource Description Framework,資源描述框架)是一種資源描述語言,利用當前的多種元資料標準來描述各種網路資源,形成人機可讀,并可由機器自動處理的檔案,
RDF的核心思想:
利用Web識別符號(URI)來標識事物,通過指定的屬性和 相應的值描述資源的性質或資源之間的關系,
RDF資料模型
RDF的基本資料模型包括資源、屬性和陳述,
- 資源(resource):一切能夠以RDF描述的物件都叫資源,用唯一的URI來表示,
- 屬性(property):用來描述資源的特征或資源之間的關系,每一個屬性都有特定的意義,
- 陳述(statement):特定的資源加上一個屬性和相應的屬性值就是一個陳述,其中資源是主體(subject), 屬性是謂詞(predicate),屬性值是客體(object),

RDF描述示例
考查以下陳述的RDF圖表示:
這篇文章(Document_001)的作者(Author_001)名為Eric Miller, 他的作業單位是Home, Inc.,他的電子郵件地址是em@home.com, 他的頭銜是Dr.

RDF Schema
RDFS是RDF的擴展,它在RDF的基礎上提供了一組建模原語,用來描述類、屬性以及它們之間的關系,
- Class, subClassOf:描述類別層次結構,
- Property, subPropertyOf:描述屬性層次結構,
- domain, range:宣告屬性所應用的資源類和屬性值類,
- type:宣告一個資源是一個類的實體,




RDFS詞匯表
RDFS允許定義自己的詞匯表(vocabulary):
- 類別集合和屬性集合
- 與其它詞匯表中詞匯的關系
詞匯表示例:
? Dublin core terms: creator, date, …
? FOAF terms: characterization of persons
? Good relations: e-Commerce terms
? Creative commons: copyright classes, license relations,
? schema.org terms: events, organizations, places, reviews,
RDF(S)特性
優點:
? 簡單:資源以三元組的形式描述,簡單、易控制,
? 易擴展:描述和詞匯集分開,具備良好的可擴展性,
? 包容性:允許定義自己的詞匯集,并可以無縫使用多種 詞匯集來描述資源,
? 易綜合:RDF認為一切都是資源,這樣很容易綜合描述,
缺點:
? 不能準確描述語意:同一個概念有多種詞匯表示,同一 個詞匯有多種含義(概念),
? 沒有推理模型,不具備推理能力,
為什么需要Ontology
- Ontology(本體)通過對概念的嚴格定義和概念與概念 之間的關系來確定概念的精確含義,表示共同認可的、可共享的知識,
- 對于ontology來說,author,creator和writer是同一個概念,而doctor在大學和醫院分別表示的是兩個概念,因 此在語意網中,ontology具有非常重要的地位,是解決語意層次上Web資訊共享和交換的基礎,
本體的定義
哲學界:對世界上客觀存在物的系統地描述,即存在論,
知識工程界:
- 1991/Neches:本體定義了主題領域的詞匯的基本術 語和關系,以及利用這些術語和關系構成的規定這些詞 匯外延的規則,
- 1993/Gruber:本體是概念模型的明確的規范說明,
- 1997/Borst:本體是共享概念模型的形式化規范說明,
- 1998/Studer:本體是共享概念模型的明確的形式化規范說明,
An ontology is a formal, explicit specification of a shared conceptualization
概念模型 (conceptualization):本體是通過抽象客觀世界的概念而得到的模型,其表示的含義獨立于具體的環境狀態,
明確性 (explicit):本體所使用的概念及使用這些概念的約束都有明確的定義,沒有二義性,
形式化 (formal):本體是計算機可處理的,而非自然語言,
共享 (shared):本體體現的是共同認可的知識,反映的是 相關領域中公認的概念集合,它所針對的是團體而非個體,
本體的組成:𝑂={𝐶,𝑅,𝐹,𝐴,𝐼}
概念 (concept) 或類 (class):可以指任何事物,從語意上講,它表示的是物件的集合,
學生、教授、演員、歌手
關系 (relation):描述概念之間的語意關聯,
part-of、kind-of、instance-of、attribute-of
函式 (function):一類特殊的關系,該關系中的第n個元素可由前n-1個元素唯一決定,
father-of(x, y)表示y是x的父親
公理 (axiom):代表永真斷言,
如果A是B的子女,B是C的子女,則A是C的子孫
實體 (instance):某類概念所指的具體個體,即物件,
John Smith是概念學生的實體
OWL
OWL (Web Ontology Language,Web本體語言)是在語意網上表示本體的推薦語言,作為RDF(S)的擴展,其目的是提供更多原語以支持更加豐富的語意表達并支持推理,
OWL的三個子語言:
- OWL Lite:提供一個分類層次和簡單屬性約束,
- OWL DL:提供推理系統,保證計算完備性和可判定性,
- OWL Full:支持完全自由的RDF語法,但是不具備可 計算性保證,
表達能力:OWL Lite < OWL DL < OWL Full
OWL建模原語
類運算式 (class descriptions):
? 列舉
owl:oneOf
? 屬性值約束
owl:allValuesFrom, owl:someValuesFrom, owl:hasValue
? 屬性基數約束
owl:maxCadinality, owl:minCadinality, owl:cadinality
? 交集、并集、補集
owl:intersectionOf, owl:unionOf, owl:complementOf
類公理 (class axioms):
? 子類、等價類、不相交類
rdfs:subClassOf, owl:equivalentClass, owl:disjointWith

語意網知識描述語言體系
? XML (http://www.w3.org/XML/) 提供了一種結構化文 檔的表層語法,但沒有對檔案含義施加任何語意約束 ,
? RDF (http://www.w3.org/TR/2002/WD-rdf-concepts- 20021108/) 是一個關于物件(資源)和它們之間關系的 資料模型,該模型具備簡單語意,能夠用XML語法表示,
? RDF Schema (http://www.w3.org/TR/2002/WD-rdf- schema-20021112/)是一組描述RDF資源的類和屬性的 建模原語,提供了關于這些類和屬性的層次結構的語意,
? OWL (http://www.w3.org/TR/2004/REC-owl-ref- 20040210/) 添加了更多用于描述類和屬性的建模原語, 支持更加豐富的語意表達并支持推理,

7. 知識圖譜中的知識表示
知識圖譜的概念最早出現于Google公司的知識圖譜項 目,體現在使用Google搜索引擎時,出現于搜索結果右側的相關知識展示,

截止到2016年底,Google 知識圖譜中的知識數量已經達到了600億條,關于1500 個類別的5.7億個物體,以及它們之間的3.5萬種關系,
物體、關系和事實
物體 (entity):現實世界中可區分、可識別的事物或概念,
- 客觀物件:人物、地點、機構
- 抽象事件:電影、獎項、賽事

關系 (relation):物體和物體之間的語意關聯,
- BornInCity, IsParentOf, AthletePlaysForTeam
事實 (fact):陳述兩個物體之間關系的斷言,通常表示為 (head entity, relation,tail entity) 三元組形式,
狹義知識圖譜
狹義知識圖譜:具有圖結構的三元組知識庫,
- 知識庫中的物體作為知識圖譜中的節點,
- 知識庫中的事實作為知識圖譜中的邊,邊的方向由頭物體指向尾物體,邊的型別就是兩物體間關系型別,

知識圖譜特性
-
知識圖譜不太專注于對知識框架的定義,而專注于如何以工程的方式,從文本中自動抽取或依靠眾包的方式獲取并組建廣泛的、具有平鋪結構的知識實體,最后再要求使用它的方式具有容錯、模糊匹配等機制,
-
知識圖譜的真正魅力在于其圖結構,可以在知識圖譜上運行搜索、隨機游走、網路流等大規模圖演算法,使知識圖譜與圖論、概率圖等碰撞出火花,
8. 分布式知識表示
核心思想:將符號化的物體和關系在低維連續向量空間進 行表示,在簡化計算的同時最大程度保留原始的圖結構,
- 將物體和關系在向量空間進行表示(向量/矩陣/張量),
- 定義打分函式,衡量每個三元組成立的可能性,
- 構造優化問題,學習物體和關系的低維連續向量表示,

1Wang et al. Knowledge Graph Embedding: A Survey of Approaches and Applications. IEEE TKDE, to appear, 2017.http://ieeexplore.ieee.org/document/8047276/
方法型別:
位移距離模型 (translational distance models):采用基于距離的打分函式來衡量三元組成立的可能性,
語意匹配模型 (semantic matching models):采用基于相似度的打分函式來衡量三元組成立的可能性,

位移距離模型
代表性方法:TransE及其變種
- head entity + relation = tail entity
China – Beijing = France – Paris = capital-of Beijing + capital-of = China
Paris + capital-of = France


語意匹配模型
代表性方法:RESCAL及其變種
- matching(relation, composition(head, tail))

代表性方法:神經網路
matching via neural network architectures



模型訓練
開放世界假設 (Open World Assumption, OWA):知識圖譜僅包括正確的事實,那些不在其中出現的事實要么是錯誤的,要么是缺失的,

關鍵:以何種策略生成負樣本,

封閉世界假設 (Closed World Assumption, CWA):但凡未在知識圖譜中出現的事實都是錯誤的,

等價于分解由知識圖譜表示成的三階張量,

9. 本章小結
一階謂詞邏輯表示法
? 通過個體、謂詞、量詞、邏輯聯結詞來表示事物的狀態、 屬性等事實性知識,以及事物間因果關系的規則性知識,
? 定義謂詞及個體,確定每個謂詞及個體的確切含義,
? 依據所要表達的事物,為謂詞中的變數賦以特定的值,
? 用邏輯聯結詞將各個謂詞連接起來形成謂詞公式,
? 優點:精確性、通用性、自然性、模塊化,
? 缺點:表示能力差、管理困難、效率低,
產生式規則表示法
產生式系統結構:資料庫 + 規則庫 + 推理機

? 資料庫:存放已知事實、推理的中間結果和最終結論,
? 規則庫:存放與求解問題有關的所有規則,
? 推理機:控制整個系統的運行,決定問題求解的線路,
框架表示法
? 框架是一種描述所論物件屬性的資料結構,由框架名、槽、 側面和值四部分組成,
? 框架型別:類框架 + 實體框架
? 層次結構:子類-subclass of->父類、實體-instance of->類
? 優點:結構化、繼承性、自然性、模塊化,
? 缺點:不能表示程序性知識、缺乏明確的推理機制,
腳本表示法
? 腳本是描述特定背景關系中的原型事件序列的結構化表示,由 進入條件、角色、道 具、場景和結果五部分組成,
? 缺點:表達能力非常有限,表示范圍窄,不具備對于物件基 本屬性的描述能力,也難以描述復雜事件發展的可能方向,
? 優點:在非常狹小的領域內,腳本表示卻可以更細致地刻畫 步驟和時序關系,適合于表達預先構思好的特定知識或順序 性動作及事件,
語意網表示法
? 語意網提供了一套為描述資料而設計的表示語言和工具, 用于形式化的描述一個知識領域內的概念、術語和關系,

? XML (http://www.w3.org/XML/) 提供了一種結構化文 檔的表層語法,但沒有對檔案含義施加任何語意約束 ,
? RDF (http://www.w3.org/TR/2002/WD-rdf-concepts- 20021108/) 是一個關于物件(資源)和它們之間關系的 資料模型,該模型具備簡單語意,能夠用XML語法表示,
? RDF Schema (http://www.w3.org/TR/2002/WD-rdf- schema-20021112/) 是一組描述RDF資源的類和屬性的 建模原語,提供了關于這些類和屬性的層次結構的語意,
? OWL (http://www.w3.org/TR/2004/REC-owl-ref- 20040210/) 添加了更多用于描述類和屬性的建模原語, 支持更加豐富的語意表達并支持推理,
知識圖譜中的知識表示
? 狹義知識圖譜:具有圖結構的三元組知識庫,
? 知識庫中的物體作為知識圖譜中的節點,
? 知識庫中的事實作為知識圖譜中的邊,邊的方向由頭物體指向尾物體,邊的型別就是兩物體間關系型別,

分布式知識表示
? 核心思想:將符號化的物體和關系在低維連續向量空間進 行表示,在簡化計算的同時最大程度保留原始的圖結構,
? 物體關系表示(向量/矩陣/張量)
? 打分函式定義(距離函式/相似度函式)
? 表示學習(開放世界假設/封閉世界假設)


加油!
感謝!
努力!
轉載請註明出處,本文鏈接:https://www.uj5u.com/qita/344102.html
標籤:AI
