數據科學的圖算法

[斯洛文尼亞] 托馬茲·布拉塔尼奇(Toma? Bratanic)著 鄔瑞文 殷海英 譯

  • 數據科學的圖算法-preview-1
  • 數據科學的圖算法-preview-2
  • 數據科學的圖算法-preview-3
  • 數據科學的圖算法-preview-4
  • 數據科學的圖算法-preview-5
  • 數據科學的圖算法-preview-6
  • 數據科學的圖算法-preview-7
數據科學的圖算法-preview-1

商品描述

"簡單來說,圖就是由各類關聯數據組成的網絡結構。借助圖,我們能高效識別、挖掘數據集中天然存在的重要關系。《數據科學的圖算法》系統梳理了數據科學領域的核心圖算法,並搭配機器學習、業務應用、自然語言處理等多領域實戰案例輔助講解。 《數據科學的圖算法》將手把手教你如何利用結構化與非結構化數據來構建、分析圖結構。你將學會應用 PageRank、社區發現與聚類、知識圖譜模型等經典圖算法,每一類算法都會落地到完整的數據實戰項目中。作為前沿技術讀本,本書還會詳解節點嵌入實現方案,教你優化圖數據,為 AI 模型供高質量的輸入數據。 核心要點: ?知識圖譜的完整搭建方法 ?節點分類、鏈接預測工作流 ?用於圖構建的自然語言處理技術"

作者簡介

托馬茲???布拉塔尼奇(Toma? Bratani?),長期深耕圖計算與機器學習交叉研究領域。

目錄大綱

目    錄

第Ⅰ部分  圖的基礎概念

第1章  圖和網絡科學:入門  3

1.1  通過關系理解數據  7

1.2  如何識別圖問題  10

1.2.1  自引用關系  10

1.2.2  尋路網絡  11

1.2.3  二分圖  12

1.2.4  復雜網絡  13

1.3  本章小結  14

第2章  表示網絡結構:設計你的第一個圖模型  17

2.1  圖的術語  19

2.1.1  有向圖與無向圖  19

2.1.2  加權圖與無權圖  20

2.1.3  二分圖與單分圖  21

2.1.4  多重圖與簡單圖  22

2.1.5  完全圖  22

2.2  網絡表示法  23

2.3  設計你的第一個LPG模型  26

2.3.1  關註者網絡  27

2.3.2  用戶-推文網絡  29

2.3.3  轉推網絡  32

2.3.4  表示圖模式  34

2.4  從文本中抽取知識  36

2.4.1  鏈接  37

2.4.2  話題標簽  39

2.4.3  提及  42

2.4.4  最終的Twitter社交網絡圖模式  43

2.5  本章小結  45

第Ⅱ部分  網絡分析

第3章  初識Cypher查詢語言  49

3.1  Cypher查詢語言子句  50

3.1.1  CREATE子句  50

3.1.2  MATCH子句  53

3.1.3  WITH子句  56

3.1.4  SET子句  57

3.1.5  REMOVE子句  59

3.1.6  DELETE子句  59

3.1.7  MERGE子句  61

3.2  使用Cypher導入CSV文件  64

3.2.1  清理數據庫  64

3.2.2  Twitter圖模型  65

3.2.3  唯一性約束  66

3.2.4  LOAD CSV子句  67

3.2.5  導入Twitter社交網絡  67

3.3  答案  73

3.4  本章小結  75

第4章  探索性圖分析  77

4.1  探索推特網絡  78

4.2  使用Cypher查詢語言聚合數據  79

4.3  篩選圖模式  85

4.4  計數子查詢  89

4.5  序列中的多個聚合  90

4.6  答案  92

4.7  本章小結  95

第5章  社交網絡分析簡介  97

5.1  關註者網絡  99

5.2  Neo4j圖數據科學庫簡介  106

5.3  網絡特征描述  108

5.3.1  弱連通分量算法  108

5.3.2  強連通分量算法  111

5.3.3  局部聚類系數  115

5.4  識別中心節點  118

5.4.1  PageRank算法  118

5.4.2  個性化PageRank算法  122

5.4.3  刪除命名圖  123

5.5  答案  124

5.6  本章小結  125

第6章  投影單分網絡  127

6.1  將間接多跳路徑轉換為直接關系  131

6.2  轉發網絡特征描述  133

6.2.1  度中心性  134

6.2.2  弱連通分量  137

6.3  識別影響最大的內容創作者  139

6.3.1  排除自環  139

6.3.2  加權PageRank變體  140

6.3.3  刪除投影的內存圖  141

6.4  答案  142

6.5  本章小結  143

第7章  基於二分網絡推斷共現網絡  145

7.1  從推文中提取話題標簽  151

7.2  構建共現網絡  154

7.2.1  Jaccard相似性系數  156

7.2.2  節點相似性算法  158

7.3  共現網絡的特征描述  163

7.3.1  節點度中心性  163

7.3.2  弱連通分量  164

7.4  使用標簽傳播算法進行社群發現  165

7.5  使用PageRank識別社群代表  168

7.6  答案  170

7.7  本章小結  171

第8章  構建最近鄰相似性網絡  173

8.1  特征提取  176

8.1.1  基序和圖元  178

8.1.2  介數中心性  180

8.1.3  緊密性中心性  181

8.2  構建最近鄰圖  183

8.2.1  評估特征  183

8.2.2  推斷相似性網絡  185

8.3  使用社群發現算法進行用戶分群  186

8.4  答案  188

8.5  本章小結  190

第Ⅲ部分  圖機器學習

第9章  節點嵌入與分類  193

9.1  節點嵌入模型  196

9.1.1  基於同質性與基於結構性角色的方法  196

9.1.2  歸納式與直推式嵌入模型  197

9.2  節點分類任務  198

9.2.1  定義與Neo4j數據庫的連接  199

9.2.2  導入Twitch數據集  200

9.3  Node2Vec算法  202

9.3.1  Word2Vec算法  202

9.3.2  隨機遊走  204

9.3.3  計算Node2Vec嵌入  206

9.3.4  評估節點嵌入  207

9.3.5  訓練分類模型  210

9.3.6  評估預測  211

9.4  答案  213

9.5  本章小結  214

第10章  鏈接預測  215

10.1  鏈接預測工作流  217

10.2  數據集劃分  219

10.2.1  基於時間的劃分  220

10.2.2  隨機劃分  221

10.2.3  負樣本  223

10.3  網絡特征工程  224

10.3.1  網絡距離  225

10.3.2  優先連接  226

10.3.3  共同鄰居  228

10.3.4  Adamic-Adar指數  228

10.3.5  共同鄰居的聚類系數  230

10.4  鏈接預測分類模型  230

10.4.1  缺失值  232

10.4.2  訓練模型  232

10.4.3  評估模型  233

10.5  答案  234

10.6  本章小結  235

第11章  知識圖譜補全  237

11.1  知識圖譜嵌入模型  241

11.1.1  三元組  241

11.1.2  TransE  241

11.1.3  TransE的局限性  242

11.2  知識圖譜補全  244

11.2.1  Hetionet  245

11.2.2  數據集分割  247

11.2.3  訓練PairRE模型  247

11.2.4  藥物應用預測  248

11.2.5  解釋預測  249

11.3  答案  251

11.4  本章小結  251

第12章  使用自然語言處理技術構建圖  253

12.1  共指消解  256

12.2  命名實體識別  257

12.3  關系抽取  258

12.4  實現信息抽取流程  259

12.4.1  SpaCy  259

12.4.2  共指消解  260

12.4.3  端到端關系抽取  261

12.4.4  實體鏈接  264

12.4.5  外部數據豐富  266

12.5  答案  266

12.6  本章小結  267

附錄  Neo4j環境  269

A.1  Cypher查詢語言  269

A.2  Neo4j安裝  270

A.2.1  Neo4j Desktop安裝  270

A.2.2  Neo4j Docker安裝  274

A.2.3  Neo4j Aura  274

A.3  Neo4j Browser配置  275