Python文本挖掘：基于共现提取《釜山行》人物关系

2017 年 9 月 15 日 数据挖掘入门与实战 要学习更多点这→

大数据挖掘DT数据分析公众号： datadw

《釜山行》是一部丧尸灾难片，其人物少、关系简单，非常适合我们学习文本处理。这个项目将介绍共现在关系中的提取，使用python编写代码实现对《釜山行》文本的人物关系提取，最终利用Gephi软件对提取的人物关系绘制人物关系图。实体间的共现是一种基于统计的信息提取。关系紧密的人物往往会在文本中多段内同时出现，可以通过识别文本中已确定的实体(人名)，计算不同实体共同出现的次数和比率。当比率大于某一阈值，我们认为两个实体间存在某种联系。这种联系可以具体细化，但提取过程也更加复杂。因此在此课程只介绍最基础的共现网络。
1.开发环境
剧本

http://7xktmz.com1.z0.glb.clouddn.com/Train%20to%20Busan.txt

字典

http://labfile.oss.aliyuncs.com/courses/677/dict.txt

gephi
Python2+jieba库
2.实验过程
开始编写我们的代码。

import os, sys

import jieba, codecs, math

import jieba.posseg as pseg

names = {}

relationships = {}

lineNames = []

字典类型names保存人物，该字典的键为人物名称，值为该人物在全文中出现的次数。字典类型relationships保存人物关系的有向边，该字典的键为有向边的起点，值为一个字典edge，edge的键是有向边的终点，值是有向边的权值，代表两个人物之间联系的紧密程度。lineNames是一个缓存变量，保存对每一段分词得到当前段中出现的人物名称，lineNames[i]是一个列表，列表中存储第i段中出现过的人物。

jieba.load_userdict("dict.txt")

with codecs.open("to_train.txt", "r", "utf8") as f:

for line in f.readlines():

poss = pseg.cut(line)

lineNames.append([])

for w in poss:

if w.flag != "nr" or len(w.word) < 2:

continue

lineNames[-1].append(w.word)

if names.get(w.word) is None:

names[w.word] = 0

relationships[w.word] = {}

names[w.word] += 1

在具体实现过程中，读入剧本的每一行，对其做分词。提取该行中出现的人物集存入lineNames中。之后对出现的人物，更新他们在names中的出现次数。

for line in lineNames:

for name1 in line:

for name2 in line:

if name1 == name2:

continue

if relationships[name1].get(name2) is None:

relationships[name1][name2]= 1

else:

relationships[name1][name2] = relationships[name1][name2]+ 1

对于lineNames中每一行，我们为该行中出现的所有人物两两相连。如果两个人物之间尚未有边建立，则将新建的边权值设为1，否则将已存在的边的权值加1。这种方法将产生很多的冗余边，这些冗余边将在最后处理。

with codecs.open("node.txt", "w", "gbk") as f:

f.write("Id Label Weight\r\n")

for name, times in names.items():

f.write(name + " " + name + " " + str(times) + "\r\n")

with codecs.open("edge.txt", "w", "gbk") as f:

f.write("Source Target Weight\r\n")

for name, edges in relationships.items():

for v, w in edges.items():

if w > 3:

f.write(name + " " + v + " " + str(w) + "\r\n")

将已经建好的names和relationships输出到文本，以方便gephi可视化处理。输出边的过程中可以过滤可能是冗余的边，这里假设共同出现次数少于3次的是冗余边，则在输出时跳过这样的边。
完整的代码如下。

运行得到节点集合node.txt，边集合edge.txt。

下面使用gephi这个软件来将人物关系可视化。启动gephi，分别选择节点表格和边表格导入上面代码中生成的两个文件，分隔符选择空格，编码选择GB2312。

可以在最上方的数据资料选项卡中查看图中所有的边和节点，对于分词不准确导致的噪音可以手动删除。分别点击右侧统计栏中平均度和模块化运行计算。模块化运算时Resolution值填写0.5。

点击左上角外观中节点第一个选项卡，选择数值设定，选择Modularity Class，点击应用。

点击左上角外观中节点第二个选项卡，选择数值设定，选择连入度，最小尺寸填10，最大尺寸填40，点击应用。

选择左下角布局中的Force Atlas，斥力强度填写20000.0，吸引强度填写 1.0。点击运行，稍后点击停止。

点染色根据模块化计算结果不定，但染色效果大致相同。点击最上方的预览按钮，选中左侧节点标签中显示标签选项，并选择一种字体。

点击刷新按钮，右侧显示最终的人物关系图。为了优化显示的效果，还可以调整左边的参数。

人工智能大数据与深度学习

搜索添加微信公众号：weic2c

长按图片，识别二维码，点关注

大数据挖掘DT数据分析

搜索添加微信公众号：datadw

教你机器学习，教你数据挖掘

长按图片，识别二维码，点关注

登录查看更多

相关内容

共现

关注 0

【开放书-纽约大学】面向数据科学的概率与统计，237页pdf

专知会员服务

149+阅读 · 2020年7月6日

【干货书】用于概率、统计和机器学习的Python，288页pdf

专知会员服务

291+阅读 · 2020年6月3日

超越三元组:基于超关系知识图谱嵌入的链接预测，Beyond Triplets: Hyper-Relational Knowledge Graph Embedding for Link Prediction

专知会员服务

78+阅读 · 2020年5月11日

【ACL2020-复旦大学NLP】异构图神经网络的文档摘要提取

专知会员服务

35+阅读 · 2020年5月1日

【经典书】精通机器学习特征工程，中文版，178页pdf

专知会员服务

360+阅读 · 2020年2月15日

数据挖掘大拿韩家炜：从非结构化文本到知识立方TextCube：自动化构建和多维探索

专知会员服务

101+阅读 · 2019年12月28日

【论文推荐】文本分析应用的NLP特征推荐

专知会员服务

34+阅读 · 2019年12月8日

【WSDM2020】超越统计关系：将知识关系整合到多标签音乐风格分类的风格关联中（附pdf）

专知会员服务

18+阅读 · 2019年11月23日

【综述】关键词生成，附10页pdf论文下载

专知会员服务

54+阅读 · 2019年11月20日

【CLL 2019】汉语复合名词短语语义关系知识库构建与自动识别研究

专知会员服务

17+阅读 · 2019年10月18日

论文浅尝 | 将文本建模为关系图，用于联合实体和关系提取

开放知识图谱

77+阅读 · 2019年9月14日

别找了，送你 20 个文本数据集

机器学习算法与Python学习

69+阅读 · 2019年5月17日

文本分析与可视化

Python程序员

9+阅读 · 2019年2月28日

一种关键字提取新方法

1号机器人网

21+阅读 · 2018年11月15日

主题模型 | 挖掘商品在线评论的主题特征（NLP方法）

沈浩老师

45+阅读 · 2018年11月6日

word2vec中文语料训练

全球人工智能

12+阅读 · 2018年4月23日

文本情感分析的预处理

Datartisan数据工匠

17+阅读 · 2018年3月8日

【干货】--基于Python的文本情感分类

R语言中文社区

6+阅读 · 2018年1月5日

【宁波站】网络爬虫与文本挖掘

数萃大数据

5+阅读 · 2017年7月19日

NLP自然语言处理（二）——基础文本分析

乐享数据DataScientists

12+阅读 · 2017年2月7日

GIANT: Scalable Creation of a Web-scale Ontology

Arxiv

10+阅读 · 2020年4月5日

Learning Attention-based Embeddings for Relation Prediction in Knowledge Graphs

Arxiv

40+阅读 · 2019年6月4日

MDE: Multi Distance Embeddings for Link Prediction in Knowledge Graphs

Arxiv

4+阅读 · 2019年5月29日

Building Knowledge Graphs About Political Agents in the Age of Misinformation

Arxiv

5+阅读 · 2019年1月29日

Testing Matrix Rank, Optimally

Arxiv

3+阅读 · 2018年10月18日

Improving Information Extraction from Images with Learned Semantic Models

Arxiv

6+阅读 · 2018年8月27日

Working Memory Networks: Augmenting Memory Networks with a Relational Reasoning Module

Arxiv

5+阅读 · 2018年5月23日

Incorporating Glosses into Neural Word Sense Disambiguation

Arxiv

4+阅读 · 2018年5月21日

LCMR: Local and Centralized Memories for Collaborative Filtering with Unstructured Text

Arxiv

7+阅读 · 2018年4月20日

Transferring Common-Sense Knowledge for Object Detection

Arxiv

12+阅读 · 2018年4月3日

VIP会员