机器学习实现金融风控 - 专知

会员服务 ·

1

机器学习实现金融风控

2017 年 6 月 1 日 凡人机器学习

一、背景

本文将针对阿里云平台上图算法模块来进行实验。图算法一般被用来解决关系网状的业务场景。与常规的结构化数据不同，图算法需要把数据整理成首尾相连的关系图谱。图算法更多的是考虑边和点的概念。阿里云机器学习平台上提供了丰富的图算法组件，包括K-Core、最大联通子图、标签传播聚类等。
本文的业务场景如下：
下图是已知的一份人物通联关系图，每两个人之间的连线表示两人有一定关系，可以是同事关系或者亲人关系等。已知“Enoch”是信用用户，"Evan"是欺诈用户，计算出其它人的信用指数。通过图算法，可以算出图中每个人是欺诈用户的概率，这个数据可以方便相关机构做风控。

二、数据集介绍

数据源：本文数据为自己生成，用于实验。
具体字段如下：

字段名	含义	类型	描述
start_point	边的起始节点	string	人
end_point	边结束节点	string	人
count	关系紧密度	double	数值越大，两人的关系越紧密

数据截图：

三、数据探索流程

首先，实验流程图：

1.最大联通子图

最大联通子图的功能很好理解，前面已经介绍了，图算法的输入数据是关系图谱结构的。最大联通子图可以找到有通联关系的最大集合，在团伙发现的场景中可以排除掉一些与风控场景无关的人。本次实验通过“最大联通子图”组件将数据中的群体分为两部分，并赋予group_id。通过“SQL脚本”组件和“JOIN”组件去除下图中的无关联人员。

2.单源最短路径

通过“单源最短路径”组件探查出每个人的一度人脉、二度人脉关系等。distance讲的是“Enoch”通过几个人可以联络到目标人。
如下图：

3.标签传播分类

“标签传播分类”算法为半监督的分类算法，原理是用已标记节点的标签信息去预测未标记节点的标签信息。在算法执行过程中，每个节点的标签按相似度传播给相邻节点。
调用“标签传播分类”组件除了要有所有人员的通联图数据以外，还要有人员打标数据。这里通过“已知数据-读odps”组件导入打标数据(weight表示目标是欺诈用户的概率)：

通过SQL对结果进行筛选，最终结果展现的是每个人涉嫌欺诈的概率，数值越大表示是欺诈用户的概率越大。

登录查看更多

15

相关内容

标签传播

大规模时间序列分析框架的研究与实现，计算机学报

大规模时间序列分析框架的研究与实现，计算机学报

专知会员服务

59+阅读 · 2020年7月13日

【实用书】Python机器学习Scikit-Learn应用指南，247页pdf

【实用书】Python机器学习Scikit-Learn应用指南，247页pdf

专知会员服务

270+阅读 · 2020年6月10日

【干货书】机器学习，408页pdf，开发人员和技术专业人员的动手实践手册

【干货书】机器学习，408页pdf，开发人员和技术专业人员的动手实践手册

专知会员服务

219+阅读 · 2020年5月7日

【实用书】掌握Python数据分析，282页pdf，Mastering Python Data Analysis

【实用书】掌握Python数据分析，282页pdf，Mastering Python Data Analysis

专知会员服务

103+阅读 · 2020年4月22日

【经典书】Python数据数据分析第二版，541页pdf

【经典书】Python数据数据分析第二版，541页pdf

专知会员服务

197+阅读 · 2020年3月12日

【新书】Pro 机器学习算法Python实现，379页pdf

【新书】Pro 机器学习算法Python实现，379页pdf

专知会员服务

204+阅读 · 2020年2月11日

KGCN：使用TensorFlow进行知识图谱的机器学习

KGCN：使用TensorFlow进行知识图谱的机器学习

专知会员服务

83+阅读 · 2020年1月13日

【金融机器学习课程资料】Financial Machine Learning

专知会员服务

119+阅读 · 2019年12月24日

为机器学习应用实践Scikit-Learn，数据科学基础与Python，247页pdf

为机器学习应用实践Scikit-Learn，数据科学基础与Python，247页pdf

专知会员服务

144+阅读 · 2019年12月1日

《“5G+区块链”融合发展与应用白皮书》（2019版），53页PDF，联通研究院、中兴通讯编

《“5G+区块链”融合发展与应用白皮书》（2019版），53页PDF，联通研究院、中兴通讯编

专知会员服务

61+阅读 · 2019年11月9日

关系图谱在贝壳找房风控体系的应用与实践

关系图谱在贝壳找房风控体系的应用与实践

DataFunTalk

50+阅读 · 2020年2月12日

赶紧收藏！西瓜书《机器学习》完整笔记来了

赶紧收藏！西瓜书《机器学习》完整笔记来了

大数据技术

30+阅读 · 2019年8月24日

【智能金融】机器学习在反欺诈中应用

【智能金融】机器学习在反欺诈中应用

产业智能官

35+阅读 · 2019年3月15日

金融风控背后的技术综述

金融风控背后的技术综述

七月在线实验室

45+阅读 · 2019年2月28日

五步帮你实现用户画像的数据加工

五步帮你实现用户画像的数据加工

云栖社区

7+阅读 · 2018年2月4日

机器学习面试题精讲（一）

机器学习面试题精讲（一）

七月在线实验室

4+阅读 · 2018年1月11日

机器学习(23)之GBDT详解

机器学习(23)之GBDT详解

机器学习算法与Python学习

12+阅读 · 2017年10月25日

金融科技&大数据产品推荐：众安科技X-model反欺诈

金融科技&大数据产品推荐：众安科技X-model反欺诈

数据猿

9+阅读 · 2017年10月9日

机器学习算法实践：决策树 (Decision Tree)

机器学习算法实践：决策树 (Decision Tree)

Python开发者

9+阅读 · 2017年7月17日

阿里数加：机器学习算法基于信用卡消费记录做信用评分

阿里数加：机器学习算法基于信用卡消费记录做信用评分

ITS专业大数据

7+阅读 · 2017年6月16日

Multi-Modal Graph Neural Network for Joint Reasoning on Vision and Scene Text

Multi-Modal Graph Neural Network for Joint Reasoning on Vision and Scene Text

Arxiv

10+阅读 · 2020年3月31日

Deep Learning for Learning Graph Representations

Arxiv

35+阅读 · 2020年1月2日

Question Generation by Transformers

Question Generation by Transformers

Arxiv

5+阅读 · 2019年9月14日

3D-LaneNet: end-to-end 3D multiple lane detection

3D-LaneNet: end-to-end 3D multiple lane detection

Arxiv

7+阅读 · 2018年11月26日

DOLORES: Deep Contextualized Knowledge Graph Embeddings

Arxiv

7+阅读 · 2018年10月31日

Did the Model Understand the Question?

Arxiv

4+阅读 · 2018年5月14日

Attention Focusing for Neural Machine Translation by Bridging Source and Target Embeddings

Arxiv

5+阅读 · 2018年5月10日

ParaNMT-50M: Pushing the Limits of Paraphrastic Sentence Embeddings with Millions of Machine Translations

Arxiv

3+阅读 · 2018年4月20日

Image-Image Domain Adaptation with Preserved Self-Similarity and Domain-Dissimilarity for Person Re-identification

Arxiv

7+阅读 · 2018年1月10日

Analysis of Wikipedia-based Corpora for Question Answering

Arxiv

7+阅读 · 2018年1月6日

VIP会员

相关主题

相关VIP内容

大规模时间序列分析框架的研究与实现，计算机学报

大规模时间序列分析框架的研究与实现，计算机学报

专知会员服务

59+阅读 · 2020年7月13日

【实用书】Python机器学习Scikit-Learn应用指南，247页pdf

【实用书】Python机器学习Scikit-Learn应用指南，247页pdf

专知会员服务

270+阅读 · 2020年6月10日

【干货书】机器学习，408页pdf，开发人员和技术专业人员的动手实践手册

【干货书】机器学习，408页pdf，开发人员和技术专业人员的动手实践手册

专知会员服务

219+阅读 · 2020年5月7日

【实用书】掌握Python数据分析，282页pdf，Mastering Python Data Analysis

【实用书】掌握Python数据分析，282页pdf，Mastering Python Data Analysis

专知会员服务

103+阅读 · 2020年4月22日

【经典书】Python数据数据分析第二版，541页pdf

【经典书】Python数据数据分析第二版，541页pdf

专知会员服务

197+阅读 · 2020年3月12日

【新书】Pro 机器学习算法Python实现，379页pdf

【新书】Pro 机器学习算法Python实现，379页pdf

专知会员服务

204+阅读 · 2020年2月11日

KGCN：使用TensorFlow进行知识图谱的机器学习

KGCN：使用TensorFlow进行知识图谱的机器学习

专知会员服务

83+阅读 · 2020年1月13日

【金融机器学习课程资料】Financial Machine Learning

专知会员服务

119+阅读 · 2019年12月24日

为机器学习应用实践Scikit-Learn，数据科学基础与Python，247页pdf

为机器学习应用实践Scikit-Learn，数据科学基础与Python，247页pdf

专知会员服务

144+阅读 · 2019年12月1日

《“5G+区块链”融合发展与应用白皮书》（2019版），53页PDF，联通研究院、中兴通讯编

《“5G+区块链”融合发展与应用白皮书》（2019版），53页PDF，联通研究院、中兴通讯编

专知会员服务

61+阅读 · 2019年11月9日

热门VIP内容

开通专知VIP会员享更多权益服务

【博士论文】多目标奖励与偏好优化：理论与算法

《无形的防御者？将定向能武器集成到反无人机框架的机遇与挑战》报告

自主化海军：海上无人系统与未来海战

迈向智能体系统规模化的科学

相关资讯

关系图谱在贝壳找房风控体系的应用与实践

关系图谱在贝壳找房风控体系的应用与实践

DataFunTalk

50+阅读 · 2020年2月12日

赶紧收藏！西瓜书《机器学习》完整笔记来了

赶紧收藏！西瓜书《机器学习》完整笔记来了

大数据技术

30+阅读 · 2019年8月24日

【智能金融】机器学习在反欺诈中应用

【智能金融】机器学习在反欺诈中应用

产业智能官

35+阅读 · 2019年3月15日

金融风控背后的技术综述

金融风控背后的技术综述

七月在线实验室

45+阅读 · 2019年2月28日

五步帮你实现用户画像的数据加工

五步帮你实现用户画像的数据加工

云栖社区

7+阅读 · 2018年2月4日

机器学习面试题精讲（一）

机器学习面试题精讲（一）

七月在线实验室

4+阅读 · 2018年1月11日

机器学习(23)之GBDT详解

机器学习(23)之GBDT详解

机器学习算法与Python学习

12+阅读 · 2017年10月25日

金融科技&大数据产品推荐：众安科技X-model反欺诈

金融科技&大数据产品推荐：众安科技X-model反欺诈

数据猿

9+阅读 · 2017年10月9日

机器学习算法实践：决策树 (Decision Tree)

机器学习算法实践：决策树 (Decision Tree)

Python开发者

9+阅读 · 2017年7月17日

阿里数加：机器学习算法基于信用卡消费记录做信用评分

阿里数加：机器学习算法基于信用卡消费记录做信用评分

ITS专业大数据

7+阅读 · 2017年6月16日

相关论文

Multi-Modal Graph Neural Network for Joint Reasoning on Vision and Scene Text

Multi-Modal Graph Neural Network for Joint Reasoning on Vision and Scene Text

Arxiv

10+阅读 · 2020年3月31日

Deep Learning for Learning Graph Representations

Arxiv

35+阅读 · 2020年1月2日

Question Generation by Transformers

Question Generation by Transformers

Arxiv

5+阅读 · 2019年9月14日

3D-LaneNet: end-to-end 3D multiple lane detection

3D-LaneNet: end-to-end 3D multiple lane detection

Arxiv

7+阅读 · 2018年11月26日

DOLORES: Deep Contextualized Knowledge Graph Embeddings

Arxiv

7+阅读 · 2018年10月31日

Did the Model Understand the Question?

Arxiv

4+阅读 · 2018年5月14日

Attention Focusing for Neural Machine Translation by Bridging Source and Target Embeddings

Arxiv

5+阅读 · 2018年5月10日

ParaNMT-50M: Pushing the Limits of Paraphrastic Sentence Embeddings with Millions of Machine Translations

Arxiv

3+阅读 · 2018年4月20日

Image-Image Domain Adaptation with Preserved Self-Similarity and Domain-Dissimilarity for Person Re-identification

Arxiv

7+阅读 · 2018年1月10日

Analysis of Wikipedia-based Corpora for Question Answering

Arxiv

7+阅读 · 2018年1月6日

大家都在搜

大型语言模型

蓝牙安全攻防

朱克爱德华兹家族

冷启动，0预算，如何借助分销裂变引爆私域用户增长？

微信扫码咨询专知VIP会员