Electronic Health Records (EHRs) are widely applied in healthcare facilities nowadays. Due to the inherent heterogeneity, unbalanced, incompleteness, and high-dimensional nature of EHRs, it is a challenging task to employ machine learning algorithms to analyse such EHRs for prediction and diagnostics within the scope of precision medicine. Dimensionality reduction is an efficient data preprocessing technique for the analysis of high dimensional data that reduces the number of features while improving the performance of the data analysis, e.g. classification. In this paper, we propose an efficient curvature-based feature selection method for supporting more precise diagnosis. The proposed method is a filter-based feature selection method, which directly utilises the Menger Curvature for ranking all the attributes in the given data set. We evaluate the performance of our method against conventional PCA and recent ones including BPCM, GSAM, WCNN, BLS II, VIBES, 2L-MJFA, RFGA, and VAF. Our method achieves state-of-the-art performance on four benchmark healthcare data sets including CCRFDS, BCCDS, BTDS, and DRDDS with impressive 24.73% and 13.93% improvements respectively on BTDS and CCRFDS, 7.97% improvement on BCCDS, and 3.63% improvement on DRDDS. Our CFS source code is publicly available at https://github.com/zhemingzuo/CFS.


翻译:健康电子记录(EHRs)目前广泛应用于卫生保健设施。由于健康电子记录(EHRs)固有的异质性、不平衡、不完善和高维性质,采用机器学习算法分析这类EHR,用于精确医学范围内的预测和诊断,这是一项具有挑战性的任务。减少多面性是一种高效的数据处理前处理技术,用于分析高维数据,减少特征数量,同时改进数据分析(例如分类)的性能。在本文中,我们建议一种高效的基于曲线的特征选择方法,以支持更精确的诊断。拟议的方法是一种基于过滤的特征选择方法,直接使用门格调曲线来对特定数据集的所有属性进行排序。我们对照常规的五氯苯和最近的数据,包括:BPCM、GSAM、WCNN、BLS II、VIBBES、2L-MJFA、RFGA、RGA和VAFF。我们的方法在四个基准保健数据集(CCRDS)、BCCDDS、BDS、BDS% 和DRDS 分别在CFS、CFS、CR%和DFS、CRMS、BS、CMS、BS、BS、BS、BS、BS、BS、BS、BS、BS、BS、BSDFS、BS、BS、BSDS、7.93和S、B、CM、CM、B、B、C%的改进了4、B、B、C、CM、C的改进。

0
下载
关闭预览

相关内容

特征选择( Feature Selection )也称特征子集选择( Feature Subset Selection , FSS ),或属性选择( Attribute Selection )。是指从已有的M个特征(Feature)中选择N个特征使得系统的特定指标最优化,是从原始特征中选择出一些最有效特征以降低数据集维度的过程,是提高学习算法性能的一个重要手段,也是模式识别中关键的数据预处理步骤。对于一个学习算法来说,好的学习样本是训练模型的关键。
专知会员服务
44+阅读 · 2020年12月18日
[综述]深度学习下的场景文本检测与识别
专知会员服务
78+阅读 · 2019年10月10日
LibRec 精选:AutoML for Contextual Bandits
LibRec智能推荐
7+阅读 · 2019年9月19日
已删除
将门创投
4+阅读 · 2019年6月5日
Hierarchically Structured Meta-learning
CreateAMind
26+阅读 · 2019年5月22日
Self-Attention Graph Pooling
Arxiv
5+阅读 · 2019年4月17日
Efficient and Effective $L_0$ Feature Selection
Arxiv
5+阅读 · 2018年8月7日
VIP会员
相关资讯
LibRec 精选:AutoML for Contextual Bandits
LibRec智能推荐
7+阅读 · 2019年9月19日
已删除
将门创投
4+阅读 · 2019年6月5日
Hierarchically Structured Meta-learning
CreateAMind
26+阅读 · 2019年5月22日
Top
微信扫码咨询专知VIP会员