国内刊号:11-2560/TP
国际刊号:1000-9825
发布日期:
作者:谢娟英,丁丽娟,王明钊
单位:谢娟英,陕西师范大学 计算机科学学院, 陕西 西安 71006211,丁丽娟,陕西师范大学 计算机科学学院, 陕西 西安 710062;武警工程大学 信息工程学院, 陕西 西安 71008602,王明钊,陕西师范大学 生命科学学院, 陕西 西安 71006203
关键词:谱聚类;无监督特征选择;特征独立性;特征区分度;特征重要度
基金:国家自然科学基金(61673251);陕西省科技攻关重点项目(2018ZDXMSF-079);国家重点研发计划(2016YFC0901900);科技成果转化培育项目(GK201806013);中央高校基本科研业务费专项资金(GK201701006);研究生培养创新基金(2015CXS028,2016CSY009,2018TS078)
基因表达数据具有高维小样本特点,包含了大量与疾病无关的基因,对该类数据进行分析的首要步骤是特征选择.常见的特征选择方法需要有类标的数据,但样本类标获取往往比较困难.针对基因表达数据的特征选择问题,提出基于谱聚类的无监督特征选择思想FSSC(feature selection by spectral clustering).FSSC对所有特征进行谱聚类,将相似性较高的特征聚成一类,定义特征的区分度与特征独立性,以二者之积度量特征重要性,从各特征簇选取代表性特征,构造特征子集.根据使用的不同谱聚类算法,得到FSSC-SD(FSSC based on standard deviation)、FSSC-MD(FSSC based on mean distance)和FSSC-ST(FSSC based on self-tuning)这3种无监督特征选择算法.以SVMs(support vector machines)和KNN(K-nearest neighbours)为分类器,在10个基因表达数据集上进行实验测试.结果表明,FSSC-SD、FSSC-MD和FSSC-ST算法均能选择到具有强分类能力的特征子集.
来源:2020年第4期
《软件学报》期刊编辑部