|
|
|
题名
|
作者
|
年代
|
出处
|
被引量
|
| 1 | 基于Spark平台和多变量L_2-Boosting回归模型的分布式能源系统短期负荷预测显示文摘分布式能源系统负荷预测是系统规划与经济运行的可靠前提和依据,在当前海量高维数据的背景下,有效的在线数据处理平台与精确的负荷预测方法是当前的研究重点。基于分布式能源系统负荷数据特点,在缺失数据处理、坏数据分类以及特征选择的基础上,建立了基于Spark平台与多变量L_2-Boosting回归模型的分布式能源系统短期负荷预测方法。首先,利用Spark平台分割全部数据得到多个子数据模型,通过并行计算提高数据处理效率,采用特征提取方法得出模型需要的输入向量;其次,将得出的有效数据信息输入到多变量L_2-Boosting回归模型进行训练学习,得到训练后的多变量L_2-Boosting回归模型;最后,利用测试数据测试模型。算例结果验证了所提模型的有效性。 | 马天男 牛东晓 黄雅莉 杜振东 | 2016 | 电网技术2016,40,6: | 33 |
| 2 | 基于KM-SMOTE和随机森林的不平衡数据分类显示文摘基于SMOTE算法的随机森林能够很好地处理不平衡数据集的分类,是一种通过对数据进行改造以达到良好分类要求的分类器。但SMOTE算法在处理不平衡数据后,可能会导致不平衡数据集分布的整体变化以及模糊正负类边界。这两个缺陷极易导致平衡后的数据与原始数据集有很大差异,从而使分类结果有提高但仍旧不够理想。K-means算法能够有效地聚类,并达到对数据分布的描述。在此基础上,结合K-means算法与SMOTE算法,利用两者优点,文中提出了一种基于K-means的KM-SMOTE算法,有效地解决了上述两个问题。并用于随机森林分类器进行实验,结果表明,改进后的算法分类效果更加明显。 | 陈斌 苏一丹 黄山 | 2015 | 计算机技术与发展2015,25,9: | 20 |
| 3 | 自适应AP聚类算法及其在入侵检测中的应用显示文摘网络数据流量的增大对入侵检测系统的实时性提出了更高的要求,压缩训练数据可加快未知样本的分类处理速度。针对数据量过大造成压缩处理和聚类效率低下的难题,提出了一种改进的自适应AP(affinity propagation)聚类方法,采取直接关联与簇中心距离较近样本的方法,减少聚类样本数量,降低聚类时空消耗,并依据关联结果,不断调整聚类参数,精确聚类结果。2个网络安全数据集的应用结果表明,该方法可从大规模样本中有效聚出代表性子集,在保证准确率的前提下,提高入侵检测的实效性。 | 江颉 王卓芳 陈铁明 朱陈晨 陈波 | 2015 | 通信学报2015,36,11: | 17 |
| 4 | 基于类别加权和方差统计的特征选择方法显示文摘为提高不均衡文本分类的准确率和稳定性,提出了一种基于类别加权和方差统计的联合特征选择方法.首先,基于类别文档数大小对特征选择的影响,给出了一种类别加权策略以强化小类别的特征;其次,在探究特征类别区分能力的基础上,设计了类别方差统计策略来凸显含有丰富类别信息的特征;最后,将2种策略相融合,实现了一种联合特征选择的新算法.在Reuters-21578和复旦大学语料这2个不均衡语料上的实验都表明:该算法有效,特别是在小类别的分类效果上远远好于IG、CHI和DFICF等流行的通用算法. | 冀俊忠 吴金源 吴晨生 杜芳华 | 2014 | 北京工业大学学报2014,40,10: | 11 |
| 5 | 基于Stacking算法的员工离职预测分析与研究显示文摘针对员工离职会增加企业运营成本,降低企业盈利能力的问题,提出使用机器学习的离职员工预测算法;通过Stacking集成学习算法组合Adaboost和Random Forest基本算法构建LRA预测模型,实现对某企业的员工离职预测;实验结果显示,LRA模型的预测准确率为89. 09%,相对于单一算法所构建验证的模型预测准确率明显提高,LRA模型的查准率、查全率以及F1度量指标证实模型的可行性与可靠性,通过对输入LRA模型的特征进行重要性排序,得到影响员工离职的主要因素有加班、工龄(0-3年)、收入、职业级别等,丰富已有研究的结论,有利于企业决策者,针对离职行为进行合理决策。 | 李强 翟亮 | 2019 | 重庆工商大学学报(自然科学版)2019,36,1: | 9 |
| 6 | 面向结构化数据集的敏感属性识别与分级算法显示文摘如何对生产环境中经代码混淆的结构化数据集的敏感属性(字段)进行自动化识别、分类分级,已成为对结构化数据隐私保护的瓶颈。提出一种面向结构化数据集的敏感属性自动化识别与分级算法,利用信息熵定义了属性敏感度,通过对敏感度聚类和属性间关联规则挖掘,将任意结构化数据集的敏感属性进行识别和敏感度量化;通过对敏感属性簇中属性间的互信息相关性和关联规则分析,对敏感属性进行分组并量化其平均敏感度,实现敏感属性的分类分级。实验表明,该算法可识别、分类、分级任意结构化数据集的敏感属性,效率和精确率更高;对比分析表明,该算法可同时实现敏感属性的识别与分级,无须预知属性特征、敏感特征字典,兼顾了属性间的相关性和关联关系。 | 何文竹 彭长根 王毛妮 丁兴 樊玫玫 丁红发 | 2020 | 计算机应用研究2020,37,10: | 8 |
| 7 | 激光诱导击穿光谱的自组织特征映射结合相关判别对天然地质样品分类方法研究显示文摘激光诱导击穿光谱技术具有微损、原位、快速分析的特点,在样品分类识别、成分分析等领域有广阔的应用前景。为探索该技术在天然地质样品识别应用的可行性,提出了一种自组织特征映射神经网络结合相关判别对天然地质样品LIBS光谱分类识别的方法。为减小全谱中背景噪声等不相关数据干扰、降低计算量,在元素谱线归属的基础上进行了特征谱线提取,实现了高维光谱数据的降维。以特征谱数据为输入建立网络训练模型,得到具有输入样本特征的权向量,通过权向量与待测样本进行相关分析可以实现样品分类。对16种天然地质样品的分类算法实验证明,在全谱、主成分降维和特征谱段三种数据处理方法中,特征谱的降维和提取LIBS数据主特征效果最优。改进的SOM网络结合相关判别算法比支持向量机方法和直接应用SOM网络方法的分类准确度更高,初步证实了该方法的有效性。 | 闫梦鸽 董晓舟 李颖 张莹 毕云峰 | 2018 | 光谱学与光谱分析2018,38,6: | 5 |
| 8 | 数据发布中基于模糊集的隐私保护研究显示文摘隐私保护数据发布是近年来研究的热点技术之一,主要研究如何在数据发布中避免敏感数据的泄露,又能保证数据发布的高效用性。基于模糊集的隐私保护模型,文中方法首先计算训练样本数据的先验概率,然后通过将单个敏感属性和两个相关联属性基于贝叶斯分类泛化实现隐私保护。通过实验验证基于模糊集的隐私保护模型(Fuzzy k-匿名)比经典隐私保护k-匿名模型具有更高的效率,隐私保护度高,数据可用性强。 | 刘英华 | 2016 | 计算机工程与科学2016,38,6: | 3 |
| 9 | 农机不间断组合导航系统探究显示文摘针对农机田间作业过程中易出现短时间全球卫星导航系统(GNSS)信号、实时动态(RTK)信号丢失导致的农机导航系统无法连续工作的问题,提出采用捷联惯性导航系统和GNSS的组合导航方法进行不间断导航的思路,在GNSS信号、RTK信号短时间丢失期间为农机提供导航信息。仿真实验结果验证了方法的有效性。 | 肖鹏 周志峰 赵勇 | 2019 | 导航定位学报2019,7,1: | 3 |
| 10 | 基于随机森林的老年人居住偏好预测研究显示文摘随着我国老龄化和高龄化趋势的加速,以及家庭养老功能弱化、社会养老服务体系不健全等问题,养老事业面临诸多挑战。为了更好地为老年人提供居住安排建议,同时为养老事业管理部门提供精准的决策支持,对CHARLS问卷中将近2万名老年人的数据进行了分析,力图发现影响老年人居住偏好的主要因素。同时,也尝试利用大数据和数据挖掘方法,从个人层面对老年人居住偏好进行预测,并针对类不平衡的情况下随机森林特征选择算法进行了改进。研究结果表明:基于老年人的特征数据可以很好地预测其居住偏好,为养老事业的精准化决策提供一种依据。 | 吴帅 赵方 | 2018 | 计算机工程与科学2018,40,5: | 3 |
| 11 | 基于属性相似度的连续型特征选择方法显示文摘特征选择作为模式识别领域的研究热点,是一种重要的降维方法.对于连续型特征,目前主要采用离散化方法或特征分类能力的'相关性'评估进行特征选择.引入区间数相似度的概念,提出一种连续型特征选择方法.该方法以区间数相似度为基础,定义每个特征的属性相似度,以此作为特征选择的启发信息,对特征全集进行排序,选择特征子集,实现特征选择.相关实验表明了该方法的有效性. | 王宏威 李国和 | 2014 | 渤海大学学报(自然科学版)2014,35,4: | 2 |
| 12 | 基于Logistic回归的数据分类问题研究显示文摘数据分类是数据科学的一个重要研究方向,Logistic回归是最基本的分类算法之一。线性回归和Logistic回归都属于线性模型,本文介绍了两者的联系,详细阐述了模型的目标函数和参数训练过程。在经典的模式识别数据集Iris上,应用Logistic回归模型基于部分特征和全部特征维度进行了建模和分类预测。实验结果表明,适合比例的训练集和测试集切分,较高权重特征组合的建模可以获得较高的分类准确率。 | 邹晓辉 | 2016 | 智能计算机与应用2016,6,6: | 2 |
| 13 | 基于改进混沌粒子群的特征提取方法显示文摘为解决数据维数高、信息冗余导致的数据处理问题,提出基于改进混沌粒子群的最优特征提取方法。引入初始潜能的概念优化粒子群的初始化,降低传统的随机初始化导致的盲目性;在此基础上同时考虑粒子的适应度值和位置两个影响因素,对权重做出动态调整,调节空间范围搜索的能力,通过早熟判断机制,及时引入混沌变量避免局部最优。KDDCUP99数据实验得到的分类正确率验证了该方法的有效性和高效性。 | 许迪 徐连诚 任敏 | 2015 | 计算机工程与设计2015,36,4: | 2 |
| 14 | 一种基于数据分布特征的模糊规则提取显示文摘针对数据分类问题提出一种新的模糊规则提取方法。定义了一种类间离散程度的度量方法,并将此度量作为特征选择的依据。给出了一种模糊区间划分的方法,应用数据分布特征和分布函数,给出模糊规则的前件形式,进而生成模糊规则。最后聚合具有相同前项的规则,得到最后的结果。在Matlab环境下用IRIS数据进行分类实验,提取出了形式较为简单的规则,并得到了较高的分类正确率,验证了方法的有效性。 | 朱田华 周军 刘旭华 | 2013 | 辽宁工业大学学报(自然科学版)2013,33,2: | 1 |
| 15 | 基于轮廓重合度分析的道路标记鲁棒识别显示文摘基于道路标线识别是自动驾驶中的一个关键问题,提出一种消除道路场景中大量非目标干扰的道路标线识别方法。该方法将基于椭圆傅里叶描述子的支持向量机分类结果和对道路标线轮廓分析结果进行融合。在此算法中,为了减小非目标区域的干扰,对轮廓图像与Canny边缘图像重合度进行分析以滤除非目标区域。研究结果表明:该道路标记识别算法的分类准确率高达98.69%,召回率高达94.02%,同时误报率较低,为0.61%;精确率和召回率的调和平均数F1高达96.30%;整个道路标记识别算法平均运行时间为34.79 ms,能够实时地检测并分类8种常见道路标记,表明该方法的识别效果较好。 | 陈家成 肖晓明 黄余 唐琎 耿耀君 | 2020 | 中南大学学报(自然科学版)2020,51,7: | 1 |
| 16 | 一种快速特征选择方法在医疗数据挖掘中的应用显示文摘提出一种基于不一致率的特征选择及数据分类方法,并给出特征选择和分类方法在Weka中的完整实现;利用Weka中的实现,对某三甲医院的多个医疗数据集进行实验分析;通过Java调用Weka设计开发了一套在线病情分析系统,医生可通过Web上传医疗数据集,系统后台自动进行数据预处理、特征选择及分类,最终给出病情分类结果,具有较高的诊断决策支持作用。 | 许杰 缪茹一 | 2016 | 中国数字医学2016,11,4: | 1 |
| 17 | 互联网企业海外并购财务风险大数据预警研究——基于Stacking集成学习显示文摘数智化时代中国互联网企业海外并购强势崛起但风险巨大,机器学习与非财务信息可为此类风险预警提供新思路。在已有研究基础上,选取2013—2020年45家中国互联网上市公司56起海外并购事件的大数据,构建Stacking集成学习模型进行大数据财务风险预警因子挖掘。结果表明,Stacking集成学习模型相比其他机器学习模型的大数据预警效果更好;运营能力等传统型财务指标依然是互联网企业海外并购财务风险大数据预警的首选指标,但股吧评论等创新型非财务指标也具有重要预警价值。研究结论提供了Stacking机器学习与利益相关者大数据信息有助于预警互联网企业海外并购财务风险的经验证据,为互联网企业、投资者、监管者等进行海外并购财务风险管控决策提供了重要参考。 | 江乾坤 王成哲 | 2023 | 技术经济2023,42,9: | 0 |
| 18 | 基于数据挖掘的在线医疗诊断系统显示文摘随着生活水平的不断提高以及生活环境的不断变化,人们对医疗的重视也逐步增加,对自身健康也更加关注。文章介绍了多种数据挖掘的方法,并采用了一种通过分析数据不一致化率的分类方法实现对确诊数据的高效分类。最后,将该方法应用于糖尿病患者的确诊数据挖掘,从而通过实例证明了该分类方法在医疗领域有一定的有效性。 | 林震 | 2016 | 电脑与信息技术2016,24,6: | 0 |
| 19 | 基于特征非规则离散化在线性回归中应用研究显示文摘特征离散化是线性回归算法在模型训练时必要步骤。特征的离散化通常包括两种方式即0-1归一化和均等区间归一化,这两种离散化方式是假设数据分布均匀的情况,在实际业务场景中数据分布具有很大的不确定性,以数据的分布趋势为区间划分标准进行特征离散化,将离散化后的特征数据应用于线性回归中,以今日头条新闻数据作为测试数据集,实验结果表明,新的特征离散化方法能够较为显著地提高模型预测AUC。 | 梁律 | 2018 | 科技通报2018,0,3: | 0 |
| 20 | 结构化数据在电力年金体系中的应用显示文摘大多数电力系统都存有年金托管机构的基本信息,但目前由于托管机构的投资的实效性和市场的约束性导致各投资机构的投资信息独立,且投资信息的保密程度过高,往往只能通过内网邮件的形式交互,使得年金专责无法在短时间内对托管机构的投资方向和投资利润做对比,以至于无法比较托管机构的优劣。在邮件信息中往往存在大量的且关键的信息,基于对结构化数据的模糊识别与算法,并根据定价日、科目名称、成本、市值建立数据模型,实现重要信息的分类处理,解决了投资信息的实时录入和对托管机构营收的准确判断。 | 李博龙 朱思宁 余涵 孟熔 王毅 李剑峰 | 2021 | 软件2021,42,1: | 0 |