|
|
|
题名
|
作者
|
年代
|
出处
|
被引量
|
| 1 | 微博短文本预处理及学习研究综述显示文摘认为因短文本具有特征稀疏性和高度冗余性,微博短文本的预处理及学习方法研究已经成为微博信息挖掘及应用的关键,并在许多方面有着非常重要和广泛的应用。重点分析微博短文本的特性,并对微博短文本的预处理和学习方法及其应用现状进行归纳和总结,包括短文本特征表示、短文本特征拓展与选择、短文本分类与聚类学习、热点事件发现及自动文摘等。最后指出相关研究的局限性,并对未来的发展方向进行展望。 | 王连喜 | 2013 | 图书情报工作2013,57,11: | 33 |
| 2 | 基于自动编码器的短文本特征提取及聚类研究显示文摘针对短文本的特点,提出一种基于深层噪音自动编码器的特征提取及聚类算法。该算法利用深度学习网络,将高维、稀疏的短文本空间向量变换到新的低维、本质特征空间。首先在自动编码器的基础上,引入L1范式惩罚项来避免模型过分拟合,然后添加噪音项以提高算法的鲁棒性。实验结果表明,将提取的文本特征应用于短文本聚类,显著提高了聚类的效果,有效地解决了短文本空间向量的高维、稀疏问题。 | 刘勘 袁蕴英 | 2015 | 北京大学学报(自然科学版)2015,51,2: | 30 |
| 3 | 融合标签关联关系与用户社交关系的微博推荐方法显示文摘通过分析微博特点及现有微博推荐算法的缺陷,提出一种融合了标签间关联关系与用户间社交关系的微博推荐方法.采用标签检索策略对未加标签和标签较少的用户进行加标,构建用户-标签矩阵,得到用户标签权重,为了解决该矩阵中稀疏的问题,通过挖掘标签间的关联关系,继而更新用户-标签矩阵.考虑到多用户之间社交关系对挖掘用户兴趣并进行微博推荐的重要性,构建用户-用户社交关系相似度矩阵,并与更新后的用户-标签矩阵进行迭代,得到最终的用户兴趣并进行相关推荐.实验证明了该算法针对微博信息推荐是有效的. | 马慧芳 贾美惠子 张迪 蔺想红 | 2017 | 电子学报2017,45,1: | 12 |
| 4 | 一种融合用户关系的自适应微博话题跟踪方法显示文摘针对微博口语化、文本短小等特点以及现有研究的不足,本文提出了一种融合用户关系的自适应微博话题跟踪方法.首先,在当前跟踪的时间窗内,推文被映射到特征空间,并作为候选推文集合.然后,针对推文的分布特点以及话题跟踪的目的,变换推文特征空间.在此基础上,利用改进的K-means聚类算法对候选推文集合进行二元聚类,从而划分出相关推文集合,即当前话题目标模型.本文通过Twitter平台获取数据进行实验,实验结果表明,该方法能够实时地跟踪话题热度的变化以及焦点的演变,并提高了微博中话题跟踪的稳定性.该方法为用户推荐、舆情分析等领域提供了有效的支撑. | 柏文言 张闯 徐克付 张志明 | 2017 | 电子学报2017,45,6: | 9 |
| 5 | 一种基于标签关联关系的微博推荐方法显示文摘通过分析微博特点及现有微博推荐发现算法的缺陷,提出一种新的微博推荐方法。采用标签检索策略对未加标签和标签较少的用户进行加标,构建用户-标签矩阵,得到用户-标签权重并利用标签信息表征用户兴趣。为解决该矩阵中高维稀疏的问题,通过挖掘标签间的关联关系,继而更新用户-标签矩阵,获得最终的用户兴趣并进行相关推荐。实验结果表明,与忽略标签间关系的微博推荐方法相比,该推荐方法能够更有效地进行微博推荐。 | 马慧芳 贾美惠子 李晓红 鲁小勇 | 2016 | 计算机工程2016,42,4: | 9 |
| 6 | 基于潜在语义与图结构的微博语义检索显示文摘微博文本短小、特征稀疏、与用户查询之间存在语义鸿沟的特点会降低语义检索效率。针对该问题,结合文本特征和知识库语义,构建基于潜在语义与图结构的语义检索模型。通过Tversky算法计算基于Hashtag的特征相关度;利用隐含狄利克雷分布算法对Wikipedia语料库训练主题模型,基于JSD距离计算映射到该模型的文本主题相关度;抽取DBpedia中实体及其网络关系连接图,使用SimRank算法计算图中实体间的相关度。综合以上3个结果得到最终相关度。通过短文本和长文本检索对Twitter子集进行实验,结果表明,与基于开放关联数据和图论的方法相比,该模型在评估指标MAP,P@30,R-Prec上分别提高了2.98%,6.40%,5.16%,具有较好的检索性能。 | 肖宝 李璞 胡娇娇 蒋运承 | 2017 | 计算机工程2017,34,6: | 4 |
| 7 | 基于多语义复合表示模型的去离群点文本聚类显示文摘目的:将词语的多种语义信息融合,提出多语义复合文本表示模型和基于该模型的文本聚类算法。方法:首先,利用高斯混合模型构建词语的多语义空间,计算词语的不同语义概率权重;其次,运用所有的语义概率加权词嵌入复合形成文本向量;最后,借助文本向量的多语义结构识别文本数据中的离群点,通过剔除离群点提升K-means算法的聚类性能。结果:多语义复合文本向量能够有效地去除冗余,突出文本的语义结构特征;实验表明,与其他文本聚类算法相比,本文提出的算法能够提高约3.57%~44.88%的聚类性能。结论:基于多语义复合表示模型的去离群点文本聚类算法具有更优性能。 | 顾永春 武娇 金世举 顾兴全 尹雪婷 刘雅萱 | 2021 | 中国计量大学学报2021,32,3: | 3 |
| 8 | 基于加权核非负矩阵分解的短文本聚类算法显示文摘对互联网产生的大量短文本进行聚类分析具有重要的应用价值,但由于短文本存在特征稀疏和特征难以提取的问题,导致传统的文本聚类算法难以有效处理该问题。为了解决该问题,利用非负矩阵分解(NMF)模型提出基于加权核非负矩阵分解(WKNMF)的短文本聚类算法。该算法通过核方法的映射关系将稀疏特征空间映射到高维隐性空间,从而可以充分利用短文本中的隐性语义特征进行聚类;另外,利用核技巧简化高维数据的复杂运算,并通过迭代更新规则不断地动态调整短文本的权重向量,从而可以区分不同短文本对聚类的重要性。在真实的微博数据集上进行了相关实验,结果表明WKNMF算法比K均值、隐含狄利克雷分布(LDA)、NMF和自组织神经网络(SOM)具有更好的聚类质量,准确度和归一化互信息分别达到了66.38%和66.91%。 | 曹大为 贺超波 陈启买 刘海 | 2018 | 计算机应用2018,38,8: | 2 |
| 9 | 一种融合Wikipedia类图和主题特征的短文本检索方法显示文摘社交网络的快速发展催生出大量短文本数据.鉴于短文本具有长度短、信息量少、特征稀疏、语法不规则等特点,根据Wikipedia类图(Wikipedia Category Graph,WCG)中包含的结构信息,通过分析其中的主题特征,提出一种语义特征选择及关联度计算方法.以此为基础,通过计算用户查询与目标短文本之间的语义关联度,实现对短文本的检索和排序.最后通过在Twitter子集上的实验结果表明,融合Wikipedia类图和主题特征的短文本检索方法比现有一些检索方法在评估指标MAP,P@k及R-Prec上具有更好的效果. | 李璞 肖宝 孙玉胜 张志锋 邓璐娟 | 2019 | 河南师范大学学报(自然科学版)2019,47,6: | 1 |
| 10 | 基于背景重构与边缘相关短文本特征选择方法显示文摘为了解决短文本对象特征空间稀疏性与背景缺失造成的精确分类困难与语义混淆问题,提出一种背景补偿与边缘相关计算的特征选择方法.通过提取并利用文本间存在的关联性建立小样本簇背景特征集,重构特征空间,并结合边缘相关性分析确定最终的特征集.过程可分为2个阶段:1)基于词矢量语义量化模型计算特征词的背景相关性;2)将测试文本重组特征空间,并进行边缘性相关计算.提出的短文本特征选择方法,可以在保持原始特征空间性质与结构的前提下,强化特征空间紧凑性,减少冗余性,降低特征维度.在Reuters-21578和NewsGroup标准语料集上的实验证明,提出的方法比传统的文档频率、信息增益、互信息等方法更有效,针对两个标准的数据集,其在典型的分类器上运行表现强于一般特征选择方法. | 张海涛 王斌君 王靖亚 | 2016 | 武汉大学学报(工学版)2016,49,3: | 1 |
| 11 | Event analysis in social multimedia: a survey显示文摘 | Xueliang LIU Meng WANG Benoit HUET | 2016 | Frontiers of Computer Science2016,10,3: | 1 |
| 12 | 迁移知识辅助的语义稀疏服务聚类方法显示文摘现有服务聚类方法缺乏对服务描述语义稀疏情境下的研究,因此将迁移学习技术应用到服务聚类领域,尝试解决语义稀疏服务聚类的问题。通过对偶PLSA模型将目标领域和辅助领域语料知识进行融合,利用无监督的方式迁移辅助领域知识,从而提高目标领域语义稀疏服务聚类的能力。实验结果表明,该方法能够提高语义稀疏服务的聚类效果。与K-Means、Agglomerative和PLSA等方法相比,该方法在聚类纯度、熵上均具有更好的性能。 | 田刚 何克清 高莹 黄颖 | 2015 | 四川大学学报(工程科学版)2015,47,5: | 1 |
| 13 | 基于转发评论的微博语义扩充和分类方法显示文摘为了对微博用户、微博文本和微博评论进行分析和研究,提出了一种基于转发评论的微博语义扩充和分类方法.首先在对微博用户类型分析的基础上将微博分为6种类型;然后以信息发布型微博为研究对象,提出了微博评论选择算法,筛选出微博有效评论;再利用基于转发评论的微博语义扩充和分类(comment-based microblog's semantic expansion and classification,CBMSEC)方法,将微博有效评论信息补充进微博语义,改善微博数据稀疏的问题,提高微博的分类性能. | 刘磊 许志刚 蔡海博 王石 | 2015 | 北京工业大学学报2015,41,10: | 0 |
| 14 | 一种语义稀疏服务聚类方法显示文摘随着SOA迅猛发展和互联网上服务数量俱增,服务发现成为极具挑战性的工作。传统的服务发现方法在语义稀疏情境下精准度不高,主要是缺乏有效信息对发现工作的支持,无法对服务进行准确的类别划分。针对此问题,提出一种基于BTM面向Web服务短文本描述的服务聚类方法 S3C,该方法的主要思想是利用BTM在短文本聚类过程中使用Biterm(词对)优势对服务描述进行潜在特征表示,基于服务潜在特征使用Kmeans聚类方法进行服务聚类。BTM采用词对的主题建模方式,能够极大程度地扩展文本信息,解决短文本中的关键词稀疏问题。采用PWeb数据集进行大量对比实验可知,该方法与经典聚类方法相比,类簇的平均纯度提高30%,平均熵降低近50%。 | 胡文生 谢芳 | 2020 | 软件导刊2020,19,11: | 0 |