|
|
|
题名
|
作者
|
年代
|
出处
|
被引量
|
| 1 | 基于N-最短路径方法的中文词语粗分模型显示文摘预处理过程的词语粗切分,是整个中文词语分析的基础环节,对最终的召回率、准确率、运行效率起着重要的作用。词语粗分必须能为后续的过程提供少量的、高召回率的、中间结果。本文提出了一种基于N-最短路径方法的粗分模型,旨在兼顾高召回率和高效率。在此基础上,引入了词频的统计数据,对原有模型进行改进,建立了更实用的统计模型。针对人民日报一个月的语料库(共计185,192个句子),作者进行了粗分实验。按句子进行统计,2-最短路径非统计粗分模型的召回率为99.73%;在10-最短路径统计粗分模型中,平均6.12个粗分结果得到的召回率高达99.94%,比最大匹配方法高出15%,比以前最好的切词方法至少高出6.4%。而粗分结果数的平均值较全切分减少了64倍。实验结果表明:N-最短路径方法是一种预处理过程中实用、有效的的词语粗分手段。 | 张华平 刘群 | 2002 | 中文信息学报2002,16,5: | 99 |
| 2 | 基于统计的汉语词性标注方法的分析与改进显示文摘从词性概率矩阵与词汇概率矩阵的结构和数值变化等方面 ,对目前常用的基于统计的汉语词性标注方法中训练语料规模与标注正确率之间所存在的非线性关系作了分析 .为了充分利用训练语料库 ,提高标注正确率 ,从利用词语相关的语法属性和加强对未知词的处理两个方面加以改进 ,提高了标注性能 .封闭测试和开放测试的正确率分别达到 96.5%和 96% . | 魏欧 吴健 孙玉芳 sonata.iscas.ac.cn | 2000 | 软件学报2000,11,4: | 31 |
| 3 | 基于完全二阶隐马尔可夫模型的汉语词性标注显示文摘该文基于隐马尔可夫理论,提出了一种三元词汇概率和词性概率相结合的汉语词性标注模型,并对传统的Viterbi算法进行了扩展。对统计模型中出现的数据稀疏问题,给出了基于线性插值法的平滑算法。实验表明,完全二阶隐马尔可夫模型比标准的二元、三元模型有更高的词性标注正确率和消歧率。 | 梁以敏 黄德根 | 2005 | 计算机工程2005,31,10: | 25 |
| 4 | 面向自然语言信息处理的维吾尔语名词形态分析研究显示文摘名词是人类语言中的基本词类之一。维吾尔语是一种形态变化很复杂的语言,其中名词是一种形态变化复杂的词类。因此名词的形态分析研究无论在语法研究还是在语言信息处理中都非常重要。本文对维吾尔语名词的形态变化(名词的数、人称、格等语法范畴)进行了形式化的描述和分析。指出了维吾尔语名词的基本形态参数,总结出参数的组配规律并统计了其类型,探索了维吾尔语名词的削尾方法。这些工作将为维吾尔语名词形态处理提供有效的方法和新的思路。 | 阿依克孜.卡德尔 开沙尔.卡德尔 吐尔根.依布拉音 | 2006 | 中文信息学报2006,20,3: | 22 |
| 5 | 基于规则和统计相结合的中文命名实体识别研究显示文摘介绍命名实体识别在文本信息处理领域的重要地位,分析了中文命名实体识别存在的困难,介绍中文命名实体识别的一般过程、评价标准及方法。提出了一种在构造内部规则和外部规则的同时采用概率统计的中文命名实体的识别方法,并利用这种基于规则和统计相结合的方法。实验证明该方法获得了较高的准确率和召回率,具有可行性和合理性,同时也指出了它的局限性。 | 潘正高 | 2012 | 情报科学2012,30,5: | 22 |
| 6 | 统计和规则相结合的汉语组块分析显示文摘从文本中获得的组块对机器翻译、信息检索等很多领域都非常有用.介绍了规则和统计进行组块分析的处理策略,提出了规则与统计相结合的处理方法.并且结合组块分析的实际情况改进了一般评价系统性能的指标,通过封闭测试和开放测试验证,与单纯规则组块划分相比较,组块识别的精确率和召回率都得到了提高,组块划分错误率降低了7%. | 李素建 刘群 白硕 | 2002 | 计算机研究与发展2002,39,4: | 21 |
| 7 | 一种基于N-Gram改进的文本特征提取算法显示文摘介绍一种改进的文本特征提取及匹配算法。该算法基于N-Gram算法思路进行文本处理和特征提取,设计了gram关联矩阵用于统计与合并特征词,从而在固定长度N-Gram算法的基础上能够提取出不同长度的特征词。实验证明,该特征提取算法能够更为准确地描述文本特征,可应用于文本检索、Web挖掘等信息处理领域。 | 于津凯 王映雪 陈怀楚 | 2004 | 图书情报工作2004,48,8: | 17 |
| 8 | 基于TF统计和语法分析的关键词提取算法显示文摘为了提高中文关键词提取的准确率和实用性,提出一种基于TF统计和语法分析相结合的中文关键词提取算法。该算法在对文本进行自动分词后,用TF统计和语法分析对每个词进行权重计算,然后根据计算结果提取文献的关键词。实验结果表明,该方法提高了关键词提取的精度。 | 战学刚 吴强 | 2014 | 计算机应用与软件2014,31,1: | 12 |
| 9 | 文本信息处理研究述评显示文摘文本信息处理就是通过计算机对文本从表及里、由此及彼的分析处理,不仅仅抽取包含其中的信息,更需要分析推理蕴涵其中的意义。全面地分析探讨了文本信息处理研究现状,概述了文本信息处理的发展历史,将文本信息处理研究归纳为分词研究、文本信息抽取、文本分类、文本信息检索、文本自动摘要等方面,并分别对各领域的研究现状做了概述,指出了各研究领域中存在的问题。讨论了文本信息处理的关键技术问题及其挑战,指出了文本信息处理的远景目标就是文本信息的语义分析、归纳推理和文语转换。 | 袁鼎荣 钟宁 张师超 | 2011 | 计算机科学2011,38,2: | 11 |
| 10 | 语言信息处理技术中的最大熵模型方法显示文摘1引言
进行汉语处理时经常遇到的问题有:分词、词性标注、语法和语义分析等等.这些自然语言中的问题都可以形式化为分类问题,估计某一类y在上下文x中发生的概率,即p(y,x).在汉语中上下文x的内容可以包括汉字、词、词性等,对于不同的任务上下文的内容也不同.这类问题可以采用统计建模的方法去处理. | 李素建 刘群 张志勇 程学旗 | 2002 | 计算机科学2002,29,7: | 10 |
| 11 | 面向数字人文的中国古代典籍词性自动标注研究——以SikuBERT预训练模型为例显示文摘在深度学习技术和预训练语言模型不断发展背景下,文章探讨面向数字人文研究需求的古文典籍文本词性自动标注问题。以校验后的高质量《四库全书》全文语料作为训练集,构建SikuBERT预训练语言模型,在源自多领域的16部古文典籍文本上开展词性自动标注实验。结果表明:SikuBERT预训练语言模型在词性自动标注任务中表现优良,词性标签总体预测准确率达到89.64%。文章还展示了单机版“SIKU-BERT典籍智能处理系统”的词性自动标注功能设计及应用。 | 耿云冬 张逸勤 刘欢 王东波 | 2022 | 图书馆论坛2022,42,6: | 8 |
| 12 | 语句级汉字输入系统中语义规则研究显示文摘提高音字转换的正确率是新一代汉字输入技术-语句输入技术的核心问题,而基于语料库统计模式和基于语法规则相结合是提高音字转换正确率的一种有效途径。建立规则的核心问题就是要研究和解决适合于音字转换的短语搭配问题。文章依据自然语言理解和计算语言学理论,就规则在音字转换中的作用和建立方法进行了研究。 | 高升 王晓龙 | 2003 | 计算机工程与应用2003,39,4: | 7 |
| 13 | 基于智能技术的远程教育答疑系统研究显示文摘网上答疑系统是现代远程教育系统中不可缺少的一部分 ,然而当前的答疑系统只是根据用户的输入对题库中的问题进行简单的关键词匹配 ,查询精度和用户界面满足不了用户的需求。针对以上缺点 ,本文给出一个应用语义网络原理构筑起来的智能答疑系统。文章分析了建立智能答疑系统的必要性 ,由此提出了一个基于限定领域的智能答疑系统模型及其技术路线 ,并以两门大学计算机课程作为知识库来源 ,实现了系统的功能。试验结果表明 ,本文所提出的方法有效地提高了查询精度 。 | 高光来 王玉峰 | 2003 | 中文信息学报2003,17,6: | 6 |
| 14 | 一种计算汉字串之间相关程度的新方法显示文摘本文提出了一种能更准确的反映两个汉字串之间相关程度的新概念———黏结度 ,并给出了其计算方法。该方法把需要计算相关程度的汉字串放在一个大环境中进行讨论 ,通过加入上下文信息来提高分词的准确度 ;另外 ,该方法在引用汉字词频时 ,增加了对动态词频的考虑 ,可以自动识别未登陆的专业词汇。文中同时给出了黏结度在分词领域中的应用实例。通过与前人提出的相关信息的方法相比较 。 | 曹娟 周经野 | 2004 | 中文信息学报2004,18,4: | 6 |
| 15 | 规则与统计相结合的兼类词处理机制显示文摘兼类词处理是词性标注的关键所在 ,本文对兼类词排岐进行了研究 ,介绍了规则和统计相结合的排岐策略 .按照上述策略 ,实现了一个兼类词处理系统 .实验测试结果表明 ,利用规则与统计相结合的兼类词处理机制可以有效地提高排岐正确率和词性标注正确率 ,在封闭测试和开放测试中兼类词的排歧正确率分别达到了 93.91%和 91.16 % ,标注正确率分别达到了 97.85 %和 96 .71% . | 黄德根 张丽静 张艳丽 杨元生 | 2003 | 小型微型计算机系统2003,24,7: | 6 |
| 16 | 大数据在煤矿安全领域应用方法研究显示文摘应用大数据方法,挖掘信息化煤矿长期积累的海量数据,多维度洞察发现海量数据隐含的内在规律,将煤矿安全生产管理提升到精细化的新层面。本研究主要包括:收集大量煤矿安全事故报告,针对煤矿安全事故报告进行文本挖掘,在此基础上运用Delphi专家调查法确定事故关键要素;利用Apriori关联分析法分析关键要素之间的关联关系,挖掘关键要素频繁项集;依据煤矿现有信息化系统数据,建立与关键要素对应的数据指标并对其进行实时监控和预测;在关键要素频繁项集的基础上构建BP神经网络模型,通过计算实时数据预测事故发生的可能性,为煤矿事故的研究和预防提供了全新的视角。 | 李东 周勇 | 2018 | 中国煤炭2018,44,7: | 5 |
| 17 | 理性主义与经验主义相结合的机器翻译研究策略显示文摘主要介绍了基于规则、基于实例和基于统计等3种主流机器翻译方法,探讨了自然语言处理技术和机器翻译中基于规则的理性主义方法和基于统计的经验主义方法的优缺点,结合机器翻译研究的现状和发展方向,提出了规则和统计相结合的机器翻译方法的基本思路,阐述了词义消歧中的理性主义方法和经验主义方法相结合的发展方向,对机器翻译的发展趋势进行了探讨。 | 徐金安 | 2011 | 计算机科学2011,38,6: | 5 |
| 18 | 大数据在煤矿安全领域应用方法研究显示文摘本研究应用大数据方法,挖掘信息化煤矿长期积累的海量数据,多维度洞察发现海量数据隐含的内在规律,将煤矿安全生产管理提升到精细化的新层面。本研究主要包括:收集大量煤矿安全事故报告,针对煤矿安全事故报告进行文本挖掘,在此基础上运用Delphi专家调查法确定事故关键要素;利用Apriori关联分析法分析关键要素之间的关联关系,挖掘关键要素频繁项集;依据煤矿现有信息化系统数据,建立与关键要素对应的数据指标并对其进行实时监控和预测;在关键要素频繁项集的基础上构建BP神经网络模型,通过计算实时数据预测事故发生的可能性,为煤矿事故的研究和预防提供了全新的视角。 | 李东 周勇 | 2018 | 煤炭经济研究2018,38,6: | 5 |
| 19 | 中文歧义研究25年——以《中文信息学报》论文为例显示文摘过去的25年间中文信息处理领域的歧义研究取得了长足进步,涌现出大量科研成果。该文试图以中国中文信息学会会刊《中文信息学报》刊载的论文为例,着重从研究对象和研究方法两个方面观察探讨歧义研究的进展、特点和大体趋势。文章分时间段从多个角度对中文歧义研究进行定量统计分析,述评结合,针对歧义研究的现状提出了建议。 | 张禄彭 易绵竹 周云 | 2012 | 中文信息学报2012,26,4: | 4 |
| 20 | 一种基于规则优先级的词性标注方法显示文摘词性标注作为汉语自动分词以至中文信息处理领域比较关键的问题之一,是该领域的研究难点也是研究重点,对兼类词词性标注的正确率严重影响着词性标注的质量。在基于规则的词性标注的基础上,提出了一种基于规则优先级的词性标注方法,即对每条词性标注规则加上优先级,并在标注算法中通过对优先级进行控制来完成兼类词的词性标注。并用大规模语料对该方法做了试验,结果表明其词性标注正确率可达到96.4%。 | 王广正 王喜凤 | 2008 | 安徽工业大学学报(自然科学版)2008,25,4: | 4 |