维普中文期刊产品整合服务
共被期刊论文引用了4次 您的检索式:您选中1篇文献正在查看引证文献汇总
    题名 作者 年代 出处 被引量
1分布式爬虫的研究与实现显示文摘网络中的数据蕴藏着大量有价值信息,在实际的项目需求中,为了实现能够自动的在网页上对大量数据的数据信息的收集、解析、格式化存储的过程,提出了基于分布式的网络爬虫技术。采用Nutch爬虫框架和Zookeeper分布式协调服务,配合高性能的Key-Value数据库Redis对数据进行存储,采用Solr引擎将抓取信息进行清晰地索引、展示。运用提取页面信息算法优化提取页面信息流程,通过关键词匹配优化算法根据指标从抓取的数据中获取指标相关数据。通过分布式集群的搭建,Nutch项目的实现,及大量数据的采集,验证了基于Nutch的分布式网络爬虫的可行性。通过页面解析流程实验分析,基于Nutch的分布式爬虫与其他爬虫多组实验数据对比结果表明,基于Nutch的分布式爬虫项目在性能和准确度方面都优于传统其他爬虫。马蕾 冯锡炜 窦予梓 高天铸 朱睿 吴衍兵 2020计算机技术与发展2020,30,2:7
2一种多源统一爬虫框架的设计与实现显示文摘面向深层网数据的爬虫技术与反爬虫技术之间的对抗随着网站技术、大数据、异步传输等技术的发展而呈现此消彼长的趋势。综合对比当前主流的爬虫和反爬虫技术,针对高效开发、快速爬取的需求,MUCrawler(多源统一爬虫框架)被设计成一种可以面向多个网站数据源,以统一的接口形式提供爬虫开发的Python框架。测试结果显示,该框架不但能够突破不同的反爬虫技术获取网站数据,在开发效率、鲁棒性和爬取效率等方面也体现出较好的运行效果。潘洪涛 2021软件工程2021,24,4:2
3基于领域本体的文献语义标引模式的构建研究显示文摘提出了基于领域本体的文献语义标引模式,并利用跨学科研究法、信息研究方法及定量与定性相结合分析法,通过构建领域本体模块、文本处理模块和语义向量模块,使检索系统提高了查全率并降低了误检率。王欣 孔庆杰 徐宝祥 2013情报科学2013,31,9:2
4招聘主题爬虫的设计和应用显示文摘随着网络技术的发展,面向垂直搜索引擎的主题爬虫因其效率高,搜索结果完备可靠的优势,成为专业化信息搜集的有效手段,这使得主题爬虫在招聘信息的采集方面意义非凡。层次化的爬行策略和网页内容分析算法组成了主题爬虫的基本结构。仅仅搜集数据不够直观,对采集的数据分词并加权并融入搜索引擎使招聘类主题爬虫能快速搜集完备的,可靠的,准确的招聘信息,并按网页价值为信息排序,提高实用性和针对性,进而在一定程度上缓解就业压力。邢黎 吴茂念 2018电脑知识与技术2018,14,9:2
返回顶部 每页显示:
共1页 首页 上一页 第1页 下一页 末页 /1 跳转

网站首页 | 关于我们 | 联系我们 | 产品服务 | 客服中心 | 广告服务 | 版权声明 | 网站联盟 | 友情链接 | 售卡网点

版权所有© 渝B2-20050021-1 渝公网安备 50019002500403号 违法和不良信息举报中心

互联网出版许可证 新出网证(渝)字10号 全国400电话 - 免长途话费