● 摘要
随着互联网规模的急速增长,谷歌、百度、Bing等通用搜索引擎面临着巨大的挑战,由此,垂直搜索引擎应运而生。针对特定主题,垂直搜索引擎可以为互联网用户提供更加全面、及时和深入的检索结果,满足了用户对于某一特定主题信息的检索需求。然而,垂直搜索引擎缺少有效的主题过滤方法,限制了其进一步的发展和推广。
针对这一现状,本文对垂直搜索引擎主题过滤问题进行了研究,提出了基于机器学习方法的主题过滤模型。模型分为网页表示、网页主题判定和网页过滤三个部分。本文的研究成果主要包括:
(1) 网页表示阶段,提出了基于主题不平衡因子(Topic Unbalanced Factor,TUF)的词项加权模式。该模式的原理是对不同主题间分布不平衡的词项赋予更大的权重,本文中给出了具体的权重计算公式。在公共语料上的实验结果表明,分别将本文提出的TUF与经典的TF(Topic Frequency)和TF-IDF(Topic Frequency-Inverse Document Frequency)组合使用,主题判定的F值各提高了3%和1%。
(2) 网页主题判定阶段,提出了基于机器学习方法的主题判定模型。针对主题过滤问题的特点,选择朴素贝叶斯算法作为主题过滤的方法。通过网页爬取、均匀抽样的方法提高语料质量,应用非平衡语料预处理操作提高训练效果。应用上文提出的TF-IDF-TUF词项加权模式进行特征提取。公共语料和网页语料上的实验结果表明,本文提出的主题判定模型的F值能够达到90%以上。
(3) 网页过滤阶段,提出了基于主题局域性的主题爬虫模型。在主题爬虫模型中,将主题过滤加入到爬取阶段,实现对于主题无关网页的过滤。并且依据主题判定的结果,利用网页在主题上“大杂居,小聚居”的特点,进一步实现具有方向感的主题爬虫。主题爬虫能够在爬取主题相关网络区域的同时,略过主题无关的区域。
本文提出了主题过滤模型,并基于该模型设计和实现了面向科技领域的垂直搜索引擎,从而实现对科技领域资源的爬取、索引,并为用户提供检索服务。应用本文的垂直搜索引擎,能够检索全面及时的科技领域信息,包括科技文献、科技资讯和科技资源等。
关键词:垂直搜索引擎,主题爬虫,朴素贝叶斯,词项频率,主题不平衡因子
相关内容
相关标签