● 摘要
随着社交媒体的飞速发展和广泛应用,各种形式的在线社交网站已经成为用户日常生活的重要组成部分。微博作为最具有代表性的社交网络平台之一,每天都会有大量微博信息产生,用户通过发布、转发等多种形式将信息传播给其他用户。因此,海量微博的产生,使得用户如何寻找感兴趣、有价值的信息成为亟待解决的问题。
目前,用户获取目标信息主要利用的技术有信息过滤、话题检索与分类、话题检测以及信息推荐,我们的研究主要集中前三个方面。但是,微博文本的非规范性、长度限制以及特征词稀疏等特点对上述研究问题提出了挑战。因此,本文的研究以“用户”为中心,从海量微博数据中过滤用户感兴趣的微博信息,并进行话题的主题分类以及实体相关的突发话题预测。主要的研究工作和创新点如下:
(1)微博的信息过滤。
在线微博过滤需要我们针对大量在线的微博信息,过滤掉用户不感兴趣的微博以及噪声数据,过滤后的微博为用户感兴趣的信息。这个任务为我们提出了信息准确性和实时性的双重要求。为了能够提出一个有效的过滤模型,本文的研究内容主要分为以下两个方面:首先,本文基于微博的特点,尝试综合利用多种上下文信息(如:微博的文本、微博用户的社交网络和行为、地点、时间等)来构建特征;其次,为了能够适应微博平台实时性的要求,我们提出了话题无关微博过滤模型(Contextual Real-time Event-related Microblog Filtering),它能够通过划分时间间隔,不断地迭代分类器,过滤话题无关的噪声微博。该模型可通过调整不同类型时间窗口的训练数据的比例,来缓解话题漂移问题对微博信息过滤产生的影响。实验结果表明微博过滤模型能够有效的融合多种特征,消融测试结果表明多种特征对微博过滤模型都有显著贡献。
(2)微博话题的主题分类。
对于普通用户来说,获取感兴趣话题微博的最好方式就是使用搜索技术,即输入至少一个查询关键词,搜索返回的结果即为与查询词(话题)相关的微博。由于搜索结果是按时间倒序排列,多个与查询词相关的话题都会混在一起。为了更好地展现用户关于某个话题的检索结果,本文研究的着眼点是对某个查询词的搜索结果进行主题分类。本文提出了一个半监督的贝叶斯网络话题主题分类模型(Semi-supervised Bayesian Network),一方面,该模型通过检测微博中大量存在的非正式用语,对其进行规范化,并进一步充分利用外部与搜索关键词相关的其他网络资源来丰富微博的文本特征,补充相关的特征词,从而降低文本特征稀疏性的影响;另一方面,我们通过借助少量的未标注数据以及辅助的外部资源,来预测大量待标注微博信息所属话题的主题,从而降低人工标注的成本。通过在两个数据集上的实验,结果表明了我们提出的半监督的贝
叶斯网络话题模型的有效性和鲁棒性,尤其对于新浪微博数据集,所有的评价指标都超过80%。
(3)机构实体相关的微博突发热点话题预测。
微博平台中除了大量的普通网络用户,还存在着大量的机构实体用户。与普通用户不同,他们对于微博话题的需求通常不如普通用户明确,一般难以用一组关键词来刻画和搜索其所关注的相关信息。对于此类机构实体用户,他们希望通过社交网络数据来获取“与机构相关”的用户、客户等对机构的评价和建议,从而为其提供决策支持。与一般的话题检测不同,如何获得与目标机构实体相关的尽可能多的数据是我们面临的重要挑战之一。本文首先通过挖掘机构实体相关的用户和关键词来设计爬虫,从而尽可能多地获得与机构相关的数据。因为机构实体希望越早发现相关的热点话题越好,因此,我们的研究重点放在机构实体的突发话题预测。本文我们设计了一个两阶段的话题预测算法,首先,我们通过增量式聚类算法获取可能的候选热点话题,然后,我们抽取多种特征,利用半监督学习算法来检测机构实体相关的突发热点话题。据我们所知,这是第一个通过抽取各种“突发”话题相关的特征训练分类器模型来做话题预测研究的工作。实验结果表明半监督集成分类器对于不同的时间阈值都有好的表现。