当前位置:问答库>论文摘要

题目:基于深度学习的文本情感分析的研究

关键词:情感分析;自编码器;取样聚合

  摘要


情感是人类相互交流的基础,也是人类活动的重要特征,因此情感分析作为文本分析中的一个重要任务,逐渐成为一个广泛研究的课题。以往的研究者提出了许多情感分析的方法,主要可以分为两类,一类是基于计算语言学的方法,另一类是机器学习的方法。计算语言学方法通过计算每个词预先定义好的情感分值来获得句子的极性,而机器学习方法使用与研究领域相关的标注好的数据训练一个预测模型来进行情感分析。以往的研究中提出了许多机器学习的方法,例如简单的面向特征的SVM 和更加复杂的概率模型。尽管这些方法显示出了它们对情感检测的优越性,但是仍然面临着一些问题,其中之一就是维数灾难的问题。这个问题是由于文本本身的高维度性质造成的。在这个课题中,通过结合自编码器的降维和特征提取性能,论文提出了一个基于自编码器的Bagging 预测架构(AEBPA)。在通用数据集上的实验结果显示了这种架构的潜力,相信这种模型能够给这个领域的研究者在面向Bagging 的情感分析方法上提供一些启示。
在特征提取方面,AEBPA 架构利用了自编码器实现非监督地学习抽象特征,并且进行了预先试验以确定最佳的层数。由于单一的基于自编码器的预测模型仍然面临泛化误差的问题,为了进一步减小泛化误差,论文采用集合学习中的Bagging 方法,即首先通过原始训练数据集生成若干采样训练数据集并投入到预测模型中,最终的结果通过各个模型投票得出。在此研究中,首先采用了不同类型的数据集以不同的超参数对模型进行验证,并总结一些规律。之后运用拥有最优的超参数配置的AEBPA 模型在经典数据集上进行情感分析。
由于单词作为句子的基本组成成分的抽象程度较高,为了更好识别情感标签,建模单词的语义信息成为一项重要任务。传统的基于bag-of-word 的向量空间模型并没有考虑语义信息,因此效能不高。以往的研究中提出了许多建模语义信息的模型,其中训练词向量模型作为一种有效方法得到广泛应用。考虑到基于自编码器的预测模型是一种基于神经网络的模型,参数初始化对于成功的模型优化有着至关重要的意义。因此,本研究采用语言模型训练词向量,并用词向量初始化基于自编码器的预测模型中的参数,并以此将语义信息整合到AEBPA 模型中。