一种面向多文本集的部分比较性LDA模型

摘要：

跨时空、跨文化文本挖掘等比较性文本挖掘(comparative text mining,CTM)旨在从多个可比的文本集中发现各文本集隐含语义结构的异同.针对当前主要的CTM模型只能分析公共话题的缺陷,提出一种部分比较性跨文本集LDA模型(partial comparative cross collections LDA model,PCCLDA)来实现跨文本集的话题分析,该模型通过层次狄利克雷过程(hierarchical Dirichlet processes,HDP)把话题划分为公共话题和文本集特有话题,使模型能更加精确地对文本进行建模.模型采用Gibbs抽样方法进行参数推导,一系列包括Held-Out数据对数似然和模型困惑度指标在内的定量与定性的实验表明,模型不仅能够发现公共话题在不同文本集中的差异,而且能分析各文本集特有的话题;在Held-Out对数似然测度和模型困惑度指标上,PCCLDA相对当前两个主要的CTM模型具有较大的优势.

关键词：信息处理比较性文本挖掘话题模型

作者: 谭文堂王桢文殷风景葛斌肖卫东

作者单位: 国防科学技术大学信息系统工程重点实验室长沙 410073

会议类型: 国内会议

会议名称: 2013年中国计算机学会人工智能会议

会议地点: 北京

会议语种:中文

页码: 1943-1953

在线出版日期: 2013-07-31（万方平台首次上网日期，不代表论文的发表时间）

会议专题

一种面向多文本集的部分比较性LDA模型