一种基于二元背景模型的新词发现方法
本研究提出了一种基于二元背景模型的新词发现方法。采用前、背景语料二元似然比挑选候选二元组(bigram);然后根据频率、刚性、条件概率等基于前景语料的统计量,对二元组进行进一步筛选和扩展,以确定新词边界。用该方法提取出的词既包含新词特征,又可以成词。而且该方法充分利用现有背景生语料却无需分词等标注信息,不依赖词典、分词模型和规则,具有良好的扩展性。为了得到更好的发现效果,还讨论了各统计量阈值的选取策略和垃圾元素剔除策略。该方法在网络小说语料上验证了其有效性。
汉字处理 新词发现 二元组模型 数理语言学
吴悦 燕鹏举 翟鲁峰
复旦大学 数学科学学院,上海 200433 盛大语音创新院,上海 201203
国内会议
西安
中文
1-4
2011-10-16(万方平台首次上网日期,不代表论文的发表时间)