会议专题

基于文档发散度的作文跑题检测

作文跑题检测是作文自动评分系统的重要模块.传统的作文跑题检测一般计算文章内容相关性作为得分,并将其与某一固定阈值进行对比,从而判断文章是否跑题.但是实际上文章得分高低与题目有直接关系,发散性题目和非发散性题目的文章得分有明显差异,所以很难用一个固定阈值来判断所有文章.本文提出一种作文跑题检测方法,基于文档发散度的作文跑题检测方法.该方法的创新之处在于研究文章集合发散度的概念,建立发散度与跑题阈值的关系模型,对于不同的题目动态选取不同的跑题阈值.本文构建了一套跑题检测系统,并在一个真实的数据集中进行测试.实验结果表明基于文档发散度的作文跑题检测系统能有效识别跑题作文.

作文评分 跑题检测 文档发散度 文本相似度

陈志鹏 陈文亮

苏州大学计算机科学与技术学院,江苏苏州215006;软件新技术与产业化协同创新中心,江苏苏州215006

国内会议

第十五届全国计算语言学学术会议(CCL2016)暨第四届基于自然标注大数据的自然语言处理国际学术研讨会(NLP-NABD-2016)

烟台

中文

1-11

2016-10-14(万方平台首次上网日期,不代表论文的发表时间)