会议专题

服务于内容侧面发现的框架识别

文本中的内容通常包含多个侧面,全面地识别这些内容侧面对自然语言处理有重要的意义.但是传统的使用简单特征的统计方法难以识别出所有的内容侧面.以自动摘要为例,传统的抽取式方法多以词频为主要特征,一些重要的句子常因重复度不高被舍弃.要想全面地覆盖原始文本的重要信息,就要识别出文本描述的内容侧面.本文以框架语义学为指导,使用FrameNet语料库作为知识库,综合多种特征来标注文本描述的框架,在此基础上识别文本所包含的内容侧面.该方法在新闻语料上取得了较好的结果,达到了61%的正确率.

文本处理 内容侧面 框架识别 FrameNet语料库

王荀 李素建 宋涛 姜伯平

北京大学计算语言学教育部重点实验室,北京100871

国内会议

第十一届全国计算语言学学术会议

洛阳

中文

149-154

2011-08-20(万方平台首次上网日期,不代表论文的发表时间)