会议专题

基于规则和非规则方法的WEB信息提取

互联网上的各个信息源是相互独立的.如果一个系统能够把关于某个主题的来自各个信息源的信息集成到一个完全的信息源中,用户就能方便地获得这个主题他(她)所需的最想要的或者全部的信息.该系统中最重要的一个部分就是从网页中提取指定的信息.本文以网上书店为例详细介绍了web页面信息提取的实现.网页中一些信息可以采用基于正则表达式的规则提取,然而也有一类信息很难用规则提取,例如书名.对这些信息,我们采用了基于字体、距离等非语言启发信息的非规则方法提取,试验获得了比较好的结果.以网上书店为例,采用非规则的方法使书名提取的F值提高了31个百分点.

WEB信息集成 WEB信息提取

黄晓宏 连理 夏迎炬 徐国伟

富士通研究开发中心有限公司 复旦大学计算机系

国内会议

全国第六届计算语言学联合学术会议

太原

中文

386-392

2001-08-04(万方平台首次上网日期,不代表论文的发表时间)