基于规则和非规则方法的WEB信息提取

摘要：

互联网上的各个信息源是相互独立的.如果一个系统能够把关于某个主题的来自各个信息源的信息集成到一个完全的信息源中,用户就能方便地获得这个主题他(她)所需的最想要的或者全部的信息.该系统中最重要的一个部分就是从网页中提取指定的信息.本文以网上书店为例详细介绍了web页面信息提取的实现.网页中一些信息可以采用基于正则表达式的规则提取,然而也有一类信息很难用规则提取,例如书名.对这些信息,我们采用了基于字体、距离等非语言启发信息的非规则方法提取,试验获得了比较好的结果.以网上书店为例,采用非规则的方法使书名提取的F值提高了31个百分点.

关键词： WEB信息集成 WEB信息提取

作者: 黄晓宏连理夏迎炬徐国伟

作者单位: 富士通研究开发中心有限公司复旦大学计算机系

会议类型: 国内会议

会议名称: 全国第六届计算语言学联合学术会议

会议地点: 太原

会议语种:中文

页码: 386-392

在线出版日期: 2001-08-04（万方平台首次上网日期，不代表论文的发表时间）

会议专题

基于规则和非规则方法的WEB信息提取