基于模板的网页主题信息抽取
快速准确地抽取网页主题信息是影响Web应用服务质量的关键。网页模板就是已经做好的网页框架,由模板生成的网页结构布局是基本一致的。本文提出了利用模板技术进行网页主题信息抽取的算法。该方法充分考虑了网页的结构特征,能够明显改善信息抽取的性能。实验结果表明,该方法准确率可达99.6%。
DOM 网页 主题信息 样本集 模板 信息抽取
冯少卿 都云程 施水才
北京信息科技大学 中文信息处理研究中心,北京 100101
国内会议
苏州
中文
695-701
2007-11-01(万方平台首次上网日期,不代表论文的发表时间)