专用搜索引擎中信息采集的预测与过滤方法

摘要：

Web信息急速膨胀使搜索引擎专用化成为发展趋势.有效定向采集过滤专业信息成为搜索引擎一个重要研究方向.本文提出一种基于潜在语义索引的Web信息预测采集过滤方法.在样本文档集潜在语义索引对文档相似计算基础上,构造出用户兴趣模型,判断页面相关性进行文本过滤.通过对Web站点结构分析,对未知网页的相关性的预测来控制信息的采集.在保持定向采集精度的同时,缩短采集时间、减少存储、加快检索,节约网络资源.

关键词：潜在语义索引信息采集文本过滤搜索引擎

作者: 李振星任继成唐卫清唐荣锡

作者单位: 北京航空航天大学机械工程及自动化学院中国科学院计算技术研究所(北京)

会议类型: 国内会议

会议名称: 全国搜索引擎和网上信息挖掘学术讨论会

会议地点: 北京

会议语种:中文

页码: 107-115

在线出版日期: 2003-03-01（万方平台首次上网日期，不代表论文的发表时间）

会议专题

专用搜索引擎中信息采集的预测与过滤方法