会议专题

专用搜索引擎中信息采集的预测与过滤方法

Web信息急速膨胀使搜索引擎专用化成为发展趋势.有效定向采集过滤专业信息成为搜索引擎一个重要研究方向.本文提出一种基于潜在语义索引的Web信息预测采集过滤方法.在样本文档集潜在语义索引对文档相似计算基础上,构造出用户兴趣模型,判断页面相关性进行文本过滤.通过对Web站点结构分析,对未知网页的相关性的预测来控制信息的采集.在保持定向采集精度的同时,缩短采集时间、减少存储、加快检索,节约网络资源.

潜在语义索引 信息采集 文本过滤 搜索引擎

李振星 任继成 唐卫清 唐荣锡

北京航空航天大学机械工程及自动化学院 中国科学院计算技术研究所(北京)

国内会议

全国搜索引擎和网上信息挖掘学术讨论会

北京

中文

107-115

2003-03-01(万方平台首次上网日期,不代表论文的发表时间)