avtt 天堂网影音先锋:什么是搜索蜘蛛?

来源:百度文库 编辑:查人人中国名人网 时间:2024/04/25 14:22:20

是搜索引擎查找网络数据的一种工具.
比如百度的搜索蜘蛛在网络上不停的查找各各网站的数据然后添加到百度的数据库中.我们的使用百度搜索的时候直接从百度的数据库里查找.

搜索引擎“蜘蛛”指的是网络爬虫(又被称为网页蜘蛛,网络机器人,在FOAF社区中间,更经常的称为网页追逐者),是一种按照一定的规则,自动地抓取信息的程序或者脚本。
基于目标网页特征的爬虫所抓取、存储并索引的对象一般为网站或网页。根据种子样本获取方式可分为:
(1) 预先给定的初始抓取种子样本;
(2) 预先给定的网页分类目录和与分类目录对应的种子样本,如Yahoo!分类结构等;
(3) 通过用户行为确定的抓取目标样例,分为:
(a) 用户浏览过程中显示标注的抓取样本;
(b) 通过用户日志挖掘得到访问模式及相关样本。
其中,网页特征可以是网页的内容特征,也可以是网页的链接结构特征等等。