搜索引擎使用自动的程序根据网页之间的互相联系(链接)以及URL对应空间上的内容进行自动搜索,一般称作蜘蛛程序。每个独立的搜索引擎都有自己的网页抓取程序(spider)。Spider顺着网页中的超链接,连续地抓取网页。被抓取的网页被称之为网页快照。由于互联网中超链接的应用很普遍,理论上,从一定范围的网页出发,就能搜集到绝大多数的网页。
搜索引擎抓到网页后,还要做大量的预处理工作,才能提供检索服务。其中,最重要的就是提取关键词,建立索引文件。其他还包括去除重复网页、分析超链接、计算网页的重要度。
用户输入关键词进行检索,搜索引擎从索引数据库中找到匹配该关键词的网页;为了用户便于判断,除了网页标题和URL外,还会提供一段来自网页的摘要以及其他信息。
搜索引擎收录可以分为两个基本类别:全文搜索引擎(FullText Search Engine)和分类目录(Directory)。
分类目录是通过人工的方式收集整理网站资料,比如雅虎中国以及国内的搜狐、新浪、网易分类目录。另外,在网上的一些导航站点,也属分类目录,比如“Dmoz目录”、“网址之家”、“256导航“等,一般这类收录需要我们自行为提交。
全文搜索引擎自动分析网页的超链接分析HTML获取网页信息内容,通常情况下搜索引擎可以自动收录。
分类目录是人工方式建立网站的索引,全文搜索是自动方式建立网页的索引。
全文搜索引擎收录过程:
全文搜索引擎收录一般经过信息采集、索引、搜索三个步骤。
(1)信息采集(Web crawling):信息采集由搜索器和分析器共同完成,搜索引擎利用网络爬虫(crawlers)或网络蜘蛛(spider)或者叫做网络机器人(robots)的来查询网页上的超链接。
“网络蜘蛛”通过超级链接遍历指定范围内的整个Web空间,从一个网页转到另一个网页,从一个站点移动到另一个站点,将采集到的网页添加到网页数据库中。"网络蜘蛛"会抓取新网页内部所有的链接,所以建立网站地图为“网络蜘蛛”铺好路是必要的。
首先我们应该注意html代码应该尽量标准(可以到w3去验证当前页面)这样更容易被采集机器人所分析和采集。
例如,页面没有关闭标签的页面有可能被拒绝收录,而 ../../a.html 这样的超级链接可能不被网络蜘蛛分析。
“网络蜘蛛”在采集信息的过程中如果遇到相同的超链接如果内容一致,则只采集一次。
(2)建立索引(Indexing):搜索引擎把采集的信息按照一定的规则进行编排。
大家可能注意到“搜索引擎蜘蛛”每隔一段时间就来我们的网站采集资料,但索引创建需要一段时间,因此即便爬虫来过,采集结果要呈现在搜索引擎上,会有一定的时间间隔,这个时间对于新站来说需要很长的时间。
建立索引的同时搜索引擎会按照一定的算法计算所采集的文章的重要程度,比如:是否是“原创”,是否被其它网站转载,分析文章的关键词等一系列因素建立当前页面的“权重”。
(3)用户搜索(Searching):当用户在搜索引擎查询,搜索引擎对网页的相关度进行了计算和评估,例如:google参照pr值。不同搜索引擎有不同的排序规则,因此在不同的搜索引擎中搜索相同关键词,排序是不同的。
与全文搜索引擎相比,目录索引有许多不同之处。
首先,搜索引擎属于自动网站检索,而目录索引则完全依赖手工操作。用户提交网站后,目录编辑人员会亲自浏览你的网站,然后根据一套自定的评判标准甚至编辑人员的主观印象,决定是否接纳你的网站。
其次,搜索引擎收录网站时,只要网站本身没有违反有关的规则,一般都能登录成功。而目录索引对网站的要求则高得多,有时即使登录多次也不一定成功。尤其象Yahoo!这样的超级索引,登录更是困难。
此外,在登录搜索引擎时,我们一般不用考虑网站的分类问题,而登录目录索引时则必须将网站放在一个最合适的目录(Directory)。
最后,搜索引擎中各网站的有关信息都是从用户网页中自动提取的,所以用户的角度看,我们拥有更多的自主权;而目录索引则要求必须手工另外填写网站信息,而且还有各种各样的限制。更有甚者,如果工作人员认为你提交网站的目录、网站信息不合适,他可以随时对其进行调整,当然事先是不会和你商量的。
目录索引,顾名思义就是将网站分门别类地存放在相应的目录中,因此用户在查询信息时,可选择关键词搜索,也可按分类目录逐层查找。如以关键词搜索,返回的结果跟搜索引擎一样,也是根据信息关联程度排列网站,只不过其中人为因素要多一些。如果按分层目录查找,某一目录中网站的排名则是由标题字母的先后顺序决定(也有例外)。
目前,搜索引擎与目录索引有相互融合渗透的趋势。原来一些纯粹的全文搜索引擎现在也提供目录搜索,如Google就借用Open Directory目录提供分类查询。而象 Yahoo! 这些老牌目录索引则通过与Google等搜索引擎合作扩大搜索范围(注)。在默认搜索模式下,一些目录类搜索引擎首先返回的是自己目录中匹配的网站,如国内搜狐、新浪、网易等;而另外一些则默认的是网页搜索,如Yahoo。
评论