百度蜘蛛抓取原理(lǐ) - 新(xīn)闻资讯

新(xīn)闻资讯

您当前的位置：首页新(xīn)闻资讯

百度蜘蛛抓取原理(lǐ) 发布时间：2014-04-25 已访问：1714 次

网络蜘蛛即Web Spider，是一个比喻得很(hěn)形象的名字。把互联网比喻成一个蜘蛛网，那么Spider就是在网上爬来爬去的蜘蛛。网络蜘蛛是通过网页的链接地址来寻找网页，从网站某一个页面（通常是首页）开始，读取网页的内容，找到在网页中的其它链接地址，然后通过这些链接地址寻找下一个网页，这样一直循环下去，直到把这个网站所有(yǒu)的网页都抓取完為(wèi)止。如果把整个互联网当成一个网站，那么网络蜘蛛就可(kě)以用(yòng)这个原理(lǐ)把互联网上所有(yǒu)的网页都抓取下来。

在抓取网页的时候，网络蜘蛛一般有(yǒu)两种策略：广度优先和深度优先

广度优先是指网络蜘蛛会先抓取起始网页中链接的所有(yǒu)网页，然后再选择其中的一个链接网页，继续抓取在此网页中链接的所有(yǒu)网页。这是最常用(yòng)的方式，因為(wèi)这个方法可(kě)以让网络蜘蛛并行处理(lǐ)，提高其抓取速度。

深度优先是指网络蜘蛛会从起始页开始，一个链接一个链接跟踪下去，处理(lǐ)完这条線(xiàn)路之后再转入下一个起始页，继续跟踪链接。这个方法有(yǒu)个优点是网络蜘蛛在设计的时候比较容易。

上一篇：徐州金网官网全新(xīn)升级
下一篇：徐州网站建设哪家好