百度蜘蛛是干嘛的,有什么用??

百度蜘蛛是干嘛的,有什么用??,第1张

百度蜘蛛其实并不是蜘蛛,只是由于人们通常把互联网比喻成一张网,而百度要收录网站就是靠服务器去抓取收录,而他的行进过程就像蜘蛛一样爬行。所以百度蜘蛛并不是真实的蜘蛛,而是百度抓取服务器的简称而已。

搜索引擎基本工作原理
了解搜索引擎的工作原理对我们日常搜索应用和网站提交推广都会有很大帮助。

■ 全文搜索引擎
在搜索引擎分类部分我们提到过全文搜索引擎从网站提取信息建立网页数据库的概念。搜索引擎的自动信息搜集功能分两种。一种是定期搜索,即每隔一段时间(比如Google一般是28天),搜索引擎主动派出“蜘蛛”程序,对一定IP地址范围内的互联网站进行检索,一旦发现新的网站,它会自动提取网站的信息和网址加入自己的数据库。
另一种是提交网站搜索,即网站拥有者主动向搜索引擎提交网址,它在一定时间内(2天到数月不等)定向向你的网站派出“蜘蛛”程序,扫描你的网站并将有关信息存入数据库,以备用户查询。由于近年来搜索引擎索引规则发生了很大变化,主动提交网址并不保证你的网站能进入搜索引擎数据库,因此目前最好的办法是多获得一些外部链接,让搜索引擎有更多机会找到你并自动将你的网站收录。
当用户以关键词查找信息时,搜索引擎会在数据库中进行搜寻,如果找到与用户要求内容相符的网站,便采用特殊的算法——通常根据网页中关键词的匹配程度,出现的位置/频次,链接质量等——计算出各网页的相关度及排名等级,然后根据关联度高低,按顺序将这些网页链接返回给用户。

■ 目录索引
与全文搜索引擎相比,目录索引有许多不同之处。
首先,搜索引擎属于自动网站检索,而目录索引则完全依赖手工 *** 作。用户提交网站后,目录编辑人员会亲自浏览你的网站,然后根据一套自定的评判标准甚至编辑人员的主观印象,决定是否接纳你的网站。
其次,搜索引擎收录网站时,只要网站本身没有违反有关的规则,一般都能登录成功。而目录索引对网站的要求则高得多,有时即使登录多次也不一定成功。尤其象 Yahoo!这样的超级索引,登录更是困难。(由于登录Yahoo!的难度最大,而它又是商家网络营销必争之地,所以我们会在后面用专门的篇幅介绍登录 Yahoo雅虎的技巧)
此外,在登录搜索引擎时,我们一般不用考虑网站的分类问题,而登录目录索引时则必须将网站放在一个最合适的目录(Directory)。
最后,搜索引擎中各网站的有关信息都是从用户网页中自动提取的,所以用户的角度看,我们拥有更多的自主权;而目录索引则要求必须手工另外填写网站信息,而且还有各种各样的限制。更有甚者,如果工作人员认为你提交网站的目录、网站信息不合适,他可以随时对其进行调整,当然事先是不会和你商量的。
目录索引,顾名思义就是将网站分门别类地存放在相应的目录中,因此用户在查询信息时,可选择关键词搜索,也可按分类目录逐层查找。如以关键词搜索,返回的结果跟搜索引擎一样,也是根据信息关联程度排列网站,只不过其中人为因素要多一些。如果按分层目录查找,某一目录中网站的排名则是由标题字母的先后顺序决定(也有例外)。
目前,搜索引擎与目录索引有相互融合渗透的趋势。原来一些纯粹的全文搜索引擎现在也提供目录搜索,如Google就借用Open Directory目录提供分类查询。而象 Yahoo! 这些老牌目录索引则通过与Google等搜索引擎合作扩大搜索范围(注)。在默认搜索模式下,一些目录类搜索引擎首先返回的是自己目录中匹配的网站,如国内搜狐、新浪、网易等;而另外一些则默认的是网页搜索,如Yahoo。

百度对于收录页面是通过网站入口URL的联通成一个网状,然后百度的抓取功能是被称为“百度蜘蛛”的工具在进行收集,那么这个百度蜘蛛的收集器就是网站页面收录的关键。怎么才能更容易的被百度蜘蛛发现与收录呢?百度蜘蛛的计算原理目前我的了解有限,百度蜘蛛并不是人,它没有思考能力,它只是根据命令与设定的规则来行动

蜘蛛网
建议你看看下面这篇报道:
蜘蛛编织了一张网之后,就在哪里“守株待兔”式地捕捉昆虫,这种被动式的捕获效率还颇高,科学家对此大惑不解。后来、美国耶鲁大学生物学家偶然发现了其中的奥秘。
他们在研究某些品种的蜘蛛进化时发现、蜘蛛网对紫外光反射得特别强,这是否就是蜘蛛捕虫的奥秘呢?他们将同一只蜘蛛结的两张网放在不同的地方,一张网用紫外光照射,另一张网用不含紫外光的可见光照射。结果发现,有意放入室内的一群果蝇居然都飞向第一张网了。科学家们推断,果蝇是因为第一张网反射了足够多紫外光而误以为飞向蓝天的。
更为有趣的是,蜘蛛还会随自身的进化而调整蜘蛛网的光学特性。进化水平较低的品种习惯于在暗处结网,它们的网都具有强烈反射紫外光的特点。进化水平较高的蜘蛛、有些从暗处迁到较明亮处。这样,蜘蛛的捕猎就发生了问题,它如果仍然像过去一样使所结网反射大量紫外光,反而使昆虫觉得前面不是蓝天而有某些障碍物,昆虫识破了蜘蛛的用意就不会自投罗网了。然而,道高一尺,魔高一丈。对于高度进化的蜘蛛,居然能结出不会大量反射紫外光的网。这种网的绝大部分都不反射紫外光,加上在较明亮处本来就存在的紫外光,促使昆虫误以为这还是蓝天,妙还妙在随着昆虫品种的不同,蜘蛛还会在结新网时调整这些结点的多少与分布。
蜘蛛网的结构也有奥秘在其中,许多人都看到过昆虫在蜘蛛网上拼命挣扎的情况。经过这样的折腾蜘蛛网仍不破裂,说明它具有很高的强度和柔性,这些特性来自何方也是一个谜。
牛津大学的研究人员发现,蜘蛛网是由两股不同类型的丝线绞合在一起构成的。网丝中首先是一种干性的直线状线丝,它是网丝的主干线和支撑物,最多只能比原来拉长20%,再拉就会断裂。直线状丝线旁还绞合着另一种粘性的螺旋状丝线,它是专门用来捕捉昆虫的,可以伸长到原来的4倍,恢夏原状后也不会下垂。在高倍电子显微镜下,可以看到螺旋状丝线周围覆盖着一层胶质液体微滴,液体中80%是水,其余是脂肪、氨基酸和糖类的混合物。每个微滴中包含着一团丝线,当被捕获的昆虫挣扎着将丝线拉长时,微滴中的丝团便会展开以增加丝线的长度。当捕获物不再挣扎时,丝团便会自动复原。
英国牛津大学的物理学家唐纳德


欢迎分享,转载请注明来源:内存溢出

原文地址: https://outofmemory.cn/yw/12937571.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
上一篇 2023-05-29
下一篇 2023-05-29

发表评论

登录后才能评论

评论列表(0条)

保存