百度蜘蛛是按照html代码爬行吗_随笔

网络蜘蛛即Web Spider，是一个比喻得很形象的名字。把互联网比喻成一个蜘蛛网，那么Spider就是在网上爬来爬去的蜘蛛。网络蜘蛛是通过网页的链接地址来寻找网页，从网站某一个页面（通常是首页）开始，读取网页的内容，找到在网页中的其它链接地址，然后通过这些链接地址寻找下一个网页，这样一直循环下去，直到把这个网站所有的网页都抓取完为止。如果把整个互联网当成一个网站，那么网络蜘蛛就可以用这个原理把互联网上所有的网页都抓取下来。

在抓取网页的时候，网络蜘蛛一般有两种策略：广度优先和深度优先

广度优先是指网络蜘蛛会先抓取起始网页中链接的所有网页，然后再选择其中的一个链接网页，继续抓取在此网页中链接的所有网页。这是最常用的方式，因为这个方法可以让网络蜘蛛并行处理，提高其抓取速度。

深度优先是指网络蜘蛛会从起始页开始，一个链接一个链接跟踪下去，处理完这条线路之后再转入下一个起始页，继续跟踪链接。这个方法有个优点是网络蜘蛛在设计的时候比较容易。

百度蜘蛛是顺着链接爬，每个链接里会收录一些关键词建立数据库。

img的文件只能从其属性alt中记录，没有alt是没有办法收录的，js至今还没有能力和技术去爬行，凡是不能识别的百度都会认为是不友好的。

百度蜘蛛是根据你网站综合情况来抓取的，网站文章日常更新比较及时，可能抓取的比较快。不然自动抓取时间会很慢，网站地图做好后，你可以在百度站长工具——链接提交——sitemap里提交下，这样抓取更快一点呢。

欢迎分享，转载请注明来源：内存溢出

原文地址: http://outofmemory.cn/zaji/7420700.html

百度蜘蛛是按照html代码爬行吗

发表评论

评论列表（0条）