浏览器F12的Network选项里的数据，使用Python编程如何导出_框架

我们经常会发现网页中的许多数据并不是写死在HTML中的，而是通过js动态载入的。所以也就引出了什么是动态数据的概念，动态数据在这里指的是网页中由Javascript动态生成的页面内容，是在页面加载到浏览器后动态生成的，而之前并没有的。

在编写爬虫进行网页数据抓取的时候，经常会遇到这种需要动态加载数据的HTML网页，如果还是直接从网页上抓取那么将无法获得任何数据。

今天，我们就在这里简单聊一聊如何用python来抓取页面中的JS动态加载的数据。

给出一个网页：豆瓣**排行榜，其中的所有**信息都是动态加载的。我们无法直接从页面中获得每个**的信息。

如下图所示，我们无法在HTML中找到对应的**信息。

在Chrome浏览器中，点击F12，打开Network中的XHR，我们来抓取对应的js文件来进行解析。如下图：

在豆瓣页面向下拖拽，使得页面加载入更多的**信息，从而我们可以抓取对应的报文。

我们可以看到它采用的是AJAX异步请求。通过在后台与服务器进行少量数据交换，AJAX 可以使网页实现异步更新。因此就可以在不重新加载整个网页的情况下，对网页的某部分进行更新，从而实现数据的动态载入。

我们可以看到，通过GET，我们得到的response之中包含了所对应的**相关信息，它们以JSON的格式保存在一起。

查看一下RequestURL信息，我们可以发现在action参数之后又跟了两个参数"start"和"limit"，很显然它们的意思是："从某个位置开始返回的**的个数"。

如果想快速获取相关的**信息，就可以直接把这个URL复制进地址栏，修改你所需要的start和limit参数值，将得到对应的结果进行抓取即可。

但是这样显得很不自动化，而且很多其他网站的RequestURL并不给的这么直接，所以我们接下来用python进行进一步的 *** 作来获取这个返回的报文信息。

#coding:utf-8import urllibimport requestspost_param = {'action':'','start':'0','limit':'1'}

return_data = requestsget(">

因为豆瓣是>

我们可以发现打印出的结果中就是对应的JSON文件，下一步的解析和 *** 作在这里就不赘述了。[{"rating":["96","50"],"rank":1,"cover_url":">

Python爬取网页静态数据

这个就很简单，直接根据网址请求页面就行，这里以爬取糗事百科上的内容为例：

1这里假设我们要爬取的文本内容如下，主要包括昵称、内容、好笑数和评论数这4个字段：

打开网页源码，对应网页结构如下，很简单，所有字段内容都可以直接找到：

2针对以上网页结构，我们就可以编写相关代码来爬取网页数据了，很简单，先根据url地址，利用requests请求页面，然后再利用BeautifulSoup解析数据（根据标签和属性定位）就行，如下：

程序运行截图如下，已经成功爬取到数据：

Python爬取网页动态数据

很多种情况下，网页数据都是动态加载的，直接爬取网页是提取不到任何数据的，这时就需要抓包分析，找到动态加载的数据，一般情况下就是一个json文件（当然，也可能是其他类型的文件，像xml等），然后请求解析这个json文件，就能获取到我们需要的数据，这里以爬取人人贷上面的散标数据为例：

1这里假设我们爬取的数据如下，主要包括年利率，借款标题，期限，金额，进度这5个字段：

2按F12调出开发者工具，依次点击“Network”->“XHR”，F5刷新页面，就可以找到动态加载的json文件，具体信息如下：

3接着，针对以上抓包分析，我们就可以编写相关代码来爬取数据了，基本思路和上面的静态网页差不多，先利用requests请求json，然后再利用python自带的json包解析数据就行，如下：

程序运行截图如下，已经成功获取到数据：

至此，我们就完成了利用python来爬取网页数据。总的来说，整个过程很简单，requests和BeautifulSoup对于初学者来说，非常容易学习，也易掌握，可以学习使用一下，后期熟悉后，可以学习一下scrapy爬虫框架，可以明显提高开发效率，非常不错，当然，网页中要是有加密、验证码等，这个就需要自己好好琢磨，研究对策了，网上也有相关教程和资料，感兴趣的话，可以搜一下，希望以上分享的内容能对你上有所帮助吧，也欢迎大家评论、留言。

绕过反爬虫机制的方法

1、模拟正常用户。反爬虫机制还会利用检测用户的行为来判断，例如Cookies来判断是不是有效的用户。

2、动态页面限制。有时候发现抓取的信息内容空白，这是因为这个网站的信息是通过用户的XHR动态返回内容信息。解决这种问题就要爬虫程序对网站进行分析，找到内容信息并抓取，才能获取内容。

3、降低IP访问频率。有时候平台为了阻止频繁访问，会设置IP在规定时间内的访问次数，超过次数就会禁止访问。所以绕过反爬虫机制可以降低爬虫的访问频率，还可以用IPIDEA代理IP换IP解决限制。

以上就是关于浏览器F12的Network选项里的数据，使用Python编程如何导出全部的内容，包括:浏览器F12的Network选项里的数据，使用Python编程如何导出、Python爬虫如何写、当Python爬虫遇到网站防爬机制时如何处理等相关内容解答，如果想了解更多相关内容，可以关注我们，你们的支持是我们更新的动力！

欢迎分享，转载请注明来源：内存溢出

原文地址: http://outofmemory.cn/web/10098828.html

浏览器F12的Network选项里的数据，使用Python编程如何导出

发表评论

评论列表（0条）