selenium爬取网页实验心得（selenium爬虫实例） - 杂七乱八

本篇文章给大家谈谈selenium爬取网页实验心得，以及selenium爬虫实例对应的知识点，希望对各位有所帮助，不要忘了收藏本站喔。

本文目录一览：

1、用爬虫抓取网页得到的源代码和浏览器中看到的不一样运用了什么技术？
2、从零开始学Python-使用Selenium抓取动态网页数据
3、用selenium来做爬虫的方法有什么优缺点
4、Python+Selenium 元素获取及使用心得

用爬虫抓取网页得到的源代码和浏览器中看到的不一样运用了什么技术？

网页源代码和浏览器中看到的不一样是因为网站采用了动态网页技术（如AJAX、JavaScript等）来更新网页内容。这些技术可以在用户与网站进行交互时，通过异步加载数据、动态更新页面内容，实现更加流畅、快速的用户体验。而这些动态内容无法通过简单的网页源代码获取，需要通过浏览器进行渲染后才能看到。

当使用爬虫抓取网页时，一般只能获取到网页源代码，而无法获取到经过浏览器渲染后的页面内容。如果要获取经过浏览器渲染后的内容，需要使用一个浏览器渲染引擎（如Selenium）来模拟浏览器行为，从而获取到完整的页面内容。

另外，网站为了防止爬虫抓取数据，可能会采用一些反爬虫技术，如设置验证码、限制IP访问频率等。这些技术也会导致爬虫获取到的页面内容与浏览器中看到的不一样。

从零开始学Python-使用Selenium抓取动态网页数据

AJAX（Asynchronouse JavaScript And XML：异步JavaScript和XML）通过在后台与服务器进行少量数据交换，Ajax 可以使网页实现异步更新，这意味着可以在不重新加载整个网页的情况下，对网页的某部分进行局部更新。传统的网页（不使用Ajax）如果需要更新内容，必须重载整个网页页面。

因为传统的网页在传输数据格式方面，使用的是 XML 语法，因此叫做 AJAX ，其实现在数据交互基本上都是使用 JSON 。使用AJAX加载的数据，即使使用了JS将数据渲染到了浏览器中，在右键-查看网页源代码还是不能看到通过ajax加载的数据，只能看到使用这个url加载的html代码。

法1：直接分析ajax调用的接口。然后通过代码请求这个接口。

法2：使用Selenium+chromedriver模拟浏览器行为获取数据。

Selenium 相当于是一个机器人。可以模拟人类在浏览器上的一些行为，自动处理浏览器上的一些行为，比如点击，填充数据，删除cookie等。 chromedriver 是一个驱动 Chrome 浏览器的驱动程序，使用他才可以驱动浏览器。当然针对不同的浏览器有不同的driver。以下列出了不同浏览器及其对应的driver：

现在以一个简单的获取百度首页的例子来讲下 Selenium 和 chromedriver 如何快速入门：

参考：Selenium的使用

直接直接分析ajax调用的接口爬取

selenium结合lxml爬取

selenium爬取网页实验心得（selenium爬虫实例）,selenium爬取网页实验心得,信息,文章,百度,第1张