最新公告
  • 欢迎您光临网站无忧模板网,本站秉承服务宗旨 履行“站长”责任,销售只是起点 服务永无止境!立即加入钻石VIP
  • python怎么获取js动态加载的数据

    正文概述    2020-10-18   378

    python怎么获取js动态加载的数据

    我们在做网页抓取的时候,一般来说使用urllib和urllib2就能满足大部分需求。

    但是有时候我们遇见那种使用js动态加载的网页。就会发现urllib只能抓出一个部分内容空白的网页。就像下面百度图片的结果页:

    python怎么获取js动态加载的数据

    相关推荐:《Python基础教程》

    审查元素之后,发现百度图片中,显示图片的div为:pullimages

    python怎么获取js动态加载的数据

    这个div里面的内容是动态加载的。而使用urllib&urllib2是抓取不到的。

    要抓取动态加载的元素,首先考虑使用selenium来调用浏览器进行抓取。

    而我们运行的环境是linux,最理想的方法是在无界面情况下进行抓取,所以使用selenium+phantomjs来进行无界面抓取。

    phantomjs是什么呢?它是一个基于webkit内核的无头浏览器,即没有UI界面,即它就是一个浏览器。

    selenium和phantomjs的安装配置可以google,这里就略过不谈了。

    代码如下:

    from selenium import webdriver
    driver = webdriver.PhantomJS(executable_path='/bin/phantomjs/bin/phantomjs')
    #如果不方便配置环境变量。就使用phantomjs的绝对路径也可以
    driver.get('http://image.baidu.com/i?ie=utf-8&word=%E5%91%A8%E6%9D%B0%E4%BC%A6')
    #抓取了百度图片,query:周杰伦
    driver.page_source 
    #这就是返回的页面内容了,与urllib2.urlopen().read()的效果是类似的,但比urllib2强在能抓取到动态渲染后的内容。
    driver.quit()

    到这里。就抓取动态页面成功了。


    下载网 » python怎么获取js动态加载的数据

    常见问题FAQ

    免费下载或者VIP会员专享资源能否直接商用?
    本站所有资源版权均属于原作者所有,这里所提供资源均只能用于参考学习用,请勿直接商用。若由于商用引起版权纠纷,一切责任均由使用者承担。更多说明请参考 VIP介绍。
    提示下载完但解压或打开不了?
    最常见的情况是下载不完整: 可对比下载完压缩包的与网盘上的容量,若小于网盘提示的容量则是这个原因。这是浏览器下载的bug,建议用百度网盘软件或迅雷下载。若排除这种情况,可在对应资源底部留言,或 联络我们.。
    找不到素材资源介绍文章里的示例图片?
    对于PPT,KEY,Mockups,APP,网页模版等类型的素材,文章内用于介绍的图片通常并不包含在对应可供下载素材包内。这些相关商业图片需另外购买,且本站不负责(也没有办法)找到出处。 同样地一些字体文件也是这种情况,但部分素材会在素材包内有一份字体下载链接清单。
    模板不会安装或需要功能定制以及二次开发?
    请QQ联系我们

    发表评论

    还没有评论,快来抢沙发吧!

    如需帝国cms功能定制以及二次开发请联系我们

    联系作者

    请选择支付方式

    ×
    迅虎支付宝
    迅虎微信
    支付宝当面付
    余额支付
    ×
    微信扫码支付 0 元