Selenium 模拟浏览器动态加载页面的实现方法
2018-05-16 09:39
936 查看
相信爬取大公司的数据时,常常会遇到页面信息动态加载的问题,
如果仅仅使用content = urllib2.urlopen(URL).read(),估计信息是获取不全的,这时候就需要模拟浏览器加载页面的过程,
selenium提供了方便的方法,我也是菜鸟,试了很多种方式,下面提供觉得最靠谱的(已经证明对于爬取新浪微博的topic、twitter under topic完全没问题)。
至于下面的browser变量是什么,看前面的几篇文章。
首先是请求对应的URL:
right_URL = URL.split("from")[0] + "current_page="+str(current_page) + "&since_id="+str(since_id) + "&page="+str(page_index) + "#Pl_Third_App__"+str(Pl_Third_App) print right_URL try: browser.get(right_URL) print "loading more, sleep 3 seconds ... 0" time.sleep(3) # NO need for this sleep, but we add ... browser = selenuim_loading_more(browser, method_index=0) except: print "one exception happen ==> get_tweeter_under_topic 2 ..." pass
然后模拟浏览器,加载更多(推荐使用method_index=0,已经证明比其他好用很多):
def selenuim_loading_more(browser, method_index=0): if method_index==0: browser.implicitly_wait(3) # 为了快速滑动,先设置超时时间为1秒 # while True: for i in range(1, 4): # at most 3 times print "loading more, window.scrollTo bettom for the", i,"time ..." browser.execute_script("window.scrollTo(0,document.body.scrollHeight);") try: # 定位页面底部的换页tab browser.find_element_by_css_selector("div[class='W_pages']") break # 如果没抛出异常就说明找到了底部标志,跳出循环 except NoSuchElementException: pass # 抛出异常说明没找到底部标志,继续向下滑动 browser.implicitly_wait(4) # 将超时时间改回10秒 elif method_index==1: browser.find_element_by_css_selector("div[class='empty_con clearfix']").click() # loading more print "loading more, sleep 4 seconds ... 1" time.sleep(4) browser.find_element_by_css_selector("div[class='empty_con clearfix']").click() # loading more print "loading more, sleep 3 seconds ... 2" time.sleep(2) elif method_index==2: load_more_1 = browser.find_element_by_css_selector("div[class='empty_con clearfix']") # loading more ActionChains(browser).click(load_more_1).perform() print "loading more, sleep 4 seconds ... 1" time.sleep(4) load_more_2 = browser.find_element_by_css_selector("div[class='empty_con clearfix']") # loading more ActionChains(browser).click(load_more_2).perform() print "loading more, sleep 3 seconds ... 2" time.sleep(2) elif method_index==3: print "loading more, sleep 4 seconds ... 1" element = WebDriverWait(browser, 4).until( EC.element_to_be_clickable((By.CSS_SELECTOR, "div[class='empty_con clearfix']")) ) element.click() print "loading more, sleep 2 seconds ... 2" WebDriverWait(browser, 2).until( EC.element_to_be_clickable((By.CSS_SELECTOR, "div[class='empty_con clearfix']")) ).click() return browser
以上就是本文的全部内容,希望对大家的学习有所帮助,也希望大家多多支持脚本之家。
您可能感兴趣的文章:
- 详解Python多线程Selenium跨浏览器测试
- 浅谈python爬虫使用Selenium模拟浏览器行为
- selenium python浏览器多窗口处理代码示例
- python selenium 对浏览器标签页进行关闭和切换的方法
- 通过python+selenium3实现浏览器刷简书文章阅读量
- Python使用Selenium模块实现模拟浏览器抓取淘宝商品美食信息功能示例
- Python使用Selenium模块模拟浏览器抓取斗鱼直播间信息示例
- Selenium鼠标与键盘事件常用操作方法示例
- Selenium元素的常用操作方法分析
- Selenium(Python web测试工具)基本用法详解
- Selenium控制浏览器常见操作示例
相关文章推荐
- jQuery实现页面滚动时动态加载内容的方法
- 爬天眼查,动态加载的网页,模拟浏览器方法
- jQuery实现页面滚动时动态加载内容的方法
- Python利用selenium模拟浏览器抓取异步加载等难爬页面信息
- MVC4中AJAX Html页面打开调用后台方法实现动态加载数据库中的数据
- Selenium总结:模拟浏览器动态加载页面
- asp.net ext treepanel 动态加载XML的实现方法
- 在PHP动态网页中实现支持页面回跳的方法
- C#实现反射调用动态加载的DLL文件中的方法
- JQuery实现页面随滚动条滚动而动态加载内容的效果
- 要实现动态加载JS脚本有4种方法
- C#实现反射调用动态加载的DLL文件中的方法
- asp.net在使用母版页的内容页面中动态加载css和js文件的方法
- 用于实现EXT单页面的动态js加载.(修复版)
- 用AjaxMethod 方法实现动态加载地图
- ASP.NET动态加载用户控件的实现方法
- 通过使页面动态加载不同CSS实现多界面
- C# aspx页面动态加载ascx用户控件 及 利用反射调用其内方法
- 实现Web页面中级联菜单的设计/实现动态加载列表框/实现自动刷新页面/实现Web页面的局部动态更新/实现自动完成功能
- asp.net Mvc中实现在View页面中嵌入公用动态数据,实现方法为:include(包含动态页面数据)