python爬取百度贴吧前1000页内容(requests库面向对象思想实现)
2019-08-10 14:49
991 查看
此程序以李毅吧为例子,以面向对象的设计思想实现爬取保存网页数据,暂时并未用到并发处理,以后有机会的话会加以改善
- 首先去百度贴吧分析贴吧地址栏中url后的参数,找到分页对应的参数pn,贴吧名字对应的参数kw
- 首先创建类,写好__init__方法,run方法,__init__方法里先可以直接写pass
- run方法里大概整理一下整体的思路 构造 url 列表,因为要爬取1000页,每页需对应一个url
- 遍历发送请求,获取响应
- 保存
-
get_url_list方法可以返回需要访问的所有url的一个列表
import requests class TiebaSpider(object): def __init__(self, tieba_name): # tieba_name为要爬取贴吧的名称 self.tieba_name = tieba_name self.url_temp = 'https://tieba.baidu.com/f?kw=' + tieba_name + '&ie=utf-8&pn={}' self.headers = { 'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/75.0.3770.100 Safari/537.36', } def get_url_list(self): # 构造url列表 # url_list = [] # for i in range(1000): # url_list.append(self.url_temp.format(i * 50)) # return url_list return [self.url_temp.format(i*50) for i in range(1000)] # 列表推导式替换上面代码 def parse_url(self, url): # 发送请求,获取响应 print(url) response = requests.get(url, headers=self.headers) return response.content.decode() def save_html(self, html_str, page_num): # 保存html字符串 file_path = '{}-第{}页.html'.format(self.tieba_name, page_num) with open(file_path, 'w', encoding='utf-8') as f: # 样例: 李毅-第一页.html f.write(html_str) def run(self): # 实现主要逻辑 # 1.构造url列表 url_list = self.get_url_list() # 2.遍历,发送请求,获取响应 for url in url_list: html_str = self.parse_url(url) # 3.保存 page_num = url_list.index(url) + 1 # 页码数 self.save_html(html_str, page_num) if __name__ == '__main__': tieba_spider = TiebaSpider('李毅') tieba_spider.run()
以上就是本文的全部内容,希望对大家的学习有所帮助
您可能感兴趣的文章:
相关文章推荐
- python3百度贴吧爬虫小程序逻辑及面向对象实现
- Python, Java, C++, Perl 面向对象思想比较
- OC学习--<猜拳游戏> 之 通过面向对象思想实现 2.0版本
- Python的面向对象思想分析
- Python语言基础(面向对象思想)(day10)
- (Java实现) HDOJ 2023 求平均成绩 面向对象设计思想
- python学习(3):python中的面向对象思想,类和对象
- Python面向对象思想与应用入门教程【类与对象】
- OC学习--<猜拳游戏> 之 通过面向对象思想实现 2.0版本
- .使用面向对象思想,输出员工信息并计算员工的工资。实现过程为:定义一个部门(Department)类,该类有部门编号(Id)、部门名称(Name)属性; 再定义一个员工(Employee)类,该类的属
- Python--面向对象的程序设计之继承实现的原理(继承顺序)、封装、property
- linux内核设计与实现思想 – C风格的面向对象
- python 面向对象简单实现
- Python面向对象实现案例——士兵突击
- 长内容分页的面向对象实现
- 【Linux开发】linux设备驱动归纳总结(三):3.设备驱动面向对象思想和lseek的实现
- [Java实现]通过一个Java小程序(吃苹果)深入理解面向对象思想
- linux设备驱动归纳总结(三):3.设备驱动面向对象思想和lseek的实现【转】
- python面向对象实现K均值聚类
- python(三):面向对象实现之打飞机游戏