Python 爬虫学习笔记三:多页内容爬取&内容分析及格式化
2017-11-15 15:14
645 查看
Python 爬虫学习笔记三:多页内容爬取&内容分析及格式化
python int 与 string 之间的转换:Python int与string之间的转化
string–>int
1、10进制string转化为int
int(‘12’)
2、16进制string转化为int
int(‘12’, 16)
int–>string
1、int转化为10进制string
str(18)
2、int转化为16进制string
hex(18)
2 . 由于链家网上面选中第二页的时候,只是在页面后面多了一个“d2”, 如: http://sh.lianjia.com/ershoufang/pudong/d2 , 所以要想爬取更多的网页只需要循环更新requests 的页面URL
3 . 增加了一个循环之后,可以打印所有的爬取结果
from lxml import etree import requests import string url = 'http://sh.lianjia.com/ershoufang/' region = 'pudong' price = 'p23' finalURL = url+region+price def spider_room(finallyURL): r= requests.get(finallyURL) html = requests.get(finalURL).content.decode('utf-8') dom_tree = etree.HTML(html) # all the messages all_message = dom_tree.xpath("//ul[@class='js_fang_list']/li") for index in range(len(all_message)): print(all_message[index].xpath('string(.)').strip()) return for i in range(20): finallyURL = finalURL + '/d'+str(i) spider_room(finallyURL)
4 . 爬取了20页的内容,可是内容的结果输出的形式并没有改变
【注】 看到的比较好的文章
[1] 利用Python爬取朋友圈数据,爬到你开始怀疑人生
[2] 请问爬虫如何爬取动态页面的内容?
[3] 如何用爬取的数据赚钱
[4] 钱塘数据大数据交易中心
[5] 利用爬虫技术能做到哪些很酷很有趣很有用的事情?
相关文章推荐
- Python & 数据分析学习笔记[第2篇]
- python爬虫:下载百度贴吧图片(多页)学习笔记
- Python & 数据分析学习笔记[第1篇]
- python 字符串&格式化-----廖雪峰教程学习笔记
- python3.4学习笔记(十三) 网络爬虫实例代码,使用pyspider抓取多牛投资吧里面的文章信息,抓取政府网新闻内容
- python 核心编程学习笔记(第3章) 对应Let's-python视频第4集
- python学习笔记之module && package
- python学习笔记-zipimport.ZipImportError: can't decompress data; zlib not available
- ARM&LINUX学习笔记(6)------启动代码分析
- Python学习笔记之网络爬虫
- python学习笔记(1)--《python基础教程》第1章内容总结
- 【学习笔记】python版希尔排序及其时间复杂度分析
- Python学习笔记之格式化输出
- Jsp&Servelet 学习笔记-映射静态的内容到一个servlet中
- python&php数据抓取、爬虫分析与中介,有网址案例
- Python学习笔记整理(六)Python中的字典(含字典嵌套内容)
- Python学习笔记 第二部分 - 正则表达式 与 爬虫小实例(抓取豆瓣电影中评分大于等于8分的影片)
- python 核心编程学习笔记(1, 2章) 对应Let's-python视频第1, 2, 3集
- Python & Django 学习笔记
- Python学习笔记(11):更多内容