python3 实现爬取TOP500的音乐信息并存储到mongoDB数据库中
2019-08-24 09:22
323 查看
爬取TOP500的音乐信息,包括排名情况、歌曲名、歌曲时间。
网页版酷狗不能手动翻页进行下一步的浏览,仔细观察第一页的URL:
http://www.kugou.com/yy/rank/home/1-8888.html
这里尝试将1改为2,再进行浏览,恰好是第二页的信息,再改为3,恰好是第三页的信息,多次尝试发现不同的数字即为不同的页面。因此只需更改home/后面的数字即可。由于每页显示的为22首歌曲,所以总共需要23个URL。
import requests from bs4 import BeautifulSoup from time import sleep import pymongo #连接数据库 client = pymongo.MongoClient(‘localhost',27017) mydb = client[‘yourdb'] #创建数据库 musicTop = mydb[‘musicTop'] #使用header是用于伪装为浏览器,让爬虫更稳定 Headers = { ‘User-Agent': ‘Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/70.0.3538.67 Safari/537.36' } #定义获取信息的函数 def get_info(url): wd_data = requests.get(url,headers=Headers) soup = BeautifulSoup(wd_data.text,‘lxml') #获取排名情况 ranks = soup.select(‘span.pc_temp_num') #获取标题 titles = soup.select(‘div.pc_temp_songlist > ul > li > a') #获取时间 times = soup.select(‘span.pc_temp_tips_r > span') for rank,title,time in zip(ranks,titles,times): data = { ‘rank':rank.get_text().strip(), ‘singer':title.get_text(), ‘song':title.get_text(), ‘time':time.get_text().strip() } musicTop.insert_one(data) #存入数据库中 if name == ‘main': urls = [‘http://www.kugou.com/yy/rank/home/{}-8888.html'.format(number) for number in range(1,24)] for url in urls: get_info(url) sleep(2)
运行后,爬取的数据在mongoDB数据库中显示如下:
以上这篇python3 实现爬取TOP500的音乐信息并存储到mongoDB数据库中就是小编分享给大家的全部内容了,希望能给大家一个参考
您可能感兴趣的文章:
相关文章推荐
- 【答疑】| python实现批量存储文件信息到指定文件
- 在/sys目录下建立一个文件,并且实现信息的读取和存储
- python批量获取apk软件详细信息的实现
- 用 C++实现的简单物流信息存储
- python实现double型浮点数在内存中的存储样式转换接口
- python实现上传样本到virustotal并查询扫描信息的方法
- 利用jquery完成表单域的收集,利用ajax实现信息传递给服务器存储
- C语言实现电话本 动态开辟 信息存储于文件
- 一段有意思的代码:类实现中将信息存储到其他位置
- 【Python 编程】实现文本分类中的信息增益算法
- Python实现支持JSON存储和解析的对象
- Python实现方便使用的级联进度信息实例
- C/C++用动态链表实现对学生信息的存储
- python 实现用ISBN从豆瓣获取图书信息
- 使用shell和python分别实现简单菜单功能--打印当前系统状态信息
- python实现获取Ip归属地等信息
- C#实现支持单点登录的一个存储用户信息的类
- 实现报名人信息与存储库中信息同步显示
- python实现的一个火车票转让信息采集器
- Winform开发框架中实现信息阅读状态的显示和存储