Java数据抓取总结--1.准备工作
2016-03-16 16:34
357 查看
前言:自从2014年4月大一开始接触Java,7月开始接触网络爬虫至今已经两年的时间,共抓取非同类型网站150余个,其中包括一些超大型网站,比如百度文库,亚马逊,魔方格,学科网等。也在学长五年经验留下来的代码的基础上,整合成一个小型的爬虫框架,主要用于抓取期刊之类的数据型网站,包括元数据抓取和文件下载。在此感谢曾经给我指导方向,帮助我学习的学长们。
1.关于Java基础
此文档主要以Jsoup解析+MySql数据库存储讲解数据抓取,需要具备一定的Java基础和数据库基础。由于在实际抓取中经常使用到Java中对String的操作,如indexOf,subString,split,replace等,请重点回顾相关用法及有可能抛出的异常。对于一些复杂的网站只靠Jsoup解析+String操作远远不够,有时候也需要使用正则表达式,也需要适当了解。
2.关于开发必备软件如下:
开发工具推荐使用Eclipse系列,注意修改工作空间编码为UTF-8。
下载地址:
http://www.eclipse.org/downloads/packages/eclipse-ide-java-ee-developers/mars1
浏览器使用火狐或者谷歌,请自行选择。
火狐浏览器下载地址:
http://download.firefox.com.cn/releases/stub/official/zh-CN/Firefox-latest.exe
谷歌浏览器下载地址:
http://w.x.baidu.com/alading/anquan_soft_down_ub/14744
(注:使用火狐浏览器需要安装FireBug插件,关于使用方式请查看文档链接:http://pan.baidu.com/s/1dExJj3b 密码:ddmi)
3.解析网页源码使用的是Jsoup,使用前请先查看一下文档学习。
教程网址:http://www.open-open.com/jsoup/(重点)
/article/11509810.html
关于本系列博文:主要基于Java语言,使用Jsoup解析网页源码,HttpClient模拟请求,MySQL数据持久化存储等,包括模拟登陆,数据抓取,代理IP,验证码识别等。
学习前的准备工作:1.关于Java基础
此文档主要以Jsoup解析+MySql数据库存储讲解数据抓取,需要具备一定的Java基础和数据库基础。由于在实际抓取中经常使用到Java中对String的操作,如indexOf,subString,split,replace等,请重点回顾相关用法及有可能抛出的异常。对于一些复杂的网站只靠Jsoup解析+String操作远远不够,有时候也需要使用正则表达式,也需要适当了解。
2.关于开发必备软件如下:
开发工具推荐使用Eclipse系列,注意修改工作空间编码为UTF-8。
下载地址:
http://www.eclipse.org/downloads/packages/eclipse-ide-java-ee-developers/mars1
浏览器使用火狐或者谷歌,请自行选择。
火狐浏览器下载地址:
http://download.firefox.com.cn/releases/stub/official/zh-CN/Firefox-latest.exe
谷歌浏览器下载地址:
http://w.x.baidu.com/alading/anquan_soft_down_ub/14744
(注:使用火狐浏览器需要安装FireBug插件,关于使用方式请查看文档链接:http://pan.baidu.com/s/1dExJj3b 密码:ddmi)
3.解析网页源码使用的是Jsoup,使用前请先查看一下文档学习。
教程网址:http://www.open-open.com/jsoup/(重点)
/article/11509810.html
相关文章推荐
- 请简叙Java中的main()方法
- java如何获取正确的字符编码
- struts2 上传单个文件
- Spring的事务管理
- No_16_0314 Java基础学习第十七天
- 【Java】Java 中IO流知识总结
- 如何理解Java中的装箱与拆箱
- struts2与springMVC的区别
- IP库查询算法
- java中File类中的常用的方法 复制,读文件
- eclipse调试java程序的九个技巧
- LeetCode: 8. String to Integer 【java 解题】
- mac OS X 上设置动态JAVA_HOME
- 在一个字符串的相同指定长度间隔处插入指定字符串
- Java.math.BigDecimal.movePointRight()方法实例
- 浅谈Java中的hashcode方法
- java包含哪些基本数据类型及其包装类
- javaweb实现验证码功能
- Eclipse中Outline里各种图标的含义
- MyEclipse安装后需要进行的配置