您的位置：首页 > 其它

爬虫遇到取到网页为reload的问题

2014-07-09 09:49 106 查看

有的网站防采集，会在页面加上this.window.location.reload(),这时候你就会得到如下代码：

<html>
<head>
<meta http-equiv="Content-Type" content="text/html; charset=UTF-8">
</head>
<body>
<iframe height="0" width="0" style="border: 0px;" src="http://www.***.cn/***/***_cookie.html"></iframe>
<script type="text/javascript">
setTimeout(function(){
this.window.location.reload();
}, 1000);
</script></body>
</html>

这样你就取不到他的网页内容了，但是浏览器可以正常显示

这时候你需要在爬虫的时候添加cookie，比较直接的就是静态的添加上浏览器访问时的cookie，也可以根据他的地址动态取（我没有试过动态取）

内容来自用户分享和网络整理，不保证内容的准确性，如有侵权内容，可联系管理员处理

标签：

相关文章推荐

python爬虫请求网页时遇到问题
java网页爬虫遇到的问题及解决方法
python 爬虫遇到的网页乱码问题
python第一个爬虫小程序以及遇到问题解决（中文乱码)+批量爬取网页并保存至本地
windows下的网络爬虫遇到的问题
瀑布流网页中遇到的问题和解决方法
网页抓取中遇到的编码问题
浅谈个人在瀑布流网页的实现中遇到的问题和解决方法
静态网页中内嵌外部网站遇到的问题
最近用htmlunit做网络爬虫遇到拿不到初始化js加载的数据的问题最近解决了写个简单的例子
使用QtWebKit加载网页，编译时遇到的问题
IE框架中访问不同域的网页遇到的问题
02-项目开发中遇到的问题之网页乱码
做爬虫时候遇到的中文字符编码问题（Python）
爬虫遇到的问题
C++编写网页控件,遇到的问题总结
静态网页动态化遇到的问题
[转]制作适合手机的网页遇到的问题
使用curl抓取网页遇到HTTP跳转时得到多个HTTP头部的问题
四十七、加载网页可能会遇到的问题

新的分享

一次教科书级别的Redis高可用架构设计实践 - Redis
曾光：北京这次的毒株不像国内流行类型
从PRD文档到产品上线，有哪些问题需要解决？
vue3自定义指令的使用
Oracle SQL性能优化最常用的40条建议 - ORACLE
程序员翻车常见反应，你中枪了吗？ - 职场生涯
新鲜开源：基于Prometheus的企业监控平台设计与实现 - 运维
嵌入式软件开发之程序架构设计-任务调度
【Java面试】请简单说一下你对受检异常和非受检异常的理解
奇安信更新招股书：第一季亏损过5亿，齐向东持股38%
艾瑞咨询：2020年中国后智能厨房案例研究报告
艾瑞咨询：2020年中国人工智能+物流发展研究报告

章节导航