献给所有想学习正则和采集的朋友
2009-02-21 23:52
357 查看
<?php
function get_url_content($Url,$Method = 'c') {
//引入需要的语言编码.如果没有, 就会默认为utf-8,不必担心.
global $Charset;
$Urlarr = parse_url($Url);
//如果检测不出域名,就返回.
if (!isset($Urlarr['host'])) {
return false;
}
//我们用智能方式定义header头倍信息.
foreach (@getallheaders() as $key => $val){
$key==='Host' && $val = $Urlarr['host'];
$key==='Referer' && $val ='http://'.$Urlarr['host'];
$str .= "'$key:$val', /n";
}
//虚拟来路.
!eregi('Referer',$str) && $str .="'Referer:http://{$Urlarr['host']}', /n";
//经过修正, 基本上, 来路也是那个站, 主机也是Url站点.
$Header = array(trim($str));
//下面仅仅是选择用哪个程序来采集.
if($Method === 'f'&&function_exists('file_get_contents')) {
$opts = array(
'http'=>array(
'method'=>"GET",
'header'=>$Header,
)
);
$cxContext = stream_context_create($opts);
$file_contents = @file_get_contents($Url, false, $cxContext);
} elseif ($Method === 'c'&&function_exists('curl_init')) {
$Ch = curl_init();
$Timeout = 5;
curl_setopt($Ch,CURLOPT_HTTPHEADER,$Header);
curl_setopt ($Ch, CURLOPT_URL, $Url);
curl_setopt ($Ch, CURLOPT_RETURNTRANSFER,1);
curl_setopt ($Ch, CURLOPT_CONNECTTIMEOUT, $Timeout);
$file_contents = curl_exec($Ch);
curl_close($Ch);
}
//为了让样式显示得漂亮,我们给它加一句目标引向.
$file_contents = str_replace('</title>',"</title>/n<base href=/"http://{$Urlarr['host']}//" />",$file_contents);
//处理最常见的几种编码, 如果目标网站没有编码, 就默认为GBK
!preg_match('/charset=([^<>"]*)"/isU',$file_contents,$lang) && $lang[1]='GBK';
function_exists('mb_convert_encoding') && $file_contents = mb_convert_encoding($file_contents,empty($Charset)?'UTF-8':$Charset,$lang[1]);
//注销部分代码;
unset($Url,$lang,$Timeout,$Urlarr,$Charset);
return $file_contents;
}
//测试开始 测试用file_get_contents方式
HEADER("CONTENT-TYPE:TEXT/HTML; CHARSET=UTF-8");
//http://www.xtzj.com/read-htm-tid-347550.html 这是采集不到.
$file = get_url_content("http://www.hao123.com",'f');
$file = strip_tags($file,'<a>');
preg_match_all('/(http:[^"<>]*)>/isU',$file,$link);unset($link[0]);
$link = $link[1];
//我们来模拟获得数据. 自己更换数字.0-151 下面是用curl方式
$x = 10;
$file = get_url_content($link[$x]);
echo $file;
?>
function get_url_content($Url,$Method = 'c') {
//引入需要的语言编码.如果没有, 就会默认为utf-8,不必担心.
global $Charset;
$Urlarr = parse_url($Url);
//如果检测不出域名,就返回.
if (!isset($Urlarr['host'])) {
return false;
}
//我们用智能方式定义header头倍信息.
foreach (@getallheaders() as $key => $val){
$key==='Host' && $val = $Urlarr['host'];
$key==='Referer' && $val ='http://'.$Urlarr['host'];
$str .= "'$key:$val', /n";
}
//虚拟来路.
!eregi('Referer',$str) && $str .="'Referer:http://{$Urlarr['host']}', /n";
//经过修正, 基本上, 来路也是那个站, 主机也是Url站点.
$Header = array(trim($str));
//下面仅仅是选择用哪个程序来采集.
if($Method === 'f'&&function_exists('file_get_contents')) {
$opts = array(
'http'=>array(
'method'=>"GET",
'header'=>$Header,
)
);
$cxContext = stream_context_create($opts);
$file_contents = @file_get_contents($Url, false, $cxContext);
} elseif ($Method === 'c'&&function_exists('curl_init')) {
$Ch = curl_init();
$Timeout = 5;
curl_setopt($Ch,CURLOPT_HTTPHEADER,$Header);
curl_setopt ($Ch, CURLOPT_URL, $Url);
curl_setopt ($Ch, CURLOPT_RETURNTRANSFER,1);
curl_setopt ($Ch, CURLOPT_CONNECTTIMEOUT, $Timeout);
$file_contents = curl_exec($Ch);
curl_close($Ch);
}
//为了让样式显示得漂亮,我们给它加一句目标引向.
$file_contents = str_replace('</title>',"</title>/n<base href=/"http://{$Urlarr['host']}//" />",$file_contents);
//处理最常见的几种编码, 如果目标网站没有编码, 就默认为GBK
!preg_match('/charset=([^<>"]*)"/isU',$file_contents,$lang) && $lang[1]='GBK';
function_exists('mb_convert_encoding') && $file_contents = mb_convert_encoding($file_contents,empty($Charset)?'UTF-8':$Charset,$lang[1]);
//注销部分代码;
unset($Url,$lang,$Timeout,$Urlarr,$Charset);
return $file_contents;
}
//测试开始 测试用file_get_contents方式
HEADER("CONTENT-TYPE:TEXT/HTML; CHARSET=UTF-8");
//http://www.xtzj.com/read-htm-tid-347550.html 这是采集不到.
$file = get_url_content("http://www.hao123.com",'f');
$file = strip_tags($file,'<a>');
preg_match_all('/(http:[^"<>]*)>/isU',$file,$link);unset($link[0]);
$link = $link[1];
//我们来模拟获得数据. 自己更换数字.0-151 下面是用curl方式
$x = 10;
$file = get_url_content($link[$x]);
echo $file;
?>
相关文章推荐
- 献给所有想当程序员的朋友(转)
- C# 多线程基础,仅以此心得献给那些渴望学习多线程的朋友[转]
- 谨以此文献给所有想当程序员的朋友
- 软件以程序员为本,谨以此文献给所有想当程序员的朋友。
- 射电肢体再生仪器建设构架【此文献给所有能看懂《源代码》电影的朋友】这不是换头手术成功,是再生成功。
- 每天进步一点点——记学struts+spring+hibernate的感想,献给所有正在学习软件开发的朋友们
- 此文献给所有想当程序员的朋友
- 送给正在学习 正则 awk sed 朋友的礼物
- 软件以程序员为本,谨以此文献给所有想当程序员的朋友(转自timothy空间)
- 正则表达式口诀_学习正则的朋友值得一看
- [原创]发一篇自己的感情贴,献给所有嗜好星际的朋友
- 正则表达式 口诀 学习正则的朋友看看
- 献给想深入学习网络编程的朋友
- 正则表达式 口诀 学习正则的朋友看看
- C# 多线程基础,仅以此心得献给那些渴望学习多线程的朋友
- 【程序员生涯】谨以此文献给所有想当程序员的朋友
- 以此献给所有的朋友:有关癌症
- 谨以此文献给所有想当程序员的朋友(转)
- 李笑来老师在《把时间当作朋友》曾说过:“所有学习上的成功,都只靠两件事:策略和坚持,而坚持本身就应该是最重要的策略之一
- 送给所有想学习web前端开发的朋友