使用PHP的cURL库可以简单和有效地去抓网页。你只需要运行一个脚本,然后分析一下你所抓取的网页,然后就可以以程序的方式得到你想要的数据了。无论是你想从从一个链接上取部分数据,或是取一个XML文件并把其导入数据库,那怕就是简单的获取网页内容,cURL 是一个功能强大的PHP库。
PHP中的CURL函数库(Client URL Library Function)
<br />curl_close — 关闭一个curl会话<br />curl_copy_handle — 拷贝一个curl连接资源的所有内容和参数<br />curl_errno — 返回一个包含当前会话错误信息的数字编号<br />curl_error — 返回一个包含当前会话错误信息的字符串<br />curl_exec — 执行一个curl会话<br />curl_getinfo — 获取一个curl连接资源句柄的信息<br />curl_init — 初始化一个curl会话<br />curl_multi_add_handle — 向curl批处理会话中添加单独的curl句柄资源<br />curl_multi_close — 关闭一个批处理句柄资源<br />curl_multi_exec — 解析一个curl批处理句柄<br />curl_multi_getcontent — 返回获取的输出的文本流<br />curl_multi_info_read — 获取当前解析的curl的相关传输信息<br />curl_multi_init — 初始化一个curl批处理句柄资源<br />curl_multi_remove_handle — 移除curl批处理句柄资源中的某个句柄资源<br />curl_multi_select — Get all the sockets associated with the cURL extension, which can then be "selected"<br />curl_setopt_array — 以数组的形式为一个curl设置会话参数<br />curl_setopt — 为一个curl设置会话参数<br />curl_version — 获取curl相关的版本信息<br />curl_init()函数的作用初始化一个curl会话,curl_init()函数唯一的一个参数是可选的,表示一个url地址。<br />curl_exec()函数的作用是执行一个curl会话,唯一的参数是curl_init()函数返回的句柄。<br />curl_close()函数的作用是关闭一个curl会话,唯一的参数是curl_init()函数返回的句柄。<br />
例子一: 基本例子
<br />﹤?php<br />// 初始化一个 cURL 对象<br />$curl = curl_init();<br />// 设置你需要抓取的URL<br />curl_setopt($curl, CURLOPT_URL, 'http://www.cmx8.cn');<br />// 设置header<br />curl_setopt($curl, CURLOPT_HEADER, 1);<br />// 设置cURL 参数,要求结果保存到字符串中还是输出到屏幕上。<br />curl_setopt($curl, CURLOPT_RETURNTRANSFER, 1);<br />// 运行cURL,请求网页<br />$data = curl_exec($cur<a>2本文来源gao*daima.com搞@代#码&网6</a><pre>搞gaodaima代码
l);
// 关闭URL请求
curl_close($curl);
// 显示获得的数据
var_dump($data);
?>
例子二: POST数据
sendSMS.php,其可以接受两个表单域,一个是电话号码,一个是短信内容。
<br />﹤?php<br />$phoneNumber = '13812345678';<br />$message = 'This message was generated by curl and php';<br />$curlPost = 'pNUMBER=' . urlencode($phoneNumber) . '&MESSAGE=' . urlencode($message) . '&SUBMIT=Send';<br />$ch = curl_init();<br />curl_setopt($ch, CURLOPT_URL, 'http://www.lxvoip.com/sendSMS.php');<br />curl_setopt($ch, CURLOPT_HEADER, 1);<br />curl_setopt($ch, CURLOPT_RETURNTRANSFER, 1);<br />curl_setopt($ch, CURLOPT_POST, 1);<br />curl_setopt($ch, CURLOPT_POSTFIELDS, $curlPost);<br />$data = curl_exec();<br />curl_close($ch);<br />?﹥<br />
例子三:使用代理服务器
<br />﹤?php <br />$ch = curl_init();<br />curl_setopt($ch, CURLOPT_URL, 'http://www.cmx8.cn');<br />curl_setopt($ch, CURLOPT_HEADER, 1);<br />curl_setopt($ch, CURLOPT_RETURNTRANSFER, 1);<br />curl_setopt($ch, CURLOPT_HTTPPROXYTUNNEL, 1);<br />curl_setopt($ch, CURLOPT_PROXY, 'proxy.lxvoip.com:1080');<br />curl_setopt($ch, CURLOPT_PROXYUSERPWD, 'user:password');<br />$data = curl_exec();<br />curl_close($ch);<br />?﹥<br />
例子四: 模拟登录
Curl 模拟登录 discuz 程序,适合DZ7.0,将username改成你的用户名,userpass改成你的密码就可以了.
<br /><?php <br />/** <br />* Curl 模拟登录 discuz 程序 <br />* 尚未实现开启验证码的的论坛登录功能 <br />*/ <br />!extension_loaded('curl') && die('The curl extension is not loaded.'); <br />$discuz_url = 'http://www.lxvoip.com';//论坛地址 <br />$login_url = $discuz_url .'/logging.php?action=login';//登录页地址 <br />$get_url = $discuz_url .'/my.php?item=threads'; //我的帖子 <br />$post_fields = array(); <br />//以下两项不需要修改 <br />$post_fields['loginfield'] = 'username'; <br />$post_fields['loginsubmit'] = 'true'; <br />//用户名和密码,必须填写 <br />$post_fields['username'] = 'lxvoip'; <br />$post_fields['password'] = '88888888'; <br />//安全提问 <br />$post_fields['questionid'] = 0; <br />$post_fields['answer'] = ''; <br />//@todo验证码 <br />$post_fields['seccodeverify'] = ''; <br />//获取表单FORMHASH <br />$ch = curl_init($login_url); <br />curl_setopt($ch, CURLOPT_HEADER, 0); <br />curl_setopt($ch, CURLOPT_RETURNTRANSFER, 1); <br />$contents = curl_exec($ch); <br />curl_close($ch); <br />preg_match('//i', $contents, $matches); <br />if(!empty($matches)) { <br /> $formhash = $matches[1]; <br />} else { <br /> die('Not found the forumhash.'); <br />} <br />//POST数据,获取COOKIE <br />$cookie_file = dirname(__FILE__) . '/cookie.txt'; <br />//$cookie_file = tempnam('/tmp'); <br />$ch = curl_init($login_url); <br />curl_setopt($ch, CURLOPT_HEADER, 0); <br />curl_setopt($ch, CURLOPT_RETURNTRANSFER, 1); <br />curl_setopt($ch, CURLOPT_POST, 1); <br />curl_setopt($ch, CURLOPT_POSTFIELDS, $post_fields); <br />curl_setopt($ch, CURLOPT_COOKIEJAR, $cookie_file); <br />curl_exec($ch); <br />curl_close($ch); <br />//带着上面得到的COOKIE获取需要登录后才能查看的页面内容 <br />$ch = curl_init($get_url); <br />curl_setopt($ch, CURLOPT_HEADER, 0); <br />curl_setopt($ch, CURLOPT_RETURNTRANSFER, 0); <br />curl_setopt($ch, CURLOPT_COOKIEFILE, $cookie_file); <br />$contents = curl_exec($ch); <br />curl_close($ch); <br />var_dump($contents); <br />?><br />
以上就是本文的全部内容了,希望大家能够喜欢。