phpcurl怕數(shù)據(jù) phpcurl詳解

php中curl爬蟲怎么樣通過網(wǎng)頁獲取所有鏈接

本文承接上面兩篇，本篇中的示例要調用到前兩篇中的函數(shù)，做一個簡單的URL采集。一般php采集網(wǎng)絡數(shù)據(jù)會用file_get_contents、file和cURL。不過據(jù)說cURL會比file_get_contents、file更快更專業(yè)，更適合采集。今天就試試用cURL來獲取網(wǎng)頁上的所有鏈接。示例如下：

成都創(chuàng)新互聯(lián)專注于網(wǎng)站建設，為客戶提供成都網(wǎng)站建設、網(wǎng)站制作、網(wǎng)頁設計開發(fā)服務，多年建網(wǎng)站服務經(jīng)驗，各類網(wǎng)站都可以開發(fā)，高端網(wǎng)站設計，公司官網(wǎng)，公司展示網(wǎng)站，網(wǎng)站設計，建網(wǎng)站費用，建網(wǎng)站多少錢，價格優(yōu)惠，收費合理。

?php

* 使用curl 采集hao123.com下的所有鏈接。

include_once('function.php');

$ch = curl_init();

curl_setopt($ch, CURLOPT_URL, '');

// 只需返回HTTP header

curl_setopt($ch, CURLOPT_HEADER, 1);

// 頁面內容我們并不需要

// curl_setopt($ch, CURLOPT_NOBODY, 1);

// 返回結果，而不是輸出它

curl_setopt($ch, CURLOPT_RETURNTRANSFER, 1);

$html = curl_exec($ch);

$info = curl_getinfo($ch);

if ($html === false) {

echo "cURL Error: " . curl_error($ch);

}

curl_close($ch);

$linkarr = _striplinks($html);

// 主機部分，補全用

$host = '';

if (is_array($linkarr)) {

foreach ($linkarr as $k = $v) {

$linkresult[$k] = _expandlinks($v, $host);

}

printf("p此頁面的所有鏈接為：/ppre%s/pren", var_export($linkresult , true));

function.php內容如下（即為上兩篇中兩個函數(shù)的合集）：

?php

function _striplinks($document) {

preg_match_all("'s*as.*?hrefs*=s*(["'])?(?(1) (.*?)\1 | ([^s]+))'isx", $document, $links);

// catenate the non-empty matches from the conditional subpattern

while (list($key, $val) = each($links[2])) {

if (!empty($val))

$match[] = $val;

} while (list($key, $val) = each($links[3])) {

if (!empty($val))

$match[] = $val;

}

// return the links

return $match;

}

/*===================================================================*

Function: _expandlinks

Purpose: expand each link into a fully qualified URL

Input: $links the links to qualify

$URI the full URI to get the base from

Output: $expandedLinks the expanded links

*===================================================================*/

function _expandlinks($links,$URI)

{

$URI_PARTS = parse_url($URI);

$host = $URI_PARTS["host"];

preg_match("/^[^?]+/",$URI,$match);

$match = preg_replace("|/[^/.]+.[^/.]+$|","",$match[0]);

$match = preg_replace("|/$|","",$match);

$match_part = parse_url($match);

$match_root =

$match_part["scheme"]."://".$match_part["host"];

$search = array( "|^http://".preg_quote($host)."|i",

"|^(/)|i",

"|^(?!http://)(?!mailto:)|i",

"|/./|",

"|/[^/]+/../|"

);

$replace = array( "",

$match_root."/",

$match."/",

"/",

"/"

);

$expandedLinks = preg_replace($search,$replace,$links);

return $expandedLinks;

}

通過PHP 的 curl 如何抓取進港碼頭的數(shù)據(jù)？

使用PHP的cURL庫可以簡單和有效地去抓網(wǎng)頁。你只需要運行一個腳本，然后分析一下你所抓取的網(wǎng)頁，然后就可以以程序的方式得到你想要的數(shù)據(jù) 了。無論是你想從從一個鏈接上取部分數(shù)據(jù)，或是取一個XML文件并把其導入數(shù)據(jù)庫，那怕就是簡單的獲取網(wǎng)頁內容，cURL 是一個功能強大的PHP庫。本文主要講述如果使用這個PHP庫。

//如果要轉載本文請注明出處,免的出現(xiàn)版權紛爭,我不喜歡看到那種轉載了我的作品卻不注明出處的人 Seven{See7di#Gmail.com}

啟用 cURL 設置

首先，我們得先要確定我們的PHP是否開啟了這個庫，你可以通過使用php_info()函數(shù)來得到這一信息。

?php

phpinfo();

如果你可以在網(wǎng)頁上看到下面的輸出，那么表示cURL庫已被開啟。

如果你看到的話，那么你需要設置你的PHP并開啟這個庫。如果你是在Windows平臺下，那么非常簡單，你需要改一改你的php.ini文件的設置，找到php_curl.dll，并取消前面的分號注釋就行了。如下所示：

//取消下在的注釋

extension=php_curl.dll

如果你是在Linux下面，那么，你需要重新編譯你的PHP了，編輯時，你需要打開編譯參數(shù)——在configure命令上加上“–with-curl” 參數(shù)。

一個小示例

如果一切就緒，下面是一個小例程：

?php

// 初始化一個 cURL 對象

$curl = curl_init();

// 設置你需要抓取的URL

curl_setopt($curl, CURLOPT_URL, '');

// 設置header

curl_setopt($curl, CURLOPT_HEADER, 1);

// 設置cURL 參數(shù)，要求結果保存到字符串中還是輸出到屏幕上。

curl_setopt($curl, CURLOPT_RETURNTRANSFER, 1);

// 運行cURL，請求網(wǎng)頁

$data = curl_exec($curl);

// 關閉URL請求

curl_close($curl);

// 顯示獲得的數(shù)據(jù)

var_dump($data);

如何POST數(shù)據(jù)

上面是抓取網(wǎng)頁的代碼，下面則是向某個網(wǎng)頁POST數(shù)據(jù)。假設我們有一個處理表單的網(wǎng)址，其可以接受兩個表單域，一個是電話號碼，一個是短信內容。

?php

$phoneNumber = '13912345678';

$message = 'This message was generated by curl and php';

$curlPost = 'pNUMBER=' . urlencode($phoneNumber) . 'MESSAGE=' . urlencode($message) . 'SUBMIT=Send';

$ch = curl_init();

curl_setopt($ch, CURLOPT_URL, '');

curl_setopt($ch, CURLOPT_HEADER, 1);

curl_setopt($ch, CURLOPT_RETURNTRANSFER, 1);

curl_setopt($ch, CURLOPT_POST, 1);

curl_setopt($ch, CURLOPT_POSTFIELDS, $curlPost);

$data = curl_exec();curl_close($ch);

從上面的程序我們可以看到，使用CURLOPT_POST設置HTTP協(xié)議的POST方法，而不是GET方法，然后以CURLOPT_POSTFIELDS設置POST的數(shù)據(jù)。

關于代理服務器

下面是一個如何使用代理服務器的示例。請注意其中高亮的代碼，代碼很簡單，我就不用多說了。

?php

$ch = curl_init();

curl_setopt($ch, CURLOPT_URL, '');

curl_setopt($ch, CURLOPT_HEADER, 1);

curl_setopt($ch, CURLOPT_RETURNTRANSFER, 1);

curl_setopt($ch, CURLOPT_HTTPPROXYTUNNEL, 1);

curl_setopt($ch, CURLOPT_PROXY, 'fakeproxy.com:1080');

curl_setopt($ch, CURLOPT_PROXYUSERPWD, 'user:password');

$data = curl_exec();curl_close($ch);

關于SSL和Cookie

關于SSL也就是HTTPS協(xié)議，你只需要把CURLOPT_URL連接中的http://變成https://就可以了。當然，還有一個參數(shù)叫CURLOPT_SSL_VERIFYHOST可以設置為驗證站點。

關于Cookie，你需要了解下面三個參數(shù)：

CURLOPT_COOKIE，在當面的會話中設置一個cookie

CURLOPT_COOKIEJAR，當會話結束的時候保存一個Cookie

CURLOPT_COOKIEFILE，Cookie的文件。

HTTP服務器認證

最后，我們來看一看HTTP服務器認證的情況。

?php

$ch = curl_init();

curl_setopt($ch, CURLOPT_URL, '');

curl_setopt($ch, CURLOPT_RETURNTRANSFER, 1);

curl_setopt($ch, CURLOPT_HTTPAUTH, CURLAUTH_BASIC);

curl_setopt(CURLOPT_USERPWD, '[username]:[password]')

$data = curl_exec();

curl_close($ch);

php curl 模擬登錄并獲取數(shù)據(jù)實例詳解

PHP的curl()在抓取網(wǎng)頁的效率方面是比較高的，而且支持多線程，而file_get_contents()效率就要稍低些，當然，使用curl時需要開啟下curl擴展。

代碼實戰(zhàn)

先來看登錄部分的代碼：

//模擬登錄

function

login_post($url,

$cookie,

$post)

{

$curl

curl_init();//初始化curl模塊

curl_setopt($curl,

CURLOPT_URL,

$url);//登錄提交的地址

curl_setopt($curl,

CURLOPT_HEADER,

0);//是否顯示頭信息

curl_setopt($curl,

CURLOPT_RETURNTRANSFER,

0);//是否自動顯示返回的信息

curl_setopt($curl,

CURLOPT_COOKIEJAR,

$cookie);

//設置Cookie信息保存在指定的文件中

curl_setopt($curl,

CURLOPT_POST,

1);//post方式提交

curl_setopt($curl,

CURLOPT_POSTFIELDS,

http_build_query($post));//要提交的信息

curl_exec($curl);//執(zhí)行cURL

curl_close($curl);//關閉cURL資源，并且釋放系統(tǒng)資源

}

函數(shù)login_post()首先初始化curl_init()，然后使用curl_setopt()設置相關選項信息，包括要提交的url地址，保存的cookie文件，post的數(shù)據(jù)（用戶名和密碼等信息），是否返回信息等等，然后curl_exec執(zhí)行curl，最后curl_close()釋放資源。注意PHP自帶的http_build_query()可以將數(shù)組轉換成相連接的字符串。

接下來如果登錄成功后，我們要獲取登錄成功后的頁面信息。

//登錄成功后獲取數(shù)據(jù)

function

get_content($url,

$cookie)

{

$ch

curl_init();

curl_setopt($ch,

CURLOPT_URL,

$url);

curl_setopt($ch,

CURLOPT_HEADER,

0);

curl_setopt($ch,

CURLOPT_RETURNTRANSFER,

1);

curl_setopt($ch,

CURLOPT_COOKIEFILE,

$cookie);

//讀取cookie

$rs

curl_exec($ch);

//執(zhí)行cURL抓取頁面內容

curl_close($ch);

return

$rs;

}

函數(shù)get_content()中也是先初始化curl，然后設置相關選項，執(zhí)行curl，釋放資源。其中我們設置CURLOPT_RETURNTRANSFER為1即自動返回信息，而CURLOPT_COOKIEFILE可以讀取到登錄時保存的cookie信息，最后將頁面內容返回。

我們的最終目的是要獲取到模擬登錄后的信息，也就是只有正常登錄成功后才能獲取的有用信息。接下來我們以登錄開源中國的移動版為例，看看如何抓取到登錄成功后的信息。

//設置post的數(shù)據(jù)

$post

array

(

'email'

'oschina賬戶',

'pwd'

'oschina密碼',

'goto_page'

'/my',

'error_page'

'/login',

'save_login'

'1',

'submit'

'現(xiàn)在登錄'

);

//登錄地址

$url

"";

//設置cookie保存路徑

$cookie

dirname(__FILE__)

'/cookie_oschina.txt';

//登錄后要獲取信息的地址

$url2

"";

//模擬登錄

login_post($url,

$cookie,

$post);

//獲取登錄頁的信息

$content

get_content($url2,

$cookie);

//刪除cookie文件

unlink($cookie);

//匹配頁面信息

$preg

"/td

class='portrait'(.*)\/td/i";

preg_match_all($preg,

$content,

$arr);

$str

$arr[1][0];

//輸出內容

echo

$str;

使用總結

1、初始化curl；

2、使用curl_setopt設置目標url，和其他選項；

3、curl_exec，執(zhí)行curl；

4、執(zhí)行后，關閉curl；

5、輸出數(shù)據(jù)。

感謝閱讀，希望能幫助到大家，謝謝大家對本站的支持！

php的curl怎么爬取網(wǎng)頁內容

創(chuàng)建一個新cURL資源

設置URL和相應的選項

抓取URL并把它傳遞給瀏覽器

關閉cURL資源，并且釋放系統(tǒng)資源

代碼案例：

本文題目：phpcurl怕數(shù)據(jù) phpcurl詳解
文章分享：http://weahome.cn/article/higihc.html

真实的国产乱ⅩXXX66竹夫人,五月香六月婷婷激情综合,亚洲日本VA一区二区三区,亚洲精品一区二区三区麻豆

phpcurl怕數(shù)據(jù) phpcurl詳解

php中curl爬蟲怎么樣通過網(wǎng)頁獲取所有鏈接

通過PHP 的 curl 如何抓取進港碼頭的數(shù)據(jù)？

php curl 模擬登錄并獲取數(shù)據(jù)實例詳解

php的curl怎么爬取網(wǎng)頁內容

其他資訊

網(wǎng)站制作

企業(yè)服務

網(wǎng)站建設

服務器托管

真实的国产乱ⅩXXX66竹夫人,五月香六月婷婷激情综合,亚洲日本VA一区二区三区,亚洲精品一区二区三区麻豆

phpcurl怕數(shù)據(jù) phpcurl詳解

php中curl爬蟲 怎么樣通過網(wǎng)頁獲取所有鏈接

通過PHP 的 curl 如何抓取進港碼頭的數(shù)據(jù)？

php curl 模擬登錄并獲取數(shù)據(jù)實例詳解

php的curl怎么爬取網(wǎng)頁內容

其他資訊

網(wǎng)站制作

企業(yè)服務

網(wǎng)站建設

服務器托管

php中curl爬蟲怎么樣通過網(wǎng)頁獲取所有鏈接