對于第一項表單而言
麻陽網(wǎng)站建設公司創(chuàng)新互聯(lián)公司,麻陽網(wǎng)站設計制作,有大型網(wǎng)站制作公司豐富經(jīng)驗。已為麻陽1000+提供企業(yè)網(wǎng)站建設服務。企業(yè)網(wǎng)站搭建\外貿(mào)營銷網(wǎng)站建設要多少錢,請找那個售后服務好的麻陽做網(wǎng)站的公司定做!
比如:
內(nèi)容的第一頁
內(nèi)容的第二頁
那么表單填.html
分析規(guī)則就是對比第一頁與第二頁的網(wǎng)址從左到右哪個字符出現(xiàn)不同,就把第一頁網(wǎng)址之后的字符復制出來
如果是這種情況
;page=1
;page=2
對于這種情況,他后面不同的是一個數(shù)字,即是頁碼數(shù)字的話,就不需要填寫.留空即可
對于第二項表單而言
第一頁
第二頁
那么右邊的表單填_[page].htm
分析規(guī)則就是對比第一頁與第二頁的網(wǎng)址從左到右哪個字符出現(xiàn)不同,就把第二頁的網(wǎng)址之后的字符復制出來,并把變動的頁碼數(shù)字用[page]替換
如果是這種情況
;page=1
;page=2
對于這種情況,他后面不同的是一個數(shù)字,即是頁碼數(shù)字的話,更簡單,只需要填寫[page]即可
對于第三項表單而言
第一頁
第二頁
此時屬于怪癖的,理論上應該是
第三頁
所以表單請選擇是,但一般情況都是選否的,也就是說頁碼數(shù)字為1卻是第二頁.頁碼數(shù)為2卻是第三頁.就屬于特殊現(xiàn)象.需要選則是.
可以用以下4個方法來抓取網(wǎng)站 的數(shù)據(jù):
1. 用 file_get_contents 以 get 方式獲取內(nèi)容:
?
$url = '';
$html = file_get_contents($url);
echo $html;
2. 用fopen打開url,以get方式獲取內(nèi)容
?
$url = '';
$fp = fopen($url, 'r');
stream_get_meta_data($fp);
$result = '';
while(!feof($fp))
{
$result .= fgets($fp, 1024);
}
echo "url body: $result";
fclose($fp);
3. 用file_get_contents函數(shù),以post方式獲取url
?
$data = array(
'foo'='bar',
'baz'='boom',
'site'='',
'name'='nowa magic');
$data = http_build_query($data);
//$postdata = http_build_query($data);
$options = array(
'http' = array(
'method' = 'POST',
'header' = 'Content-type:application/x-www-form-urlencoded',
'content' = $data
//'timeout' = 60 * 60 // 超時時間(單位:s)
)
);
$url = "";
$context = stream_context_create($options);
$result = file_get_contents($url, false, $context);
echo $result;
4、使用curl庫,使用curl庫之前,可能需要查看一下php.ini是否已經(jīng)打開了curl擴展
$url = '';
$ch = curl_init();
$timeout = 5;
curl_setopt ($ch, CURLOPT_URL, $url);
curl_setopt ($ch, CURLOPT_RETURNTRANSFER, 1);
curl_setopt ($ch, CURLOPT_CONNECTTIMEOUT, $timeout);
$file_contents = curl_exec($ch);
curl_close($ch);
echo $file_contents;
用curl獲取到整個頁面的html,然后用正則去匹配。我采集小說就是這么采集的,如果目標網(wǎng)站做了防采集,你就需要在curl中指定header來模擬瀏覽器了。
這段數(shù)據(jù)頭很好匹配,終點在于結(jié)尾的匹配
那么這段字符串的最顯著結(jié)尾就是']})'這個字符串了(這字符串應該是json,但是如果是json,結(jié)尾應該是']})]}'這樣的五個括號,這里姑且按照你提供的']})'數(shù)據(jù)來匹配)
所以正則可以這樣寫
$str=file_get_contents('');
preg_match('/listData = ({.*?}]})/si',$str,$match);
echo $match[1].']}';
這樣輸出出來是一個完整的json
還有一種方法是用正則的平衡組匹配,但是寫起來太過麻煩,而且因為這段json少了']}'兩個括號,造成平衡組不平衡,所以在方法一可用的情況下,不推薦此寫法
這個是平衡組匹配的相關資料:網(wǎng)頁鏈接
當前標題:包含php抓取網(wǎng)易數(shù)據(jù)的詞條
鏈接URL:http://www.chinadenli.net/article46/doojchg.html
成都網(wǎng)站建設公司_創(chuàng)新互聯(lián),為您提供商城網(wǎng)站、軟件開發(fā)、網(wǎng)站內(nèi)鏈、建站公司、營銷型網(wǎng)站建設、
聲明:本網(wǎng)站發(fā)布的內(nèi)容(圖片、視頻和文字)以用戶投稿、用戶轉(zhuǎn)載內(nèi)容為主,如果涉及侵權請盡快告知,我們將會在第一時間刪除。文章觀點不代表本網(wǎng)站立場,如需處理請聯(lián)系客服。電話:028-86922220;郵箱:631063699@qq.com。內(nèi)容未經(jīng)允許不得轉(zhuǎn)載,或轉(zhuǎn)載時需注明來源: 創(chuàng)新互聯(lián)