您好,登錄后才能下訂單哦!
這篇文章主要介紹“php只抓取網(wǎng)頁頭的方法是什么”,在日常操作中,相信很多人在php只抓取網(wǎng)頁頭的方法是什么問題上存在疑惑,小編查閱了各式資料,整理出簡單好用的操作方法,希望對大家解答”php只抓取網(wǎng)頁頭的方法是什么”的疑惑有所幫助!接下來,請跟著小編一起來學習吧!
php只抓取網(wǎng)頁頭的方法:1、使用get_headers()函數(shù);2、使用http_response_header方法;3、使用stream_get_meta_data()函數(shù);4、使用php CURL來獲取網(wǎng)頁頭即可。
本文操作環(huán)境:windows7系統(tǒng)、PHP7.1版、DELL G3電腦
php如何只抓取網(wǎng)頁頭?
php獲取網(wǎng)頁header信息的4種方法
php獲取網(wǎng)頁header信息的方法多種多樣,就php語言來說,我知道的方法有4種, 下面逐一獻上。
方法一:使用get_headers()函數(shù)
推薦指數(shù): ★★★★★
get_header方法最簡單只要兩行代碼即可搞定。如下:
$thisurl = "http://www.lao8.org/"; print_r(get_headers($thisurl, 1));
得到的結(jié)果為:
Array ( [0] => HTTP/1.1 200 OK [Cache-Control] => max-age=86400 [Content-Length] => 76102 [Content-Type] => text/html [Content-Location] => http://www.lao8.org/index.html [Last-Modified] => Fri, 19 Jul 2013 03:52:30 GMT [Accept-Ranges] => bytes [ETag] => "50bc48643384ce1:5cb3" [Server] => Microsoft-IIS/6.0 [X-Powered-By] => ASP.NET [Date] => Fri, 19 Jul 2013 09:06:39 GMT [Connection] => close )
方法二:使用http_response_header
推薦指數(shù): ★★★
http_response_headerf方法也很簡單,僅三行:
$thisurl = "http://www.lao8.org"; $html = file_get_contents($thisurl ); print_r($http_response_header);
得到的結(jié)果為:
Array ( [0] => HTTP/1.1 200 OK [1] => Cache-Control: max-age=86400 [2] => Content-Length: 76102 [3] => Content-Type: text/html [4] => Content-Location: http://www.lao8.org/index.html [5] => Last-Modified: Fri, 19 Jul 2013 03:52:30 GMT [6] => Accept-Ranges: bytes [7] => ETag: "50bc48643384ce1:5cb3" [8] => Server: Microsoft-IIS/6.0 [9] => X-Powered-By: ASP.NET [10] => Date: Fri, 19 Jul 2013 09:06:41 GMT [11] => Connection: close )
方法三:使用stream_get_meta_data()函數(shù)
推薦指數(shù): ★★★
使用stream_get_meta_data()代碼也只需三行:
$thisurl = "http://www.lao8.org/"; $fp = fopen($thisurl, 'r'); print_r(stream_get_meta_data($fp));
得到的結(jié)果為:
Array ( [wrapper_data] => Array ( [0] => HTTP/1.1 200 OK [1] => Cache-Control: max-age=86400 [2] => Content-Length: 76102 [3] => Content-Type: text/html [4] => Content-Location: http://www.lao8.org/index.html [5] => Last-Modified: Fri, 19 Jul 2013 03:52:30 GMT [6] => Accept-Ranges: bytes [7] => ETag: "50bc48643384ce1:5cb3" [8] => Server: Microsoft-IIS/6.0 [9] => X-Powered-By: ASP.NET [10] => Date: Fri, 19 Jul 2013 09:06:41 GMT [11] => Connection: close ) [wrapper_type] => http [stream_type] => tcp_socket [mode] => r+ [unread_bytes] => 1086 [seekable] => [uri] => http://www.lao8.org/ [timed_out] => [blocked] => 1 [eof] => )
第四種方法: 使用php的高級函數(shù) CURL()來獲取
推薦指數(shù): ★★★★
上面的三種方法能獲取一般的網(wǎng)頁header信息,如果想要獲取更詳細的header信息比如網(wǎng)頁是否啟用了GZip壓縮。這時候可以用php的高級函數(shù)curl()來獲取。
使用curl獲得header可以檢測GZip壓縮
先貼出代碼:
<?php $szUrl = 'http://www.lao8.org/'; $curl = curl_init(); curl_setopt($curl, CURLOPT_URL, $szUrl); curl_setopt($curl, CURLOPT_HEADER, 1); //輸出header信息 curl_setopt($curl, CURLOPT_RETURNTRANSFER, 1); //不顯示網(wǎng)頁內(nèi)容 curl_setopt($curl, CURLOPT_ENCODING, ''); //允許執(zhí)行g(shù)zip $data=curl_exec($curl); if(!curl_errno($curl)) { $info = curl_getinfo($curl); $httpHeaderSize = $info['header_size']; //header字符串體積 $pHeader = substr($data, 0, $httpHeaderSize); //獲得header字符串 $split = array("rn", "n", "r"); //需要格式化header字符串 $pHeader = str_replace($split, '<br>', $pHeader); //使用<br>換行符格式化輸出到網(wǎng)頁上 echo $pHeader; } ?>
輸出結(jié)果如下:
HTTP/1.1 200 OK Cache-Control: max-age=86400 Content-Length: 15189 Content-Type: text/html Content-Encoding: gzip Content-Location: http://www.lao8.org/index.html Last-Modified: Fri, 19 Jul 2013 03:52:28 GMT Accept-Ranges: bytes ETag: "0268633384ce1:5cb3" Vary: Accept-Encoding Server: Microsoft-IIS/6.0 X-Powered-By: ASP.NET Date: Fri, 19 Jul 2013 09:27:21 GMT
可以看到使用curl獲取到的header信息多了這行:Content-Encoding: gzip,網(wǎng)頁啟用了GZip壓縮。
到此,關(guān)于“php只抓取網(wǎng)頁頭的方法是什么”的學習就結(jié)束了,希望能夠解決大家的疑惑。理論與實踐的搭配能更好的幫助大家學習,快去試試吧!若想繼續(xù)學習更多相關(guān)知識,請繼續(xù)關(guān)注億速云網(wǎng)站,小編會繼續(xù)努力為大家?guī)砀鄬嵱玫奈恼拢?/p>
免責聲明:本站發(fā)布的內(nèi)容(圖片、視頻和文字)以原創(chuàng)、轉(zhuǎn)載和分享為主,文章觀點不代表本網(wǎng)站立場,如果涉及侵權(quán)請聯(lián)系站長郵箱:is@yisu.com進行舉報,并提供相關(guān)證據(jù),一經(jīng)查實,將立刻刪除涉嫌侵權(quán)內(nèi)容。