溫馨提示×

溫馨提示×

您好,登錄后才能下訂單哦!

密碼登錄×
登錄注冊×
其他方式登錄
點擊 登錄注冊 即表示同意《億速云用戶服務(wù)條款》

Python實現(xiàn)網(wǎng)頁爬蟲基本實現(xiàn)代碼怎么編寫

發(fā)布時間:2021-11-24 09:57:13 來源:億速云 閱讀:343 作者:柒染 欄目:編程語言

Python實現(xiàn)網(wǎng)頁爬蟲基本實現(xiàn)代碼怎么編寫,很多新手對此不是很清楚,為了幫助大家解決這個難題,下面小編將為大家詳細(xì)講解,有這方面需求的人可以來學(xué)習(xí)下,希望你能有所收獲。

Python是一款功能強大的計算機程序語言,同時也可以被看做是一款面向?qū)ο蟮耐ㄓ眯驼Z言。它的功能特點比較突出,極大的方便開發(fā)人員應(yīng)用。在這里我們先來一起了解一下有關(guān)Python實現(xiàn)網(wǎng)頁爬蟲的方法。

今天看到一個網(wǎng)頁,又因為在家里用電話線上網(wǎng),一直在線閱讀很麻煩。所以就寫了個簡單的程序把網(wǎng)頁抓下來離線閱讀,省點電話費:)這個程序因為主頁面鏈接到的頁面都在同一個目錄下,結(jié)構(gòu)很簡單,只有一層。因此寫了一些硬編碼做鏈接地址的分析。

Python實現(xiàn)網(wǎng)頁爬蟲代碼如下:

#!/usr/bin/env python  # -*- coding: GBK -*-  import urllib  from sgmllib import SGMLParser  class URLLister(SGMLParser):  def reset(self):  SGMLParser.reset(self)  self.urls = []  def start_a(self, attrs):  href = [v for k, v in attrs if k == 'href']  if href:  self.urls.extend(href)  url = r'http://www.sinc.sunysb.edu/Clubs/buddhism/JinGangJingShuoShenMo/' sock = urllib.urlopen(url)  htmlSource = sock.read()  sock.close()  #print htmlSource  f = file('jingangjing.html', 'w')  f.write(htmlSource)  f.close()  mypath = r'http://www.sinc.sunysb.edu/Clubs/buddhism/JinGangJingShuoShenMo/' parser = URLLister()  parser.feed(htmlSource)  for url in parser.urls:  myurl = mypath + url  print "get: " + myurl  sock2 = urllib.urlopen(myurl)  html2 = sock2.read()  sock2.close()  # 保存到文件  print "save as: " + url  f2 = file(url, 'w')  f2.write(html2)  f2.close()

看完上述內(nèi)容是否對您有幫助呢?如果還想對相關(guān)知識有進(jìn)一步的了解或閱讀更多相關(guān)文章,請關(guān)注億速云行業(yè)資訊頻道,感謝您對億速云的支持。

向AI問一下細(xì)節(jié)

免責(zé)聲明:本站發(fā)布的內(nèi)容(圖片、視頻和文字)以原創(chuàng)、轉(zhuǎn)載和分享為主,文章觀點不代表本網(wǎng)站立場,如果涉及侵權(quán)請聯(lián)系站長郵箱:is@yisu.com進(jìn)行舉報,并提供相關(guān)證據(jù),一經(jīng)查實,將立刻刪除涉嫌侵權(quán)內(nèi)容。

AI