Python實現(xiàn)網(wǎng)頁爬蟲基本實現(xiàn)代碼怎么編寫

發(fā)布時間：2021-11-24 09:57:13 來源：億速云閱讀：343 作者：柒染欄目：編程語言

Python實現(xiàn)網(wǎng)頁爬蟲基本實現(xiàn)代碼怎么編寫，很多新手對此不是很清楚，為了幫助大家解決這個難題，下面小編將為大家詳細(xì)講解，有這方面需求的人可以來學(xué)習(xí)下，希望你能有所收獲。

Python是一款功能強大的計算機程序語言，同時也可以被看做是一款面向?qū)ο蟮耐ㄓ眯驼Z言。它的功能特點比較突出，極大的方便開發(fā)人員應(yīng)用。在這里我們先來一起了解一下有關(guān)Python實現(xiàn)網(wǎng)頁爬蟲的方法。

今天看到一個網(wǎng)頁，又因為在家里用電話線上網(wǎng)，一直在線閱讀很麻煩。所以就寫了個簡單的程序把網(wǎng)頁抓下來離線閱讀，省點電話費：）這個程序因為主頁面鏈接到的頁面都在同一個目錄下，結(jié)構(gòu)很簡單，只有一層。因此寫了一些硬編碼做鏈接地址的分析。

Python實現(xiàn)網(wǎng)頁爬蟲代碼如下：

#!/usr/bin/env python  # -*- coding: GBK -*-  import urllib  from sgmllib import SGMLParser  class URLLister(SGMLParser):  def reset(self):  SGMLParser.reset(self)  self.urls = []  def start_a(self, attrs):  href = [v for k, v in attrs if k == 'href']  if href:  self.urls.extend(href)  url = r'http://www.sinc.sunysb.edu/Clubs/buddhism/JinGangJingShuoShenMo/' sock = urllib.urlopen(url)  htmlSource = sock.read()  sock.close()  #print htmlSource  f = file('jingangjing.html', 'w')  f.write(htmlSource)  f.close()  mypath = r'http://www.sinc.sunysb.edu/Clubs/buddhism/JinGangJingShuoShenMo/' parser = URLLister()  parser.feed(htmlSource)  for url in parser.urls:  myurl = mypath + url  print "get: " + myurl  sock2 = urllib.urlopen(myurl)  html2 = sock2.read()  sock2.close()  # 保存到文件  print "save as: " + url  f2 = file(url, 'w')  f2.write(html2)  f2.close()

看完上述內(nèi)容是否對您有幫助呢？如果還想對相關(guān)知識有進(jìn)一步的了解或閱讀更多相關(guān)文章，請關(guān)注億速云行業(yè)資訊頻道，感謝您對億速云的支持。

向AI問一下細(xì)節(jié)

Python實現(xiàn)網(wǎng)頁爬蟲基本實現(xiàn)代碼怎么編寫

猜你喜歡

最新資訊

相關(guān)推薦

相關(guān)標(biāo)簽