溫馨提示×

溫馨提示×

您好，登錄后才能下訂單哦！

密碼登錄×

忘記密碼？

登錄注冊×

獲取短信驗證碼

其他方式登錄

點擊登錄注冊即表示同意《億速云用戶服務(wù)條款》

用戶登錄×

賬戶密碼登錄

請使用微信掃描上方二維碼

使用幫助

請求超時！

請點擊重新獲取二維碼

python中scrapy指的是什么

發(fā)布時間：2020-11-21 11:42:56 來源：億速云閱讀：117 作者：小新欄目：編程語言

這篇文章主要介紹python中scrapy指的是什么，文中介紹的非常詳細，具有一定的參考價值，感興趣的小伙伴們一定要看完！

Scrapy是Python開發(fā)的一個快速、高層次的屏幕抓取和web抓取框架，用于抓取web站點并從頁面中提取結(jié)構(gòu)化的數(shù)據(jù)。Scrapy用途廣泛，可以用于數(shù)據(jù)挖掘、監(jiān)測和自動化測試。

Scrapy吸引人的地方在于它是一個框架，任何人都可以根據(jù)需求方便的修改。它也提供了多種類型爬蟲的基類，如BaseSpider、sitemap爬蟲等，最新版本又提供了web2.0爬蟲的支持。

基本功能

Scrapy是一個為爬取網(wǎng)站數(shù)據(jù)、提取結(jié)構(gòu)性數(shù)據(jù)而設(shè)計的應(yīng)用程序框架，它可以應(yīng)用在廣泛領(lǐng)域：Scrapy 常應(yīng)用在包括數(shù)據(jù)挖掘，信息處理或存儲歷史數(shù)據(jù)等一系列的程序中。通常我們可以很簡單的通過 Scrapy 框架實現(xiàn)一個爬蟲，抓取指定網(wǎng)站的內(nèi)容或圖片。

盡管Scrapy原本是設(shè)計用來屏幕抓取（更精確的說，是網(wǎng)絡(luò)抓?。部梢杂脕碓L問API來提取數(shù)據(jù)。

Scrapy架構(gòu)

Scrapy Engine(引擎)：負責(zé)Spider、ItemPipeline、Downloader、Scheduler中間的通訊，信號、數(shù)據(jù)傳遞等。

Scheduler(調(diào)度器)：它負責(zé)接受引擎發(fā)送過來的Request請求，并按照一定的方式進行整理排列，入隊，當(dāng)引擎需要時，交還給引擎。

Downloader（下載器）：負責(zé)下載Scrapy Engine(引擎)發(fā)送的所有Requests請求，并將其獲取到的Responses交還給Scrapy Engine(引擎)，由引擎交給Spider來處理。

Spider（爬蟲）：它負責(zé)處理所有Responses,從中分析提取數(shù)據(jù)，獲取Item字段需要的數(shù)據(jù)，并將需要跟進的URL提交給引擎，再次進入Scheduler(調(diào)度器)。

Item Pipeline(管道)：它負責(zé)處理Spider中獲取到的Item，并進行進行后期處理（詳細分析、過濾、存儲等）的地方。

Downloader Middlewares（下載中間件）：一個可以自定義擴展下載功能的組件。

Spider Middlewares（Spider中間件）：一個可以自定擴展和操作引擎和Spider中間通信的功能組件。

以上是python中scrapy指的是什么的所有內(nèi)容，感謝各位的閱讀！希望分享的內(nèi)容對大家有幫助，更多相關(guān)知識，歡迎關(guān)注億速云行業(yè)資訊頻道！

向AI問一下細節(jié)

推薦閱讀：

免責(zé)聲明：本站發(fā)布的內(nèi)容（圖片、視頻和文字）以原創(chuàng)、轉(zhuǎn)載和分享為主，文章觀點不代表本網(wǎng)站立場，如果涉及侵權(quán)請聯(lián)系站長郵箱：is@yisu.com進行舉報，并提供相關(guān)證據(jù)，一經(jīng)查實，將立刻刪除涉嫌侵權(quán)內(nèi)容。

上一篇新聞：
python算不算是高級語
下一篇新聞：
python有哪些高級特性

猜你喜歡

AI
助
手

產(chǎn)品服務(wù)

地區(qū)劃分

專題活動

幫助支持

關(guān)于我們

售后咨詢

7*24小時在線電話：400-100-2938

7*24小時在線 QQ：800811969

關(guān)注億速云

億速云公眾號

手機網(wǎng)站二維碼

<ins id="g0h40"></ins>

<progress id="g0h40"><menu id="g0h40"></menu></progress>