您好,登錄后才能下訂單哦!
這篇文章主要講解了“如何用Storm來寫一個Crawler的工具”,文中的講解內(nèi)容簡單清晰,易于學習與理解,下面請大家跟著小編的思路慢慢深入,一起來研究和學習“如何用Storm來寫一個Crawler的工具”吧!
閱讀背景:
1: 您可能需要了解基本的爬蟲知識。
2:您可能需要對HTTP協(xié)議有初步了解。
3:您可能需要對Storm計算的邏輯有初步的了解。
package com.digitalpebble.storm.crawler; import backtype.storm.Config; import backtype.storm.LocalCluster; import backtype.storm.StormSubmitter; import backtype.storm.topology.TopologyBuilder; import backtype.storm.tuple.Fields; import com.digitalpebble.storm.crawler.bolt.IPResolutionBolt; import com.digitalpebble.storm.crawler.bolt.indexing.IndexerBolt; import com.digitalpebble.storm.crawler.bolt.parser.ParserBolt; import com.digitalpebble.storm.crawler.fetcher.Fetcher; import com.digitalpebble.storm.crawler.spout.RandomURLSpout; /** * 整體爬蟲引擎的topology */ public class CrawlTopology { public static void main(String[] args) throws Exception { TopologyBuilder builder = new TopologyBuilder(); builder.setSpout("spout", new RandomURLSpout()); builder.setBolt("ip", new IPResolutionBolt()).shuffleGrouping("spout"); builder.setBolt("fetch", new Fetcher()).fieldsGrouping("ip", new Fields("ip")); builder.setBolt("parse", new ParserBolt()).shuffleGrouping("fetch"); builder.setBolt("index", new IndexerBolt()).shuffleGrouping("parse"); Config conf = new Config(); conf.setDebug(true); conf.registerMetricsConsumer(DebugMetricConsumer.class); if (args != null && args.length > 0) { conf.setNumWorkers(3); StormSubmitter.submitTopology(args[0], conf, builder.createTopology()); } else { conf.setMaxTaskParallelism(3); LocalCluster cluster = new LocalCluster(); cluster.submitTopology("crawl", conf, builder.createTopology()); Thread.sleep(10000); cluster.shutdown(); } } }
感謝各位的閱讀,以上就是“如何用Storm來寫一個Crawler的工具”的內(nèi)容了,經(jīng)過本文的學習后,相信大家對如何用Storm來寫一個Crawler的工具這一問題有了更深刻的體會,具體使用情況還需要大家實踐驗證。這里是億速云,小編將為大家推送更多相關(guān)知識點的文章,歡迎關(guān)注!
免責聲明:本站發(fā)布的內(nèi)容(圖片、視頻和文字)以原創(chuàng)、轉(zhuǎn)載和分享為主,文章觀點不代表本網(wǎng)站立場,如果涉及侵權(quán)請聯(lián)系站長郵箱:is@yisu.com進行舉報,并提供相關(guān)證據(jù),一經(jīng)查實,將立刻刪除涉嫌侵權(quán)內(nèi)容。