如何用Storm來寫一個Crawler的工具

發(fā)布時間：2021-12-23 14:22:19 來源：億速云閱讀：103 作者：iii 欄目：云計算

這篇文章主要講解了“如何用Storm來寫一個Crawler的工具”，文中的講解內(nèi)容簡單清晰，易于學習與理解，下面請大家跟著小編的思路慢慢深入，一起來研究和學習“如何用Storm來寫一個Crawler的工具”吧！

閱讀背景：

1：您可能需要了解基本的爬蟲知識。

2：您可能需要對HTTP協(xié)議有初步了解。

3：您可能需要對Storm計算的邏輯有初步的了解。

package com.digitalpebble.storm.crawler;

import backtype.storm.Config;
import backtype.storm.LocalCluster;
import backtype.storm.StormSubmitter;
import backtype.storm.topology.TopologyBuilder;
import backtype.storm.tuple.Fields;

import com.digitalpebble.storm.crawler.bolt.IPResolutionBolt;
import com.digitalpebble.storm.crawler.bolt.indexing.IndexerBolt;
import com.digitalpebble.storm.crawler.bolt.parser.ParserBolt;
import com.digitalpebble.storm.crawler.fetcher.Fetcher;
import com.digitalpebble.storm.crawler.spout.RandomURLSpout;

/**
 * 整體爬蟲引擎的topology
 */
public class CrawlTopology {

	public static void main(String[] args) throws Exception {

		TopologyBuilder builder = new TopologyBuilder();

		builder.setSpout("spout", new RandomURLSpout());

		builder.setBolt("ip", new IPResolutionBolt()).shuffleGrouping("spout");

		builder.setBolt("fetch", new Fetcher()).fieldsGrouping("ip",
				new Fields("ip"));

		builder.setBolt("parse", new ParserBolt()).shuffleGrouping("fetch");

		builder.setBolt("index", new IndexerBolt()).shuffleGrouping("parse");

		Config conf = new Config();
		conf.setDebug(true);
		conf.registerMetricsConsumer(DebugMetricConsumer.class);

		if (args != null && args.length > 0) {
			conf.setNumWorkers(3);

			StormSubmitter.submitTopology(args[0], conf,
					builder.createTopology());
		} else {
			conf.setMaxTaskParallelism(3);

			LocalCluster cluster = new LocalCluster();
			cluster.submitTopology("crawl", conf, builder.createTopology());

			Thread.sleep(10000);

			cluster.shutdown();
		}
	}
}

如何用Storm來寫一個Crawler的工具

感謝各位的閱讀，以上就是“如何用Storm來寫一個Crawler的工具”的內(nèi)容了，經(jīng)過本文的學習后，相信大家對如何用Storm來寫一個Crawler的工具這一問題有了更深刻的體會，具體使用情況還需要大家實踐驗證。這里是億速云，小編將為大家推送更多相關(guān)知識點的文章，歡迎關(guān)注！

向AI問一下細節(jié)

如何用Storm來寫一個Crawler的工具

猜你喜歡

最新資訊

相關(guān)推薦

相關(guān)標簽