<tr id="kiegu"><sup id="kiegu"></sup></tr>

溫馨提示×

溫馨提示×

您好，登錄后才能下訂單哦！

密碼登錄×

忘記密碼？

登錄注冊(cè)×

獲取短信驗(yàn)證碼

其他方式登錄

點(diǎn)擊登錄注冊(cè) 即表示同意《億速云用戶服務(wù)條款》

用戶登錄×

賬戶密碼登錄

請(qǐng)使用微信掃描上方二維碼

使用幫助

請(qǐng)求超時(shí)！

請(qǐng)點(diǎn)擊重新獲取二維碼

hadoop中map的個(gè)數(shù)是多少

發(fā)布時(shí)間：2021-12-09 14:44:53 來源：億速云閱讀：143 作者：iii 欄目：云計(jì)算

這篇文章主要介紹“hadoop中map的個(gè)數(shù)是多少”，在日常操作中，相信很多人在hadoop中map的個(gè)數(shù)是多少問題上存在疑惑，小編查閱了各式資料，整理出簡(jiǎn)單好用的操作方法，希望對(duì)大家解答”hadoop中map的個(gè)數(shù)是多少”的疑惑有所幫助！接下來，請(qǐng)跟著小編一起來學(xué)習(xí)吧！

hadooop提供了一個(gè)設(shè)置map個(gè)數(shù)的參數(shù)mapred.map.tasks，我們可以通過這個(gè)參數(shù)來控制map的個(gè)數(shù)。但是通過這種方式設(shè)置map的個(gè)數(shù)，并不是每次都有效的。原因是mapred.map.tasks只是一個(gè)hadoop的參考數(shù)值，最終map的個(gè)數(shù)，還取決于其他的因素。
為了方便介紹，先來看幾個(gè)名詞：
block_size : hdfs的文件塊大小，默認(rèn)為64M，可以通過參數(shù)dfs.block.size設(shè)置
total_size : 輸入文件整體的大小
input_file_num : 輸入文件的個(gè)數(shù)

（1）默認(rèn)map個(gè)數(shù)
如果不進(jìn)行任何設(shè)置，默認(rèn)的map個(gè)數(shù)是和blcok_size相關(guān)的。
default_num = total_size / block_size;

（2）期望大小
可以通過參數(shù)mapred.map.tasks來設(shè)置程序員期望的map個(gè)數(shù)，但是這個(gè)個(gè)數(shù)只有在大于default_num的時(shí)候，才會(huì)生效。
goal_num = mapred.map.tasks;

（3）設(shè)置處理的文件大小
     可以通過mapred.min.split.size 設(shè)置每個(gè)task處理的文件大小，但是這個(gè)大小只有在大于block_size的時(shí)候才會(huì)生效。
     split_size = max(mapred.min.split.size, block_size);
     split_num = total_size / split_size;

（4）計(jì)算的map個(gè)數(shù)
compute_map_num = min(split_num, max(default_num, goal_num))

除了這些配置以外，mapreduce還要遵循一些原則。 mapreduce的每一個(gè)map處理的數(shù)據(jù)是不能跨越文件的，也就是說min_map_num >= input_file_num。所以，最終的map個(gè)數(shù)應(yīng)該為：
final_map_num = max(compute_map_num, input_file_num)

經(jīng)過以上的分析，在設(shè)置map個(gè)數(shù)的時(shí)候，可以簡(jiǎn)單的總結(jié)為以下幾點(diǎn)：
（1）如果想增加map個(gè)數(shù)，則設(shè)置mapred.map.tasks 為一個(gè)較大的值。
（2）如果想減小map個(gè)數(shù)，則設(shè)置mapred.min.split.size 為一個(gè)較大的值。
（3）如果輸入中有很多小文件，依然想減少map個(gè)數(shù)，則需要將小文件merger為大文件，然后使用準(zhǔn)則2。

到此，關(guān)于“hadoop中map的個(gè)數(shù)是多少”的學(xué)習(xí)就結(jié)束了，希望能夠解決大家的疑惑。理論與實(shí)踐的搭配能更好的幫助大家學(xué)習(xí)，快去試試吧！若想繼續(xù)學(xué)習(xí)更多相關(guān)知識(shí)，請(qǐng)繼續(xù)關(guān)注億速云網(wǎng)站，小編會(huì)繼續(xù)努力為大家?guī)砀鄬?shí)用的文章！

向AI問一下細(xì)節(jié)

推薦閱讀：

免責(zé)聲明：本站發(fā)布的內(nèi)容（圖片、視頻和文字）以原創(chuàng)、轉(zhuǎn)載和分享為主，文章觀點(diǎn)不代表本網(wǎng)站立場(chǎng)，如果涉及侵權(quán)請(qǐng)聯(lián)系站長(zhǎng)郵箱：is@yisu.com進(jìn)行舉報(bào)，并提供相關(guān)證據(jù)，一經(jīng)查實(shí)，將立刻刪除涉嫌侵權(quán)內(nèi)容。

上一篇新聞：
windows eclipse怎么遠(yuǎn)程連接hadoop集群并提交任務(wù)運(yùn)行
下一篇新聞：
Hadoop HDFS分布式文件系統(tǒng)怎么理解

猜你喜歡

AI
助
手

產(chǎn)品服務(wù)

地區(qū)劃分

專題活動(dòng)

幫助支持

關(guān)于我們

售后咨詢

7*24小時(shí)在線電話：400-100-2938

7*24小時(shí)在線 QQ：800811969

關(guān)注億速云

億速云公眾號(hào)

手機(jī)網(wǎng)站二維碼

<video id="ietbd"><sup id="ietbd"></sup></video>

<samp id="ietbd"><tbody id="ietbd"><dl id="ietbd"></dl></tbody></samp>

<table id="ietbd"><nav id="ietbd"></nav></table>

<samp id="ietbd"><del id="ietbd"></del></samp>

<samp id="ietbd"><sup id="ietbd"><listing id="ietbd"></listing></sup></samp>