游戏电视苹果数码历史美丽
投稿投诉
美丽时装
彩妆资讯
历史明星
乐活安卓
数码常识
驾车健康
苹果问答
网络发型
电视车载
室内电影
游戏科学
音乐整形

大数据开发MapReduce的工作原理是怎样的?

  知识的学习,最好是要理解原理,原理理解到了那么这个问题再怎么变化,还是离不开原理,你就有所头绪,解决起来也会简单许多。那么大数据开发的MapReduce的工作原理又是怎么一回事呢?下面就来给大家讲解。(内容较多,建议收藏后慢慢观看)
  一、基础知识复习
  MapReduce是一种编程模型,用于大规模数据集(大于1TB)的并行运算。概念Map(映射)和Reduce(归约),和它们的主要思想,都是从函数式编程语言里借来的,还有从矢量编程语言里借来的特性。它极大地方便了编程人员在不会分布式并行编程的情况下,将自己的程序运行在分布式系统上。当前的软件实现是指定一个Map(映射)函数,用来把一组键值对映射成一组新的键值对,指定并发的Reduce(归约)函数,用来保证所有映射的键值对中的每一个共享相同的键组。
  二、流程分析
  1。在客户端启动一个作业。
  2。向JobTracker请求一个JobID,将运行任务所需要的程序文件复制到HDFS上,包括MapReduce程序打包的JAR文件、配置文件和客户端计算所得的输入划分信息。这些文件都存放在JobTracker专门为该任务创建的文件夹中。文件夹名JobID。
  3。将运行作业所需要的资源文件复制到HDFS上,包括MapReduce程序打包的JAR文件、配置文件和客户端计算所得的输入划分信息。这些文件都存放在JobTracker专门为该作业创建的文件夹中。文件夹名为该作业的JobID。JAR文件默认会有10个副本(mapred。submit。replication属性控制);输入划分信息告诉了JobTracker应该为这个作业启动多少个map任务等信息。
  4。JobTracker接收到作业后,将其放在一个作业队列里,等待作业调度器对其进行调度(这里是不是很像微机中的进程调度呢,呵呵),当作业调度器根据自己的调度算法调度到该作业时,会根据输入划分信息为每个划分创建一个map任务,并将map任务分配给TaskTracker执行。对于map和reduce任务,TaskTracker根据主机核的数量和内存的大小有固定数量的map槽和reduce槽。这里需要强调的是:map任务不是随随便便地分配给某个TaskTracker的,这里有个概念叫:数据本地化(DataLocal)。意思是:将map任务分配给含有该map处理的数据块的TaskTracker上,同时将程序JAR包复制到该TaskTracker上来运行,这叫运算移动,数据不移动。而分配reduce任务时并不考虑数据本地化。
  5。TaskTracker每隔一段时间会给JobTracker发送一个心跳,告诉JobTracker它依然在运行,同时心跳中还携带着很多的信息,比如当前map任务完成的进度等信息。当JobTracker收到作业的最后一个任务完成信息时,便把该作业设置成成功。当JobClient查询状态时,它将得知任务已完成,便显示一条消息给用户。
  以上是在客户端、JobTracker、TaskTracker的层次来分析MapReduce的工作原理的,下面我们再细致一点,从map任务和reduce任务的层次来分析分析。
  三、MapReduce运行流程
  1。split阶段
  首先mapreduce会根据要运行的大文件来进行split,每个输入分片(inputsplit)针对一个map任务,输入分片(inputsplit)存储的并非数据本身,而是一个分片长度和一个记录数据位置的数组。输入分片(inputsplit)往往和HDFS的block(块)关系很密切,假如我们设定HDFS的块的大小是64MB,我们运行的大文件是64x10M,mapreduce会分为10个map任务,每个map任务都存在于它所要计算的block(块)的DataNode上。
  2。map阶段
  map阶段就是程序员编写的map函数了,因此map函数效率相对好控制,而且一般map操作都是本地化操作也就是在数据存储节点上进行。
  3。shuffle阶段
  shuffle阶段主要负责将map端生成的数据传递给reduce端,因此shuffle分为在map端的过程和在reduce端的执行过程。
  四、Map端流程
  每个输入分片会让一个map任务来处理,map输出的结果会暂时放在一个环形内存缓冲区中(该缓冲区的大小默认为100M),当该缓冲区快要溢出时(默认为缓冲区大小的80),会在本地文件系统中创建一个溢出文件,将该缓冲区中的数据写入这个文件。
  在写入磁盘之前,线程首先根据reduce任务的数目将数据划分为相同数目的分区,也就是一个reduce任务对应一个分区的数据。这样做事为了避免有些reduce任务分配到大量数据,而有些reduce任务却分到很少数据,甚至没有分到数据的尴尬局面。其实分区就是对数据进行hash的过程。然后对每个分区中的数据进行排序(默认快速排序),如果此时设置了combiner,将排序后的结果进行combiner操作,这样做的目的是让尽可能少的数据写入到磁盘。
  当map任务输出最后一个记录时,可能会有很多的溢出文件,这时需要将这些文件归并。归并的过程中会不断地进行排序(归并排序)和combiner操作,目的有两个:一是尽量减少每次写入磁盘的数据量;二是尽量减少reduce复制阶段网络传输的数据量。最后归并成了一个已分区且已排序的文件。为了减少网络传输的数据量,这里可将数据压缩,只要将mapred。compress。map。out设置为true就可以了。
  将分区中的数据拷贝给相对应的reduce任务。分区中的数据怎么知道它对应的reduce是哪个呢?其实map任务一直和其父TaskTracker保持联系,而TaskTracker又一直和JobTracker保持心跳。所以JobTracker中保存了整个集群的宏观信息。只要reduce任务向JobTracker获取对应的map输出位置就可以了。
  五、Reduce端流程
  Reduce会接收到不同map任务传来的数据,并且每个map传来的数据都是有序的。如果reduce端接受的数据量相当小,则直接存储在内存中(缓冲区大小由mapred。job。shuffle。input。buffer。percent属性控制,表示用作此用途的堆空间的百分比),如果数据量超过了该缓冲区大小的一定比例(由mapred。job。shuffle。merge。percent决定),则对数据合并后溢写到磁盘中。
  随着溢写文件的增多,后台线程会将它们合并成一个更大的有序的文件,这样做事为了给后面的合并节省时间。其实不管在map端还是reduce端,MapReduce都是反复地执行排序,合并操作,所以排序是hadoop的灵魂。
  合并的过程中会产生许多的中间文件(写入磁盘了),但MapReduce会让写入磁盘的数据尽可能地少,并且最后一次合并的结果并没有写入磁盘,而是直接输入到reduce函数。
  在map处理数据后,到reduce得到数据之前,这个流程在MapReduce中可以看做是一个shuffle过程。在经过map的运行后,我们得知map的输出是这样一个keyvalue对。到底当前的key应该交由哪个reduce去做呢,是需要现在决定的。MapReduce提供Partitioner接口,它的作用就是根据key或value及reduce的数量来决定当前的这对输出数据最终应该交由哪个reducetask处理。默认对key做hash后再对reducetask数量取模。默认的取模方式只是为了平均reduce的处理能力,如果用户自己对Partitioner由需求,可以定制并设置到job上。
  以上就是本期的所有内容了,知识点很多,理解起来也很需要时间,建议收藏后慢慢观看,仔细理解。大数据开发的原理类知识还是要理解清楚,不然学习会比较困难。
  希望大家点个关注,及时收取最新文章推送,想了解更多敬请咨询加米谷大数据。
  有问题的欢迎在评论区留言,如有侵权请告知。

认识抽象画教学反思认识抽象画的教学开展能帮助学生们更好地认识抽象画的欣赏价值。下面是小编推荐给大家的认识抽象画教学反思,希望大家有所收获。认识抽象画教学反思(一)《认识抽象画》是一节欣赏。……世界多美呀教学设计范文作为一位优秀的人民教师,就不得不需要编写教学设计,教学设计以计划和布局安排的形式,对怎样才能达到教学目标进行创造性的决策,以解决怎样教的问题。那么写教学设计需要注意哪些问题呢?……儿童节儿歌六一儿童节,送你一首歌。雏燕追云雀,蜻蜓戏蝴蝶。穿上蹓冰鞋,换辆自行车。广场奔三国,笑闹找同桌。赛尔船同坐,植物战恶魔。羊羊喜玩乐,抬头看天河。……成语故事画龙点睛教案画龙点睛原形容梁代画家张僧繇作画的神妙。后多比喻写文章或讲话时,在关键处用几句话点明实质,使内容生动传神,使画更加生动。下面是小编为你带来的成语故事:《画龙点睛》教案,欢迎阅读……游褒禅山记说课案(教师中心稿)连城一中沈在阳《游褒禅山记》是高中语文第二册第五单元课文。现依据教学大纲、考纲、教材、学情对本课的教学目的、教学法的制定及教学程序的设计等方面作如下说明。一、说大纲……八年级历史上册第四课教学设计人教版第4课夏、商、西周的兴亡教学目标:一、知识与能力(一)知识目标了解夏、商、西周的更替的脉络,对每个朝代的建立时间、建立者、灭亡时间、亡国者等有一个基本的……幼儿的优质体育游戏教案能根据指令变换模仿动作,体验体育活动的快乐。以下内容是小编为您精心整理的幼儿的优质体育游戏教案,欢迎参考!幼儿的优质体育游戏教案快乐的木头人活动目标:1……乘法电影院教学纪实反思与评析教学内容:北师大版数学三年级下册第三单元乘法。教学目标:1结合具体情境,经历提出问题、解决问题的过程,学会有条理的思考。2对两位数乘两位数(有进位)能进行估算……面对2007年高考试题的思考试题造成考生解题困难的一些原因:第一,是考生能力与试题要求有差距。这里即有学生的问题,也有试题的问题。如:选择题第5题。该题从知识内容上涉及的是生命活动调节的形式。考查的……数学练习四教学设计范文教学目标:能正确熟练地计算9和几、8和几、7和几、6和几的进位加法。教学重点、难点:进位加法的思考过程。教学准备:小黑板、投影、卡片。教学过程:一……画鸡蛋教学设计范文作为一位兢兢业业的人民教师,时常需要准备好教学设计,借助教学设计可以更大幅度地提高学生各方面的能力,从而使学生获得良好的发展。你知道什么样的教学设计才能切实有效地帮助到我们吗?……慈母情怀教案反思文章摘要:本文章的主要内容是关于慈母情怀教案七教学实录案例反思,欢迎您来阅读并提出宝贵意见!1、有感情朗读课文。2、理解课文内容,感受母爱的深沉与宽广,感受母子之间……
神气的吸管教案神奇的小细管新疆生产建设兵团农四师幼儿园秘玲孟凡菊设计意图:在日常生活中,孩子们对身边的事物非常感兴趣,经常问为什么。在种植区和自然角里,孩子们经常……保教主任工作职责一、负责全园教育教学及教研工作,做到不越权、不推诿。二、依据园务计划,制定学期保教工作计划,并认真组织实施,积极带领并指导教师开展教研工作。三、每月组织教研组长例会……课文峨眉道上教学设计一、教材分析小学语文义务教育教材第八册第6课《峨眉道上》。通过作者在游峨眉山途中的见闻和由此引起的感想,赞美了峨眉山铺路人是真正的无名英雄,教育学生要尊重普通劳动者和他们……臂字如何组词及造句臂字该如何组词:踏臂玉臂交臂振臂臂膊错臂约臂直臂上臂重臂力臂啮臂膀臂努臂敛臂刻臂摇臂九折臂螳螂奋臂攘臂而起三头八臂失诸交臂螳臂当车六臂祜主揎拳攘臂交臂相失揎腕攘臂扼臂啮指……课文珍珠鸟的优秀教案设计一教学目标:1、引导学生思考人与动物的关系,激发学生关爱动物,善待生命的情感;2、培养学生独立阅读和合作、探究的学习方式;3、品味文章的语言,学习文章细致生动……信箱的教学反思班长不小心把教室的钥匙弄丢了,班里就剩我手里的一把钥匙。我把它挂在办公桌边的墙上,早来的学生来这里取钥匙开完门必须放回来。有一天早上,教室门打开后,迟迟不见钥匙归位。我问……数学课教案之数独教案包括教材简析和学生分析、教学目的、重难点、教学准备、教学过程及练习设计等。下面是小编为你带来的数学课教案之数独,欢迎阅读。一、教学对象小学一年级到三年级的农民工……精品教案实录自选商场精品教案七教学实录。教学目标:1认识14个生字,会写毛巾2个字。2从词语的排列引导学生发现规律,从而体会自选商场购物的方便。教学重点:识字、写字……小学一年级语文毽子变乖了的优秀教学设计【设计理念】通过运用不同的阅读方式,培养学生自主、合作、探索的学习方式。【教学要求】1认识12个生字,会写8个字,认识部首‘‘双人旁’’。2正确流利地朗……汉语拼音auiu教案范本【学习目的】1、学习复韵母auiu及四声,读准音,认清形,正确书写。2、学习声母与auiu组成的音节,能准确拼读音节。3、认识8个生字,能借助汉语拼音正确朗读……托尔斯泰的七颗钻石优秀教学设计教学模式:质疑探究,解疑教学目标:1本课要求会认8个生字,会写15个生字,能正确读写钻石、焦渴、水罐、喜出望外、匆匆忙忙、反正、递给、忍不住、唾沫、涌出、新鲜……高一上册随机事件和概率导学设计10。2。1随机事件导学案(1)【预习】自学《数学》第二册课本155157页的内容【预习目标】初步了解确定性现象与随机现象,必然事件、不可能事件及随机事件【导……
友情链接:易事利快生活快传网聚热点七猫云快好知快百科中准网快好找文好找中准网快软网