Apache Hadoop 0.23 介绍

AI权益加码!Claude Code、Cursor等20+工具免费用! 购周边限时加赠Coding Plan Lite,畅享主流AI工具!学习进阶更高效! 阅读详情

Hadoop 1.0 (0.20.2×) 终于在27 December, 2011正式发布了【1】。下面是一个Hadoop的简单历史【2】:


这个也是目前最稳定的版本。新的版本也在开发之中,那就是0.23或者2.0吧!在新版本中引入了很多新的特性,其中着重说一个:

  • HDFS Federation
  • NextGen MapReduce

HDFS Federation

目前的HDFS包含两层:

  • 命名空间 (Namespace)
    • Consists of directories, files and blocks
    • It supports all the namespace related file system operations such as create, delete, modify and list files and directories.
  • 块存储服务 (Block Storage Service) has two parts
    • Block Management (which is done in Namenode)
      • Provides datanode cluster membership by handling registrations, and periodic heart beats.
      • Processes block reports and maintains location of blocks.
      • Supports block related operations such as create, delete, modify and get block location.
      • Manages replica placement and replication of a block for under replicated blocks and deletes blocks that are over replicated.
    • Storage - is provided by datanodes by storing blocks on the local file system and allows read/write access.
可以简单的理解为“Namenode”就是一个hadoop系统里面的文件系统,操作的基本对象就是一个block,一般为64M或者128M。“Datanode”提供抽象block到操作系统(比如Linux)的文件系统映射。

这个设计的最大问题就是可以很容易的通过增加Datanode来水平拓展物理存储空间,但是却只能有一个Namenode。这个导致很明显的问题就是single point of failure很性能瓶颈。

新的设计试图解决了这个问题:

其实这个我们也可以想到,呵呵!这里引入了一个新概念:Block Pool。它是一个block的集合,显然里面的block可以来自不同的Datanode。每个pool独立运作,只属于一个Namenode。

Apache Hadoop NextGen MapReduce (YARN)

新的版本叫做MapReduce 2.0 (MRv2) 或者 YARN。MRv2的核心是将JonTracker里面的两个主要功能,资源管理(resource management)和任务调度/监控(job scheduling/monitoring),分解为两个独立的守护进程(daemon):global ResourceManager (RM) 和 per-application ApplicationMaster (AM)。一个程序可以是以前的Map-Reduce任务或者是一个任务的有向无环图(Directed Acyclic Graph)。

ResourceManager有两个主要构成:Scheduler和ApplicationsManager。Scheduler负责分配资源,它只是一个纯粹的调度者,并不会监控任务的执行。资源调度基于Container,它是memory, cpu, disk, network等的抽象,目前只支持memory。ApplicationsManager负责接收任务提交,协商第一个Container以执行程序的ApplicationMaster和重启失败的ApplicationMaster container。

NodeManager是每台机器上的代理(per-machine framework agent),对container负责,提供对资源使用的监控和向ResourceManager/Scheduler提供汇报。

每个程序的ApplicationMaster负责协商资源,监控程序的执行和进度。

上图我们可以看到一个ApplicationMaster其实可以使用其它机器上的资源(Container),这个对于就可以提供更高的资源利用和并发执行了。

题外话,最后介绍一个hadoop 1.0里面的新的特性:WebHDFS。这个就是HDFS的HTTP REST API。这个的好处显而易见,无需hadoop环境就可以直接访问HDFS。是不是很容易实现跨data center的数据访问呢?


参考:

【1】http://hadoop.apache.org/common/docs/r1.0.0/releasenotes.html

【2】http://hortonworks.com/apache-hadoop-is-here/

【3】http://hadoop.apache.org/common/docs/r0.23.0/index.html

【4】http://hadoop.apache.org/common/docs/r1.0.0/webhdfs.html


告别配置迷茫:手把手教你用Vivado 2023.1配置Xilinx FPGA的DDR4 MIG IP核(含AXI接口详解) 本文详细介绍了如何在Vivado 2023.1中配置Xilinx FPGA的DDR4 MIG IP核,包括AXI接口的深度解析与优化。通过实战案例和调试技巧,帮助工程师快速掌握DDR4内存与FPGA的协同工作,提升系统性能。特别适合需要高性能计算和实时信号处理的开发者。 阅读详情

相关推荐

DDR4 IP核的配置与控制

DDR4 IP核的配置与控制 IP配置如下图 顶层外接引脚 input wire pll_ref_clk, // pll_ref_clk.clk, PLL reference clock input input wire oct_rzqin, // oct.oct_rzqin, Calibrated On-Chip Termination (OCT) RZQ input pin o

qq_40045070的博客 3393

vivado DDR4 SDRAM(MIG)(2.2) IP核学习记录

用户界面 PAGE 1 按照图中序号分别记录: 1.memory device interface speed 确认DDR4的运行时钟,框中填写的是DDR4的单时钟周期。例如,2400P DDR4的时钟速率为1200M,时钟周期为833ps。 2.DCI CASCADE(数字控制阻抗,digitally controlled impendence) DCI CASCADE用于约束单个或多个BANK的输出阻抗,使用该功能时,DDR4的时钟周期...

yindq1220的博客 2万+

pcie读写ddr_DDR4读写测试(一):MIG IP核配置

上回学习了万兆接口,下回打算学习PCIe接口,但如果要是做个加速的玩意儿的话,好像还缺个存东西的地方,那就拿DDR存东西吧。刚好最近学习了Xilinx家的DDR4控制器IP核,所以来知乎上简单分享一下如何使用这个MIG IP核,按照惯例还是翻译手册,好像又开了个新坑( ﹁ ﹁ ) 。本系列将分为:MIG IP核配置、连续读写测试、一些问题的解决等等......本次读写测试中采用:FPGA硬件平台为...

weixin_39604189的博客 4178

Hadoop三大发行版本简单介绍

一、hadoop三大版本 Hadoop三大发行版本Apache、Cloudera、Hortonworks。 Apache版本最原始(最基础)的版本,对于入门学习最好。 Cloudera在大型互联网企业中用的较多。 Hortonworks文档较好。 二、Apache Hadoop 官网地址:http://hadoop.apache.org/releases.html 下载地址:https://archive.apache.org/dist/hadoop/common/ 三、Cloudera Hadoop

m0_67401606的博客 5049

Apache Hadoop 0.23 HDFS Federation介绍

转载自:http://eryk.iteye.com/blog/1291303 参考:http://hadoop.apache.org/common/docs/r0.23.0/hadoop-yarn/hadoop-yarn-site/Federation.html             http://www.slideshare.net/hortonworks/hs-2011-submissi

hellohadoop的专栏 593

Apache Hadoop 0.23 MapReduce 2.0 (MRv2 or YARN) 介绍

MapReduce 在hadoop 0.23版本中经历了一次大修改。现在叫做MapReduce 2.0 (MRv2) 或者 YARN。 JobTracker在MRv2 中被拆分成了两个主要的功能使用守护进程执行:资源管理和任务的调度与监视。这个想法创建一个全局的资源管理(global ResourceManager (RM))和为每个应用创建一个应用管理(ApplicationMaster (A...

十万小时之旅 204

关于Apache Hadoop版本

转自:http://www.dw4e.com/ 本文译自cloudera公司Charles Zedlewski写的一篇文章《An update on Apache Hadoop 1.0》 关于最新发布的Apache Hadoop V1.0,一些用户或客户会问:这个版本的功能有哪些?基于哪个版本?后续的版本是什么?要解释这一点,我们应该从Apache项目发布的一些基本知识开始:

hjwang1的专栏 1270

hive 支持hadoop-0.23.1

hive要支持hadoop-0.23.1需要自己从源码编译,具体的做法如下:   $ svn co http://svn.apache.org/repos/asf/hive/trunk hive $ cd hive $ ant clean package -Dhadoop.version=0.23.1 -Dhadoop-0.23.version=0.23.1 -Dhado...

hf200012 159

hadoop版本问题

现在hadoop版本比较乱,常常搞不清楚版本之间的关系,下面简单的摘要了,apache hadoop和cloudera hadoop版本的演化.   apache hadoop官方给出的版本说明是: 1.0.X - current stable version, 1.0 release 1.1.X - current beta version, 1.1 release

一只刚刚上路的猿 637

Hadoop打开大数据新世界的大门(Hadoop介绍

前言上一篇文章我讲述了有关大数据的概念,和一些意向,也许有人会问我,麟爷大数据和Hadoop到底是什么关系呢?如果从技术角度和非技术角度来讲,我认为是技术层面和理论层面的区别,这次我写下这篇文章的主要目是和大家介绍hadoop这个框架Hadoop诞生背景Hadoop最早是作为Nutch的子项目。而Nutch是一个开源的网络搜索引擎,由Doug Cutting于2002年创建。Nutch的设计目标是构

Shinlyzsljay的博客 683

Hadoop集群运行简单实例

集群配置信息 请看这篇文章Hadoop3.3.0完全分布式集群部署 这里我们简单在Hadoop运行一下实例。 在一开始运行时,就遇到了一个报错信息. hadoop 找不到或无法加载org.apache.hadoop.mapreduce.v2.app.MRAppMaster 解决方案:我们到mapred-site.xml 配置文件添加配置 <property> <name>mapreduce.admin.user.env</name> <valu

欢迎你的到来,我们一起加油!!! 1443

Hadoop概念学习系列之版本变迁(六)

 至2012年5月,Apache Hadoop的四大分支构成了四个系列的Hadoop版本。 1. 0.20.X系列     0.20.X系列版本是最令用户感到疑惑的,因为它们具有的一些特性,trunk上没有;trunk上有的一些特性,0.20.X系列版本却没有。 2. 0.21.0/0.22.X系列 ...

weixin_34348805的博客 145

kylin问题记录

1,版本选型 hbase-0.98.23Hive 1.2.1Hadoop 2.7.1apache-kylin-1.6.0     切记hbase版本不能选用1.x,否则build时hdfs解析成localfile导致失败(yarn配置的fs.defaultFS没起作用,解决方法是手工将yarn的*.xml配置拷到./tomcat/webapps/kylin/WEB-INF/classe

szh1124的专栏 1937
上一篇: Perl中的闭包(closure)
下一篇: Hadoop套装软件包
autofei
博客等级 码龄25年 425粉丝 303原创
评论 2
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值