Hadoop概述

news/2024/6/29 4:17:53 标签: 嵌入式, 大数据
Hadoop是什么?
  •   Hadoop是一个由Apache基金会所开发的分布式系统基础架构。
  •   用户可以在不了解分布式底层细节的情况下,开发分布式程序。充分利用集群的威力进行高速运算和存储。
  •   适合大数据的分布式存储和计算平台。 

Hadoop项目主要包括以下四个模块:

  1.   Hadoop Common:为其他Hadoop模块提供基础设施
  2.   Hadoop HDFS:一个高可靠、高吞吐量的分布式文件系统
  3.   Hadoop MapReduce一个分布式的离线并行计算框架
  4.   Hadoop YARN:一个新的MapReduce框架,任务调度与资源管理
                                    --Hadoop权威指南(第四版)
 
 
Hadoop的起源
  • 项目起源
Hadoop最早受到Google的MapReduce和GFS的启发
2005年,Hadoop作为Lucene的子项目Nutch的一部分正式引入Apache基金会
2006 年3 月,Map/Reduce 和 Nutch Distributed File System (NDFS) 分别被纳入称为 Hadoop 的项目中。
 
总的来说,Hadoop起源于Google的三大论文 
GFS:Google的分布式文件系统Google File System 
MapReduce:Google的MapReduce开源分布式并行计算框架 
BigTable:一个大型的分布式数据库
 
演变关系:
GFS—->HDFS 
Google MapReduce—->Hadoop MapReduce 
BigTable—->HBase
 
  • 名字起源
Hadoop名字不是一个缩写,而是一个生造出来的词。是Hadoop之父Doug Cutting儿子毛绒玩具象命名的。
Hadoop的发音是 [hædu:p]。
 
 
Hadoop的优点
  1. 高可靠性。Hadoop按位存储和处理数据的能力值得人们信赖。
  2. 高扩展性。Hadoop是在可用的计算机集簇间分配数据并完成计算任务的,这些集簇可以方便地扩展到数以千计的节点中。
  3. 高效性。Hadoop能够在节点之间动态地移动数据,并保证各个节点的 动态平衡,因此处理速度非常快。
  4. 高容错性。Hadoop能够自动保存数据的多个副本,并且能够自动将失败的任务重新分配。
  5. 低成本。与一体机、商用数据仓库以及QlikView、Yonghong Z-Suite等数据集市相比,hadoop是开源的,项目的软件成本因此会大大降低。

 

 

Hadoop大事记 摘自董的博客
2004年— 最初的版本(现在称为HDFS和MapReduce)由Doug Cutting和Mike Cafarella开始实施。 
2005年12月— Nutch移植到新的框架,Hadoop在20个节点上稳定运行。 
2006年1月— Doug Cutting加入雅虎。 
2006年2月— Apache Hadoop项目正式启动以支持MapReduce和HDFS的独立发展。 
2006年2月— 雅虎的网格计算团队采用Hadoop。 
2006年4月— 标准排序(10 GB每个节点)在188个节点上运行47.9个小时。 
2006年5月— 雅虎建立了一个300个节点的Hadoop研究集群。 
2006年5月— 标准排序在500个节点上运行42个小时(硬件配置比4月的更好)。 
2006年11月— 研究集群增加到600个节点。 
2006年12月— 标准排序在20个节点上运行1.8个小时,100个节点3.3小时,500个节点5.2小时,900个节点7.8个小时。 
2007年1月— 研究集群到达900个节点。 
2007年4月— 研究集群达到两个1000个节点的集群。 
2008年4月— 赢得世界最快1TB数据排序在900个节点上用时209秒。 
2008年7月— 雅虎测试节点增加到4000个 
2008年9月— Hive成为Hadoop的子项目 
2008年11月— Google宣布其MapReduce用68秒对1TB的程序进行排序 
2008年10月— 研究集群每天装载10TB的数据。 
2008年— 淘宝开始投入研究基于Hadoop的系统–云梯。云梯总容量约9.3PB,共有1100台机器,每天处理18000道作业,扫描500TB数据。 
2009年3月— 17个集群总共24 000台机器。 
2009年3月— Cloudera推出CDH(Cloudera’s Dsitribution Including Apache Hadoop) 
2009年4月— 赢得每分钟排序,雅虎59秒内排序500 GB(在1400个节点上)和173分钟内排序100 TB数据(在3400个节点上)。 
2009年5月— Yahoo的团队使用Hadoop对1 TB的数据进行排序只花了62秒时间。 
2009年7月— Hadoop Core项目更名为Hadoop Common; 
2009年7月— MapReduce 和 Hadoop Distributed File System (HDFS) 成为Hadoop项目的独立子项目。 
2009年7月— Avro 和 Chukwa 成为Hadoop新的子项目。 
2009年9月— 亚联BI团队开始跟踪研究Hadoop 
2009年12月—亚联提出橘云战略,开始研究Hadoop 
2010年5月— Avro脱离Hadoop项目,成为Apache顶级项目。 
2010年5月— HBase脱离Hadoop项目,成为Apache顶级项目。 
2010年5月— IBM提供了基于Hadoop 的大数据分析软件——InfoSphere BigInsights,包括基础版和企业版。 
2010年9月— Hive( Facebook) 脱离Hadoop,成为Apache顶级项目。 
2010年9月— Pig脱离Hadoop,成为Apache顶级项目。 
2011年1月— ZooKeeper 脱离Hadoop,成为Apache顶级项目。 
2011年3月— Apache Hadoop获得Media Guardian Innovation Awards 。 
2011年3月— Platform Computing 宣布在它的Symphony软件中支持Hadoop MapReduce API。 
2011年5月— Mapr Technologies公司推出分布式文件系统和MapReduce引擎——MapR Distribution for Apache Hadoop。 
2011年5月— HCatalog 1.0发布。该项目由Hortonworks 在2010年3月份提出,HCatalog主要用于解决数据存储、元数据的问题,主要解决HDFS的瓶颈,它提供了一个地方来存储数据的状态信息,这使得 数据清理和归档工具可以很容易的进行处理。 
2011年4月— SGI( Silicon Graphics International )基于SGI Rackable和CloudRack服务器产品线提供Hadoop优化的解决方案。 
2011年5月— EMC为客户推出一种新的基于开源Hadoop解决方案的数据中心设备——GreenPlum HD,以助其满足客户日益增长的数据分析需求并加快利用开源数据分析软件。Greenplum是EMC在2010年7月收购的一家开源数据仓库公司。 
2011年5月— 在收购了Engenio之后, NetApp推出与Hadoop应用结合的产品E5400存储系统。 
2011年6月— Calxeda公司(之前公司的名字是Smooth-Stone)发起了“开拓者行动”,一个由10家软件公司组成的团队将为基于Calxeda即将推出的ARM系统上芯片设计的服务器提供支持。并为Hadoop提供低功耗服务器技术。 
2011年6月— 数据集成供应商Informatica发布了其旗舰产品,产品设计初衷是处理当今事务和社会媒体所产生的海量数据,同时支持Hadoop。 
2011年7月— Yahoo!和硅谷风险投资公司 Benchmark Capital创建了Hortonworks 公司,旨在让Hadoop更加鲁棒(可靠),并让企业用户更容易安装、管理和使用Hadoop。 
2011年8月— Cloudera公布了一项有益于合作伙伴生态系统的计划——创建一个生态系统,以便硬件供应商、软件供应商以及系统集成商可以一起探索如何使用Hadoop更好的洞察数据。 
2011年8月— Dell与Cloudera联合推出Hadoop解决方案——Cloudera Enterprise。Cloudera Enterprise基于Dell PowerEdge C2100机架服务器以及Dell PowerConnect 6248以太网交换机

 

转载于:https://www.cnblogs.com/Zlcode/p/8399691.html


http://www.niftyadmin.cn/n/709941.html

相关文章

函数:二维数组打乱顺序

2019独角兽企业重金招聘Python工程师标准>>> public function shuffle_assoc($list) { if (!is_array($list)) return $list; $keys array_keys($list); shuffle($keys); $random array(); foreach ($keys as $key) $random[$key] $list[$key]; re…

RHEL7下FTP

FTP 是File Transfer Protocol(文件传输协议)的英文简称,而中文简称为“文传协议”。我们这次使用的是VSFTP。vsftpd是 “very secure FTP deamon”的缩写,是一个完全免费,开源的ftp服务器软件。 特点 小巧轻快,安全易用,支持虚拟用户、支持带…

18 黑色星期五

18 黑色星期五 作者: Turbo时间限制: 1S章节: 基本练习(循环) 问题描述 : 有些西方人比较迷信,如果某个月的13号正好是星期五,他们就会觉得不太吉利,用古人的说法,就是“诸事不宜”。请你编写一个程序&a…

FH Admin fhadmn 源码项目下载获取 Java后台 springmvc mybatis SSM

获取【下载地址】QQ: 313596790官网 http://www.fhadmin.org/A代码编辑器,在线模版编辑,仿开发工具编辑器,pdf在线预览,文件转换编码B 集成代码生成器[正反双向](单表、主表、明细表、树形表,快速开发利器)快速表单构建…

对广搜中队列的理解

广搜的基本思想就是从起点开始(起点算队列中第一个点)依次寻找他一步能到达的所有没有重复走过的点,找到之后就将这些点放在一个对列。每次一个点扩展完毕后,就判断要到达的目的点是否在这个队列中 ,如果在就输出当前的…

17 质因数

17 质因数 作者: Turbo时间限制: 1S章节: 基本练习&#xff08;循环&#xff09; 问题描述 : 将一个正整数N(1<N<32768)分解质因数。例如&#xff0c;输入90&#xff0c;打印出90233*5。 输入说明 : 输入一个正整数 输出说明 : 按照范例输出。 其中的质因数的输出…

IPSec ***的配置实现

IPSec 的配置实现如图所示&#xff0c;某软件开发公司在中小城市建立了分支公司&#xff0c;分支公司开发项目小组所在网络地址为 172.16.10.0/24&#xff0c;该网络的主机可以通过 访问总公司开发数据服务器&#xff08;10.10.33.0/24&#xff09;。 根据上述需求&#xff0…

任意进制之间的相互转换

进过一段时间的研究&#xff0c;现在终于明白任意进制之间是如何转换的,现在就来给你分享。 解题思路&#xff1a; 比如说将一个n进制的数转换为m进制的数&#xff0c;这个过程需要一个过渡&#xff0c;就是现将一个n进制 的数转换为10进制&#xff0c;再将十进制数转换为m进制…