大数据之路-Hadoop-概述(2)

大数据之路-Hadoop-概述(2),第1张

大数据之路-Hadoop-概述(2) Hadoop集群

首先,区分下集群和分布式的概念。

分布式结构就是将一个完整的系统,按照业务功能,拆分成一个个独立的子系统。比如我们在做一个项目时,团队中按角色可分为项目经理、产品经理、开发、测试等,不同角色做不同的事,互相之间也可能存在沟通和协作。

集群,相对于单机而言,解决的都是同一个问题。以上一个例子来说,单机好比团队中只有一个测试,一个人做了所有的测试工作。因此扩招了2个测试人员,可以把这个3个测试人员看做是一个整体(集群),他们所做的是同一件事(测试),搭建集群的目的是为了提高整体工作的能力。

Hadoop集群具体来说包含两个集群:HDFS集群和YARN集群,两者逻辑上分离,但物理上常在一起。
HDFS集群:负责海量数据的存储,集群中的角色主要有NameNode,DataNode
YARN集群:负责海量数据运算时的资源调度,集群中的角色主要有 ResourceManager ,NodeManager

一般我们提到集群的的时候,往往是泛指,包含Hadoop生态体系中的各类框架,比如HDFS、YARN、Kafka等。

Hadoop和云计算的关系

2006年,谷歌在搜索引擎大会上正式提出了“云计算”的概念。云计算是分布式计算、并行计算、网格计算、多核计算、网络存储、虚拟化、负载均衡等传统计算机技术和互联网技术融合发展的产物。现阶段,云计算的两大底层支撑技术为“虚拟化”和“大数据技术”

云计算借助IaaS(基础设施即服务)、PaaS(平台即服务)、SaaS(软件即服务)等业务模式,把强大的计算能力提供给终端用户。而Hadoop则是云计算的PaaS层的解决方案之一,并不等同于PaaS,更不等同于云计算。

当前提供云计算服务的厂商,比如阿里云、华为云、AWS等,用户可以直接从云提供商那里获得技术服务,例如计算能力、存储和数据库,而无需购买、拥有和维护物理数据中心及服务器,对于一些需要搭建SAAS类平台的企业来说,是一个非常不错的选择。

Hadoop管理工具

Hadoop比较常用管理工具,比如Ambari和Cloudera Manger。Ambari作为一款开源工具,可以对其进行定制化包装或国际化。

欢迎分享,转载请注明来源:内存溢出

原文地址: https://outofmemory.cn/zaji/5699996.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
上一篇 2022-12-17
下一篇 2022-12-17

发表评论

登录后才能评论

评论列表(0条)

保存