未加星标

多图技术贴:深入浅出解析大数据平台架构

字体大小 | |
[大数据技术 所属分类 大数据技术 | 发布者 店小二04 | 时间 | 作者 红领巾 ] 0人收藏点击收藏

目录:

什么是大数据 Hadoop介绍-HDFS、MR、Hbase 大数据平台应用举例-腾讯 公司的大数据平台架构

“就像望远镜让我们能够感受宇宙,显微镜让我们能够观测微生物一样,大数据正在改变我们的生活以及理解世界的方式……”。

大数据的4V特征-来源


多图技术贴:深入浅出解析大数据平台架构

公司的“大数据”

随着公司业务的增长,大量和流程、规则相关的非结构化数据也爆发式增长。比如:

1、业务系统现在平均每天存储20万张图片,磁盘空间每天消耗100G;

2、平均每天产生签约视频文件6000个,每个平均250M,磁盘空间每天消耗1T;

……

三国里的“大数据”

“草船借箭”和大数据有什么关系呢?对天象的观察是基于一种对风、云、温度、湿度、光照和所处节气的综合分析这些数据来源于多元化的“非结构”类型,并且数据量较大,只不过这些数据输入到的不是电脑,而是人脑并最终通过计算分析得出结论。


多图技术贴:深入浅出解析大数据平台架构
Google分布式计算的三驾马车

Google File System用来解决数据存储的问题,采用N多台廉价的电脑,使用冗余(也就是一份文件保存多份在不同的电脑之上)的方式,来取得读写速度与数据安全并存的结果。 Map-Reduce说穿了就是函数式编程,把所有的操作都分成两类,map与reduce,map用来将数据分成多份,分开处理,reduce将处理后的结果进行归并,得到最终的结果。 BigTable是在分布式系统上存储结构化数据的一个解决方案,解决了巨大的Table的管理、负载均衡的问题。

Hadoop体系架构


多图技术贴:深入浅出解析大数据平台架构

Hadoop核心设计


多图技术贴:深入浅出解析大数据平台架构

HDFS介绍-文件读流程


多图技术贴:深入浅出解析大数据平台架构

Client向NameNode发起文件读取的请求。

NameNode返回文件存储的DataNode的信息。

Client读取文件信息。

HDFS介绍-文件写流程


多图技术贴:深入浅出解析大数据平台架构

Client向NameNode发起文件写入的请求。

NameNode根据文件大小和文件块配置情况,返回给Client它所管理部分DataNode的信息。

Client将文件划分为多个Block,根据DataNode的地址信息,按顺序写入到每一个DataNode块中。

MapReduce——映射、化简编程模型

输入数据->Map分解任务->执行并返回结果->Reduce汇总结果->输出结果


多图技术贴:深入浅出解析大数据平台架构

Hbase——分布式数据存储系统


多图技术贴:深入浅出解析大数据平台架构

Client:使用HBase RPC机制与HMaster和HRegionServer进行通信

Zookeeper:协同服务管理,HMaster通过Zookeepe可以随时感知各个HRegionServer的健康状况

HMaster: 管理用户对表的增删改查操作

HRegionServer:HBase中最核心的模块,主要负责响应用户I/O请求,向HDFS文件系统中读写数据

HRegion:Hbase中分布式存储的最小单元,可以理解成一个Table

HStore:HBase存储的核心。由MemStore和StoreFile组成。

HLog:每次用户操作写入Memstore的同时,也会写一份数据到HLog文件

还有哪些NoSQL产品?


多图技术贴:深入浅出解析大数据平台架构
为什么要使用NoSQL?

一个高并发网站的DB进化史


多图技术贴:深入浅出解析大数据平台架构

关系模型>聚合数据模型的转换-基本变换


多图技术贴:深入浅出解析大数据平台架构

关系模型>聚合数据模型的转换-内嵌变换


多图技术贴:深入浅出解析大数据平台架构

关系模型>聚合数据模型的转换-分割变换


多图技术贴:深入浅出解析大数据平台架构

关系模型>聚合数据模型的转换-内联变换


多图技术贴:深入浅出解析大数据平台架构

Hadoop2.0

MapReduce:
JobTracker:协调作业的运行。
TaskTracker:运行作业划分后的任务。
多图技术贴:深入浅出解析大数据平台架构

大数据的技术领域


多图技术贴:深入浅出解析大数据平台架构

腾讯大数据现状(资料来自2014.4.11 腾讯分享日大会)


多图技术贴:深入浅出解析大数据平台架构

多图技术贴:深入浅出解析大数据平台架构

腾讯大数据平台产品架构


多图技术贴:深入浅出解析大数据平台架构

腾讯大数据平台与业务平台的关系


多图技术贴:深入浅出解析大数据平台架构

公司数据处理平台的基础架构


多图技术贴:深入浅出解析大数据平台架构

公司大数据平台架构图


多图技术贴:深入浅出解析大数据平台架构

应用一数据分析


多图技术贴:深入浅出解析大数据平台架构

应用二视频存储


多图技术贴:深入浅出解析大数据平台架构

应用三离线日志分析


多图技术贴:深入浅出解析大数据平台架构

应用五在线数据分析

参考资料:京东基于Samza的流式计算实践


多图技术贴:深入浅出解析大数据平台架构

作者:昆明小虫

描微信下面二维码,随时了解大数据最新动向,添加36大数据官方微信公共帐号dashuju36:


多图技术贴:深入浅出解析大数据平台架构

End



多图技术贴:深入浅出解析大数据平台架构

转载请注明来自36大数据(36dsj.com):36大数据 多图技术贴:深入浅出解析大数据平台架构

tags: 数据,gt,Client,文件,架构,模型,存储,平台,HDFS,DataNode,NameNode,HMaster,Hadoop,HBase
分页:12
转载请注明
本文标题:多图技术贴:深入浅出解析大数据平台架构
本站链接:https://www.codesec.net/view/226304.html


1.凡CodeSecTeam转载的文章,均出自其它媒体或其他官网介绍,目的在于传递更多的信息,并不代表本站赞同其观点和其真实性负责;
2.转载的文章仅代表原创作者观点,与本站无关。其原创性以及文中陈述文字和内容未经本站证实,本站对该文以及其中全部或者部分内容、文字的真实性、完整性、及时性,不作出任何保证或承若;
3.如本站转载稿涉及版权等问题,请作者及时联系本站,我们会及时处理。
登录后可拥有收藏文章、关注作者等权限...
技术大类 技术大类 | 大数据技术 | 评论(0) | 阅读(189)