为什么Hadoop一定是分布式计算的未来？-存储专区

为什么Hadoop一定是分布式计算的未来？

作者：leftnoteasy 编辑：曾智强 2011-08-31 00:01 来源：博客园

　　【IT168 技术】今天听同事分享了一篇很有意思的讲座，叫做"Why Map-Reduce Is Not The Solution To Your Big-Data Problem"(为什么Map-Reduce不是你的“大数据”问题的解决方案)。同事很牛，也分享了很多非常有价值的观点，不过他预言Map-Reduce将会在5年之内消失(而且还呼吁有做存储方面的牛人来预言一下，Hdfs将在5年之内消失)，这个话题如果成立的话，让我这个目前在Hadoop工程师，感到无比的压力。这里不为了争个你死我活，只是谈谈自己的一些想法。另外由于这位同事的分享是内部进行的，这里就不透露分享中具体的内容了，只谈谈自己的观点。

　　(本文需要对Hadoop有一定的基础方可理解)

　　Hadoop为何物?

　　虽说Hadoop的名声很大，但是总还是有同学不太了解的，这里一笔带过一下。

　　Google分布式计算三驾马车：

　　Hadoop的创始源头在于当年Google发布的3篇文章，被称为Google的分布式计算三驾马车(Google还有很多很牛的文章，但是在分布式计算方面，应该这三篇的影响力最大了)：http://blog.sina.com.cn/s/blog_4ed630e801000bi3.html，链接的文章比我介绍得更清晰，当然最好还是看看原文了，这是做分布式系统、分布式计算的工程师必修课。

　　Google File System用来解决数据存储的问题，采用N多台廉价的电脑，使用冗余(也就是一份文件保存多份在不同的电脑之上)的方式，来取得读写速度与数据安全并存的结果。

　　Map-Reduce说穿了就是函数式编程，把所有的操作都分成两类，map与reduce，map用来将数据分成多份，分开处理，reduce将处理后的结果进行归并，得到最终的结果。但是在其中解决了容错性的问题。

　　BigTable是在分布式系统上存储结构化数据的一个解决方案，解决了巨大的Table的管理、负载均衡的问题。

　　Google就靠着这几样技术，在搜索引擎和广告方面取得了举世瞩目的成就。不过Google不是傻的，这三篇文章虽然都是干货，但是不是直接就可以用的。话说Google发表了这三篇文章后，在学术界引起了轩然大波，大家对这三样东西提起了浓厚的兴趣，都想着是不是可以实现一下，以为己用。

　　Doug Cutting：

　　Doug Cutting之前是一个非常有名的开源社区的人，创造了nutch与lucene(现在都是在Apache基金会下面的)，nutch之前就实现了一个分布式的爬虫抓取系统。等Google的三驾马车发布后，Doug Cutting一看，挖靠这么厉害的技术，于是就实现了一个DFS(distributed file system)与Map-Reduce(大牛风范啊)，集成进了Nutch，作为Nutch的一个子项目存在。那时，是2004年左右。

　　在互联网这个领域一直有这样的说法：

　　“如果老二无法战胜老大，那么就把老大赖以生存的东西开源吧”

　　当年与Google还是处在强烈竞争关系的Yahoo!于是招了Doug兄进来，把老大赖以生存的DFS与Map-Reduce开源了。开始了Hadoop的童年时期。差不多在2008年的时候，Hadoop才算逐渐成熟。

　　现在的Hadoop:

　　现在的Hadoop不仅是当年的老二Yahoo的专用产品了，从Hadoop长长的用户名单中，可以看到Facebook,可以看到Linkedin，可以看到Amazon，可以看到EMC, eBay，Tweeter，IBM, Microsoft, Apple, HP...(后面的一些未必是完全使用)。国内的公司有淘宝、百度等等。

　　我来定义一下Hadoop：

　　Hadoop是一套开源的、基础是Java的、目前能够让数千台普通、廉价的服务器组成一个稳定的、强大的集群，使其能够对pb级别的大数据进行存储、计算。已经具有了强大稳定的生态系统，也具有很多使用的延伸产品。比如做查询的Pig, 做分布式命名服务的ZooKeeper, 做数据库的Hive等等。

第1页：Hadoop为何物?第2页：为什么世界上只有一个Hadoop?第3页：Hadoop的优势分析第4页：Hadoop的劣势第5页：Hadoop的未来怎么样?

关注我们