早在2008年,云计算的概念刚刚兴起,百度内部出现了两拨势力。一拨要从零开始打造自己的大数据底层技术,把MapReduce、GFS、BigTable这些组件都要实现一遍,结果花了两三年时间,也没能稳定运行。
而另外一拨势力,直接采纳开源的Hadoop生态,很快在公司内应用起来。而我当时做的日志统计平台,也是采用了Hadoop。但百度的数据规模毕竟太大了,所需的集群规模,开源版本根本撑不住,于是不得不改写Hadoop,这样就和开源的版本渐行渐远,等到后来再也合不到一起了。
曾经有一年多的时间,我们部门新设计和实现和底层的存储及计算系统,结果发现开源的版本也差不多实现到了同样效果。虽然许多内部的人觉得我们怎么总重复造轮子,但我明白还是需求使然,你面临的需求相对领先,但也没有领先到像Google那样提早5年。
但对于小公司来说,则完全没必要从零开始做,还是要尽量用开源的产品。
整个Hadoop生态,要比我2008年刚用的时候,要成熟很多。那个时候我们去拿开源的版本,编译部署,一个新手可能两周都不一定能正常的运转起来。而现在下载一个Cloudera发行版,两个小时就可以正常跑任务了。
与此同时,又面临了新的问题,因为大数据平台牵涉到数据的采集、传输、建模存储、查询分析、可视化等多个环节,而开源领域只是一些组件,于是各家公司都在纷纷打造自己的大数据平台,这就像Oracle之前,各家都在打造自己的存储系统。这显然不是一件性价比高的事情。
有市场需求,就会有满足相应需求的公司诞生,于是就诞生了一堆提供大数据服务的公司。
由于这一新领域还处于早期,这些创业公司所能提供的服务并不会特别的完善,要么是以项目制的方式运转,要么是提供专门应用场景的服务。
这样,对于一些企业来说,这些创业公司提供的服务,似乎自己也能实现,那何不干脆自己做?
这创业一年多以来,我看到了太多的公司在打造自己的数据平台,但做的还不够完善。不管是技术实力还是人力投入上,都有点力不从心。如果选用了这些第三方数据服务,那岂不饭碗被抢了?
可我要说的是,饭碗早晚都会被抢,只是时间早晚的问题。这里只需要问一个问题:我所做的数据平台,是不是其他公司也是类似的需求?如果是的话,那肯定也有其他公司做着类似的事情,做的东西会大同小异。
那么,就会出现专门的公司,来解决这种通用的需求。因为这些公司专注于解决这一块问题,所以会更加专业,并且舍得投入。而对于需求公司来说,除非自己转型去专门做大数据平台,不然在投入上,肯定不是一件性价比很高的事情。与其如此,不如及早侧重于自己的核心业务,关注应用需求本身。
扩展阅读:OA办公系统_协同办公系统;免费OA协同办公系统专题;在线OA协同办公系统专题;..集群规模,开源版本根本撑不住,于是不得不改写Hadoop,这样就和开源的版本渐行渐远,等到后来再也合不到一起了。曾经有一年多的时间,我们部门新设计和实现和底层的存储及计算系统,结果发现开源的版本也差不多实现到了同样效果。虽然许多内部的人觉得我们怎么总重复造轮子,但我明白还是需求使然,你面临的需求相对..
|