1、从“基于预设的结构化数据库”到“无需预设的非关系型数据库” 小数据时代,我们对于数据的存储与检索一直依赖于分类法和索引法,分类和索引是一种清晰获取数据的机制设计,这种机制是以预设场域为前提的。这种结构化数据库的预设场域能够卓越地展示数据的整齐排列与准确存储,毫无疑问,这与追求数据的精确性目标是完全一致的,在数据稀缺与问题清晰的年代,这种基于预设的结构化数据库能够有效的回答人们的问题,并且这种数据库在不同的时间能够提供一致的结果。
面对大数据,由于数据的海量、混杂等特征会使预设的数据库系统崩溃。其实,数据的纷繁杂乱才真正呈现出世界的复杂性和不确定性特征,想要获得大数据的价值,承认混乱而不是对抗或避免混乱才是一种可行的路径。为此,伴随着大数据的涌现,出现了非关系型数据库,它不需要预先设定记录结构,而且允许处理各种各样形形色色参差不齐的数据。因为包容了结构的多样性,这些无需预设的非关系型数据库设计能够处理和存储更多的数据,成为大数据时代的重要应对手段。
2、从“随机样本”到“全量数据” 统计学家通过分析发现,采样分析的精确性随着采样随机性的增加而大幅提高,但与样本数量的增加关系不大。这个发现对于小数据时代无疑是非常鼓舞人心的,随机采样获得了巨大的成功,并成为现代社会测量领域的核心思想。随机样本的基础是采样的绝对随机性,然而,如此严格意义的随机实现起来是非常困难的,一旦采样过程存在任何偏见,分析结果将相去甚远,况且随机样本带给我们的只能是事先预设问题的答案。这种缺乏延展性的结果,无疑会使我们错失更多的问题域。
3、大数据时代,数据的收集问题不再成为我们的困扰,采集全量的数据成为现实。全量数据带给我们视角上的宏观与高远,这将使我们可以站在更高的层级全貌看待问题,看见曾经被淹没的数据价值,发现藏匿在整体中有趣的细节。因为拥有全部或几乎全部的数据,就能使我们获得从不同的角度更细致更全面的观察研究数据的可能性,从而使得大数据的分析过程成为惊喜的发现过程和问题域的拓展过程。
4、从“数据的精确性和结果的准确性”到“数据的混杂性和结果的容错性” 小数据时代,由于可获得的数据量比较小,为此我们必须尽量准确的记录下所获得的所有数据,从而引发了测量工具的优化工作;由于数据处理手段的限制,能被我们利用的数据基本限于能适用于传统数据库的结构化数据;由于采用的是随机采样,因此采样过程的精确度被放在重要的地位。显然,这种对精确性的执着是信息缺乏时代和模拟时代的产物。
大数据时代,海量数据的涌现一定会增加数据的混乱性且造成结果的不准确性,如果仍然执迷的依循准确性,那么我们将无法应对这个新的时代。与数据的混杂性可能带来的结果错误性的增加相比,由数据量的扩张带给我们的新洞察、新趋势和新价值更有意义,因为大数据通常都用概率说话,何况大数据的处理之前是可以对之进行数据清洗从而减少部分的错误数据。
所以,与致力于避免错误相比,对错误的包容将会带给我们更多信息。其实,允许数据的混杂性和容许结果的不精确性才是我们拥抱大数据的正确态度,只有让步和接受甚至欣赏不精确性,才能看到大数据带给我们的美好前景,未来我们应当习惯这种思维。 扩展阅读:OA办公系统_协同办公系统;免费OA协同办公系统专题;在线OA协同办公系统专题;..种结构化数据库的预设场域能够卓越地展示数据的整齐排列与准确存储,毫无疑问,这与追求数据的精确性目标是完全一致的,在数据稀缺与问题清晰的年代,这种基于预设的结构化数据库能够有效的回答人们的问题,并且这种数据库在不同的时间能够提供一致的结果。
面对大数据,由于数据的海量、混杂等特征会使预设的数据库..
|