“大数据”是万能的吗?

2016年02月22日

不久之前,一位大型银行的首席执行官正在考虑是否要退出意大利市场,因为经济形势不景气,而且未来很可能出现一场欧元危机。这位CEO手下的经济学家描绘出一片惨淡的景象,并且计算出经济低迷对公司意味着什么。但是最终,他还是在自己价值观念的指引下做出了决定。


这家银行在意大利已经有了几十年的历史。他不希望意大利人觉得他的银行只能同甘不能共苦。他不希望银行的员工认为他们在时局艰难之际会弃甲而逃。他决定留在意大利,不管未来有什么危机都要坚持下去,即便付出短期代价也在所不惜。


做决策之时他并没有忘记那些数据,但最终他采用了另一种不同的思维方式。当然,他是正确的。商业建立在信任之上。信任是一种披着情感外衣的互惠主义。在困境中做出正确决策的人和机构能够赢得自尊和他人的尊敬,这种感情上的东西是非常宝贵的,即便它不能为数据所捕捉和反映。


这个故事反映出了数据分析的长处和局限。目前这一历史时期最大的创新就在于,我们的生活现在由收集数据的计算机调控着。在这个时代,头脑无法理解的复杂情况,数据可以帮我们解读其中的含义。数据可以弥补我们对直觉的过分自信,数据可以减轻欲望对知觉的扭曲程度。

但有,些事情是“大数据”不擅长的:



数据不懂社交



大脑在数学方面很差劲(不信请迅速心算一下437的平方根是多少),但是大脑懂得社会认知。人们擅长反射彼此的情绪状态,擅长侦测出不合作的行为,擅长用情绪为事物赋予价值。

计算机数据分析擅长的是测量社会交往的“量”而非“质”。网络科学家可以测量出你在76%的时间里与6名同事的社交互动情况,但是他们不可能捕捉到你心底对于那些一年才见2次的儿时玩伴的感情,更不必说但丁对于仅有两面之缘的贝阿特丽斯的感情了。因此,在社交关系的决策中,不要愚蠢到放弃头脑中那台充满魔力的机器,而去相信你办工作上的那台机器。




数据不懂背景



人类的决策不是离散的事件,而是镶嵌在时间序列和背景之中的。经过数百万年的演化,人脑已经变得善于处理这样的现实。人们擅长讲述交织了多重原因和多重背景的故事。数据分析则不懂得如何叙事,也不懂得思维的浮现过程。即便是一部普普通通的小说,数据分析也无法解释其中的思路。




数据会制造出更大的“干草垛”



这一观点是由纳西姆•塔勒布(Nassim Taleb,著名商业思想家,著有《黑天鹅:如何应对不可知的未来》等书作)提出的。随着我们掌握的数据越来越多,可以发现的统计上显著的相关关系也就越来越多。这些相关关系中,有很多都是没有实际意义的,在真正解决问题时很可能将人引入歧途。这种欺骗性会随着数据的增多而指数级地增长。在这个庞大的“干草垛”里,我们要找的那根针被越埋越深。大数据时代的特征之一就是,“重大”发现的数量被数据扩张带来的噪音所淹没。




大数据无法解决大问题



如果你只想分析哪些邮件可以带来最多的竞选资金赞助,你可以做一个随机控制实验。但假设目标是刺激衰退期的经济形势,你就不可能找到一个平行世界中的社会来当对照组。最佳的经济刺激手段到底是什么?人们对此争论不休,尽管数据像海浪一般涌来,就我所知,这场辩论中尚未有哪位主要“辩手”因为参考了数据分析而改变立场的。




数据偏爱潮流,忽视杰作



当大量个体对某种文化产品迅速产生兴趣时,数据分析可以敏锐地侦测到这种趋势。但是,一些重要的(也是有收益的)产品在一开始就被数据摈弃了,仅仅因为它们的特异之处不为人所熟知。




数据掩盖了价值观念



我最近读到一本有着精彩标题的学术专著——《‘原始数据’只是一种修辞》。书中的要点之一就是,数据从来都不可能是“原始”的,数据总是依照某人的倾向和价值观念而被构建出来的。数据分析的结果看似客观公正,但其实价值选择贯穿了从构建到解读的全过程。

这篇文章并不是要批评大数据不是一种伟大的工具。只是,和任何一种工具一样,大数据有拿手强项,也有不擅长的领域。正如耶鲁大学的爱德华•图弗特教授(Edward Tufte)所说:“这个世界的有趣之处,远胜任何一门学科。”



由上可见大数据并不是万能的,而对于目前工业品领域,大数据还在概念的范畴,并没有拳头产品推广落地。但大数据是一个无可争辩的重要工具,必须要学习了解。

说说数据乃至大数据,用透析法进行说明,透析就是一层层的,日常我们经常看到报表,报告或者数据或者数字,这些都是数据范畴类。


我们先从数据底层说起。



第一层是数据收集



(叫数据积累,存储等是广义上的收集)
数据的收集趋势,从标准化数据到零散的,从多年积累的到每日都要达到千万级数据,从纯数据到文本数据,到各种数据,到各种颗粒度。
互联网时代,数据量是几何级的升高,但绝大多数的都是标准化的数据,相对更容易,但最大的问题是量大,快速,多变。
数据的收集后的下一步,基本上可以分为,数据校验,为什么是数据校验,因为整个数据就是不正确的,GA的数据正确么?接口的数据正确么?另外一部分是数据分析&挖掘,超过半数的企业的数据都是不准确的,或者不完全准确的,涉及到接口,接口交换或者传输各种问题,数据都不能正确的,何谈大数据。




第二层是数据应用&分析&挖掘



大数据应用其实是业务的运用,不是数据运用,不是数据结果运用。
面对小数据很多时候我们一筹莫展,更别提更多的数据,往往不了解的人都会说,我们通过大数据,得出某某结论,其实这是断掉中间的东西(如何分析,如何发现未知,确定未知),臆想,众口铄金,迷乱了很多人的双眼。
数据的结果是为业务分析服务,不是大数据,还是小数据的分析,大数据的分析一定是最后做到小数据,既要全局全揽,还要落到小点。
再谈大数据的数据模型,模型是统计学家,前人的成果,搜索下现行所有模型,仍然是关联模型,行为判别,再加上判别等模型。



第三层是大数据的重中之重-数据转换存储



大数据其实是底层技术的大数据,海量的数据更多是数据集成,存储,转换。
每日千万量的数据,每次ETL如此量的数据,是服务器的配置的设置,大数据考验的有一点是数据架构。



第四层时回归到小数据,解释世界



做了大量模型,推荐模型,关键在于准确度,这些需要汇报,汇报高级主管的,落的是小数据。
当很多人在说需求预测,自动输出,这些是模型范畴的选模型步骤,模型检验,其实跟我们理解的都不一样,大数据混淆,模型的说法也开始使用到业务工作中,完全开始混了。
回归数据,一定是回归小数据,跟所说的大数据似乎关系很小。



数据落到最后,是解释世界,业务分析。



记得之前跟客户团队成员提过,谈大数据的都不会分析,甚至不知道如何分析;做数据分析的都在谈数据研究,做数据研究的都在做市场研究,做市场研究的其实在做业务。


“大数据”并非万能,却是大势所趋


对于目前喷码标识行业,生产用数据的来源一是政府机关,如:药监码,电子监管码,兽药二维码等;二是软件商,如生产管理码、物流码、查询网址等,三是生产厂家的实时数据,典型代表就是三期。生产用数据的质量高且有效性强,不会有太多数据的干扰,但生产管控数据和流通领域数据则有所不同。


单从数据收集而言,生产管控数据对产线自动化智能化的要求很高,方能收集到足够的有效数据以改进生产,但对于喷码标识而言关系不大。


流通领域数据与喷码标识行业则关系较大,从数据承载工具发展来看,二维码作为打通线上线下的接口,大规模应用是必然趋势。另一方面,为了打击假冒伪劣产品,追溯码的推广也是势在必行,把监管落实到细处就是“一物一码”,如何在追溯码上附加更多价值逐渐成为品牌商的思考方向,会员制、积分制、抽奖促销等有效市场推广活动与产品信息查询码相结合,或是在不同层别的包装上赋码以实现不同的推广目的,收集更多的客户信息和行为习惯,这些都是各大品牌企业的实验课题。值得庆幸的是,不管日后大数据的具体应用是如何实现,但有一点是确定的,那就是喷码标识的需求将会持续增长。


流通领域不断增长的喷码标识需求或许就是行业的下一个增长突破点所在


文章部分来源:高印工业系统