正在阅读:大数据也有弊端:数据量剧增 需要“智能遗忘”

大数据也有弊端:数据量剧增 需要“智能遗忘”

2016-06-14 09:46:38来源:新浪科技 原标题:大数据也有问题:数据量增加远超摩尔定律需要“智能遗忘” 关键词:大数据摩尔定律智能遗忘阅读量:30590

导读:据国外媒体报道,在经济领域和人类行为的大量数据采集中,存在着一个违反直觉的弊端,而这会使我们忽略历史的教训。
  【中国智能制造网 智造快讯】据国外媒体报道,在经济领域和人类行为的大量数据采集中,存在着一个违反直觉的弊端,而这会使我们忽略历史的教训。大数据的问题之一是太过于关注当前,而忽略了即使近的过去。、

大数据也有弊端:数据量剧增 需要“智能遗忘”
  
  你或许很熟悉这样一个统计结论:世界90%的数据是过去几年里产生的。事实上,过去三十年中,全世界的数据量大约每两年增加10倍——远远超过了计算机领域的摩尔定律。
  
  这样的信息增长速率会带来一些问题,其中之一便是现时的数据量总是远远超过即使近的过去。想象你正在通过一本相片簿回顾人生的头18年,假设在两岁时你有两张照片,如果信息增长速率与世界数据量相同,那么在你6到8岁时,你会有惊人的2000张照片;10到12岁时有20万张照片;而在16到18岁时,照片数量会达到2亿张,相当于在后两年中,每秒有3张以上的照片。
  
  当然,这并非是数据增长情况的类比。首先,世界大部分数据的增长源于有更多的人创造出了更多的信息来源,同时伴随更大、更精细的格式。不过,有关比例的观点还是成立的。如果你像前述的例子那样回顾以往的记录,或者试图进行分析,那距离越久远的过去就会变得越无关紧要。
  
  这就是目前采集和分析大数据时所面临的问题。当你开始以更长远的视角往前回溯时,会发现近期的事情太多,而以前的事情太少。短视是结构性的,对短期趋势的过度估计是压倒性的,同时却忽略了历史的经验教训。
  
  为了理解这个问题的重要性,需要考虑社会科学中有关“近期偏差”(recencybias,又称近因效应)的研究发现。近期偏差是指在判断趋势时,认为未来事件与近期体验更加类似。这可以说是某种“可利用性法则”(availabilityheuristic)——不恰当地以容易被知觉到的信息来作为思考的基础。这还是一种普遍的心理学特征。举例来说,如果在你居住的地方,过去几年中夏季都异乎寻常地寒冷,你可能会认为夏天正在变得更冷——或者说你当地的气候正在变冷。事实上,你不应当把任何东西都塞到数据里分析。你需要有一个长远的视角,才能认识真正有意义的气候趋势。在短时期内,你好不进行任何猜测。不过,我们之中又有谁能真正做到这点呢?
  
  现实生活中大部分复杂的趋势正是如此:股票市场、经济发展、企业的成功或失败、战争或和平、国家关系、帝国的崛起和衰落等等。短期分析不仅不够扎实,而且毫无益处甚至会带来误导。看看2009年金融危机即将到来的时候,还有那么多经济学家信誓旦旦地宣称这一事件不会发生。认为从那种时间尺度的数据就能做出扎实的预测,本身就有很大的问题。
  
  我们还应当记住,在决定哪些数据是保存还是删除的时候,新颖性往往会成为主要的考虑因素。旧的淘汰,新的进来,在这个搜索算法本质上偏向于新鲜事物的数字世界中,这是明显的趋势。从高等法院的裁决,到所有的社交媒体服务平台上,我们到处都可以看到已经失效的网址。对当前的偏好已经渗透到我们身边几乎所有的技术中,大多数人已经习惯用个四五年就把原本光鲜亮丽的机器抛弃。
  
  我们需要更好地确定哪些数据值得优先保存。怎么办?这不仅是一个如何更好保存旧数据的问题——尽管这并不是个坏主意,想想我们现在还有什么东西能保留10年的。更重要的是,这个问题关系到确定哪些东西值得优先保存,如何在知识的名义下,确定哪些信息有意义。
  
  或许我们需要的是“智能遗忘”:让我们的工具变得更会放弃近的过去,从而在整体视角上保持更大的连续性。这有点像是重新组织一本相片簿,尽管加上了更多的数学方法。什么时候两百万张照片的价值比两千张照片更低?什么时候较大的样品覆盖的范围反而较小?什么时候细节水平能提供有用的质疑证据,而不是虚假的自信?
  
  许多数据集是无法缩减的,而且在完整的情况下才宝贵,比如,基因序列、人口统计学数据、地理和物理学的原始观测数据等。科学性越弱,数据规模与数据的质量更可能呈现负相关,此时时间本身就成为更加重要的过滤工具。我们如果不仔细选择过去保存下来的有价值、有意义的东西,那它们就会悄无声息地淹没在如今日益增长的噪音之中。
  
  今天的企业、个人和政府机构都能够获得比以往(甚至就在几年前)大许多数量级的数据,但这些数据并没有获得更多的处理时间。利用越来越的工具,董事会成员、执行官、政府官员等决策者可以就已有的信息提出更有意义的问题。单纯的堆积不是问题的答案。在一个数据量越来越大的时代,如何选择不知道哪些事情,与选择做什么事情一样重要。
我要评论
  • 物流智能转型新引擎:DeepSeek+物流

    DeepSeek 物流不仅是技术的革新,更是城市发展的重要推动力。它通过智能化手段提升物流效率、优化资源利用、减少环境影响,并为智慧城市建设提供支撑。未来,随着AI技术的不断进步,物流行业将迎来更深刻的变革。
    物流大数据服务平台
    2025-04-30 10:11:15
  • 2025年4月1日开始施行的重要新规一览

    四月,一系列新规定即将实施,包括《公共安全视频图像信息系统管理条例》、《车联网网络安全异常行为检测机制》等。
    大数据服务平台
    2025-04-02 09:31:36
  • 铁塔大数据灾害分析平台:提升自然灾害智能化预警水平

    目前,我国灾害预防面临着监测预警网络不健全、实效性不高、精准性不强,“三断”(断路、断网、断电)无法及时发现等问题,亟需建立防灾减灾预警网络,实现“灾后救助”向“灾前预防”转变的目标。
    大数据灾害分析平台
    2025-03-19 10:47:45
  • 淄博市召开大数据系统工作会议暨“三拼三比”动员部署会

    会议指出,2024年是新一轮机构改革后全市大数据系统全面履职的第一年,全市大数据系统在市委市政府的坚强领导和省大数据局的有力指导下,数据要素价值加速释放、数字经济发展步伐加快、数字政府建设深入推进、数字支撑底座更为夯实,数字淄博建设取得明显成效。
    大数据服务平台
    2025-03-18 10:07:30
  • 公司重要动态速览|海康威视、新华三、宇树科技......

    近期,智慧城市领域的企业有哪些动态呢?小编整理了一下,一起来回顾。海康威视发布视觉大模型周界摄像机;宇树科技入驻阿里速卖通AliExpress出海......
    大数据服务平台
    2025-03-16 14:10:47
  • 贵州省大数据局召开数字企业座谈会

    会上,朱宗尧介绍了全省数据工作“一体两翼三大转型”总体思路及数字产业重点发展方向,数字产业处就起草促进数字产业发展相关政策措施有关情况作了说明。
    大数据服务平台
    2025-03-10 11:14:27
版权与免责声明:

凡本站注明“来源:智能制造网”的所有作品,均为浙江兴旺宝明通网络有限公司-智能制造网合法拥有版权或有权使用的作品,未经本站授权不得转载、摘编或利用其它方式使用上述作品。已经本网授权使用作品的,应在授权范围内使用,并注明“来源:智能制造网”。违反上述声明者,本站将追究其相关法律责任。

本站转载并注明自其它来源(非智能制造网)的作品,目的在于传递更多信息,并不代表本站赞同其观点或和对其真实性负责,不承担此类作品侵权行为的直接责任及连带责任。如其他媒体、平台或个人从本站转载时,必须保留本站注明的作品第一来源,并自负版权等法律责任。如擅自篡改为“稿件来源:智能制造网”,本站将依法追究责任。

鉴于本站稿件来源广泛、数量较多,如涉及作品内容、版权等问题,请与本站联系并提供相关证明材料:联系电话:0571-89719789;邮箱:1271141964@qq.com。

不想错过行业资讯?

订阅 智能制造网APP

一键筛选来订阅

信息更丰富

推荐产品/PRODUCT 更多
智造商城:

PLC工控机嵌入式系统工业以太网工业软件金属加工机械包装机械工程机械仓储物流环保设备化工设备分析仪器工业机器人3D打印设备生物识别传感器电机电线电缆输配电设备电子元器件更多

我要投稿
  • 投稿请发送邮件至:(邮件标题请备注“投稿”)1271141964.qq.com
  • 联系电话0571-89719789
工业4.0时代智能制造领域“互联网+”服务平台
智能制造网APP

功能丰富 实时交流

智能制造网小程序

订阅获取更多服务

微信公众号

关注我们

抖音

智能制造网

抖音号:gkzhan

打开抖音 搜索页扫一扫

视频号

智能制造网

公众号:智能制造网

打开微信扫码关注视频号

快手

智能制造网

快手ID:gkzhan2006

打开快手 扫一扫关注
意见反馈
我要投稿
我知道了