如何应对大数据时代的变革机遇挑战

如何应对大数据时代的变革机遇挑战,第1张

上周在大数据的趋势和特点中,说到了人类这次面临的问题不是问题无法解决,而是问题过于复杂。采用机械思维,其速度和效率已经赶不上新问题的产生。正是在这种分工越来越细,协作越来越紧密,问题越来越复杂的背景下,产生了大数据思维。大数据思维也由其独特的体量大、多样性和完备性,使得过去看来很复杂很难处理的问题变得可以解决了。

其实早在20世纪60年代就有研究学者提出采用人工智能的方法来解决社会问题。当时的人工智能方法还是局限于通过首先了解人类是如何产生智能,然后让计算机按照人的思路去做。吴军老师在《智能时代》中说到:“在人类发明的历史上,很多领域早期的尝试都是模仿人或者动物的行为,因为这是我们的直觉最容易想到的方法。” 但是经过十几年的发展,科学家们发现采用上面的思路去发展人工智能,似乎解决不了什么实际问题。很多科学家开始反思人工智能的发展,而在之后的20年左右的时间,在人工智能学术界的研究是处于低谷的。20世纪70年代,人类开始尝试智能的另一条发展道路,即采用数据驱动和超级计算的方法。即便在10年前,那时我还在念书,也曾接触过人工神经网络算法。很显然,当时对机器智能的概念大家都还是比较模糊的,人工智能也还没有被我们提高到现在的高度。

机器智能的概念在60多年就被提出来了,真正的突破却在具有了大数据的今天。为什么大数据的拐点会发生在今天?大数据到底面临何种技术挑战?

过去的10年,最容易看到的特征就是全球数据量呈爆炸式增长。大数据的第一个来源是电脑本身;第二个来源是传感器;第三个来源是将那些过去已经存在的、以非数字化形式储存的信息数字化。据2015年思科公司的统计数据显示,从2009~2015年的6年时间内,企业级数据增长了50倍。当然数据的爆炸式增长,离不开电脑硬件、软件、互联网、数据储存、数据处理等一系列配套技术的发展和支撑。大数据实际上是对计算机科学、电机工程、通信、应用数学和认知科学发展的一个综合考量。目前这些技术难题不一定有最佳的解决方案,甚至不存在什么绝对好的解决办法。

一、数据收集

传统的数据方法常常是先有一个目的,然后开始收集数据。比如,海王星的发现就是在人们发现天王星运动轨迹和牛顿力学预测出来的不一样之后,天文学家拍了很多星空的照片后发现的;心理学研究也是在有了一个明确的研究课题后,再通过实验的方法采集数据,如 “棉花糖测验”系列实验,以及关于认知失调的“追随者案例”等等。大数据则避免了采样之苦,因为大数据常常以全集(大数据的特征之一)作为样本集。

但是,如何收集到全集就是一件很有挑战的事情了。目前一些聪明公司,比如Google, Facebook, 百度,京东都是绕一个弯子,间接地去收集数据,然后利用数据的相关性,导出自己想要的结论。但是即便是这些如此成功的公司,仍然也有很多失败的案例。2010年,Google推出了自己的电视机顶盒Google TV,为了获取数据为进入电视广告做准备。但是,由于Google TV销售得很差,最终Google彻底地放弃了这产品。到目前为止,无论是Google过去的机顶盒,还是后来的Chromecast,苹果的Apple TV,除了统计一下收视率,计算一下可能的广告观众,并没有什么大的作为。数据收集是一个开放性的话题,不存在唯一性或最佳方法,目前仍然面临着很大的挑战。

二、数据储存

仅Google街景地图每天产生的数据量就有1TB,假如一份数据存三个拷贝,一年下来就1PB。即使使用当今最大容量的10TB硬盘,也需要用100个。因此,不能简单地依靠设备来解决数据储存的问题,而是需要技术解决方案来提高储存效率,保证不断产生出来的数据都能存得下。目前的数据储存手段主要是从如下2个方面考虑:去除数据冗余和便于使用。去除数据冗余可以简单理解为去除数据中的重复部分,比如同一份附件在所有的邮件中只储存一次。这样,在去除数据冗余的过程中,相应的数据读写处理就要改变。是否有比现在更有效率的储存格式或方式,仍然是大数据所面临的挑战。另外,便于使用的思路是从使用者的角度就去考虑数据的储存。大数据之前,数据在设计文件系统的数据储存格式时,主要考虑的是规模小、维度少的结构化数据。到了大数据时代,不仅数据量和维度都剧增,而且大数据在形式上也没有固定模式,因此需要重新设计通用、有效和便捷的数据表示方式和储存方式。

三、数据处理

大数据由于体量大、维度多,处理起来计算量巨大,其处理效率是一大技术挑战。并行计算是目前解决计算量巨大的重要手段,但仍然存在一些的问题。例如,任何一个问题总用一部分计算是无法并行计算的,这类计算占比越大,并行处理的效率就越低;再次,并行计算中无法保证每一个小任务的计算量是相同的,这样一来,并行计算的效率也会大打折扣,即完成了自己计算任务的服务器需要等待个别尚未完成的服务器,最终的计算速度取决于最后完成的子任务。

四、数据挖掘

如何从一堆杂乱无章的数据中挖掘出有价值的信息,是机器智能的关键,也是大数据的使命。数据在进行降噪处理之后,基本就可以直接使用了,接下来的关键一步就是机器学习。目前广泛使用的机器学习算法有人工神经网络算法、最大熵模型、逻辑自回归等。Google公司的AlphaGo的训练算法就是人工神经网络。机器学习的过程是一个不断迭代、不断进化的过程,只要事先定出一个目前,这些算法就会不断地优化模型,让它越来越接近真实的情况。寻找更优算法一直也是科学家们探索的难题。

五、数据安全

大数据应用的一个挑战还来自数据安全的担忧和对隐私的诉求。2014年爆出的索尼公司丢失数据时,造成的损失高达1亿美元。比商业数据丢失后损失更大的是医疗数据的被盗。在中国,除了在北京建立了大数据中心,还在贵阳建立了大数据灾备中心,而且正筹备在内蒙古再建立另一个数据灾备中心。而关于数据隐私,我想大家应该是深有感触,由于信息泄露而带来的骚扰电话以及电信诈骗,就发生在我们每个人身上。据《智能时代》中记载:“在美国的黑市上,一个医疗记录的卖家是商业数据的50倍左右”。可见,数据安全已然成为大数据发展的一大隐患和难题。

上述大数据5个方面的技术挑战并不是独立的,而是相辅相成、互相影响的。关于大数据的技术挑战在此仅谈谈个人的一点认识,希望对大家在这方面的思考有所帮助。下周我们继续聊,大数据给我们带来便利以及隐患。

公司近期安装了加密系统可以防止数据泄漏。

新形势、新安全面对严峻的数据泄漏形势,传统的信息安全措施难以独立应对,加强数据自身安全已迫在眉睫,数据泄露防护(DLP)、DSM数据加密软件、DSA数据安全隔离等产品必将获得广泛应用。

影响:

数据泄漏愈演愈烈,传统的防火墙、反病毒软件、入侵检测等信息安全防护措施,已难以独立应对,值得庆幸的是,在IT新技术迅速变化的新生态中,当传统安全法则在面临巨大挑战的同时,也为信息安全市场的发展提供了新的机遇: DLP数据泄露防护系统的异军突起。

DLP以数据为焦点、风险为驱动,依据数据特点与应用场景,在DLP平台上按需灵活采用敏感内容识别、加密、隔离等不同技术手段,防止敏感数据泄露、扩散。

此外,DSM数据加密软件、DSA数据安全隔离等产品也必将获得广泛应用。

大数据泛指巨量的数据集,因可从中挖掘出有价值的信息而受到重视。《华尔街日报》将大数据时代、智能化生产和无线网络革命称为引领未来繁荣的三大技术变革。麦肯锡公司的报告指出数据是一种生产资料,大数据是下一个创新、竞争、生产力提高的前沿。世界经济论坛的报告认定大数据为新财富,价值堪比石油。因此,发达国家纷纷将开发利用大数据作为夺取新一轮竞争制高点的重要抓手。

大数据时代的来临

互联网特别是移动互联网的发展,加快了信息化向社会经济各方面、大众日常生活的渗透。有资料显示,1998年全球网民平均每月使用流量是1MB(兆字节),2000年是10MB,2003年是100MB,2008年是1GB(1GB等于1024MB),2014年将是10GB。全网流量累计达到1EB(即10亿GB或1000PB)的时间在2001年是一年,在2004年是一个月,在2007年是一周,而2013年仅需一天,即一天产生的信息量可刻满188亿张DVD光盘。我国网民数居世界之首,每天产生的数据量也位于世界前列。淘宝网站每天有超过数千万笔交易,单日数据产生量超过50TB(1TB等于1000GB),存储量40PB(1PB等于1000TB)。百度公司目前数据总量接近1000PB,存储网页数量接近1万亿页,每天大约要处理60亿次搜索请求,几十PB数据。一个8Mbps(兆比特每秒)的摄像头一小时能产生36GB数据,一个城市若安装几十万个交通和安防摄像头,每月产生的数据量将达几十PB。医院也是数据产生集中的地方。现在,一个病人的CT影像数据量达几十GB,而全国每年门诊人数以数十亿计,并且他们的信息需要长时间保存。总之,大数据存在于各行各业,一个大数据时代正在到来。

信息爆炸不自今日起,但近年来人们更加感受到大数据的来势迅猛。一方面,网民数量不断增加,另一方面,以物联网和家电为代表的联网设备数量增长更快。2007年全球有5亿个设备联网,人均01个;2013年全球将有500亿个设备联网,人均70个。随着宽带化的发展,人均网络接入带宽和流量也迅速提升。全球新产生数据年增40%,即信息总量每两年就可以翻番,这一趋势还将持续。目前,单一数据集容量超过几十TB甚至数PB已不罕见,其规模大到无法在容许的时间内用常规软件工具对其内容进行抓取、管理和处理。

数据规模越大,处理的难度也越大,但对其进行挖掘可能得到的价值更大,这就是大数据热的原因。首先,大数据反映舆情和民意。网民在网上产生的海量数据,记录着他们的思想、行为乃至情感,这是信息时代现实社会与网络空间深度融合的产物,蕴含着丰富的内涵和很多规律性信息。根据中国互联网络信息中心统计,2012年底我国网民数为564亿,手机网民为42亿,通过分析相关数据,可以了解大众需求、诉求和意见。其次,企业和政府的信息系统每天源源不断产生大量数据。根据赛门铁克公司的调研报告,全球企业的信息存储总量已达22ZB(1ZB等于1000EB),年增67%。医院、学校和银行等也都会收集和存储大量信息。政府可以部署传感器等感知单元,收集环境和社会管理所需的信息。2011年,英国《自然》杂志曾出版专刊指出,倘若能够更有效地组织和使用大数据,人类将得到更多的机会发挥科学技术对社会发展的巨大推动作用。

大数据应用的领域

大数据技术可运用到各行各业。宏观经济方面,IBM日本公司建立经济指标预测系统,从互联网新闻中搜索影响制造业的480项经济数据,计算采购经理人指数的预测值。印第安纳大学利用谷歌公司提供的心情分析工具,从近千万条网民留言中归纳出六种心情,进而对道琼斯工业指数的变化进行预测,准确率达到87%。制造业方面,华尔街对冲基金依据购物网站的顾客评论,分析企业产品销售状况;一些企业利用大数据分析实现对采购和合理库存量的管理,通过分析网上数据了解客户需求、掌握市场动向。有资料显示,全球零售商因盲目进货导致的销售损失每年达1000亿美元,这方面的数据分析大有作为。

在农业领域,硅谷有个气候公司,从美国气象局等数据库中获得几十年的天气数据,将各地降雨、气温、土壤状况与历年农作物产量的相关度做成精密图表,预测农场来年产量,向农户出售个性化保险。在商业领域,沃尔玛公司通过分析销售数据,了解顾客购物习惯,得出适合搭配在一起出售的商品,还可从中细分顾客群体,提供个性化服务。在金融领域,华尔街“德温特资本市场”公司分析34亿微博账户留言,判断民众情绪,依据人们高兴时买股票、焦虑时抛售股票的规律,决定公司股票的买入或卖出。阿里公司根据在淘宝网上中小企业的交易状况筛选出财务健康和讲究诚信的企业,对他们发放无需担保的贷款。目前已放贷300多亿元,坏账率仅03%。

在医疗保健领域,“谷歌流感趋势”项目依据网民搜索内容分析全球范围内流感等病疫传播状况,与美国疾病控制和预防中心提供的报告对比,追踪疾病的精确率达到97%。社交网络为许多慢性病患者提供临床症状交流和诊治经验分享平台,医生借此可获得在医院通常得不到的临床效果统计数据。基于对人体基因的大数据分析,可以实现对症下药的个性化治疗。在社会安全管理领域,通过对手机数据的挖掘,可以分析实时动态的流动人口来源、出行,实时交通客流信息及拥堵情况。利用短信、微博、微信和搜索引擎,可以收集热点事件,挖掘舆情,还可以追踪造谣信息的源头。美国麻省理工学院通过对十万多人手机的通话、短信和空间位置等信息进行处理,提取人们行为的时空规律性,进行犯罪预测。在科学研究领域,基于密集数据分析的科学发现成为继实验科学、理论科学和计算科学之后的第四个范例,基于大数据分析的材料基因组学和合成生物学等正在兴起。

麦肯锡公司2011年报告推测,如果把大数据用于美国的医疗保健,一年产生潜在价值3000亿美元,用于欧洲的公共管理可获得年度潜在价值2500亿欧元;服务提供商利用个人位置数据可获得潜在的消费者年度盈余6000亿美元;利用大数据分析,零售商可增加运营利润60%,制造业设备装配成本会减少50%。

大数据技术的挑战和启示

目前,大数据技术的运用仍存在一些困难与挑战,体现在大数据挖掘的四个环节中。首先在数据收集方面。要对来自网络包括物联网和机构信息系统的数据附上时空标志,去伪存真,尽可能收集异源甚至是异构的数据,必要时还可与历史数据对照,多角度验证数据的全面性和可信性。其次是数据存储。要达到低成本、低能耗、高可靠性目标,通常要用到冗余配置、分布化和云计算技术,在存储时要按照一定规则对数据进行分类,通过过滤和去重,减少存储量,同时加入便于日后检索的标签。第三是数据处理。有些行业的数据涉及上百个参数,其复杂性不仅体现在数据样本本身,更体现在多源异构、多实体和多空间之间的交互动态性,难以用传统的方法描述与度量,处理的复杂度很大,需要将高维图像等多媒体数据降维后度量与处理,利用上下文关联进行语义分析,从大量动态而且可能是模棱两可的数据中综合信息,并导出可理解的内容。第四是结果的可视化呈现,使结果更直观以便于洞察。目前,尽管计算机智能化有了很大进步,但还只能针对小规模、有结构或类结构的数据进行分析,谈不上深层次的数据挖掘,现有的数据挖掘算法在不同行业中难以通用。

大数据技术的运用前景是十分光明的。当前,我国正处在全面建成小康社会征程中,工业化、信息化、城镇化、农业现代化任务很重,建设下一代信息基础设施,发展现代信息技术产业体系,健全信息安全保障体系,推进信息网络技术广泛运用,是实现四化同步发展的保证。大数据分析对我们深刻领会世情和国情,把握规律,实现科学发展,做出科学决策具有重要意义,我们必须重新认识数据的重要价值。

为了开发大数据这一金矿,我们要做的工作还很多。首先,大数据分析需要有大数据的技术与产品支持。发达国家一些信息技术(IT)企业已提前发力,通过加大开发力度和兼并等多种手段,努力向成为大数据解决方案提供商转型。国外一些企业打出免费承接大数据分析的招牌,既是为了练兵,也是为了获取情报。过分依赖国外的大数据分析技术与平台,难以回避信息泄密风险。有些日常生活信息看似无关紧要,其实从中也可摸到国家经济和社会脉搏。因此,我们需要有自主可控的大数据技术与产品。美国政府2012年3月发布《大数据研究与发展倡议》,这是继1993年宣布“信息高速公路”之后又一重大科技部署,联邦政府和一些部委已安排资金用于大数据开发。我们与发达国家有不少差距,更需要国家政策支持。

中国人口居世界首位,将会成为产生数据量最多的国家,但我们对数据保存不够重视,对存储数据的利用率也不高。此外,我国一些部门和机构拥有大量数据却不愿与其他部门共享,导致信息不完整或重复投资。政府应通过体制机制改革打破数据割据与封锁,应注重公开信息,应重视数据挖掘。美国联邦政府建立统一数据开放门户网站,为社会提供信息服务并鼓励挖掘与利用。例如,提供各地天气与航班延误的关系,推动航空公司提升正点率。

大数据的挖掘与利用应当有法可依。去年底全国人大通过的加强网络信息保护的决定是一个好的开始,当前要尽快制定“信息公开法”以适应大数据时代的到来。现在很多机构和企业拥有大量客户信息。应当既鼓励面向群体、服务社会的数据挖掘,又要防止侵犯个体隐私;既提倡数据共享,又要防止数据被滥用。此外,还需要界定数据挖掘、利用的权限和范围。大数据系统本身的安全性也是值得特别关注的,要注意技术安全性和管理制度安全性并重,防止信息被损坏、篡改、泄露或被窃,保护公民和国家的信息安全。

大数据时代呼唤创新型人才。盖特纳咨询公司预测大数据将为全球带来440万个IT新岗位和上千万个非IT岗位。麦肯锡公司预测美国到2018年需要深度数据分析人才44万—49万,缺口14万—19万人;需要既熟悉本单位需求又了解大数据技术与应用的管理者150万,这方面的人才缺口更大。中国是人才大国,但能理解与应用大数据的创新人才更是稀缺资源。

大数据是新一代信息技术的集中反映,是一个应用驱动性很强的服务领域,是具有无穷潜力的新兴产业领域;目前,其标准和产业格局尚未形成,这是我国实现跨越式发展的宝贵机会。我们要从战略上重视大数据的开发利用,将它作为转变经济增长方式的有效抓手,但要注意科学规划,切忌一哄而上。

(作者:中国工程院院士)

大数据安全的六大挑战_数据分析师考试

大数据的价值为大家公认。业界通常以4个“V”来概括大数据的基本特征——Volume(数据体量巨大)、Variety(数据类型繁多)、Value(价值密度低)、Velocity(处理速度快)。当你准备对大数据所带来的各种光鲜机遇大加利用的同时,请别忘记大数据也会引入新的安全威胁,存在于大数据时代“潘多拉魔盒”中的魔鬼可能会随时出现。

挑战一:大数据的巨大体量使得信息管理成本显著增加

4个“V”中的第一个“V”(Volume),描述了大数据之大,这些巨大、海量数据的管理问题是对每一个大数据运营者的最大挑战。在网络空间,大数据是更容易被“发现”的显著目标,大数据成为网络攻击的第一演兵场所。一方面,大量数据的集中存储增加了泄露风险,黑客的一次成功攻击能获得比以往更多的数据量,无形中降低了黑客的进攻成本,增加了“攻击收益”;另一方面,大数据意味着海量数据的汇集,这里面蕴藏着更复杂、更敏感、价值巨大的数据,这些数据会引来更多的潜在攻击者。

在大数据的消费者方面,公司在未来几年将处理更多的内部生成的数据。然而在许多组织中,不同的部门像财务、工程、生产、市场、IT等之间的信息仍然是孤立的,各部门之间相互设防,造成信息无法共享。那些能够在不破坏壁垒和部门现实优势的前提下更透明地沟通的公司将更具竞争优势。

解决方案 首先要找到有安全管理经验并受过大数据管理所需要技能培训的人员,尤其是在今天人力成本和培训成本不断上升的节奏中,这一定足以让许多CEO肝颤,但这些针对大数据管理人员的巨额教育和培训成本,是一种非常必要的开销。

与此同时,在流程的设计上,一定要将数据分散存储,任何一个存储单元被“黑客”攻破,都不可能拿到全集,同时对于不同安全域要进行准确的评估,像关键信息索引的保护一定要加强,“好钢用在刀刃上”,作为数据保全,能够应对部分设施的灾难性损毁。

挑战二:大数据的繁多类型使得信息有效性验证工作大大增加

4个“V”中的第二个“V”(Variety),描述了数据类型之多,大数据时代,由于不再拘泥于特定的数据收集模式,使得数据来自于多维空间,各种非结构化的数据与结构化的数据混杂在一起。

未来面临的挑战将会是从数据中提取需要的数据,很多组织将不得不接受的现实是,太多无用的信息造成的信息不足或信息不匹配。我们可以考虑这样的逻辑:依托于大数据进行算法处理得出预测,但是如果这些收集上来的数据本身有问题又该如何呢也许大数据的数据规模可以使得我们无视一些偶然非人为的错误,但是如果有个敌手故意放出干扰数据呢现在非常需要研究相关的算法来确保数据来源的有效性,尤其是比较强调数据有效性的大数据领域。

正是因为这个原因,对于正在收集和储存大量客户数据的公司来说,最显而易见的威胁就是在过去的几年里,存放于企业数据库中数以TB计,不断增加的客户数据是否真实可靠,依然有效。

众所周知,海量数据本身就蕴藏着价值,但是如何将有用的数据与没有价值的数据进行区分看起来是一个棘手的问题,甚至引发越来越多的安全问题。

解决方案 尝试尽可能使数据类型具体化,增加对数据更细粒度的了解,使数据本身更加细化,缩小数据的聚焦范围,定义数据的相关参数,数据的筛选要做得更加精致。与此同时,进一步健全特征库,加强数据的交叉验证,通过逻辑冲突去伪存真。

挑战三:大数据的低密度价值分布使得安全防御边界有所扩展

4个“V”中的第三个“V”(Value),描述了大数据单位数据的低价值。这种广种薄收似的价值量度,使得信息效能被摊薄了,大数据的安全预防与攻击事件的分析过程更加复杂,相当于安全管理范围被放大了。

大数据时代的安全与传统信息安全相比,变得更加复杂,具体体现在三个方面:一方面,大量的数据汇集,包括大量的企业运营数据、客户信息、个人的隐私和各种行为的细节记录,这些数据的集中存储增加了数据泄露风险;另一方面,因为一些敏感数据的所有权和使用权并没有被明确界定,很多基于大数据的分析都未考虑到其中涉及的个体隐私问题;再一方面,大数据对数据完整性、可用性和秘密性带来挑战,在防止数据丢失、被**、被滥用和被破坏上存在一定的技术难度,传统的安全工具不再像以前那么有用。

解决方案 确立有限管理边界,依据保护要求,加强重点保护,构建一体化的数据安全管理体系,遵循网络防护和数据自主预防并重的原则,并不是实施了全面的网络安全护理就能彻底解决大数据的安全问题,数据不丢失只是传统的边界网络安全的一个必要补充,我们还需要对大数据安全管理的盲区进行监控,只有将二者结合在一起,才是一个全面的一体化安全管理的解决方案

挑战四:大数据的快速处理要求使得独立决策的比例显著降低

“4个“V”中最后一个“V”(Velocity),决定了利用海量数据快速得出有用信息的属性。

大数据时代,对事物因果关系的关注,转变为对事物相关关系的关注。如果大数据系统只是一种辅助决策系统,这还不是最可怕的。事实上,今天大数据分析日益成为一项重要的业务决策流程,越来越多的决策结果来自于大数据的分析建议,对于领导者最艰难的事情之一,是让我的逻辑思考来做决定,还是由机器的数据分析做决定,可怕的是,今天看来,机器往往是正确的,这不得不让我们产生依赖。试想一下,如果收集的数据已经被修正过,或是系统逻辑已经被控制了呢!但是面对海量的数据收集、存储、管理、分析和共享,传统意义上的对错分析和奇偶较验已失去作用。

解决方案 在依靠大数据进行分析、决策的同时,还应辅助其他的传统决策支持系统,尽可能明智地使用数据所告诉我们的结果,让大数据为我们所用。但绝对不要片面地依赖于大数据系统。

挑战五:大数据独特的导入方式使得攻防双方地位的不对等性大大降低

在大数据时代,数据加工和存储链条上的时空先后顺序已被模糊,可扩展的数据联系使得隐私的保护更加困难。过去传统的安全防护工作,是先扎好篱笆、筑好墙,等待“黑客”的攻击,我们虽然不知道下一个“黑客”是谁,但我们一定知道,它是通过寻求新的漏洞,从前面逐层进入。守方在明处,但相比攻方有明显的压倒性优势。而在大数据时代,任何人都可以是信息的提供者和维护者,这种由先天的结构性导入设计所带来的变化,你很难知道“它”从哪里进来,“哪里”才是前沿。这种变化,使得攻、防双方的力量对比的不对等性大大下降。

同时,由于这种不对等性的降低,在我们用数据挖掘和数据分析等大数据技术获取有价值信息的同时,“黑客”也可以利用这些大数据技术发起新的攻击。“黑客”会最大限度地收集更多有用信息,比如社交网络、邮件、微博、电子商务、电话和家庭住址等信息,大数据分析使“黑客”的攻击更加精准。此外,“黑客”可能会同时控制上百万台傀儡机,利用大数据发起僵尸网络攻击。

解决方案 面对大数据所带来新的安全问题,有针对性地更新安全防护手段,增加新型防护手段,混合生产数据和经营数据,多种业务流并行,增加特征标识建设内容,增强对数据资源的管理和控制。

挑战六:大数据网络的相对开放性使得安全加固策略的复杂性有所降低

在大数据环境下,数据的使用者同时也是数据的创造者和供给者,数据间的联系是可持续扩展的,数据集是可以无限延伸的,上述原因就决定了关于大数据的应用策略要有新的变化,并要求大数据网络更加开放。大数据要对复杂多样的数据存储内容做出快速处理,这就要求很多时候,安全管理的敏感度和复杂度不能定得太高。此外,大数据强调广泛的参与性,这将倒逼系统管理者调低许多策略的安全级别。

当然,大数据的大小也影响到安全控制措施能否正确地执行,升级速度无法跟上数据量非线性增长的步伐,就会暴露大数据安全防护的漏洞。

解决方案 使用更加开放的分布式部署方式,采用更加灵活、更易于扩充的信息基础设施,基于威胁特征建立实时匹配检测,基于统一的时间源消除高级可持续攻击(APT)的可能性,精确控制大数据设计规模,削弱“黑客”可以利用的空间。

大数据时代已经到来,大数据已经产生出巨大影响力,并对我们的社会经济活动带来深刻影响。充分利用大数据技术来挖掘信息的巨大价值,从而实现并形成强有力的竞争优势,必将是一种趋势。面对大数据时代的六种安全挑战,如果我们能够予以足够重视,采取相应措施,将可以起到未雨绸缪的作用。

以上是小编为大家分享的关于大数据安全的六大挑战的相关内容,更多信息可以关注环球青藤分享更多干货

您的企业是否总是担心公司内部的各种技术机密和商务秘密通过计算机的电子文档泄漏出去?

若泄漏是否会直接影响企业生存和发展?

您的企业是否总有人员流动?

原工作人员是否将工作涉及的文档都通过U盘或电子邮件拷贝走了?

现在的工作人员是否有可能将各种机密泄漏给竞争对手?

工作人员离职后是否变成了企业的竞争对手?

您的企业把USB端口、光驱、软驱、互联网、计算机后盖全都封住了就能保证电子文档不会泄漏出去吗?

商场如战场,波谲云涌。身处其中的企业在日益激烈的商场竞争中不仅要应对来自竞争对手的挑战,还要面对企业内部的各种业务,因此承载企业重要商业信息的文件就在交错纷杂的商场风云下面临着各种安全隐患。没有进行加密防护的文件犹如一个诱人的苹果,谁都能轻易咬上一口。那么在这个没有硝烟的战场中,让域之盾加密软件坐镇文件安全,才能让企业放下包袱,轻装上阵。

域之盾加密功能如下 :

1 透明加解密

系统根据管理策略对相应文件进行加密,用户访问需要连接到服务器,按权限访问,越权访问会受限,通过共享、离线和外发管理可以实现更多的访问控制。

2 泄密控制

对打开加密文档的应用程序进行打印、内存窃取、拖拽和剪贴板等 *** 作管控,用户不能主动或被动地泄漏机密数据。

3 审批管理

支持共享、离线和外发文档,管理员可以按照实际工作需求,配置是否对这些 *** 作进行强制审批。用户在执行加密文档的共享、离线和外发等 *** 作时,将视管理员的权限许可,可能需要经过审批管理员审批。

4 离线文档管理

对于员工外出无法接入网络的情况可采用系统的离线管理功能。通过此功能授权指定用户可以在一定时间内不接入网络仍可轻松访问加密数据,而该用户相应的安全策略仍然生效,相应数据仍然受控,文档权限也与联网使用一样。

5 外发文档管理

本功能主要是解决数据二次泄密的威胁,目的是让发出的文档仍然受控。通过此功能对 需要发出的文件进行审批和授权后,使用者不必安装加密客户端即可轻松访问受控文件,且可对文件的 *** 作权限及生命周期予以管控。

6 审计管理

对加密文档的常规 *** 作,进行详细且有效的审计。对离线用户,联网后会自动上传相关日志到服务器。

7 自我保护

通过在 *** 作系统的驱动层对系统自身进行自我保护,保障客户端不被非法破坏,并且始终运行在安全可信状态。即使客户端被意外破坏,客户端计算机里的加密文档也不会丢失或泄漏。

一、建立数据治理计划时,您将遇到几个挑战:

·  数据治理是更大的 IT治理策略的一部分。  数据与IT部门需要相互配合才能成功。

·  进行任何类型的优化都很难,让员工关心数据治理更是难上加难。  需要激励和动力来让你的员工遵循新数据治理计划。

·  数据治理工作需要灵活地适应团队需求,并且对用户来说必须简单易用。  如果数据治理阻碍了政正常业务工作,则不会促进业务目标。

二、面对这些挑战,您应该如何实施数据治理方案?

以下是8点数据治理最佳实践方法,它们将帮助您进行数据治理。

1  为您的数据设置格式标准, 并在后期处理和将数据提取到大数据平台中时使用技术来实施这些标准。您将要从许多不同的来源中提取数据,因此您应该对大数据系统中的数据进行规范化。

2  非托管数据也是重要数据! 文件,文件夹和共享中的数据是您最有价值的数据中的一部分,而且通常比托管数据具有更大的风险。确保您的数据治理策略涵盖非结构化数据。

3 尽早制定 业务目标 以进行数据治理,并分配一名首席数据官(CDO)。使CDO负责管理和实现数据治理目标。

4  把事情简单化! 数据治理不是企业大多数人的主要工作。最大限度地减少对个人贡献者和团队的影响。

5  为数据治理团队的成员建立不同的角色。 数据所有者是关键,因为它们与创建和管理的数据最接近。您可以分配数据管理人员与数据所有者合作,以进行指导并促进沟通。您的数据治理团队应具有跨职能并有权推动您的数据治理计划。

6  对所有数据进行分类和标记。 为元数据建立标准,以促进您的业务目标并允许重复使用数据。

7  用几种不同的方式衡量您的进度。 您可以收集的指标越多越好。数据治理的一些关键指标可能是您要保存多少陈旧数据,已分配数据所有者的文件夹数量以及所创建的敏感数据数量。

8  尽可能自动化。  自动化工作流程,批准流程, 数据请求,权限请求以及您可以执行的其他所有 *** 作,以使数据治理计划能够高效运转。

三、数据治理工具推荐--睿治数据治理工具

面对以上8点数据治理最佳实践方法,我为您推荐一款好用的数据治理工具配合实施数据治理方案,不仅可以保证您的数据治理项目按计划实施,也可以将每一个过程都以实时可视化的方式展示给您。以下为数据治理工具推荐:

睿治数据治理平台融合数据集成、数据交换、实时计算存储、元数据管理、数据标准管理、数据质量管理、主数据管理、数据资产管理、数据安全管理、数据生命周期管理十大产品模块,打通数据治理各个环节,十大产品模块可独立或任意组合使用,快速满足政府、企业各类不同的数据治理场景。

四、睿治数据治理工具实施案例

山东某能源集团大数据资产平台

建设内容:

建设集团 数据治理体系 ,从根本解决问题,掌握数据来龙去脉,发现数据质量原因从源头提升数据质量;实现数据赋能对人财物产供销环数据集市建设,全面实现业务人员自助取数分析;建设集团数据应用商店实现数字化运营,实现数据市场化管理,通过智能化、自动化减少运营成本,降低安全风险,提升工作效率,增加企业市场竞争力。

项目价值:

基于数据治理体系建立集团大数据资产平台,运用大数据技术实现数据采集、清洗、分析建模的设计,形成集团高质量数据资产,通过数据资产目录对全集团发布,并用业务元数据解释数据含义,便于业务人员定位自己所需数据,与此同时,业务人员可以对自己所需数据提出申请,审批通过后,可直接基于治理数据利用敏捷分析工具实现自助探索分析,真正实现数据赋能,保障日常生产经营管理。

免费试用数据治理工具

以上就是关于大数据面临的技术挑战全部的内容,包括:大数据面临的技术挑战、公司近期安装了加密系统,真的能防止数据泄漏么、如何应对大数据时代的变革机遇挑战等相关内容解答,如果想了解更多相关内容,可以关注我们,你们的支持是我们更新的动力!

欢迎分享,转载请注明来源:内存溢出

原文地址: https://outofmemory.cn/langs/8824860.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
上一篇 2023-04-22
下一篇 2023-04-22

发表评论

登录后才能评论

评论列表(0条)

保存