刘德寰大数据的五点思考
百度权重查询 站长交易 友谊链接交换 网站监控 服务器监控 SEO监控
本文作者刘德寰系北京大学传播学系教授。
大数据不在乎体量有多少青岛网站制作,而是背后用它的那个大脑。实则大众对大数据依然存在不少误解。刘得寰教授在微博上发表了其对大数据的五点思考(后续可能还有更新),对近期大数据被大众捧为瑰宝的做法提出了本身不同观点:
任何一个网站的数据都是人们互联网举动数据的很小的一个子集,无论这个子集多么周全,分析多么深入,都是子集,不是全集。对于企业来讲,竞争对手的数据价值远远超过本身网站数据的价值,从量级上,对于所有公司都一样,本身拥有的数据远远小于全集数据。看起来的全数据恰恰是残缺数据。
数据量的大幅增长会造成效果的不正确,来源不同的信息混杂会加大数据的紊乱程度。研究发现:巨量数据集和细颗粒度的测量会导致出现“错误发现”的风险增长。那种认为“假设、检验、验证的科学方法已经过时”的论调,正是大数据时代的紊乱与迷茫,人们索性拥抱凯文凯利所称的紊乱。
互联网用户的基本特性、消耗举动、上网举动、渠道偏好、举动喜爱、生活轨迹与位置等,反映用户的基本举动规律。系统完备是所有分析性工作的第一步,完备的框架甚至赛过高深的模型。人类的熟悉最大的伤害是不顾后果的运用局部知识。假如只关心本身网站数据,其分析基础必然是断裂数据。
如今谈到大数据房地产策划公司,基本有四个紊乱观念:第一,大数据是全数据,忽视甚至蔑视抽样;第二,延续数据就是大数据;第三,数据量级大是大数据;第四,数据量大好于量小。对应的是:抽样数据只要抽样合理,结论正确;延续只是一个数据结构;大量级的噪音会得出错误结论;大小与价值关系不大。
大数据不是新事物,气候、地震、量子物理、基因、医学等都是,借鉴他们的方法有益。他们用抽样调查。互联网数据发掘方法论也如此,不同的是更难1.95刺影合击百度优化,由于人的复杂性。既然是关于人的研究就需应用所有研究人的方法梳理大数据。只要懂编程、懂调动数据的人就可以做大数据发掘的说法是谬误。
注:相干网站建设技巧阅读请移步到建站教程频道。
珍藏本文相干文章列表:
- 大数据时代:传统服务器挺进云端
- 百度引入全国组织机构代码管理中间权威数据
- 腾讯云陈磊:数据服务应以用户价值为依归
- 百度分享时该细致点什么?