当前位置:首页 > 运营推广

刘德寰:大数据的五点思考

时间:2018-11-08 18:40:00来源:运营推广 作者:seo实验室小编 阅读:85次
 

刘德寰

1

本文作者刘德寰系北京大学传播学系教授。

大数据不在乎体量有多少,而是背后用它的那个大脑。实则大众对大数据依然存在不少误解。刘得寰教授在微博上发表了其对大数据的五点思考(后续可能还有更新),对近期大数据被大众捧为瑰宝的做法提出了自己不同观点:

任何一个网站的数据都是人们互联网行为数据的很小的一个子集,无论这个子集多么全面,分析多么深入,都是子集,不是全集。对于企业来讲,竞争对手的数据价值远远超过自己网站数据的价值,从量级上,对于所有公司都一样,自己拥有的数据远远小于全集数据。看起来的全数据恰恰是残缺数据。

数据量的大幅增加会造成结果的不准确,来源不同的信息混杂会加大数据的混乱程度。研究发现:巨量数据集和细颗粒度的测量会导致出现“错误发现”的风险增加。那种认为“假设、检验、验证的科学方法已经过时”的论调,正是大数据时代的混乱与迷茫,人们索性拥抱凯文凯利所称的混乱。

互联网用户的基本特征、消费行为、上网行为、渠道偏好、行为喜好、生活轨迹与位置等,反映用户的基本行为规律。体系完整是所有分析性工作的第一步,完整的框架甚至胜过高深的模型。人类的认识最大的危险是不顾后果的运用局部知识。如果只关心自己网站数据,其分析基础必然是断裂数据。

现在谈到大数据,基本有四个混乱观念:第一,大数据是全数据,忽视甚至蔑视抽样;第二,连续数据就是大数据;第三,数据量级大是大数据;第四,数据量大好于量小。对应的是:抽样数据只要抽样合理,结论准确;连续只是一个数据结构;大量级的噪音会得出错误结论;大小与价值关系不大。

大数据不是新事物,天气、地震、量子物理、基因、医学等都是,借鉴他们的方法有益。他们用抽样调查。互联网数据挖掘方法论也如此,不同的是更难,因为人的复杂性。既然是关于人的研究就需应用所有研究人的方法梳理大数据。只要懂编程、懂调动数据的人就可以做大数据挖掘的说法是谬误。

相关阅读

iPad怎么连接电脑需要与电脑交换数据

终于把心爱的iPad Air抱回家,却发现不会如何连接电脑?我们在使用iPad Air需要与电脑交换数据的时候,iPad Air怎么连接电脑,是让不少第

容易被站长忽视的内容:主动访问用户数据

什么是主动访问用户主动访问用户也可以称为忠诚用户、自有用户,搜索引擎可以通过多种渠道和手段定位网站的主动访问用户。主动访问

富人发正品,穷人发A货,大数据售假是个什么鬼?

什么什么,商家开始用大数据分析你的贫富状况并根据结果选择发A货还是真货了?前段时间曝光的一系列杀熟事件似乎给大数据头顶压上不

绍兴阳光网魏晋:关于地方社区的一些思考

04年开始创业,做地方性网站,一直做到今天。前三年还做了些其他事情,后面6年一直专注做地方社区,现在做下简单总结。一路过来,折腾的东

微信又改版,头条变次条,这是我们的观察和思考

这一次,微信订阅号「信息流」更新为卡片样式,题目位于封面图最上方,不再有单独的标题呈现区域。头条封面图拓宽,占满了整个卡片,非头条

分享到:
发表评论
用户名: 密码: 匿名

栏目导航

推荐阅读

热门阅读