BT

如何利用碎片时间提升技术认知与能力? 点击获取答案

你的大数据项目使用的工具正确吗?

| 作者 侠天 关注 5 他的粉丝 发布于 2016年4月1日. 估计阅读时间: 4 分钟 | 如何结合区块链技术,帮助企业降本增效?让我们深度了解几个成功的案例。

工具/产品/解决方案是数据科学家洞察数据的利器。KDNuggets网站对此观点进行了年度调查,来分析数据科学家在用哪些类型的工具,并提供了调查的匿名原始数据

通过主成分析(PCA)法进行降维分析

对所有的工具同时进行关系分析,常规来说,PCA通过对大样本数据统计性质(eg, 协方差)的分析,试图用主要特征来解释关系。

分析结果:

当前分析的目标:通过一些主成分来分析95种工具之间的关系。最终决定以PCA的特征值来决定主成分的数目,这里选用了两种规则:一种是以特征值大于1的特征值数量来选择主成分数量;一种是画陡坡图(scree plot),通过95个特征值你会发现一个拐点的特征值。

特征点点陡坡图显示在第13和第14特征点时出现拐点,因此,这里选择的13个主成分来解释它们之间的关系,见下图。

(点击看大图)

工具分类

下面列出根据主成分析得出的13类工具(投票数大于20):

  1. 大数据生态(Hadoop、Spark)和开源项目:Hadoop, HBase, Hive, Mahout, MLlib, Other Hadoop/HDFS-based tools, Pig, Scala, Spark, SQL on Hadoop tools

  2. 微软数据科学家工具:Microsoft Azure ML, Microsoft Power BI, Microsoft SQL Server, Revolution Analytics

  3. 基于Python的机器学习:Dataiku, H2O (0xdata), Python, scikit-learn, Theano, Vowpal Wabbit

  4. SAS公司产品:JMP, SAS Base, SAS Enterprise Miner

  5. MATLAB、R语言等统计工具:Gnu Octave, MATLAB, Orange, R, RapidMiner, Rattle, Weka

  6. IBM公司产品:IBM Cognos, IBM SPSS Modeler, IBM SPSS Statistics, IBM Watson Analytics

  7. Linux工具和SQLang:Actian, C/C++, Perl, SQLang, Unix shell/awk/gawk

  8. 深度学习:Caffe, Pylearn2

  9. 商务智能软件:Pentaho and QlikView

  10. 数据分析平台:Datameer and Zementis

  11. Excel和Word统计工具:XLSTAT for Excel

  12. 其它:Other Deep Learning tools, Other free analytics/data mining tools, Other Hadoop/HDF-based tools, Other paid analytics/data mining/data science software, Other programming languages

  13. 数据可视化:C4.5/C5.0/See5, Miner3D, Oracle Data Miner

总结

数据科学家在选择大数据、数据挖掘和数据分析工具时,更倾向于有一定生态基础的工具,这样各个工具间可以相互支持。

为了提高在大数据项目中成功的机会,选择正确的工具是非常重要的。没有一个孤立的工具能够做所有的数据分析,职业的数据专家趋向于使用不止一种相关的工具(分析中发现,数据专家平均使用5种数据分析工具)。你可以根据使用相关工具的数据专家来决定自己的选择。

另外一个观点是,要选择大厂的产品,比如,IBM、微软和SAS,大品牌的产品更丰富,可以使得你的产品更容易扩展。


感谢杜小芳对本文的审校。

给InfoQ中文站投稿或者参与内容翻译工作,请邮件至editors@cn.infoq.com。也欢迎大家通过新浪微博(@InfoQ@丁晓昀),微信(微信号:InfoQChina)关注我们。

评价本文

专业度
风格

您好,朋友!

您需要 注册一个InfoQ账号 或者 才能进行评论。在您完成注册后还需要进行一些设置。

获得来自InfoQ的更多体验。

告诉我们您的想法

允许的HTML标签: a,b,br,blockquote,i,li,pre,u,ul,p

当有人回复此评论时请E-mail通知我

图片怎么了? by PAN MINGJIA

图片怎么了?

Re: 图片怎么了? by Ding Alice

点击可以看大图啦。

可信度不高! by Henry Bee

KDNuggets网站学生比较多,可信度不高!没有Knime、没有Rapidminer,C4.5和C5竟然是数据可视化,直接醉了!Oracle Data Miner作为工具实在太low了啊!

允许的HTML标签: a,b,br,blockquote,i,li,pre,u,ul,p

当有人回复此评论时请E-mail通知我

允许的HTML标签: a,b,br,blockquote,i,li,pre,u,ul,p

当有人回复此评论时请E-mail通知我

3 讨论

登陆InfoQ,与你最关心的话题互动。


找回密码....

Follow

关注你最喜爱的话题和作者

快速浏览网站内你所感兴趣话题的精选内容。

Like

内容自由定制

选择想要阅读的主题和喜爱的作者定制自己的新闻源。

Notifications

获取更新

设置通知机制以获取内容更新对您而言是否重要

BT