DataFrame是R中一个基本结构,俗称数据框。其内部可以由多种数据类型,每一列是一个变量,每行是一个观测记录。在R中数据框是很通用的数据结构,它是一种特殊的列表对象。
在R中数据框对象包含了大量的基本数理统计运算,从简单的最大最小值和均值,再到协方差等等。
可以说数据框是了解一系列数据基本特性的快速方法,数据框的存在让R更加易用。
在Spark 1.3中新增了DataFrame,隶属于Spark-Sql模块下。
在即将到来的1.4版本中DataFrame的功能进一步扩充,而且在后续版本中会进一步提升。
具体可以参考
而1.4版本中主要增加的功能有:
- 随机数据生成
- 描述性统计
- 样本协方差和相关性
- 列联表
- 频繁项
随机数据生成
随机数据生成对于测试现有算法很有用,也可以用在随机算法的开发中。
SQLContext sqlContext =new SQLContext(sc);
DataFrame dataFrame = sqlContext.range(1,10);
DataFrame frame = dataFrame.select(functions.col("id"), functions.rand(10).alias("uniform"), functions.randn(25).alias("normal"));
frame.describe("uniform","normal").show();

描述性统计
获得一些数据后需要做的第一步就是对数据整体有一个感知。描述性统计是指运用制表和分类,图形以及计算概括性数据来描述数据特征的各项活动。
描述性统计可以帮助我们了解到数据的大体分布和情况。
Spark中的描述统计提供了计数,均值,标准差,最大最小值等信息。
SQLContext sqlContext =new SQLContext(sc);



