您的位置:首页 > 编程语言 > Python开发

python数据分析pandas包入门学习(三)汇总和统计描述

2016-11-23 09:59 1016 查看
本文参考《利用Python进行数据分析》的第五章 pandas入门

pandas拥有一组常用的数学和统计方法。它们大部分属于约简和汇总统计,用于从Series中提取单个值(如sum和mean),或从DataFrame的行或列中提取一个Series。跟对应的Numpy数组方法相比,它们都是基于没有缺失数据的假设而构建的。





idxmin()/idxmax():返回最小值最大值的索引



cumsum():返回列累积和



describe():产生汇总统计







相关系数和协方差corr(), cov()

协方差cov():表示线性相关的方向,取值正无穷到负无穷。协方差为正值,说明一个变量变大另一个变量也变大;协方差取负值,说明一个变量变大另一个变量变小,取0说明两个变量咩有相关关系。

相关系数corr():不仅表示线性相关的方向,还表示线性相关的程度,取值[-1,1]。也就是说,相关系数为正值,说明一个变量变大另一个变量也变大;取负值说明一个变量变大另一个变量变小,取0说明两个变量没有相关关系。同时,相关系数的绝对值越接近1,线性关系越显著。

下图为计算a列和b列的相关系数corr()和协方差cov():



corrwith():计算DataFrame的列(axis=0,默认)或行(axis=1)跟另外一个Series或DataFrame之间的相关系数:



唯一值、值计数以及成员资格

unique():得到Series中的唯一值数值:



value_counts():计算一个Series中各值出现的频率(默认降序排列):



isin():判断成员资格,用于选取Series中或DataFrame列中数据的子集:



内容来自用户分享和网络整理,不保证内容的准确性,如有侵权内容,可联系管理员处理 点击这里给我发消息
标签:  python pandas 读书笔记