您的位置：首页 > 编程语言 > Python开发

Python对多属性的重复数据去重

2018-01-10 14:18 295 查看

python中的pandas模块中对重复数据去重步骤：

1）利用DataFrame中的duplicated方法返回一个布尔型的Series,显示各行是否有重复行，没有重复行显示为FALSE，有重复行显示为TRUE；

2）再利用DataFrame中的drop_duplicates方法用于返回一个移除了重复行的DataFrame。

注释：

如果duplicated方法和drop_duplicates方法中没有设置参数，则这两个方法默认会判断全部咧，如果在这两个方法中加入了指定的属性名（或者称为列名），例如：frame.drop_duplicates(['state']),则指定部分列（state列）进行重复项的判断。

具体实例如下：

[plain] view
plain copy

>>> import pandas as pd

>>> data={'state':[1,1,2,2],'pop':['a','b','c','d']}

>>> frame=pd.DataFrame(data)

>>> frame

  pop  state

0   a      1

1   b      1

2   c      2

3   d      2

>>> IsDuplicated=frame.duplicated()

>>> print IsDuplicated

0    False

1    False

2    False

3    False

dtype: bool

>>> frame=frame.drop_duplicates(['state'])

>>> frame

  pop  state

0   a      1

2   c      2

>>> IsDuplicated=frame.duplicated(['state'])

>>> print IsDuplicated

0    False

2    False

dtype: bool

>>>

内容来自用户分享和网络整理，不保证内容的准确性，如有侵权内容，可联系管理员处理

标签：

相关文章推荐

新的分享

章节导航