Python数据分析与处理(二)——处理中国地区信息

2022-12-07 12:53 开发作者： a Fang

2.1数据的爬取

代码：

import pandas as pd

data=pd.read_csv("example_data.csv",header=1)

print(data)

data1=pd.read_csv("北京地区信息.csv",header=1,encoding='gbk')

data2=pd.read_csv("天津地区信息.csv",encoding='gbk')

print(data1)

print(data2)

代码运行结果：

Python数据分析与处理(二)——处理中国地区信息

首先使用pandas的read_csv()方法进行数据的www.cppcns.com读取，然后就能够看到相应的表格信息。

2.2检查重复数据

dupnum=data.duplicated()

print(dupnum)

\# 对重复值进行处理

caldup=data.dropobZRpNy_duplicates()

print(caldup)

代码运行结果：

Python数据分析与处理(二)——处理中国地区信息

主要是是使用这个du编程客栈plicated()方法进行数据的查重，返回一个布尔序列，仅对唯一元素而言为True。如果有重复的数据就会在该数值的部分返货Flase。

然后我们就可以使用drop_duplicates()进行重复值删除。

2.3检查缺失值

代码：

from pandas import Series

from numpy import NAN

\# import pandas as pd 

series_obj=Series([1,None])

pd.notnull(series_obj)

\# 上面做的是测试

pd.notnull(data)

pd.notnull(data1)

pd.notnull(data2)

代码运行结果：

Python数据分析与处理(二)——处理中国地区信息

使用pd.notnulwww.cppcns.coml(data1)进行非空数值的返回，返回值是布尔型的矩阵，再取df[布尔型矩阵]返回的是id为非空的行。

2.4 检查异常值

import numpy as np

\# 2.4 检查异常值

def three_sig(ser1):

  mean_value=ser1.mean()

\#   标准差

  std_value=ser1.std()

\#   位于3范围外的都是异常值

\# 数值大于u+3小雨u-3

  rule=(mean_value-3*std_value>ser1)|(ser1.mean()+3*ser1.std()<ser1)

  编程客栈index=np.arange(ser1.shape[0])[rule]

  outrange=ser1.iloc[index]

  return outrange

three_sig(data2["女性"])

代码运行结果：

Python数据分析与处理(二)——处理中国地区信息

3原则又称为拉依达准则，该准则具体来说，就是先假设一组检测数据只含有随机误差，对原始数据进行计算处理得到标准差，然后按一定的概率确定一个区间，认为误差超过这个区间的就属于异常值。

通俗理解就是正态分布。

到此这篇关于python数据分析与处理--处理中国地区信息的文章就介绍到这了,更多相关Python Python数据分析与处理内容请搜索我们以前的文章或继续浏览下面的相关文章希望大家以后多多支持我们！

继续阅读：Python数据分析与处理处理中国地区信息

Python数据分析与处理(二)——处理中国地区信息

目录

2.1数据的爬取

2.2检查重复数据

2.3检查缺失值

2.4 检查异常值

更多精彩内容

精彩评论

最新开发

基于WinForm实现通用自动更新系统的完整流程

C#程序实现将MySQL的存储过程转换成Oracle的存储过程

SpringBoot打包为外部配置包的技巧分享

SpringBoot外部化配置的最佳实践指南

使用Python将CSV文件转换为PDF的实践指南

开发排行榜

springboot后端存储富文本内容的思路与步骤(含图片内容)

PyCharm运行python测试,报错“没有发现测试”/“空套件”的解决

return base64.b64encode(b).decode(

基于C语言实现钻石棋游戏的示例代码

Sublime Text 3解决中文乱码问题（实测可用）