Python通过四大 AutoEDA 工具包快速产出完美数据报告

程序员文章站 2022-03-21 16:22:20

autoeda工具包对于刚刚学习数据分析的小伙伴可以带来非常大的帮助。本篇文章我们介绍目前最流行的四大autoeda工具包。 d-tale pandas-profiling swee...

autoeda工具包对于刚刚学习数据分析的小伙伴可以带来非常大的帮助。

本篇文章我们介绍目前最流行的四大autoeda工具包。

d-tale
pandas-profiling
sweetviz
autoviz

这几个工具包可以以短短三五行代码帮新手节省将近一天时间去写代码分析，非常建议大家收藏学习，喜欢点赞支持，文末提供技术交流群，尽情畅聊。

介绍

01 d-tale

Python通过四大 AutoEDA 工具包快速产出完美数据报告

d-tale是flask后端和react前端组合的产物，也是一个开源的python自动可视化库，可以为我们提供查看和分析pandas dataframe的方法，帮助我们获得非常数据的详细eda。

目前d-tale支持dataframe、series、multiindex、datetimeindex 和 rangeindex 等 pandas 对象。

github 链接

https://github.com/man-group/dtale

# pip install dtale
import dtale
import pandas as pd
df = pd.read_csv('./data/titanic.csv')
d = dtale.show(df)
d.open_browser()

Python通过四大 AutoEDA 工具包快速产出完美数据报告

02 pandas-profiling

Python通过四大 AutoEDA 工具包快速产出完美数据报告

pandas-profiling可以对pandas dataframe生成report报告。其中：

pandas_profiling的df.profile_report()扩展了pandas dataframe以方便进行快速数据分析。

pandas-profiling对于每一列特征，特征的统计信息（如果与列类型相关）会显示在交互式 html的report中：

type：检测数据列类型；
essentials：类型、unique值、缺失值
分位数统计，如最小值、q1、中位数、q3、最大值、范围、四分位距
描述性统计数据，如均值、众数、标准差、总和、中值绝对偏差、变异系数、峰态、偏度
出现最多的值
直方图
高度相关变量、spearman、pearson 和 kendall 矩阵的相关性突出显示
缺失值矩阵、计数、热图和缺失值树状图
…

github 链接

https://github.com/pandas-profiling/pandas-profiling/

from pandas_profiling import profilereport
profile = profilereport(df, title="pandas profiling report")
profile

2021-10-30 22:50:43,584 - info - pandas backend loaded 1.2.5
2021-10-30 22:50:43,597 - info - numpy backend loaded 1.19.2
2021-10-30 22:50:43,599 - info - pyspark backend not loaded
2021-10-30 22:50:43,600 - info - python backend loaded

一个特征的案例

Python通过四大 AutoEDA 工具包快速产出完美数据报告

03 sweetviz

Python通过四大 AutoEDA 工具包快速产出完美数据报告

sweetviz也是一个开源python库，sweetviz可以用简短几行代码生成美观、高密度的可视化文件，只需两行代码即可开启探索性数据分析并输出一个完全独立的 html 应用程序。sweetviz主要包含下面的分析：

数据集概述
变量属性
类别的关联性
数值关联性
数值特征最频繁值、最小、最大值

github 链接

https://github.com/fbdesignpro/sweetviz

# pip install sweetviz
import sweetviz as sv 
sweetviz_report = sv.analyze(df)
sweetviz_report.show_html()

04 autoviz

Python通过四大 AutoEDA 工具包快速产出完美数据报告

autoviz可以使用一行自动显示任何数据集。给出任何输入文件（csv、txt或json），autoviz都可以对其进行可视化。autoviz的结果会以非常多的图片都形式存在文件夹下方。

github 链接

https://github.com/autoviml/autoviz

# pip install autoviz
from autoviz.autoviz_class import autoviz_class
av = autoviz_class()

sep = ';'
dft = av.autoviz(filename="",sep=sep, depvar='pclass', dfte=df, header=0, verbose=2, 
                 lowess=false, chart_format='png', max_rows_analyzed=150000, max_cols_analyzed=30)

诸多文件全都在当前文件夹下方

Python通过四大 AutoEDA 工具包快速产出完美数据报告