在Python中调用ggplot的三种方法
本文提供了三种不同的方式在python(ipython notebook)中调用ggplot。
在大数据时代,数据可视化是一个非常热门的话题。各个bi的厂商无不在数据可视化领域里投入大量的精力。tableau凭借其强大的数据可视化的功能成为硅谷炙手可热的上市公司。tableau的数据可视化的产品,其理论基础其实是《the grammar of graphic》,该书提出了对信息可视化的图表的语法抽象体系,数据的探索和分析可以由图像的语法来驱动,而非有固定的图表类型来驱动,使得数据的探索过程变得友好而有趣。
然而对于the grammar of graphic的理论的实践,并非tableau独占,作为r语言上得一个图形库,其理论基础也是这本书。(注,笔者曾就职的某bi巨头,主要职责也是数据可视化,我们曾经和加拿大团队研发过类似的产品,基于html5和d3,可惜由于种种原因未能推向市场)
现在越来越多的人开始使用python来做数据分析,ipython notebook尤其令人喜爱,它的实时交互把脚本语言的优势发挥到极致。那么怎样才能在ipython notebook中使用ggplot呢?我这里跟大家分享三种不同的方式供大家选择。
rpy2
第一种方式是使用, rpy2是对rpy的改写和重新设计,旨在提供python用户在python中使用r的api。
rpy2提供了对r语言的对象和方法的基本封装,当然也包括可视化的图库这一块。
下面就是一段运行ggplot的r程序使用rpy2在python中运行的例子:
from rpy2 import robjects from rpy2.robjects import formula, environment from rpy2.robjects.vectors import intvector, floatvector from rpy2.robjects.lib import grid from rpy2.robjects.packages import importr, data import rpy2.robjects.lib.ggplot2 as ggplot2 # the r 'print' function rprint = robjects.globalenv.get("print") stats = importr('stats') grdevices = importr('grdevices') base = importr('base') datasets = importr('datasets') mtcars = data(datasets).fetch('mtcars')['mtcars'] pp = ggplot2.ggplot(mtcars) + \ ggplot2.aes_string(x='wt', y='mpg', col='factor(cyl)') + \ ggplot2.geom_point() + \ ggplot2.geom_smooth(ggplot2.aes_string(group = 'cyl'), method = 'lm') pp.plot()
以上程序在ipython notebook中运行会有缺陷,会弹出一个新的窗口显示图,而且该python进程会阻塞在那里。我们希望图表能内嵌在ipython notebook的页面中,为了解决该问题,我们引入如下代码:
%matplotlib inline import uuid from rpy2.robjects.packages import importr from ipython.core.display import image grdevices = importr('grdevices') def ggplot_notebook(gg, width = 800, height = 600): fn = '{uuid}.png'.format(uuid = uuid.uuid4()) grdevices.png(fn, width = width, height = height) gg.plot() grdevices.dev_off() return image(filename=fn)
运行上述代码后,我们把ggplot的调用pp.plot()改为调用ggplot_notebook(pp, height=300)就能成功嵌入显示ggplot的结果。
rmagic
另一种方式是使用,rmagicy实际上依赖于rpy2。它的使用方式更像是直接在使用r
%load_ext rmagic library(ggplot2) dat <- data.frame(x = rnorm(10), y = rnorm(10), lab = sample(c('a', 'b'), 10, replace = true)) x <- ggplot(dat, aes(x = x, y = y, color = lab)) + geom_point() print(x)
运行结果如下
ggplot for python
是一个python的库,基本上是对r语言ggplot的功能移植到python上。
运行安装脚本
pip install ggplot
安装成功后,可以试一下这个例子
%matplotlib inline import pandas as pd from ggplot import * meat_lng = pd.melt(meat[['date', 'beef', 'pork', 'broilers']], id_vars='date') ggplot(aes(x='date', y='value', colour='variable'), data=meat_lng) + \ geom_point() + \ stat_smooth(color='red')
结果如下:
总结
本文提供了三种不同的方式在python(ipython notebook)中调用ggplot。
rpy2和rmagic都是一种对r的桥接,所以都需要安装r。不同之处在于rpy2提供python接口而rmagic更接近r。
ggplot python库是ggplot的python移植,所以无需安装r,部署起来更为简单,但功能上也许和r的ggplot还有差距。
大家可以根据自己的需要做出选择。
上一篇: 手机网站建站中的四个要点
下一篇: 在Python中进行自动化单元测试的教程