百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 热门文章 > 正文

Python数据分析实战,简单快速制作餐饮行业商业化报告

bigegpt 2024-08-06 12:06 12 浏览

前些天有个朋友向我求救,他们公司最近要针对餐饮行业做数据分析,并为某些商家做出线上营销方案。但是他一头雾水,不知道该从哪方面下手。

我提醒他,是否先从商家的线上评价作为数据分析的入口例如美团、大众点评、饿了么等等。

朋友点头称是:”是个好主意,但是具体怎么做呢?“

于是我花了点时间用Python帮他做了一个基于线上商家评价的数据分析演示。


本章知识点:

  1. 商家评价数据源的获取
  2. pyecharts 柱状图数据分析
  3. pyecharts 饼图数据分析
  4. Python的Counter使用方法


商家评价数据源的获取

首先我们要找到合适的商家评价,在本文以大众点评的数据为例,我随机选择一家餐厅的评价数据作为数据源。


因为隐私的关系,我隐去了商家具体的店名和地址,最终我通过线上的API接口拿到了一部分用户评价数据,用于本次演示,如果出于真正的商业目的需要获得更完整的数据,还需要大家自己去想办法。


拿到的商家评价演示数据如下:

需要注意的是,我们需要对返回的数据内容做一下处理,把数据里的true、false、null分别转换为Python语言所需要的True、False和None。原因在于这里线上数据API接口返回时是按照javascript的数据类型来的(true、false、null)。

数据清洗了之后,我们发现这个数据在Python其实就是一个大的字典,那么我们按照字典的格式对其中的数据进行解析即可。

现在我给这个大字典命名为review_data,并保存为data.py文件,方便在正式的数据分析程序里进行import使用。


随后我新建了一个名为analysis.py的文件用于数据分析,并导入刚才的数据源测试一下数据是否正常。

OK,至此我们的数据准备工作已经做好,开始进行实战吧。


个性化的pyecharts柱状图

首先我们来获取概要性的数据分析,就是用户对于该商家的整体印象嘛,这部分数据在review_data的summarys里,让我们写一段程序把它取出来进行展示。

最后图表显示效果如下:

看来这家店菜品比较新鲜、牛肉也不错、老顾客也相对较多,不过分量好像挺少,哈哈。


接着我们来解析下我们的代码:

程序入口从18行开始,Page组件就不多说了,上一章讲过,作用是在一个页面里显示多个图表。

get_summarys()函数主要用于创建一个商家整体评价的柱状图,需要讲的是第10行和12行

我们发现sumarrys的数据其实是一个list(列表)包含着多个dict(字典)数据。

那么我们的柱状图希望得到的格式数据应该是下面这样:

X轴数据 [‘菜品健康’,'牛肉赞','回头客'] ,X轴数据用于显示名称。

Y轴数据[51,32,29],Y轴数据用于显示数量。

所以我们就用Python的列表推导式分别得到了X,Y轴的数据。

    #获取整体评价名称
    summary_name_list = [i.get('summaryString') for i in summarys]
    #获取整体评价次数统计
    summary_count_list = [i.get('summaryCount') for i in summarys]

关于add_yaxis()函数里有个category_gap需要解释一下,它的作用是设置同一系列的柱间距离,默认为类目间距的 20%,可设固定值。在这里我设置为80%,就显得柱子比较远,看起来更清晰一点。

拿到X,Y轴的数据后就没什么好说的了,直接添加即可。

关于Python列表推导的内容请查看我之前的教程。


个性化的pyecharts饼图

接下来我想获取该商家的用户打分比例,我们知道在很多点评网站上,用户的分数从1-5颗星星不等。

那么在本文中这些数据是怎么体现的呢?

通过分析数据,我们可以发现每个用户的评论里都包含一个叫star的数据,这里就是用户的打分,30分代表3星。

现在我们写一段代码来把打分数据做成饼图。

在截图里为了看起来方便我隐藏了之前get_summarys()函数,大家只需要关心get_star()函数即可。

最终图表效果如下:


可以发现这家店的评价其实偏低,2星和3星加起来占了很大一部分,5星评价只有30%。

现在来解释一下代码:


Python的Counter使用方法

其实饼图大家在上一章已经学过了,我在这里着重讲一下Counter库。

Counter库是Python自带的一个计数工具,主要用于对序列里的数据进行计数,非常方便快捷,不用我们自己造轮子了。

以上三行代码可以很快帮助我们明白Counter的用途,经过它的统计,我们可以发现列表里10数字有2个,其他数字只有1个。

那么回到刚才的打分数据里,我们通过

all_star = [i.get('reviewDataVO').get('reviewData').get('star') for i in all_review]

这段代码获取到了所有的打分数据。看起来像这样:

[30, 50, 10, 20, 35, 50, 30, 20, 50, 20]

那么我们可以很方便的用Counter对其进行统计即可。

stars = dict(Counter(all_star))

在这里之所以要用dict对Counter结果进行转换成字典,是为了方便我们获取字典的keys和values,正好可以作为饼图所需的数据。大家也可以通过其他方式获取所需内容,不用拘泥于这一种方式。

饼图所需数据

最后的数据压缩代码里:

data = zip(list(stars.keys()), list(stars.values()))

stars.keys()和starts.values()其实分别就是分数和该分数的个数

stars这个字典原始数据如下:

{30: 2, 50: 3, 10: 1, 20: 3, 35: 1}

之所以要用list把keys()和values()的结果转换成列表,也是因为直接获取字典的keys()和values()得到的数据没办法直接使用,需要先转换成列表才行。

到现在为止,我们基本上可以熟练的使用本章学到的知识来对数据进行各种分析了。

最后我得到了四个图表,用于对一家店铺的初步数据分析。


因为篇幅有限,我就不在本文里提供全部源码了,对这个例子感兴趣的朋友可以私信我获取源码。


总结:

通过对pyecharts的深度学习,以及Python自带的各种统计工具的配合使用,我们可以做出更多有价值的数据分析案例,当这些案例慢慢成型后,就变成了一套完整的商业解决方案,希望大家可以从中得到启发,也欢迎继续关注我的Python数据分析系列,学习更多有价值的数据分析方法。


欢迎关注我 “纸飞机编程”,获取更多有趣的Python编程信息。

相关推荐

机器学习分类模型评估(三)-F值(F-Measure)、AUC、P-R曲线

概述上二篇文章分别讲述了准确率(accuracy)、精确率(Precision)、查准类、召回率(Recall)、查全率、ROC曲线,本文讲述机器学习分类模型评估中的F值(F-Measure)、AUC...

SPSS ROC曲线诊断临界值确定

ROC曲线是在临床医学和流行病学研究中一种常用的在诊断试验、预测模型中用于决定最佳临界点的方法。ROC曲线用真阳性率和假阳性率作图得出曲线,其横轴表示假阳性率(1-特异度),纵轴表示真阳性率(灵敏度)...

分类器模型检测--ROC曲线和AUC值

在监督学习建模中有一个重要的模块是模块的检测,就是怎样判断一个模型的好坏?那么常用的的检测的指标有P值、R值、F值、ROC曲线、AUC值等,今天来学习他们都是怎么来的,有什么用处。这里为二分类问题,即...

【Python机器学习系列】建立梯度提升模型预测心脏疾病

这是Python机器学习系列原创文章,我的第204篇原创文章。一、引言对于表格数据,一套完整的机器学习建模流程如下:针对不同的数据集,有些步骤不适用即不需要做,其中橘红色框为必要步骤,由于数据质量较高...

如何Keras自动编码器给极端罕见事件分类

全文共7940字,预计学习时长30分钟或更长本文将以一家造纸厂的生产为例,介绍如何使用自动编码器构建罕见事件分类器。现实生活中罕见事件的数据集:背景1.什么是极端罕见事件?在罕见事件问题中,数据集是...

机器学习分类问题:9个常用的评估指标总结

对机器学习的评估度量是机器学习核心部分,本文总结分类问题常用的metrics分类问题评估指标在这里,将讨论可用于评估分类问题预测的各种性能指标1ConfusionMatrix这是衡量分类问题性能的...

基于R语言的ROC曲线绘制及最佳阈值点(Cutoff)选择

ROC曲线在介绍ROC曲线之前,我们首先需要介绍混淆矩阵(ConfusionMatrix)。在统计分类模型的评估过程中分别统计分类模型归错类,归对类的观测值个数,然后把结果放在一个表里展示出来的表格...

R数据分析:多分类问题预测模型的ROC做法及解释

有同学做了个多分类的预测模型,结局有三个类别,做的模型包括多分类逻辑回归、随机森林和决策树,多分类逻辑回归是用ROC曲线并报告AUC作为模型评估的,后面两种模型报告了混淆矩阵,审稿人就提出要统一模型评...

SPSS实战:多个指标ROC曲线方向不一致的解决办法汇总(收藏)

在诊断实验和预测模型的临床效能评价中,我们常常用到ROC曲线分析。在SPSS中绘制ROC曲线操作比较简单,但如果将多个指标的ROC曲线绘制在同一个图中,有时候会碰到有些指标的ROC曲线在对角线上面,一...

小果教你快速分析ROC生存曲线图

尔云间一个专门做科研的团队原创小果生信果小伙伴们,大家好呀,很高兴和大家见面,前段时间应小伙伴出的解读ROC曲线图,小伙伴反应很是积极,这不最近小伙伴对于不同年份的ROC曲线图的分析呼声很高,...

生信文章中高频出现、模型评估必备分析——ROC曲线图,怎么看?

尔云间一个专门做科研的团队关注我们做了生信分析,拿到一堆数据,看不懂图怎么办?火山图、热图、散点图、箱线图、瀑布图···这么多类型的图都咋看?风险模型预后评估图、GO-KEGG富集分析图、GSEA...

如何看懂文献里那些图——ROC曲线图

ROC曲线的基本思想是把敏感度和特异性看作一个连续变化的过程,用一条曲线描述诊断系统的性能,其制作原理是在连续变量中不同界值点处计算相对应的灵敏度和特异度,然后以敏感度为纵坐标、1-特异性为横坐标绘制...

超强,必会的机器学习评估指标

大侠幸会,在下全网同名[算法金]0基础转AI上岸,多个算法赛Top[日更万日,让更多人享受智能乐趣]构建机器学习模型的关键步骤是检查其性能,这是通过使用验证指标来完成的。选择正确的验证指...

准确性检验 (ROC曲线)的SPSS操作教程及结果解读

作者/风仕在上一期,我们已经讲完了诊断试验的基础知识,这期开始讲准确性检验(ROC曲线),我们主要从准确性检验(ROC曲线)的介绍、基本概念、绘制原理、统计量、使用条件及案例的SPSS操作演示这几...

SPSS:ROC 曲线为什么反了?

【作者介绍】李志辉,长期从事各类统计软件应用研究,主编或参编SPSS、MINITAB、STATISTICA多个统计软件教材共8本。代表作:电子工业出版社《SPSS常用统计分析教程(SPSS22.0中...