百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 热门文章 > 正文

R数据分析:主成分分析及可视化

bigegpt 2024-08-26 11:03 2 浏览

Principal Component Analysis (PCA) is a useful technique for exploratory data analysis, allowing you to better visualize the variation present in a dataset with many variables.

主成分分析是一个常见的降维,探索性技术,常常在量表编制或者其它变量较多数据集分析的时候会用到,今天给大家写写R语言中如何快速高效的进行PCA和可视化。

数据介绍及PCA

今天用R中自带的数据集mtcars,这个数据集只有32个观测,但是有11个变量,太多了,我们就做PCA选个主成分出来:

这儿大家得注意主成分分析只能应用于数值变量,而且变量必须标准化

  • PCA only works with numeric data
  • Categorical data must be encoded as numeric data (e.g. one-hot)
  • Numeric data must be scaled (otherwise your PCA will be misleading)
str(mtcars)

可以看到我们的数据全是数值变量但是没有标准化,所以我们在做PCA的时候记得要将它标准化一波,很简单,只要设置scale的参数为真就行:

mtcars.pca <- prcomp(mtcars, center = TRUE,scale. = TRUE)
summary(mtcars.pca)

上面的代码就实现了整个数据的主成分分析,并且输出了我们的每个主成分解释的方法比。

很多时候,我们还需要画一个碎石图来决定保留多少个主成分,这个也非常容易实现:

screeplot(mtcars.pca,type = 'lines')

主成分可视化

最有意思的就是我们可以很方便地画出来变量和主成分之间的关系:

library(ggbiplot)
ggbiplot(mtcars.pca)

在上图中,所有的主成分都是从图中心发出的,我们可以看到hp,cyl,disp,wt这些变量是对主成分1贡献较大的,到这儿其实还不够,我们这个数据集是关于车车的,我们还想看那些车车在哪些变量上表现较好,

这个时候我们可以给图中的样本点加上标签:

ggbiplot(mtcars.pca, labels=rownames(mtcars))

这样你就可以看到那些样本点的特征最相近。

还有

你可以给你的样本点分组展示,比如在我的例子中,有的车车是日本的,有的是美国的,有的是欧洲的,我想看看不同的国家的车车在每个变量每个主成分上表现如何:

mtcars.country <- c(rep("Japan", 3), rep("US",4), rep("Europe", 7),rep("US",3), "Europe", rep("Japan", 3), rep("US",4), rep("Europe", 3), "US", rep("Europe", 3))

ggbiplot(mtcars.pca,ellipse=TRUE,  labels=rownames(mtcars), groups=mtcars.country)

可以看到,有了组别变量之后,出图时会自动的加上圈圈和图例

有了圈圈我们就可以发现,美国车车的hp,cyl,disp,wt这几个特征比较猛!美国车车和日本车车的差异还是比较大的。

当然了,上面的分析只是我在第一组成分和第二主成分的视角下得到的。、

我想看别别的主成分,比如PC3,PC4行不?

安排:

ggbiplot(mtcars.pca,ellipse=TRUE,choices=c(3,4),   labels=rownames(mtcars), groups=mtcars.country)

此时,我们发现乱了套了,因为3,4主成分本来解释的变异就不大了,所以三个国家车车在这个图中表现不出来差异也就正常了,所以通常默认我们会在1,2主成分视角下展示我们的数据。

小结

今天给大家写了主成分分析的做法和可视化,感谢大家耐心看完,自己的文章都写的很细,代码都在原文中,希望大家都可以自己做一做,如果对您有用请先收藏,再点赞转发。

也欢迎大家的意见和建议。

如果你是一个大学本科生或研究生,如果你正在因为你的统计作业、数据分析、论文、报告、考试等发愁,如果你在使用SPSS,R,Python,Mplus, Excel中遇到任何问题,都可以联系我。因为我可以给您提供最好的,最详细和耐心的数据分析服务。

如果你对Z检验,t检验,方差分析,多元方差分析,回归,卡方检验,相关,多水平模型,结构方程模型,中介调节,量表信效度等等统计技巧有任何问题,请私信我,获取最详细和耐心的指导。

If you are a student and you are worried about you statistical #Assignments, #Data #Analysis, #Thesis, #reports, #composing, #Quizzes, Exams.. And if you are facing problem in #SPSS, #R-Programming, #Excel, Mplus, then contact me. Because I could provide you the best services for your Data Analysis.

Are you confused with statistical Techniques like z-test, t-test, ANOVA, MANOVA, Regression, Logistic Regression, Chi-Square, Correlation, Association, SEM, multilevel model, mediation and moderation etc. for your Data Analysis...??

Then Contact Me. I will solve your Problem...

加油吧,打工人!

往期内容

R数据分析:如何计算问卷的组合信度,实例操练

R数据分析:如何计算问卷的聚合效度,实例操练

R数据分析:用R语言做潜类别分析LCA

R数据分析:中介作用与调节作用的分析与解释

相关推荐

Docker篇(二):Docker实战,命令解析

大家好,我是杰哥上周我们通过几个问题,让大家对于Docker有了一个全局的认识。然而,说跟练往往是两个概念。从学习的角度来说,理论知识的学习,往往只是第一步,只有经过实战,才能真正掌握一门技术所以,本...

docker学习笔记——安装和基本操作

今天学习了docker的基本知识,记录一下docker的安装步骤和基本命令(以CentOS7.x为例)一、安装docker的步骤:1.yuminstall-yyum-utils2.yum-con...

不可错过的Docker完整笔记(dockerhib)

简介一、Docker简介Docker是一个开源的应用容器引擎,基于Go语言并遵从Apache2.0协议开源。Docker可以让开发者打包他们的应用以及依赖包到一个轻量级、可移植的容器中,...

扔掉运营商的 IPTV 机顶盒,全屋全设备畅看 IPTV!

其实现在看电视节目的需求确实大大降低了,折腾也只是为了单纯的让它实现,享受这个过程带来的快乐而已,哈哈!预期构想家里所有设备直接接入网络随时接收并播放IPTV直播(电信点播的节目不是太多,但好在非常稳...

第五节 Docker 入门实践:从 Hello World 到容器操作

一、Docker容器基础运行(一)单次命令执行通过dockerrun命令可以直接在容器中执行指定命令,这是体验Docker最快捷的方式:#在ubuntu:15.10容器中执行ech...

替代Docker build的Buildah简单介绍

Buildah是用于通过较低级别的coreutils接口构建OCI兼容镜像的工具。与Podman相似,Buildah不依赖于Docker或CRI-O之类的守护程序,并且不需要root特权。Builda...

Docker 命令大全(docker命令大全记录表)

容器生命周期管理run-创建并启动一个新的容器。start/stop/restart-这些命令主要用于启动、停止和重启容器。kill-立即终止一个或多个正在运行的容器rm-于删除一个或...

docker常用指令及安装rabbitMQ(docker安装rabbitmq配置环境)

一、docker常用指令启动docker:systemctlstartdocker停止docker:systemctlstopdocker重启docker:systemctlrestart...

使用Docker快速部署Storm环境(docker部署confluence)

Storm的部署虽然不是特别麻烦,但是在生产环境中,为了提高部署效率,方便管理维护,使用Docker来统一管理部署是一个不错的选择。下面是我开源的一个新的项目,一个配置好了storm与mono环境的D...

Docker Desktop安装使用指南:零基础教程

在之前的文章中,我多次提到使用Docker来安装各类软件,尤其是开源软件应用。鉴于不少读者对此有需求,我决定专门制作一期关于Docker安装与使用的详细教程。我主要以Macbook(Mac平台)为例进...

Linux如何成功地离线安装docker(linux离线安装httpd)

系统环境:Redhat7.2和Centos7.4实测成功近期因项目需要用docker,所以记录一些相关知识,由于生产环境是不能直接连接互联网,尝试在linux中离线安装docker。步骤1.下载...

Docker 类面试题(常见问题)(docker面试题目)

Docker常见问题汇总镜像相关1、如何批量清理临时镜像文件?可以使用sudodockerrmi$(sudodockerimages-q-fdanging=true)命令2、如何查看...

面试官:你知道Dubbo怎么优雅上下线的吗?你:优雅上下线是啥?

最近无论是校招还是社招,都进行的如火如荼,我也承担了很多的面试工作,在一次面试过程中,和候选人聊了一些关于Dubbo的知识。Dubbo是一个比较著名的RPC框架,很多人对于他的一些网络通信、通信协议、...

【Docker 新手入门指南】第五章:Hello Word

适合人群:完全零基础新手|学习目标:30分钟掌握Docker核心操作一、准备工作:先确认是否安装成功打开终端(Windows用户用PowerShell或GitBash),输入:docker--...

松勤软件测试:详解Docker,如何用portainer管理Docker容器

镜像管理搜索镜像dockersearch镜像名称拉取镜像dockerpullname[:tag]列出镜像dockerimages删除镜像dockerrmiimage名称或id删除...