百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 热门文章 > 正文

方剂中的高频单味、两味和三味中药:R语言进行关联规则分析!

bigegpt 2024-09-27 00:36 5 浏览

背景介绍

如果有一组方剂,如下图所示,你想从中挖掘出常用的单味、单味、两味、三味中药,你该怎么去做?

今天我们使用R语言的办法来进行挖掘分析,看看能挖掘出什么东西来?

软件介绍

[软件名称]:R;RStudio

教程介绍

1.首先我们使用在RStudio中设定运行的文件夹,然后加载需要的R包,最后读取数据

# 设定文件夹
setwd("D:\\Desktop")

# 加载需要的包
# 数据处理绘图用
library(tidyverse)
# 读取excel用
library(openxlsx)
# 关联规则用
library(arules)

# 读取excel数据
data <- read.xlsx("example.xlsx")

2.接下来我们自建个函数,将方剂列分开成单味中药(我构建的这个函数,可以分单个方剂中药物为24个的,自己的是多少可以酌情增加或减少;中药之间使用的是顿号,所以以“、”分隔

# 自建函数
TCM2dataframe <-  function(TCM){
  # TCM为中药方剂的列,之间使用"、"分割
  TCM_split = TCM%>%str_split("、")
  TCM_rbind = cbind(
    TCM1 =  sapply(TCM_split, "[",1)%>%as.data.frame(),
    TCM2 =  sapply(TCM_split, "[",2)%>%as.data.frame(),
    TCM3 =  sapply(TCM_split, "[",3)%>%as.data.frame(),
    TCM4 =  sapply(TCM_split, "[",4)%>%as.data.frame(),
    TCM5 =  sapply(TCM_split, "[",5)%>%as.data.frame(),
    TCM6 =  sapply(TCM_split, "[",6)%>%as.data.frame(),
    TCM7 =  sapply(TCM_split, "[",7)%>%as.data.frame(),
    TCM8 =  sapply(TCM_split, "[",8)%>%as.data.frame(),
    TCM9 =  sapply(TCM_split, "[",9)%>%as.data.frame(),
    TCM10 = sapply(TCM_split, "[",10)%>%as.data.frame(),
    TCM11 = sapply(TCM_split, "[",11)%>%as.data.frame(),
    TCM12 = sapply(TCM_split, "[",12)%>%as.data.frame(),
    TCM13 = sapply(TCM_split, "[",13)%>%as.data.frame(),
    TCM14 = sapply(TCM_split, "[",14)%>%as.data.frame(),
    TCM15 = sapply(TCM_split, "[",15)%>%as.data.frame(),
    TCM16 = sapply(TCM_split, "[",16)%>%as.data.frame(),
    TCM17 = sapply(TCM_split, "[",17)%>%as.data.frame(),
    TCM18 = sapply(TCM_split, "[",18)%>%as.data.frame(),
    TCM19 = sapply(TCM_split, "[",19)%>%as.data.frame(),
    TCM20 = sapply(TCM_split, "[",20)%>%as.data.frame(),
    TCM21 = sapply(TCM_split, "[",21)%>%as.data.frame(),
    TCM22 = sapply(TCM_split, "[",22)%>%as.data.frame(),
    TCM23 = sapply(TCM_split, "[",23)%>%as.data.frame(),
    TCM24 = sapply(TCM_split, "[",24)%>%as.data.frame())
  
  colnames(TCM_rbind) <- paste0("中药",1:24)
  return(TCM_rbind)
}

# 整合表格并写入csv文件
TCM2dataframe(data$方剂)%>%
  write.csv(file = "TCM_2.csv")

3.读取刚才保存的那个csv文件,查看数据类型前5个

# 读取csv文件
transdata0 <- read.transactions("TCM_2.csv",
                  format = c("basket"),
                  header = TRUE,
                  sep = ",",
                  cols = 1,
                  rm.duplicates = TRUE)

# 查看数据类型
inspect(transdata0[1:5])

4.计算高频词的单味中药,此时,计算的频次就出来了

# 高频词中药计算
TCM_Freq <- itemFrequency(x = transdata0,"absolute")%>%
  sort(decreasing = TRUE)%>%
  as.data.frame()
TCM_Freq <- TCM_Freq%>%
  mutate("中药名称" = rownames(TCM_Freq), .before = 1)
TCM_Freq 

5.我们开始对这个数据进行绘图,同时使用程序保存图片

# 绘制柱状图
library(ggsci)
TCM_Freq$中药名称<- factor(TCM_Freq$中药名称,levels = TCM_Freq$中药名称)
p1 <- ggplot(TCM_Freq[1:10,],aes(x = reorder(中药名称,.),.,
                            fill = 中药名称,
                            label = .))+
  geom_bar(stat="identity",width = 0.8)+
  coord_flip()+
  scale_fill_aaas()+
  labs(x = "中药名称",y = "频次")+
  scale_y_continuous(limits = c(0,35),expand = c(0,0))+
  geom_label(nudge_y = 2)+
  theme_bw()+
  theme(legend.position = "none",
        axis.title = element_text(size = 12,face = "bold"),
        axis.text = element_text(size = 10,face = "bold"),
        text = element_text(family = "serif"))

tiff("中药词频柱状图.tif",
    width = 11,height = 9,
    units = "cm",res = 300,
    compression = "lzw",)
p1
dev.off()

6.接下来我们使用关联规则进行两味及其以上的组合分析,首先利用算法分析关联规则

# 分析关联规则
myrules <- apriori(transdata0,
                   parameter = list(supp = 0.07,
                                    conf = 0.6,
                                    target = "rules"))

summary(myrules)

7.将结果按照出现的频次进行排序,结果转化为dataframe

# 按照出现的频次进行排序
myrules.conf <- sort(myrules,by="count",decreasing = T)
TCM_FJ <- inspect(myrules.conf)%>%as.data.frame()

8.将dataframe中第一和第二列数据中的括号取消,使用paste0函数将两列粘贴在一起生成新的列

# 去除掉左右的{}
TCM_FJ$lhs <- gsub("[\\{\\}]","",TCM_FJ$lhs)
TCM_FJ$rhs <- gsub("[\\{\\}]","",TCM_FJ$rhs)
TCM_FJ方剂中的高频单味、两味和三味中药:R语言进行关联规则分析!-今日头条
组合` <- paste0(TCM_FJ$lhs,", ",TCM_FJ$rhs) TCM_FJ

9.我们会发现,生成的数据中,有些数据是重复的,如第8和9行,为石菖蒲、远志、白芍白芍、远志、石菖蒲,所以我们保留一个组合就可以了,使用下面函数进行排序并去除掉一个,写成excel文件

# 将组合的列中的中药排序,去除重复内容
TCM_FJ$组合 <- sapply(TCM_FJ$组合,
                    function(x) sort(unlist(str_split(x,", "))))
TCM_FJ <- TCM_FJ[!duplicated(TCM_FJ$组合),]

write.xlsx(TCM_FJ,"temp.xlsx")

10.最后,我们要人工将count列组合列进行筛选,如两味药的前10名三味药的前10名,整理出来,如下所示

11.最终使用R语言对其进行绘图即可,保存图片用于发表文章

# 绘图2味药物
TCM_2 <- read.xlsx("temp.xlsx",sheet = 2)
TCM_2$组合<- factor(TCM_2$组合,levels = TCM_2$组合)
p_2 <- ggplot(TCM_2,aes(x = reorder(组合,count),count,
                           fill = 组合,
                           label = count))+
  geom_bar(stat="identity",width = 0.8)+
  coord_flip()+
  scale_fill_npg()+
  labs(x = "配对中药(2味)",y = "频次")+
  scale_y_continuous(limits = c(0,25),expand = c(0,0))+
  geom_label(nudge_y = 2)+
  theme_bw()+
  theme(legend.position = "none",
        axis.title = element_text(size = 12,face = "bold"),
        axis.text = element_text(size = 10,face = "bold"),
        text = element_text(family = "serif"))
tiff("配对中药(2味).tif",
     width = 11,height = 9,
     units = "cm",res = 300,
     compression = "lzw",)
p_2
dev.off()

12.绘制3味药物的图形并进行保存

# 绘图3味药物
TCM_3 <- read.xlsx("temp.xlsx",sheet = 3)
TCM_3$组合<- factor(TCM_3$组合,levels = TCM_3$组合)
p_3 <- ggplot(TCM_3,aes(x = reorder(组合,count),count,
                 fill = 组合,
                 label = count))+
  geom_bar(stat="identity",width = 0.8)+
  coord_flip()+
  scale_fill_npg()+
  labs(x = "配对中药(3味)",y = "频次")+
  scale_y_continuous(limits = c(0,20),expand = c(0,0))+
  geom_label(nudge_y = 1)+
  theme_bw()+
  theme(legend.position = "none",
        axis.title = element_text(size = 12,face = "bold"),
        axis.text = element_text(size = 10,face = "bold"),
        text = element_text(family = "serif"))

tiff("配对中药(3味).tif",
     width = 11,height = 9,
     units = "cm",res = 300,
     compression = "lzw",)
p_3
dev.off()

13.好了,这就是今天讲解的,如何从一组方剂中,挖掘出频次最高的单味、两味、三味中药!

相关推荐

有些人能留在你的心里,但不能留在你生活里。

有时候,你必须要明白,有些人能留在你的心里,但不能留在你生活里。Sometimes,youhavetorealize,Somepeoplecanstayinyourheart,...

Python学不会来打我(34)python函数爬取百度图片_附源码

随着人工智能和大数据的发展,图像数据的获取变得越来越重要。作为Python初学者,掌握如何从网页中抓取图片并保存到本地是一项非常实用的技能。本文将手把手教你使用Python函数编写一个简单的百度图片...

软网推荐:图像变变变 一“软”见分晓

当我们仅需要改变一些图片的分辨率、裁减尺寸、添加水印、标注文本、更改图片颜色,或将一种图片转换为另一种格式时,总比较讨厌使用一些大型的图像处理软件,尤其是当尚未安装此类软件时,更是如此。实际上,只需一...

首款WP8.1图片搜索应用,搜照片得资料

首款WP8.1图片搜索应用,搜照片得资料出处:IT之家原创(天际)2014-11-1114:32:15评论WP之家报道,《反向图片搜索》(ReverseImageSearch)是Window...

分享一组美图(图片来自头条)(头条美女头像)

...

盗墓笔记电视剧精美海报 盗墓笔记电视剧全集高清种子下载

出身“老九门”世家的吴邪,因身为考古学家的父母在某次保护国家文物行动时被国外盗墓团伙杀害,吴家为保护吴邪安全将他送去德国读书,因而吴邪对“考古”事业有着与生俱来的兴趣。在一次护宝过程中他偶然获得一张...

微软调整Win11 24H2装机策略:6月起36款预装应用改为完整版

IT之家7月16日消息,微软公司今天(7月16日)发布公告,表示自今年6月更新开始,已默认更新Windows1124H2和WindowsServer2025系统中预装...

谷歌手把手教你成为谣言终结者 | 域外

刺猬公社出品,必属原创,严禁转载。合作事宜,请联系微信号:yunlugongby贾宸琰编译、整理11月23日,由谷歌新闻实验室(GoogleNewsLab)联合Bellingcat、DigD...

NAS 部署网盘资源搜索神器:全网资源一键搜,免费看剧听歌超爽!

还在为找不到想看的电影、电视剧、音乐而烦恼?还在各个网盘之间来回切换,浪费大量时间?今天就教你如何在NAS上部署aipan-netdisk-search,一款强大的网盘资源搜索神器,让你全网资源...

使用 Docker Compose 简化 INFINI Console 与 Easysearch 环境搭建

前言回顾在上一篇文章《搭建持久化的INFINIConsole与Easysearch容器环境》中,我们详细介绍了如何使用基础的dockerrun命令,手动启动和配置INFINICon...

为庆祝杜特尔特到访,这个国家宣布全国放假?

(观察者网讯)近日,一篇流传甚广的脸书推文称,为庆祝杜特尔特去年访问印度,印度宣布全国放假,并举办了街头集会以示欢迎。菲媒对此做出澄清,这则消息其实是“假新闻”。据《菲律宾世界日报》2日报道,该贴子...

一课译词:毛骨悚然(毛骨悚然的意思是?)

PhotobyMoosePhotosfromPexels“毛骨悚然”,汉语成语,意思是毛发竖起,脊梁骨发冷;形容恐惧惊骇的样子(withone'shairstandingonend...

Bing Overtakes Google in China&#39;s PC Search Market, Fueled by AI and Microsoft Ecosystem

ScreenshotofBingChinahomepageTMTPOST--Inastunningturnintheglobalsearchenginerace,Mic...

找图不求人!6个以图搜图的识图网站推荐

【本文由小黑盒作者@crystalz于03月08日发布,转载请标明出处!】前言以图搜图,专业说法叫“反向图片搜索引擎”,是专门用来搜索相似图片、原始图片或图片来源的方法。常用来寻找现有图片的原始发布出...

浏览器功能和“油管”有什么关联?为什么要下载

现在有没有一款插件可以实现全部的功能,同时占用又小呢,主题主要是网站的一个外观,而且插件则主要是实现wordpress网站的一些功能,它不仅仅可以定制网站的外观,还可以实现很多插件的功能,搭载chro...