R語言實現對數據框按某一列分組求組內平均值
可使用aggregate函數
如:
aggregate(.~ID,data=這個數據框名字,mean)
如果是對數據框分組,組內有重復的項,對於重復項保留最後一行數據用:
pcm_df$duplicated <- duplicated(paste(pcm_df$OUT_MAT_NO, pcm_df$Posit, sep = "_"), fromLast = TRUE) pcm_df <- subset(pcm_df, !duplicated) pcm_df$duplicated <- NULL
補充:R語言分組求和,分組求平均值,分組計數
我們經常可能需要把一個數據按照某一屬性分組,然後計算一些統計值。在R語言裡面,aggregate函數就可以辦到。
## S3 method for class 'data.frame' aggregate(x, by, FUN, ..., simplify = TRUE, drop = TRUE)
我們常用到的參數是:x, by, FUN。
x, 你想要計算的屬性或者列。
by, 是一個list,可以指定一個或者多個列作為分組的基礎。
FUN, 指定一個函數,用來計算,可以作用在所有分組的數據上面。
假如這個是我們的數據。
type<-c("a","b","c","a","c","d","b","a","c","b") value<-c(53,15,8,99,76,22,46,56,34,54) df<-data.frame(type,value) df type value 1 a 53 2 b 15 3 c 8 4 a 99 5 c 76 6 d 22 7 b 46 8 a 56 9 c 34 10 b 54
分組求和
aggregate(df$value, by=list(type=df$type),sum) type x 1 a 208 2 b 115 3 c 118 4 d 22
分組求平均值
分組求平均很簡單,隻要將上面的sum改成mean就可以瞭。
aggregate(df$value, by=list(type=df$type),mean) type x 1 a 69.33333 2 b 38.33333 3 c 39.33333 4 d 22.00000
分組計數
分組計數就是在分組的情況下統計rows的數目。
aggregate(df$value, by=list(type=df$type),length) type x 1 a 3 2 b 3 3 c 3 4 d 1
基於多個屬性分組求和。
我們在原有的數據上加上一列,可以看看多屬性分組。
type_2 <-c("F","M","M","F","F","M","M","F","M","M") df <- data.frame(df, type_2) df type value type_2 1 a 53 F 2 b 15 M 3 c 8 M 4 a 99 F 5 c 76 F 6 d 22 M 7 b 46 M 8 a 56 F 9 c 34 M 10 b 54 M aggregate(x=df$value, by=list(df$type,df$type_2),sum) Group.1 Group.2 x 1 a F 208 2 c F 76 3 b M 115 4 c M 42 5 d M 22
以上為個人經驗,希望能給大傢一個參考,也希望大傢多多支持WalkonNet。如有錯誤或未考慮完全的地方,望不吝賜教。
推薦閱讀:
- R語言中矩陣matrix和數據框data.frame的使用詳解
- 聊聊python中令人迷惑的duplicated和drop_duplicates()用法
- 詳解R語言數據合並一行代碼搞定
- Pandas中時間序列的處理大全
- python重復值處理得方法