我在資料框中有一列,每個單元格中有多個單詞,用“;”分隔 (第二列)。
my_dataframe <- data.frame( first_column = c("x", "y", "x", "x", "y"),
second_column = c("important; very important; not important",
"not important; important; very important",
"very important; important",
"important; not important",
"not important"))
> my_dataframe
first_column second_column
1 x important; very important; not important
2 y not important; important; very important
3 x very important; important
4 x important; not important
5 y not important
我想每個單元格保留一個詞:最重要的一個。
所以我按優先順序列出了單詞:
reference_importance <- list("very important", "important", "not important")
我想作為第二列得到什么:
second_column
1 very important
2 very important
3 very important
4 important
5 not important
我試過
for (i in 1:dim(my_dataframe)[1]) {
for (j in 1:length(reference_importance)) {
if (j %in% my_dataframe$second_column){
my_dataframe$second_column[i] <- paste(j)
break}
}
}
然后我認為問題在于它沒有考慮用“;”分隔的不同單詞 所以我嘗試了這個:
for (i in 1:dim(my_dataframe)[1]) {
value_as_list <- strsplit(my_dataframe$second_column[i], ";")
print(value_as_list)
for (j in reference_importance) {
if (j %in% value_as_list){
my_dataframe$second_column[i] == j
break}
}
}
但這些并沒有改變我專欄中的任何內容......
(我做了這個例子是為了簡化,但實際上我有一個巨大的表格,里面有更多的單詞和可能性。這就是為什么我嘗試用回圈來做,我不只是手動分配可能的答案。)
uj5u.com熱心網友回復:
如果你想使用回圈,以下對我有用:
my_dataframe <- data.frame( first_column = c("x", "y", "x", "x", "y"),
second_column = c("important; very important; not important",
"not important; important; very important",
"very important; important",
"important; not important",
"not important"))
reference_importance <- list("very important", "important", "not important")
# add new column for priority word
my_dataframe <- my_dataframe %>%
mutate(Priority_importance = NA)
# use a loop to identify highest priority substring
for (i in 1:nrow(my_dataframe)) {
value_as_list <- strsplit(my_dataframe$second_column[i], ";")
for (j in 1:length(reference_importance)) {
if (value_as_list == as.character((reference_importance[j]))) {
my_dataframe$Priority_importance[i] <- reference_importance[j] # paste importance level
break # move to next iteration
}
}
}
my_dataframe
first_column second_column Priority_importance
1 x important; very important; not important very important
2 y not important; important; very important very important
3 x very important; important very important
4 x important; not important important
5 y not important not important
uj5u.com熱心網友回復:
使用strsplit和match基本上。
my_dataframe <- transform(my_dataframe, z=strsplit(second_column, '; ') |>
lapply(match, reference_importance) |>
sapply(min) |>
{\(x) unlist(reference_importance)[x]}())
my_dataframe
# first_column second_column z
# 1 x important; very important; not important very important
# 2 y not important; important; very important very important
# 3 x very important; important very important
# 4 x important; not important important
# 5 y not important not important
注意:使用 R >= 4.1。
如果你需要一個回圈,你可以做
spl <- strsplit(my_dataframe$second_column, '; ')
my_dataframe$z <- NA_character_
for (i in seq_along(spl)) {
my_dataframe$z[i] <- reference_importance[[min(match(spl[[i]], reference_importance))]]
}
my_dataframe
# first_column second_column z
# 1 x important; very important; not important very important
# 2 y not important; important; very important very important
# 3 x very important; important very important
# 4 x important; not important important
# 5 y not important not important
當然我用于z演示目的,實際上你會second_column使用z.
uj5u.com熱心網友回復:
一個選項dplyr和tidyr:
my_dataframe %>%
rowid_to_column() %>%
separate_rows(second_column, sep = "; ") %>%
group_by(rowid) %>%
slice_min(match(second_column, reference_importance))
rowid first_column second_column
<int> <chr> <chr>
1 1 x very important
2 2 y very important
3 3 x very important
4 4 x important
5 5 y not important
我使用 reference_importance 作為字符向量而不是串列:
reference_importance <- c("very important", "important", "not important")
uj5u.com熱心網友回復:
另一種可能的解決方案,基于tidyverse:
library(tidyverse)
my_dataframe %>%
mutate(id = row_number()) %>%
separate_rows(second_column, sep = "\\s*;\\s*") %>%
group_by(id) %>%
slice(match(reference_importance, second_column) %>% na.omit() %>% .[1]) %>%
ungroup %>%
select(-id)
#> # A tibble: 5 × 2
#> first_column second_column
#> <chr> <chr>
#> 1 x very important
#> 2 y very important
#> 3 x very important
#> 4 x important
#> 5 y not important
轉載請註明出處,本文鏈接:https://www.uj5u.com/yidong/473808.html
