如何找到具有值的最后一列（對于每一行），某些行的值全部為NA？-有解無憂

我遇到了與如何在 R 中找到具有值的最后一列（對于每一行）相同的問題？，除了我有沒有值的行（NA 的整行）。所述帖子中提供的樣本沒有一整排 NA。

我想知道我應該如何修改以下內容？我不想洗掉那些帶有所有 NA 的行，因為它們在以后的分析中很有用。

df %>%
  rowwise %>% 
  mutate(m = {tmp <- c_across(starts_with('m'))
               tail(na.omit(tmp), 1)}) %>%
  ungroup

非常感謝！

uj5u.com熱心網友回復：

如果行中的所有元素都為空，那么一般的解決方案是創建條件以回傳NA這些行

library(dplyr)
df %>%
  rowwise %>% 
  mutate(m = {tmp <- c_across(starts_with('m'))
               if(all(is.na(tmp))) NA_character_ else 
                   tail(na.omit(tmp), 1)}) %>%
  ungroup

-輸出

# A tibble: 4 × 5
     id m_1   m_2   m_3   m    
  <dbl> <chr> <chr> <chr> <chr>
1     1 a     e     i     i    
2     2 b     <NA>  <NA>  b    
3     3 <NA>  <NA>  <NA>  <NA> 
4     4 d     h     l     l

如果 OP 只想回傳最后一個非 NA 元素，我們也可以添加一個索引[1]來提取，NA當沒有元素時自動回傳

df %>%
  rowwise %>% 
  mutate(m = {tmp <- c_across(starts_with('m'))
               tail(na.omit(tmp), 1)[1]}) %>%
  ungroup
# A tibble: 4 × 5
     id m_1   m_2   m_3   m    
  <dbl> <chr> <chr> <chr> <chr>
1     1 a     e     i     i    
2     2 b     <NA>  <NA>  b    
3     3 <NA>  <NA>  <NA>  <NA> 
4     4 d     h     l     l

資料

df <- structure(list(id = c(1, 2, 3, 4), m_1 = c("a", "b", NA, "d"), 
    m_2 = c("e", NA, NA, "h"), m_3 = c("i", NA, NA, "l")), row.names = c(NA, 
-4L), class = "data.frame")

uj5u.com熱心網友回復：

使用來自@akrun 的資料（非常感謝）我們可以這樣做：

'\\b[^,] $' 是一個正則運算式：

\\... 表示轉義（即不匹配）這R在其他語言中很特殊，只有一種\

\\b... 元字符 \b 是一個錨點^和$符號。它在稱為“詞邊界”的位置匹配。這個匹配是零長度的。

[^,] ... 代表字符類，這里特殊的^插入符號：一個不是的字符,。這里的意思是一個或多個,

$ ... 表示字串結束或行結束，具體取決于多行模式。

library(dplyr)
library(tidyr)
library(stringr)

df %>% 
  mutate(across(starts_with("m"), ~case_when(!is.na(.) ~ cur_column()), .names = 'new_{col}')) %>%
  unite(New_Col, starts_with('new'), na.rm = TRUE, sep = ', ') %>% 
  mutate(New_Col = str_extract(New_Col, '\\b[^,] $'))

  id  m_1  m_2  m_3 New_Col
1  1    a    e    i     m_3
2  2    b <NA> <NA>     m_1
3  3 <NA> <NA> <NA>    <NA>
4  4    d    h    l     m_3

uj5u.com熱心網友回復：

library(tidyverse)
df <- data.frame(id = c(1, 2, 3, 4), m_1 = c("a", NA, "c", "d"), m_2 = c("e", NA, "g", "h"), m_3 = c("i", NA, NA, "l"))


df %>%
  rowwise() %>%
  mutate(
    nms = list(str_subset(names(df), "^m")),
    m = c_across(starts_with("m")) %>%
      {
        ifelse(test = all(is.na(.)),
          yes = NA,
          no = nms[which(. == tail(na.omit(.), 1))]
        )
      }
  ) %>%
  select(-nms)
#> # A tibble: 4 × 5
#> # Rowwise: 
#>      id m_1   m_2   m_3   m    
#>   <dbl> <chr> <chr> <chr> <chr>
#> 1     1 a     e     i     m_3  
#> 2     2 <NA>  <NA>  <NA>  <NA> 
#> 3     3 c     g     <NA>  m_2  
#> 4     4 d     h     l     m_3




# only the value no the column name
df %>%
  rowwise() %>%
  mutate(
    m = c_across(starts_with("m")) %>%
      {
        ifelse(test = all(is.na(.)),
          yes = NA,
          no = tail(na.omit(.), 1)
        )
      }
  )
#> # A tibble: 4 × 5
#> # Rowwise: 
#>      id m_1   m_2   m_3   m    
#>   <dbl> <chr> <chr> <chr> <chr>
#> 1     1 a     e     i     i    
#> 2     2 <NA>  <NA>  <NA>  <NA> 
#> 3     3 c     g     <NA>  g    
#> 4     4 d     h     l     l

^{由reprex 包(v2.0.1)于 2022 年 1 月 1 日創建}

轉載請註明出處，本文鏈接：https://www.uj5u.com/houduan/402327.html

標籤：

上一篇：比較2個不同長度的Pandas資料框并獲取已更改值的列名

下一篇：Excelize 2.5.0 正式發布，這些新增功能值得關注