主頁 > 作業系統 > 如何根據R中的日期條件將資料框拆分為新的資料框

如何根據R中的日期條件將資料框拆分為新的資料框

2022-05-19 02:13:15 作業系統

如果上一個日期與當前日期的差異大于 5 天,我需要將一個資料框拆分為幾個新的/不同的資料框。

例如:如果日期串列如下:

2016-11-21
2016-11-22
2016-11-22
2016-11-24
2016-11-30
2016-12-01
2016-12-02
2016-12-10
2016-12-12
2016-12-20
...

我想要一個相差超過 5 天的每個日期的新資料框(同時將所有資訊保留在其他列中 - 為簡單起見,此處未顯示):

df1:
2016-11-21
2016-11-22
2016-11-22
2016-11-24

df2:
2016-11-30
2016-12-01
2016-12-02

df3:
2016-12-10
2016-12-12

df4:
2016-12-20
...

到目前為止,我已經能夠使用:

#split dataframe
split(d, as_date(d$date) <= lag(as_date(d$date)   days(5))) -> test
#set list as datatable
dt_list <- map(test, as.data.table)
#bind lists into new dataframe
dt <- rbindlist(dt_list, fill = TRUE, idcol = T)

根據這些條件,這給了我一個具有真或假的資料框-(不是我想要的):

     id     date                lc      lon   lat Timestamp  difftime
   <chr>  <dttm>              <fct> <dbl> <dbl> <date>     <lgl>                                                     
 1 158696 2016-12-11 05:26:38 A      135. -3.14 2016-12-11 FALSE                                                     
 2 158696 2016-12-26 08:13:44 B      135. -3.28 2016-12-26 FALSE                                                     
 3 158696 2017-01-09 06:35:37 A      136. -3.14 2017-01-09 FALSE                                                     
 4 158696 2017-02-02 08:30:50 0      135. -3.22 2017-02-02 FALSE                                                     
 5 158696 2017-02-18 18:28:08 B      135. -3.27 2017-02-18 FALSE  
 6 158696 2016-11-21 05:46:52 B      135. -3.22 2016-11-21 TRUE                                                      
 7 158696 2016-11-21 05:46:52 B      135. -3.22 2016-11-21 TRUE                                                      
 8 158696 2016-11-21 08:04:15 B      135. -3.22 2016-11-21 TRUE                                                      
 9 158696 2016-11-21 08:21:10 B      135. -3.22 2016-11-21 TRUE                                                      
 10 158696 2016-11-21 20:34:23 B      135. -3.22 2016-11-21 TRUE 

我很高興使用與上面完全不同的代碼,但如果可能,我更喜歡使用 Dplyr,因為我最熟悉它。

這是我的資料框的輸入:

structure(list(id = c("158696", "158696", "158696", "158696", 
"158696", "158696", "158696", "158696", "158696", "158696", "158696", 
"158696", "158696", "158696", "158696", "158696", "158696", "158696", 
"158696", "158696", "158696", "158696", "158696", "158696", "158696", 
"158696", "158696", "158696", "158696", "158696", "158696", "158696", 
"158696", "158696", "158696", "158696", "158696", "158696", "158696", 
"158696", "158696", "158696", "158696", "158696", "158696", "158696", 
"158696", "158696", "158696", "158696", "158696"), date = structure(c(1481672621, 
1482740024, 1482888520, 1483943737, 1483954584, 1483957732, 1484351217, 
1484372486, 1484635601, 1484639873, 1484649374, 1484654932, 1484910955, 
1484914028, 1484992088, 1485077809, 1485083628, 1485116630, 1485155703, 
1485241506, 1485245737, 1485302728, 1485394165, 1485407109, 1486024250, 
1486026218, 1486153828, 1486184167, 1486243717, 1486244406, 1486244406, 
1486244406, 1487442488, 1487462032, 1487488051, 1487495298, 1487507472, 
1487553204, 1487573823, 1487756502, 1487756774, 1487758235, 1487763098, 
1487795742, 1487812234, 1487929687, 1487932240, 1487979233, 1488246245, 
1488315015, 1488793040), class = c("POSIXct", "POSIXt"), tzone = "UTC"), 
    lc = structure(c(6L, 6L, 5L, 5L, 5L, 6L, 6L, 5L, 5L, 6L, 
    6L, 6L, 2L, 5L, 6L, 6L, 6L, 6L, 6L, 6L, 5L, 6L, 6L, 6L, 1L, 
    6L, 6L, 6L, 6L, 6L, 6L, 6L, 6L, 6L, 6L, 6L, 6L, 6L, 6L, 5L, 
    6L, 6L, 6L, 6L, 6L, 2L, 6L, 6L, 6L, 6L, 6L), .Label = c("0", 
    "1", "2", "3", "A", "B"), class = "factor"), lon = c(134.9559, 
    134.9635, 135.0038, 135.5555, 135.5994, 135.6039, 135.5398, 
    135.4953, 135.5485, 135.5502, 135.5447, 135.5461, 135.0267, 
    135.0148, 135.0258, 135.0221, 135.0013, 135.0037, 135.0306, 
    134.9676, 134.9523, 134.8742, 134.8938, 134.8815, 135.0038, 
    135.0047, 134.9429, 134.9381, 134.9218, 134.929, 134.9092, 
    134.9218, 135.045, 135.0479, 135.0794, 135.0884, 135.0796, 
    135.087, 135.092, 135.1609, 135.1625, 135.1626, 135.1649, 
    135.1601, 135.1714, 135.0644, 135.064, 135.0759, 135.0841, 
    135.0849, 134.9314), lat = c(-3.148, -3.275, -3.2625, -3.1398, 
    -3.1349, -3.1339, -2.5095, -2.511, -2.6931, -2.6923, -2.7032, 
    -2.7059, -3.2218, -3.2327, -3.2284, -3.2234, -3.2688, -3.2888, 
    -3.2257, -3.2096, -3.208, -3.2129, -3.179, -3.1945, -3.2158, 
    -3.2157, -3.1747, -3.1701, -3.1604, -3.1735, -3.1735, -3.1735, 
    -3.2697, -3.2623, -3.3155, -3.3182, -3.3046, -3.3131, -3.3125, 
    -3.2767, -3.2765, -3.2766, -3.2769, -3.2808, -3.283, -3.2069, 
    -3.2073, -3.1983, -3.312, -3.2977, -3.1022)), row.names = 47:97, class = "data.frame")

其中有幾個日期相差超過 5 天。我對 R 比較陌生,非常感謝您的幫助!

uj5u.com熱心網友回復:

library(dplyr)
df_grp = df %>% mutate(grp = cumsum(c(1, diff(date) > 5*86400)))
split(df_grp, df_grp$grp)

uj5u.com熱心網友回復:

我們可以lead()在這里使用為每個日期島創建一個偽組。然后,拆分該島值。

d$gap <- ifelse(as.numeric(difftime(d$date, lead(d$date), units = "days")) > 5, 1, 0)
d$grp <- cumsum(df$gap)
dt_list <- split(d, d$grp)

轉載請註明出處,本文鏈接:https://www.uj5u.com/caozuo/477070.html

標籤:r 数据框 日期 dplyr 分裂

上一篇:R中x軸中帶有日/周/月的條形圖之間的空間

下一篇:如何計算具有多個重復ID的SAS中第一個事件和最后一個事件之間的時間?

標籤雲
其他(157675) Python(38076) JavaScript(25376) Java(17977) C(15215) 區塊鏈(8255) C#(7972) AI(7469) 爪哇(7425) MySQL(7132) html(6777) 基礎類(6313) sql(6102) 熊猫(6058) PHP(5869) 数组(5741) R(5409) Linux(5327) 反应(5209) 腳本語言(PerlPython)(5129) 非技術區(4971) Android(4554) 数据框(4311) css(4259) 节点.js(4032) C語言(3288) json(3245) 列表(3129) 扑(3119) C++語言(3117) 安卓(2998) 打字稿(2995) VBA(2789) Java相關(2746) 疑難問題(2699) 细绳(2522) 單片機工控(2479) iOS(2429) ASP.NET(2402) MongoDB(2323) 麻木的(2285) 正则表达式(2254) 字典(2211) 循环(2198) 迅速(2185) 擅长(2169) 镖(2155) 功能(1967) .NET技术(1958) Web開發(1951) python-3.x(1918) HtmlCss(1915) 弹簧靴(1913) C++(1909) xml(1889) PostgreSQL(1872) .NETCore(1853) 谷歌表格(1846) Unity3D(1843) for循环(1842)

熱門瀏覽
  • CA和證書

    1、在 CentOS7 中使用 gpg 創建 RSA 非對稱密鑰對 gpg --gen-key #Centos上生成公鑰/密鑰對(存放在家目錄.gnupg/) 2、將 CentOS7 匯出的公鑰,拷貝到 CentOS8 中,在 CentOS8 中使用 CentOS7 的公鑰加密一個檔案 gpg -a ......

    uj5u.com 2020-09-10 00:09:53 more
  • Kubernetes K8S之資源控制器Job和CronJob詳解

    Kubernetes的資源控制器Job和CronJob詳解與示例 ......

    uj5u.com 2020-09-10 00:10:45 more
  • VMware下安裝CentOS

    VMware下安裝CentOS 一、軟硬體準備 1 Centos鏡像準備 1.1 CentOS鏡像下載地址 下載地址 1.2 CentOS鏡像下載程序 點擊下載地址進入如下圖的網站,選擇需要下載的版本,這里選擇的是Centos8,點擊如圖所示。 決定選擇Centos8后,選擇想要的鏡像源進行下載,此 ......

    uj5u.com 2020-09-10 00:12:10 more
  • 如何使用Grep命令查找多個字串

    如何使用Grep 命令查找多個字串 大家好,我是良許! 今天向大家介紹一個非常有用的技巧,那就是使用 grep 命令查找多個字串。 簡單介紹一下,grep 命令可以理解為是一個功能強大的命令列工具,可以用它在一個或多個輸入檔案中搜索與正則運算式相匹配的文本,然后再將每個匹配的文本用標準輸出的格式 ......

    uj5u.com 2020-09-10 00:12:28 more
  • git配置http代理

    git配置http代理 經常遇到克隆 github 慢的問題,這里記錄一下幾種配置 git 代理的方法,解決 clone github 過慢。 目錄 git配置代理 git單獨配置github代理 git配置全域代理 配置終端環境變數 git配置代理 主要使用 git config 命令 git單獨 ......

    uj5u.com 2020-09-10 00:12:33 more
  • Linux npm install 裝包時提示Error EACCES permission denied解

    npm install 裝包時提示Error EACCES permission denied解決辦法 ......

    uj5u.com 2020-09-10 00:12:53 more
  • Centos 7下安裝nginx,使用yum install nginx,提示沒有可用的軟體包

    Centos 7下安裝nginx,使用yum install nginx,提示沒有可用的軟體包。 18 (flaskApi) [root@67 flaskDemo]# yum -y install nginx 19 已加載插件:fastestmirror, langpacks 20 Loading ......

    uj5u.com 2020-09-10 00:13:13 more
  • Linux查看服務器暴力破解ssh IP

    在公網的服務器上經常遇到別人爆破你服務器的22埠,用來挖礦或者干其他嘿嘿嘿的事情~ 這種情況下正確的做法是: 修改默認ssh的22埠 使用設定密鑰登錄或者白名單ip登錄 建議服務器密碼為復雜密碼 創建普通用戶登錄服務器(root權限過大) 建立堡壘機,實作統一管理服務器 統計爆破IP [root ......

    uj5u.com 2020-09-10 00:13:17 more
  • CentOS 7系統常見快捷鍵操作方式

    Linux系統中一些常見的快捷方式,可有效提高操作效率,在某些時刻也能避免操作失誤帶來的問題。 ......

    uj5u.com 2020-09-10 00:13:31 more
  • CentOS 7作業系統目錄結構介紹

    作業系統存在著大量的資料檔案資訊,相應檔案資訊會存在于系統相應目錄中,為了更好的管理資料資訊,會將系統進行一些目錄規劃,不同目錄存放不同的資源。 ......

    uj5u.com 2020-09-10 00:13:35 more
最新发布
  • vim的常用命令

    Vim的6種基本模式 1. 普通模式在普通模式中,用的編輯器命令,比如移動游標,洗掉文本等等。這也是Vim啟動后的默認模式。這正好和許多新用戶期待的操作方式相反(大多數編輯器默認模式為插入模式)。 2. 插入模式在這個模式中,大多數按鍵都會向文本緩沖中插入文本。大多數新用戶希望文本編輯器編輯程序中一 ......

    uj5u.com 2023-04-20 08:43:21 more
  • vim的常用命令

    Vim的6種基本模式 1. 普通模式在普通模式中,用的編輯器命令,比如移動游標,洗掉文本等等。這也是Vim啟動后的默認模式。這正好和許多新用戶期待的操作方式相反(大多數編輯器默認模式為插入模式)。 2. 插入模式在這個模式中,大多數按鍵都會向文本緩沖中插入文本。大多數新用戶希望文本編輯器編輯程序中一 ......

    uj5u.com 2023-04-20 08:42:36 more
  • docker學習

    ###Docker概述 真實專案部署環境可能非常復雜,傳統發布專案一個只需要一個jar包,運行環境需要單獨部署。而通過Docker可將jar包和相關環境(如jdk,redis,Hadoop...)等打包到docker鏡像里,將鏡像發布到Docker倉庫,部署時下載發布的鏡像,直接運行發布的鏡像即可。 ......

    uj5u.com 2023-04-19 09:26:53 more
  • 設定Windows主機的瀏覽器為wls2的默認瀏覽器

    這里以Chrome為例。 1. 準備作業 wsl是可以使用Windows主機上安裝的exe程式,出于安全考慮,默認情況下改功能是無法使用。要使用的話,終端需要以管理員權限啟動。 我這里以Windows Terminal為例,介紹如何默認使用管理員權限打開終端,具體操作如下圖所示: 2. 操作 wsl ......

    uj5u.com 2023-04-19 09:25:49 more
  • docker學習

    ###Docker概述 真實專案部署環境可能非常復雜,傳統發布專案一個只需要一個jar包,運行環境需要單獨部署。而通過Docker可將jar包和相關環境(如jdk,redis,Hadoop...)等打包到docker鏡像里,將鏡像發布到Docker倉庫,部署時下載發布的鏡像,直接運行發布的鏡像即可。 ......

    uj5u.com 2023-04-19 09:19:04 more
  • Linux學習筆記

    IP地址和主機名 IP地址 ifconfig可以用來查詢本機的IP地址,如果不能使用,可以通過install net-tools安裝。 Centos系統下ens33表示主網卡;inet后表示IP地址;lo表示本地回環網卡; 127.0.0.1表示代指本機;0.0.0.0可以用于代指本機,同時在放行設 ......

    uj5u.com 2023-04-18 06:52:01 more
  • 解決linux系統的kdump服務無法啟動的問題

    問題:專案麒麟系統服務器的kdump服務無法啟動,沒有相關日志無法定位問題。 1、查看服務狀態是關閉的,重啟系統也無法啟動 systemctl status kdump 2、修改grub引數,修改“crashkernel”為“512M(有的機器數值太大太小都會導致報錯,建議從128M開始試,或者加個 ......

    uj5u.com 2023-04-12 09:59:50 more
  • 解決linux系統的kdump服務無法啟動的問題

    問題:專案麒麟系統服務器的kdump服務無法啟動,沒有相關日志無法定位問題。 1、查看服務狀態是關閉的,重啟系統也無法啟動 systemctl status kdump 2、修改grub引數,修改“crashkernel”為“512M(有的機器數值太大太小都會導致報錯,建議從128M開始試,或者加個 ......

    uj5u.com 2023-04-12 09:59:01 more
  • 你是不是暴露了?

    作者:袁首京 原創文章,轉載時請保留此宣告,并給出原文連接。 如果您是計算機相關從業人員,那么應該經歷不止一次網路安全專項檢查了,你肯定是收到過資訊系統技術檢測報告,要求你加強風險監測,確保你提供的系統服務堅實可靠了。 沒檢測到問題還好,檢測到問題的話,有些處理起來還是挺麻煩的,尤其是線上正在運行的 ......

    uj5u.com 2023-04-05 16:52:56 more
  • 細節拉滿,80 張圖帶你一步一步推演 slab 記憶體池的設計與實作

    1. 前文回顧 在之前的幾篇記憶體管理系列文章中,筆者帶大家從宏觀角度完整地梳理了一遍 Linux 記憶體分配的整個鏈路,本文的主題依然是記憶體分配,這一次我們會從微觀的角度來探秘一下 Linux 內核中用于零散小記憶體塊分配的記憶體池 —— slab 分配器。 在本小節中,筆者還是按照以往的風格先帶大家簡單 ......

    uj5u.com 2023-04-05 16:44:11 more