主頁 > 區塊鏈 > 如何優化迭代Pandas資料框架的嵌套回圈的性能

如何優化迭代Pandas資料框架的嵌套回圈的性能

2021-10-12 06:52:12 區塊鏈

假設以下資料框架df:

import pandas as pd
data = {"Time"/span>:["2021-01-10 21:00:00", "2021-01-10 22:00:00", 
                "2021-01-10 21:30:01"/span>, "2021-01-10 21:45:00"/span>,
                "2021-01-12 09:00:00", "2021-01-12 09:30:00"] 。
        "ID"。 ["1"/span>,"1"/span>,"2"/span>, "2","2","2"】。]
        "Event": ["cut","cut", "smooth", "smooth","cut","cut"】。]
        "狀態"。 ["開始", "完成", "開始", "complete","start", "complete",] }
df = pd.DataFrame(data)  
df["Time"] = pd.to_datetime(df["Time"] )  
df["ID"] = df["ID"].astype("int")  
df

在此輸入圖片描述

我的最終目標是計算每個獨特的 "ID "的總生產時間,不考慮每個時間間隔之間任何潛在的時間間隔。每個ID的開始時間是 "開始 "狀態的第一個實體,而結束生產時間是每個ID "完成 "狀態的最后一個實體。例如,對于ID==1來說,這是1小時(3600秒),而對于ID==2來說,大約是45分鐘(第一個時間間隔為15分鐘,第二個時間間隔為30分鐘)。

由于我對捕捉每個獨特ID的時間間隔也很感興趣(例如,ID==1只有1個間隔,與它的總生產時間一致,ID==2有2對開始-完成狀態,因此有2個間隔),我想做的是創建兩個字典:'time_diff_dict'和'cumulativeSumId':

  • 'time_diff_dict': key:唯一的ID, values:時間間隔
  • 'cumulativeSumId':鍵:唯一的ID,值:上述時間間隔的累積和
  • 這樣,在'cumulativeSumId'字典中,每個鍵(ID)的最后一個鍵值將等于其總生產時間。

    然而,想象一下,真實的df有大約180,000行,有大約3000個唯一的ID,終止下面的代碼需要大約10min。可能我將不得不使用類似于描述的迭代方法在此輸入圖片描述

    ,例如,對于ID==1,總的生產時間是3600秒,對于ID==2是2699秒,因為這是其累計總時間字典中的最后一個實體。

    之后,我創建了一個新的df,其中有:唯一的ID,"totalTimeId "和 "timeIntervals":

    '' 
    *創建串列的串列 
    * 每一個子串列都是一個獨特的ID的資料框架
    '''
    lists_of_IDdfs =[]
    
    for id, df_id in df.groupby("ID") 。
      lists_of_IDdfs.append(df_id)
    
    資料 = []
    for df in range(len(lists_of_IDdfs))。
      data.append((lists_of_IDdfs[df].ID.iloc[-1], lists_of_IDdfs[df].Cumulative_Time.iloc[-1])
    df_ID_TotalTime = pd.DataFrame(data, columns= ["ID", "totalTimeId"] )
    
    ''為每個唯一的ID添加各自的時間區間資料點''。
    df_ID_TotalTime["timeIntervals"] = df_ID_TotalTime["ID"].map(time_diff_dict)。
    df_ID_TotalTime
    

    最終期望的結果是:

    在此輸入圖片描述

    如果有任何想法和幫助,我將不勝感激! 謝謝你!

    uj5u.com熱心網友回復:

    你可以使用pivot重塑你的資料框架,計算兩個日期之間的差異,并使用groupby"ID "來聚合資料:

    # pre-requisite ensure that Time is of datetime type<
    df['Time'] = pd.to_datetime(df['Time'] )
    
    (df.pivot(index=['ID', 'Event'], columns='Status', values='Time')
       .assign(time=lambda d: d['complete']-d['start'] )
       .groupby('ID')['time'].sum()
    )
    

    輸出:

    ID
    1 000:30: 00
    2 0002458
    

    要獲得以秒為單位的輸出:

    (df. pivot(index=['ID', 'Event'], columns='Status', values='Time') .assign(time=lambda d: d['complete']-d['start'] ) .groupby('ID')['time'].sum() .dt.total_seconds() )

    輸出:

    ID
    1 1800.0
    2 1498.0
    

    另一種輸出方式:

    (df. pivot(index=['ID', 'Event'], columns='Status', values='Time')
       .assign(time=lambda d: (d['complete']-d['start']) dt.total_seconds()
       .groupby('ID')['time'].agg(totalTimeId='sum',timeIntervals=list)
    )
    

    輸出:

     totalTimeId timeIntervals
    編碼                              
    1 3600.0 [3600.0]
    2 2699.0 [1800.0899.0]
    

    編輯如何處理重復的內容:

    你需要添加一個唯一的二級索引(ID2)

    (df.assign(ID2=df.groupby(['ID'/span>, 'Event'/span>, 'Status'/span>]) .cumcount()
       .pivot(index=['ID', 'ID2', 'Event'], columns='Status', values='Time')
       .assign(time=lambda d: (d['complete']-d['start']) dt.total_seconds()
       .groupby('ID')['time'].agg(totalTimeId='sum',timeIntervals=list)
    )
    

    輸入:

     時間 ID 事件 狀態
    0 2021-01-10 21: 00:00 1 切割開始
    1 2021-01-10 22: 00:00 1 切割完畢
    2 2021-01-10 21:30: 01 2順利開始
    3 2021-01-10 21: 45:00 2順利完成
    4 2021-12 09:00:00 2 切割開始
    5 2021-12 09:30:00 2 切割完成
    6 2021-12 09:30:00 2 切割開始
    7 2021-01-12 09:35:00 2 切割完成
    

    中級:

    Status complete start
    ID ID2 事件                                         
    1 0 cut 2021-01-10 2200: 00 2021-01-10 21:00:00
    2 0 cut 2021-01-12 09:30: 00 2021-01-12 09:0000
           順利2021-01-10 214500 2021-01-10 2130:01
       1 cut 2021-01-12 09:35: 00 2021-01-12 09:30: 00
    

    輸出:

     totalTimeId timeIntervals
    編碼                                     
    1 3600.0 [3600.0]
    2 2999.0 [1800.0899.0300.0]
    

    uj5u.com熱心網友回復:

    你可以按ID進行分組,然后計算出定時器:

    df['Cumulative_Time'] = df. groupby('ID')['Time'].apply(lambda x: x - x.min() .dt.total_seconds()
    

    為了得到你想要的輸出,你可以做以下事情,靈感來自@mozway的回答。

    (df.groupby(['ID','Event']) ['Time']
     .apply(lambda x: x.max() - x.min() .dt.total_seconds()
     .groupby('ID')
     .agg(totalTimeId='sum', timeIntervals=list)
    

    轉載請註明出處,本文鏈接:https://www.uj5u.com/qukuanlian/309436.html

    標籤:

    上一篇:如何有效地更新多維陣列的多個副本

    下一篇:這是不是python中矩陣計算的穩定性問題?

    標籤雲
    其他(157675) Python(38076) JavaScript(25376) Java(17977) C(15215) 區塊鏈(8255) C#(7972) AI(7469) 爪哇(7425) MySQL(7132) html(6777) 基礎類(6313) sql(6102) 熊猫(6058) PHP(5869) 数组(5741) R(5409) Linux(5327) 反应(5209) 腳本語言(PerlPython)(5129) 非技術區(4971) Android(4554) 数据框(4311) css(4259) 节点.js(4032) C語言(3288) json(3245) 列表(3129) 扑(3119) C++語言(3117) 安卓(2998) 打字稿(2995) VBA(2789) Java相關(2746) 疑難問題(2699) 细绳(2522) 單片機工控(2479) iOS(2429) ASP.NET(2402) MongoDB(2323) 麻木的(2285) 正则表达式(2254) 字典(2211) 循环(2198) 迅速(2185) 擅长(2169) 镖(2155) 功能(1967) .NET技术(1958) Web開發(1951) python-3.x(1918) HtmlCss(1915) 弹簧靴(1913) C++(1909) xml(1889) PostgreSQL(1872) .NETCore(1853) 谷歌表格(1846) Unity3D(1843) for循环(1842)

    熱門瀏覽
    • JAVA使用 web3j 進行token轉賬

      最近新學習了下區塊鏈這方面的知識,所學不多,給大家分享下。 # 1. 關于web3j web3j是一個高度模塊化,反應性,型別安全的Java和Android庫,用于與智能合約配合并與以太坊網路上的客戶端(節點)集成。 # 2. 準備作業 jdk版本1.8 引入maven <dependency> < ......

      uj5u.com 2020-09-10 03:03:06 more
    • 以太坊智能合約開發框架Truffle

      前言 部署智能合約有多種方式,命令列的瀏覽器的渠道都有,但往往跟我們程式員的風格不太相符,因為我們習慣了在IDE里寫了代碼然后打包運行看效果。 雖然現在IDE中已經存在了Solidity插件,可以撰寫智能合約,但是部署智能合約卻要另走他路,沒辦法進行一個快捷的部署與測驗。 如果團隊管理的區塊節點多、 ......

      uj5u.com 2020-09-10 03:03:12 more
    • 谷歌二次驗證碼成為區塊鏈專用安全碼,你怎么看?

      前言 谷歌身份驗證器,前些年大家都比較陌生,但隨著國內互聯網安全的加強,它越來越多地出現在大家的視野中。 比較廣泛接觸的人群是國際3A游戲愛好者,游戲盜號現象嚴重+國外賬號安全應用廣泛,這類游戲一般都會要求用戶系結名為“兩步驗證”、“雙重驗證”等,平臺一般都推薦用谷歌身份驗證器。 后來區塊鏈業務風靡 ......

      uj5u.com 2020-09-10 03:03:17 more
    • 密碼學DAY1

      目錄 ##1.1 密碼學基本概念 密碼在我們的生活中有著重要的作用,那么密碼究竟來自何方,為何會產生呢? 密碼學是網路安全、資訊安全、區塊鏈等產品的基礎,常見的非對稱加密、對稱加密、散列函式等,都屬于密碼學范疇。 密碼學有數千年的歷史,從最開始的替換法到如今的非對稱加密演算法,經歷了古典密碼學,近代密 ......

      uj5u.com 2020-09-10 03:03:50 more
    • 密碼學DAY1_02

      目錄 ##1.1 ASCII編碼 ASCII(American Standard Code for Information Interchange,美國資訊交換標準代碼)是基于拉丁字母的一套電腦編碼系統,主要用于顯示現代英語和其他西歐語言。它是現今最通用的單位元組編碼系統,并等同于國際標準ISO/IE ......

      uj5u.com 2020-09-10 03:04:50 more
    • 密碼學DAY2

      ##1.1 加密模式 加密模式:https://docs.oracle.com/javase/8/docs/api/javax/crypto/Cipher.html ECB ECB : Electronic codebook, 電子密碼本. 需要加密的訊息按照塊密碼的塊大小被分為數個塊,并對每個塊進 ......

      uj5u.com 2020-09-10 03:05:42 more
    • NTP時鐘服務器的特點(京準電子)

      NTP時鐘服務器的特點(京準電子) NTP時鐘服務器的特點(京準電子) 京準電子官V——ahjzsz 首先對時間同步進行了背景介紹,然后討論了不同的時間同步網路技術,最后指出了建立全球或區域時間同步網存在的問題。 一、概 述 在通信領域,“同步”概念是指頻率的同步,即網路各個節點的時鐘頻率和相位同步 ......

      uj5u.com 2020-09-10 03:05:47 more
    • 標準化考場時鐘同步系統推進智能化校園建設

      標準化考場時鐘同步系統推進智能化校園建設 標準化考場時鐘同步系統推進智能化校園建設 安徽京準電子科技官微——ahjzsz 一、背景概述隨著教育事業的快速發展,學校建設如雨后春筍,隨之而來的學校教育、管理、安全方面的問題成了學校管理人員面臨的最大的挑戰,這些問題同時也是學生家長所擔心的。為了讓學生有更 ......

      uj5u.com 2020-09-10 03:05:51 more
    • 位元幣入門

      引言 位元幣基本結構 位元幣基礎知識 1)哈希演算法 2)非對稱加密技術 3)數字簽名 4)MerkleTree 5)哪有位元幣,有的是UTXO 6)位元幣挖礦與共識 7)區塊驗證(共識) 總結 引言 上一篇我們已經知道了什么是區塊鏈,此篇說一下區塊鏈的第一個應用——位元幣。其實先有位元幣,后有的區塊 ......

      uj5u.com 2020-09-10 03:06:15 more
    • 北斗對時服務器(北斗對時設備)電力系統應用

      北斗對時服務器(北斗對時設備)電力系統應用 北斗對時服務器(北斗對時設備)電力系統應用 京準電子科技官微(ahjzsz) 中國北斗衛星導航系統(英文名稱:BeiDou Navigation Satellite System,簡稱BDS),因為是目前世界范圍內唯一可以大面積提供免費定位服務的系統,所以 ......

      uj5u.com 2020-09-10 03:06:20 more
    最新发布
    • web3 產品介紹:metamask 錢包 使用最多的瀏覽器插件錢包

      Metamask錢包是一種基于區塊鏈技術的數字貨幣錢包,它允許用戶在安全、便捷的環境下管理自己的加密資產。Metamask錢包是以太坊生態系統中最流行的錢包之一,它具有易于使用、安全性高和功能強大等優點。 本文將詳細介紹Metamask錢包的功能和使用方法。 一、 Metamask錢包的功能 數字資 ......

      uj5u.com 2023-04-20 08:46:47 more
    • Hyperledger Fabric 使用 CouchDB 和復雜智能合約開發

      在上個實驗中,我們已經實作了簡單智能合約實作及客戶端開發,但該實驗中智能合約只有基礎的增刪改查功能,且其中的資料管理功能與傳統 MySQL 比相差甚遠。本文將在前面實驗的基礎上,將 Hyperledger Fabric 的默認資料庫支持 LevelDB 改為 CouchDB 模式,以實作更復雜的資料... ......

      uj5u.com 2023-04-16 07:28:31 more
    • .NET Core 波場鏈離線簽名、廣播交易(發送 TRX和USDT)筆記

      Get Started NuGet You can run the following command to install the Tron.Wallet.Net in your project. PM> Install-Package Tron.Wallet.Net 配置 public reco ......

      uj5u.com 2023-04-14 08:08:00 more
    • DKP 黑客分析——不正確的代幣對比率計算

      概述: 2023 年 2 月 8 日,針對 DKP 協議的閃電貸攻擊導致該協議的用戶損失了 8 萬美元,因為 execute() 函式取決于 USDT-DKP 對中兩種代幣的余額比率。 智能合約黑客概述: 攻擊者的交易:0x0c850f,0x2d31 攻擊者地址:0xF38 利用合同:0xf34ad ......

      uj5u.com 2023-04-07 07:46:09 more
    • Defi開發簡介

      Defi開發簡介 介紹 Defi是去中心化金融的縮寫, 是一項旨在利用區塊鏈技術和智能合約創建更加開放,可訪問和透明的金融體系的運動. 這與傳統金融形成鮮明對比,傳統金融通常由少數大型銀行和金融機構控制 在Defi的世界里,用戶可以直接從他們的電腦或移動設備上訪問廣泛的金融服務,而不需要像銀行或者信 ......

      uj5u.com 2023-04-05 08:01:34 more
    • solidity簡單的ERC20代幣實作

      // SPDX-License-Identifier: GPL-3.0 pragma solidity >=0.7.0 <0.9.0; import "hardhat/console.sol"; //ERC20 同質化代幣,每個代幣的本質或性質都是相同 //ETH 是原生代幣,它不是ERC20代幣, ......

      uj5u.com 2023-03-21 07:56:29 more
    • solidity 參考型別修飾符memory、calldata與storage 常量修飾符C

      在solidity語言中 參考型別修飾符(參考型別為存盤空間不固定的數值型別) memory、calldata與storage,它們只能修飾參考型別變數,比如字串、陣列、位元組等... memory 適用于方法傳參、返參或在方法體內使用,使用完就會清除掉,釋放記憶體 calldata 僅適用于方法傳參 ......

      uj5u.com 2023-03-08 07:57:54 more
    • solidity注解標簽

      在solidity語言中 注釋符為// 注解符為/* 內容*/ 或者 是 ///內容 注解中含有這幾個標簽給予我們使用 @title 一個應該描述合約/介面的標題 contract, library, interface @author 作者的名字 contract, library, interf ......

      uj5u.com 2023-03-08 07:57:49 more
    • 評價指標:相似度、GAS消耗

      【代碼注釋自動生成方法綜述】 這些評測指標主要來自機器翻譯和文本總結等研究領域,可以評估候選文本(即基于代碼注釋自動方法而生成)和參考文本(即基于手工方式而生成)的相似度. BLEU指標^[^?88^^?^]^:其全稱是bilingual evaluation understudy.該指標是最早用于 ......

      uj5u.com 2023-02-23 07:27:39 more
    • 基于NOSTR協議的“公有制”版本的Twitter,去中心化社交軟體Damus

      最近,一個幽靈,Web3的幽靈,在網路游蕩,它叫Damus,這玩意詮釋了什么叫做病毒式營銷,滑稽的是,一個Web3產品卻在Web2的產品鏈上瘋狂傳銷,各方大佬紛紛為其背書,到底發生了什么?Damus的葫蘆里,賣的是什么藥? 注冊和簡單實用 很少有什么產品在用戶注冊環節會有什么噱頭,但Damus確實出 ......

      uj5u.com 2023-02-05 06:48:39 more