我有一個包含 50 多個列的資料框,前 2 個是唯一 ID。由于某些原因,對于不同的 ID,第三列中的資料可能完全相同。
我想要實作的是根據從第三列開始的所有列從資料框中洗掉重復項。如果有超過 1 行具有不同的 ID 和來自第三列的相同資料,我們將保留哪一行都是一樣的,它可以是最后一行或第一行,以更容易做的為準。
我對熊貓還很陌生,我嘗試過的是這樣的:
df.drop_duplicates(subset=df.iloc[2:], keep="last")
uj5u.com熱心網友回復:
df.drop_duplicates需要一個列名串列作為subset引數,所以試試這個:
df.drop_duplicates(subset=df.columns[2:], keep="last")
轉載請註明出處,本文鏈接:https://www.uj5u.com/qukuanlian/414814.html
標籤:
下一篇:將特定字串從一列移動到另一列
