我嘗試從 Unix 服務器讀取兩個 10 億條記錄檔案以進行檔案比較。
我嘗試在 python 中使用 paramiko 包,但連接和讀取 Unix 檔案非常慢。這就是我選擇Java的原因。
在 Java 中,當我讀取檔案時,我面臨記憶體問題和性能問題。
我的要求:首先從Unix服務器file1讀取所有記錄,然后從Unix服務器讀取第二個檔案記錄,最后比較兩個檔案。
uj5u.com熱心網友回復:
聽起來你想處理大檔案。經驗法則是它們會超過您的 RAM,因此永遠不要希望一次全部讀取它們。
而是嘗試閱讀有意義的塊,處理它們,然后忘記它們。有意義的塊可以是字符、單詞、線條、運算式、物件。
uj5u.com熱心網友回復:
當您在 UNIX 中作業時,我建議您對檔案進行排序并使用diff命令列工具:UNIX 的命令列命令非常強大。請向我們展示檔案的摘錄(也許您可能需要cut或也需要awk腳本)。
轉載請註明出處,本文鏈接:https://www.uj5u.com/qukuanlian/359612.html
