我欲封天耳根小说零,有声读物,梦入神机

Pandas 支持多種存儲格式，在本文中將對不同類型存儲格式下的Pandas Dataframe的讀取速度、寫入速度和大小的進行測試對比。

創建測試Dataframe

首先創建一個包含不同類型數據的測試Pandas Dataframe。

import pandas as pd
import random
import string
import numpy as np

# Config DF
df_length= 10**6
start_date= '2023-01-01'
all_string= list(string.ascii_lette rs + string.digits)
string_length= 10**1
min_number= 0
max_number= 10**3

# Create Columns
date_col= pd.date_range(start= start_date, periods= df_length, freq= 'H')
str_col= [''.join(np.random.choice(all_string, string_length)) for i in range(df_length)]
float_col= np.random.rand(df_length)
int_col= np.random.randint(min_number,max_number, size = df_length)

# Create DataFrame
df= pd.DataFrame({'date_col' : date_col,
'str_col' : str_col,
'float_col' : float_col,
'int_col' : int_col})
df.info()
df.head()

以不同的格式存儲

接下來創建測試函數，以不同的格式進行讀寫。

import time
import os

def check_read_write_size(df, file_name, compression= None) :
format= file_name.split('.')[-1]
# Write
begin= time.time()
if file_name.endswith('.csv') : df.to_csv(file_name, index= False, compression= compression)
elif file_name.endswith('.parquet') : df.to_parquet(file_name, compression= compression)
elif file_name.endswith('.pickle') : df.to_pickle(file_name, compression= compression)
elif file_name.endswith('.orc') : df.to_orc(file_name)
elif file_name.endswith('.feather') : df.to_feather(file_name)
elif file_name.endswith('.h5') : df.to_hdf(file_name, key= 'df')
write_time= time.time() - begin
# Read
begin= time.time()
if file_name.endswith('.csv') : pd.read_csv(file_name, compression= compression)
elif file_name.endswith('.parquet') : pd.read_parquet(file_name)
elif file_name.endswith('.pickle') : pd.read_pickle(file_name, compression= compression)
elif file_name.endswith('.orc') : pd.read_orc(file_name)
elif file_name.endswith('.h5') : pd.read_hdf(file_name)
read_time= time.time() - begin
# File Size
file_size_mb = os.path.getsize(file_name) / (1024 * 1024)
return [format, compression, read_time, write_time, file_size_mb]

然后運行該函數并將結果存儲在另一個Pandas Dataframe中。

test_case= [
['df.csv','infer'],
['df.csv','gzip'],
['df.pickle','infer'],
['df.pickle','gzip'],
['df.parquet','snappy'],
['df.parquet','gzip'],
['df.orc','default'],
['df.feather','default'],
['df.h5','default'],
]

result= []
for i in test_case :
result.append(check_read_write_size(df, i[0], compression= i[1]))

result_df= pd.DataFrame(result, columns= ['format','compression','read_time','write_time','file_size'])
result_df

測試結果

下面的圖表和表格是測試的結果。

我們對測試的結果做一個簡單的分析：

CSV

未壓縮文件的大小最大
壓縮后的尺寸很小，但不是最小的
CSV的讀取速度和寫入速度是最慢的

Pickle

表現得很平均
但壓縮寫入速度是最慢的

Feather（再見 CSV，速度提升 150 倍！）

最快的讀寫速度，文件的大小也是中等，非常的平均

ORC

所有格式中最小的
讀寫速度非常快，幾乎是最快的

Parquet

總的來說，快速并且非常小，但是并不是最快也不是最小的

總結

從結果來看，我們應該使用ORC或Feather，而不再使用CSV了，是嗎？

這取決于需求。

如果你正在做一些單獨的項目，那么使用最快或最小的格式肯定是有意義的。

但大多數時候，我們必須與他人合作。所以，除了速度和大小，還有更多的因素。

未壓縮的CSV可能很慢，而且最大，但是當需要將數據發送到另一個系統時，它非常容易。

ORC作為傳統的大數據處理格式（來自Hive）對于速度的和大小的優化是做的最好的，Parquet比ORC更大、更慢，但是它卻是在速度和大小中取得了最佳的平衡，并且支持他的生態也多，所以在需要處理大文件的時候可以優先選擇Parquet。

聲明：本文內容及配圖由入駐作者撰寫或者入駐合作網站授權轉載。文章觀點僅代表作者本人，不代表電子發燒友網立場。文章及其配圖僅供工程師學習之用，如有內容侵權或者其他違規問題，請聯系本站處理。舉報投訴

數據

數據

+關注

關注
8

文章
7030

瀏覽量
89035
存儲

存儲

+關注

關注
13

文章
4314

瀏覽量
85846
函數

函數

+關注

關注
3

文章
4331

瀏覽量
62618

ICL5101與ICL5102性能對比

ICL5101與ICL5102性能對比-中文

發表于 06-17 14:26 ?1次下載

在线观看www成人影院-在线观看www日本免费网站-在线观看www视频-在线观看操-欧美18在线-欧美1级

搜索歷史

Pandas DataFrame的存儲格式性能對比

創建測試Dataframe

總結

評論

Python利用pandas讀寫Excel文件

Nanopi系列板子資源性能對比

在PyODPS DataFrame自定義函數中使用pandas、scipy和scikit-learn

SparkRDMA基于BigDataBench的性能對比測試

Linux下AWTK與Qt的性能對比

Arm Cortex-A35性能對比分析

步進電機和交流伺服電機性能對比分析哪個好？

常用無線收發芯片性能對比分析哪個好？

步進電機和交流伺服電機性能對比分析哪個好？

arduino和stm32性能對比究竟誰更厲害？

關于STM32各系列MCU性能對比及測試說明

高頻型直流充電機性能對比檢驗試驗總結報告

什么格式是保存Pandas數據的最好格式

如何實現Pandas的DataFrame轉換交互式表格

ICL5101與ICL5102性能對比