Zip sıkıştırılmış dosyalarını genişletme ve okuma

Zip (unzip) sıkıştırılmış dosya veya dosya dizinlerini açmak için .zip Bash komutunu kullanabilirsiniz. Azure Databricks %shmagic komutu, unzip komutu da dahil olmak üzere rastgele Bash kodlarının yürütülmesini sağlar.

Apache Spark, sıkıştırılmış Parquet dosyalarıyla etkileşim için yerel codec'ler sağlar. Azure Databricks tarafından yazılan Parquet dosyalarının çoğu, snappy sıkıştırma kullandıklarını gösteren .snappy.parquet ile biter.

Dosyayı indirme ve sıkıştırmasını açma

curl kullanarak sıkıştırılmış dosyayı indirin ve ardından verileri genişletmek için unzip kullanın. Aşağıdaki örnek, İnternet'ten indirilen sıkıştırılmış bir CSV dosyası kullanır. Bkz. İnternet'ten veri indirme.

%sh curl https://resources.lendingclub.com/LoanStats3a.csv.zip --output /tmp/LoanStats3a.csv.zip
unzip /tmp/LoanStats3a.csv.zip

Dosyayı bir birime taşıma

Şimdi genişletilmiş dosyayı bir Unity Kataloğu birimine taşıyın:

%sh mv /tmp/LoanStats3a.csv /Volumes/my_catalog/my_schema/my_volume/LoanStats3a.csv

Bu örnekte, indirilen verilerin ilk satırında bir açıklaması ve ikincisinde üst bilgisi vardır. Artık verileri taşıdığınıza ve genişlettiklerine göre, CSV dosyalarını okumak için standart seçenekleri kullanın, örneğin:

df = spark.read.format("csv").option("skipRows", 1).option("header", True).load("/Volumes/my_catalog/my_schema/my_volume/LoanStats3a.csv")
display(df)