Not
Bu sayfaya erişim yetkilendirme gerektiriyor. Oturum açmayı veya dizinleri değiştirmeyi deneyebilirsiniz.
Bu sayfaya erişim yetkilendirme gerektiriyor. Dizinleri değiştirmeyi deneyebilirsiniz.
Zip (unzip) sıkıştırılmış dosya veya dosya dizinlerini açmak için .zip Bash komutunu kullanabilirsiniz. Azure Databricks %shmagic komutu, unzip komutu da dahil olmak üzere rastgele Bash kodlarının yürütülmesini sağlar.
Apache Spark, sıkıştırılmış Parquet dosyalarıyla etkileşim için yerel codec'ler sağlar. Azure Databricks tarafından yazılan Parquet dosyalarının çoğu, snappy sıkıştırma kullandıklarını gösteren .snappy.parquet ile biter.
Dosyayı indirme ve sıkıştırmasını açma
curl kullanarak sıkıştırılmış dosyayı indirin ve ardından verileri genişletmek için unzip kullanın. Aşağıdaki örnek, İnternet'ten indirilen sıkıştırılmış bir CSV dosyası kullanır. Bkz. İnternet'ten veri indirme.
%sh curl https://resources.lendingclub.com/LoanStats3a.csv.zip --output /tmp/LoanStats3a.csv.zip
unzip /tmp/LoanStats3a.csv.zip
Dosyayı bir birime taşıma
Şimdi genişletilmiş dosyayı bir Unity Kataloğu birimine taşıyın:
%sh mv /tmp/LoanStats3a.csv /Volumes/my_catalog/my_schema/my_volume/LoanStats3a.csv
Bu örnekte, indirilen verilerin ilk satırında bir açıklaması ve ikincisinde üst bilgisi vardır. Artık verileri taşıdığınıza ve genişlettiklerine göre, CSV dosyalarını okumak için standart seçenekleri kullanın, örneğin:
df = spark.read.format("csv").option("skipRows", 1).option("header", True).load("/Volumes/my_catalog/my_schema/my_volume/LoanStats3a.csv")
display(df)