Apa itu BlobFuse?

BlobFuse adalah driver sistem file virtual sumber terbuka yang memungkinkan integrasi Azure Blob Storage dengan lingkungan Linux yang lancar. Dengan menggunakan BlobFuse, Anda dapat memasang kontainer akun Azure Storage sebagai sistem file, membuat data blob dapat diakses melalui operasi file Linux standar. BlobFuse menerjemahkan operasi ini ke dalam panggilan Azure Blob REST API, sehingga aplikasi Anda dapat memanfaatkan skalabilitas dan durabilitas Azure Blob Storage.

BlobFuse menyediakan beberapa mekanisme penyimpanan sementara, termasuk penyimpanan sementara file, metadata, dan atribut, untuk meningkatkan kinerja dan meminimalkan biaya lalu lintas jaringan. Anda dapat mengonfigurasi kebijakan lokasi, ukuran, dan retensi cache untuk performa optimal.

Proyek BlobFuse dilisensikan di bawah lisensi MIT.

Nota

BlobFuse v2 adalah versi terbaru blobFuse dan memiliki banyak peningkatan signifikan atas BlobFuse v1. Dukungan BlobFuse v1 berakhir pada Bulan September 2026. Migrasikan ke BlobFuse v2 dengan menggunakan instruksi yang disediakan.

Kasus penggunaan kunci

Dengan menerjemahkan panggilan sistem file ke panggilan Azure Blob REST API, BlobFuse menyediakan jembatan praktis antara beban kerja berbasis file Anda dan skala besar dan efisiensi biaya Azure Blob Storage. Contoh kasus penggunaan meliputi:

  • Pelatihan model dan titik pemeriksaan untuk AI dan pembelajaran mesin (ML). BlobFuse meningkatkan alur kerja AI/ML dengan menyediakan akses cepat ke set data multi-petabyte di Azure Blob Storage melalui caching cerdas. Ini memungkinkan simpul komputasi (komputer virtual), kontainer, dan pod Azure Kubernetes Service (AKS) untuk memuat data pelatihan secara efisien dan menyimpan titik pemeriksaan model. Memuat data sebelumnya dengan BlobFuse memastikan akses cepat sebelum pelatihan dimulai, membantu mengoptimalkan penggunaan GPU. BlobFuse divalidasi dengan kerangka kerja ML terdistribusi seperti PyTorch dan Ray, memberikan portabilitas alur kerja yang lebih besar.

  • Komputasi Kinerja Tinggi (HPC). BlobFuse memungkinkan akses cepat dan dapat diskalakan ke Azure Blob Storage dalam pengaturan HPC, memproses data secara efisien di seluruh domain seperti:

    • Beban kerja mengemudi otonom (ADAS) yang menggunakan AKS. Beban kerja ini memanfaatkan BlobFuse untuk simulasi skala besar dan data pelatihan model.

    • Simulasi hidrofoil. BlobFuse mengelola file komputasi dan hasil untuk analisis teknik yang disederhanakan.

    • Pengurutan genomik. BlobFuse menangani himpunan data besar dan mempercepat berbagi data.

    • Simulasi game yang mengandalkan akses data cepat. BlobFuse meningkatkan pemrosesan dan skala paralel untuk mendukung skenario yang kompleks.

  • Integrasi Beban Kerja Cloud-Native. Anda dapat menggunakan BlobFuse sebagai lapisan penyimpanan persisten untuk kontainer dan beban kerja stateful di Kubernetes melalui driver CSI. Ini memungkinkan aplikasi untuk berbagi file besar, bobot model, atau log menggunakan kapasitas Azure Blob Storage yang dapat diskalakan. BlobFuse sangat cocok untuk mode akses baca-tulis atau baca-saja dalam skenario kluster bersama.

  • Pra-pemrosesan Big Data Analytics dan AI data pelatihan. BlobFuse meningkatkan beban kerja analitik dengan mengintegrasikan dengan alat seperti Hadoop dan Spark untuk penyimpanan dan pengambilan data yang efisien. BlobFuse juga berguna untuk pra-pemrosesan data blob untuk tugas AI seperti pembersihan data, validasi, dan transformasi.

  • Pencadangan dan pengarsipan data. BlobFuse menyederhanakan pencadangan dan pengarsipan himpunan data besar dengan mengaktifkan penyimpanan langsung di Azure Blob Storage. Ini mendukung tugas pencadangan utama, seperti pencadangan database Oracle Recovery Manager (RMAN) dan cadangan sistem perusahaan. Ini menyediakan penyimpanan yang aman dan dapat diskalakan untuk data video pengawasan, mengurangi overhead manajemen data manual.

Kemampuan utama

Berikut adalah beberapa tugas utama.

  • Pasang kontainer Azure Blob Storage atau sistem file Azure Data Lake Storage di Linux.

    BlobFuse mendukung akun penyimpanan dengan namespace datar atau namespace hierarkis yang dikonfigurasi.

  • Gunakan operasi sistem file dasar seperti mkdir, , opendir, readdir, rmdiropen, read, create, write, close, unlink, truncate, stat, , dan rename.

  • Gunakan penembolokan file lokal untuk meningkatkan waktu akses berikutnya.

  • Dapatkan wawasan tentang aktivitas pemasangan dan penggunaan sumber daya dengan menggunakan monitor kesehatan.

  • Batasi blob mana yang dapat dilihat atau dioperasikan dengan menggunakan filter blob.

  • Unduh seluruh kontainer atau subdirektori ke cache lokal saat Anda memasang BlobFuse. Lihat Mengoptimalkan performa dengan pramuat data.

Cara kerja BlobFuse

BlobFuse menggunakan pustaka libfuse (fuse3) untuk terhubung dengan modul kernel Linux FUSE. Ini melakukan operasi sistem file dengan menggunakan REST API Azure Storage. Melalui konvensi jalur, ini mengonversi nama objek Azure Blob Storage menjadi struktur seperti direktori. Anda dapat mengakses file seolah-olah file tersebut berada secara lokal. BlobFuse mendukung operasi standar seperti mkdir, , , opendirreaddir, rmdir, openread, create, write, close, unlink, truncate, , stat, dan rename. Ini juga mendukung chmod untuk akun namespace hierarkis (HNS).

Nota

BlobFuse tidak menjamin kepatuhan POSIX penuh karena menerjemahkan permintaan ke DALAM API REST Blob. Misalnya, operasi penggantian nama adalah atomik di POSIX tetapi tidak di BlobFuse. Lihat Sistem file BlobFuse dan Linux dibandingkan.

BlobFuse memiliki dua mode operasi: caching (cache file) dan streaming (cache blok).

Dalam mode caching, BlobFuse mengunduh seluruh file dari Azure Blob Storage ke direktori cache lokal sebelum tersedia untuk aplikasi. Semua pembacaan dan penulisan berikutnya beroperasi pada cache lokal ini sampai file dikeluarkan atau dianggap tidak valid. Saat Anda membuat atau mengubah file, menutup handel file akan memicu pengunggahan file ke kontainer penyimpanan. Mode ini berfungsi dengan baik untuk beban kerja yang berulang kali mengakses file atau bekerja dengan himpunan data yang muat pada disk lokal.

Dalam mode streaming, BlobFuse mengalirkan data dalam gugus (blok) dan menyajikannya seiring dengan proses pengunduhan. Mode ini dirancang untuk beban kerja yang melibatkan file besar, seperti himpunan data pelatihan AI/ML, pengurutan genomik, dan simulasi HPC.

Langkah berikutnya

Lihat juga