Menyimpan data di Microsoft Fabric

Microsoft Fabric menyediakan beberapa opsi penyimpanan yang dirancang untuk mendukung analitik, pemrosesan real time, dan pelaporan operasional dalam platform terpadu. Memilih pengalaman penyimpanan yang tepat membantu Anda mengoptimalkan performa, mengelola biaya, dan menyelaraskan arsitektur data Anda dengan persyaratan beban kerja. Terlepas dari sumber atau metode persiapannya, semua data mendarat di yayasan penyimpanan terpadu yang disebut OneLake.

Artikel ini menjelaskan bagaimana data disimpan dalam Fabric dan menjelaskan pengalaman penyimpanan inti yang tersedia. Bagian berikut mencakup:

  • OneLake – Data lake logis terpadu yang mendukung semua beban kerja Fabric.
  • Lakehouse – Menyimpan dan menganalisis data terstruktur dan tidak terstruktur menggunakan tabel Delta.
  • Gudang – Menyimpan data relasional yang dioptimalkan untuk analitik SQL berkinerja tinggi.
  • Eventhouse – Menyimpan dan mengkueri data peristiwa real time volume tinggi.
  • Database dan pengalaman penyimpanan lainnya – Pahami kemampuan penyimpanan tambahan yang tersedia dalam Fabric.

Gunakan gambaran umum ini untuk memahami cara kerja setiap opsi penyimpanan dan memilih yang paling cocok untuk skenario analitik dan operasional Anda.

Lakehouse untuk penyimpanan data yang fleksibel

Lakehouse adalah item penyimpanan inti di Fabric yang menggunakan OneLake untuk menyimpan data dalam format file dan tabel. Lakehouse mewakili struktur folder yang dikumpulkan di OneLake dan menyertakan antarmuka SQL. Lakehouse menyimpan data sebagai file dalam format Parquet Delta. Anda dapat mengatur file mentah seperti file atau gambar CSV dalam folder, dan Anda dapat membuat tabel Delta terkelola untuk data terstruktur. Model ini mendukung data terstruktur dan tidak terstruktur di lingkungan yang sama.

Fabric secara otomatis menyediakan titik akhir analitik SQL untuk setiap Lakehouse. Anda dan alat seperti Power BI bisa mengkueri tabel Delta dengan menggunakan Transact-SQL, seolah-olah mengkueri database relasional. Lakehouse menggabungkan skalabilitas dan fleksibilitas data lake dengan kemampuan gudang inti, termasuk kueri tabel langsung dan manajemen skema.

Gudang untuk analitik terstruktur

Gudang di Fabric memberikan pengalaman gudang data SQL tradisional (dengan tabel, tampilan SQL, prosedur tersimpan, dan banyak lagi) pada penyimpanan terpadu Fabric. Saat Anda membuat Gudang, ia menyimpan data dalam format OneLake dalam Delta sebagai sekumpulan tabel Delta yang terorganisir dengan antarmuka ANSI SQL di atasnya. Gudang menyediakan komputasi khusus dan performa yang disempurnakan untuk kueri SQL yang kompleks dan beban kerja gaya BI. Ini mendukung fitur seperti pengindeksan, prosedur tersimpan, dan transaksi ACID yang kuat pada tabel.

Gudang dan Lakehouse menggunakan penyimpanan OneLake yang sama sebagai dasar. Anda dapat mengintegrasikannya dengan menggunakan pintasan atau fitur interoperabilitas lainnya saat diperlukan. Namun, Anda biasanya memisahkannya untuk kasus penggunaan yang berbeda. Gudang data ini sangat ideal untuk data relasional dengan skema bintang yang terstruktur, yang perlu Anda analisis dan olah menggunakan SQL. Anda dapat menggunakan alur Fabric untuk memuat data ke dalam Gudang. Power BI dapat tersambung dengan menggunakan Direct Lake atau DirectQuery untuk mengambil data tanpa impor.

Panduan keputusan: Lakehouse vs. Warehouse

Gudang dan Lakehouses melayani peran yang berbeda tetapi melengkapi.

  • Gudang dioptimalkan untuk pergudangan data skala perusahaan terstruktur dengan dukungan T-SQL penuh, transaksi ACID, dan penegakan skema yang kuat—ideal untuk BI dan pelaporan. Pilih Gudang untuk mengelola beban kerja SQL berperforma tinggi dan Lakehouse untuk pemrosesan big data, analisis eksploratif, serta skenario yang melibatkan berbagai format data atau integrasi lake eksternal.

  • Lakehouses menawarkan penyimpanan yang fleksibel dan dapat diskalakan untuk data terstruktur dan tidak terstruktur, mendukung rekayasa data berbasis Spark dan analitik SQL baca-saja melalui titik akhir otomatis.

Banyak organisasi mendapat manfaat dari menggunakan keduanya bersama-sama: data lakehouses untuk penyerapan dan transformasi, dan data warehouses untuk analitik dan pelaporan yang lebih terperinci. Untuk mempelajari lebih lanjut, lihat panduan keputusan.

Database cermin untuk replikasi mendekati real-time

Database cermin dalam Fabric adalah salinan database operasional eksternal yang terus direplikasi, seperti Azure SQL Database, SQL Server, Azure Cosmos DB, atau Snowflake. Fabric menyimpan data mirror di OneLake dalam format Delta Lake.

Pencerminan menyinkronkan perubahan sumber ke Fabric dalam waktu dekat secara real time tanpa memerlukan ekstrak tradisional, transformasi, beban alur. Setelah replikasi, data menjadi dapat langsung dikueri melalui endpoint analitik SQL dan tersedia di berbagai beban kerja Fabric, termasuk Power BI, notebook Spark, dan pipeline.

Arsitektur ini mendukung skenario pemrosesan transaksional dan analitik hibrid (HTAP), di mana Anda menganalisis data operasional sambil mempertahankan integritas sistem sumber. Jika data sumber sudah disimpan di lokasi yang dapat diakses melalui fitur pintasan OneLake (seperti Azure Data Lake Storage atau ruang kerja lain dalam Fabric), pertimbangkan untuk menggunakan pintasan untuk akses langsung tanpa penyalinan daripada membuat duplikat. Pencerminan paling cocok untuk database operasional yang memerlukan penangkapan data perubahan berkelanjutan, sementara pintasan sangat ideal ketika Anda memerlukan akses langsung baca saja tanpa replikasi.

Pintasan OneLake untuk akses data zero-copy

Pintasan OneLake adalah link logis yang mereferensikan data dalam sistem penyimpanan eksternal atau di ruang kerja Fabric lainnya tanpa menyalinnya. Pintasan membuat data yang dirujuk muncul sebagai bagian dari namespace OneLake lokal, sehingga semua mesin komputasi Fabric (Spark, SQL, Power BI) dapat mengkueri target pintasan bersama data asli. Pendekatan ini mempertahankan satu versi kebenaran dan menghindari duplikasi penyimpanan.

Anda juga dapat menggunakan berbagi data OneLake untuk memperluas akses pintasan di seluruh batas penyewa Microsoft Entra. Pemilik data memberikan izin OneLake kepada identitas eksternal, dan penerima membuat pintasan ke data yang dibagikan di ruang kerja mereka sendiri. Kebijakan tata kelola tetap diberlakukan di sumbernya. Untuk informasi selengkapnya, lihat Pintasan OneLake dan Pembagian data eksternal.

Eventhouse untuk analitik acara waktu nyata

Eventhouse menyediakan lingkungan analitik real-time yang dapat diskalakan yang dirancang untuk menyerap, menyimpan, dan menganalisis data peristiwa dalam volume tinggi. Ini adalah mesin dasar untuk beban kerja Real-Time Intelligence.

Eventhouse menghosting satu atau beberapa database Kusto Query Language berdasarkan mesin Kusto. Database ini secara otomatis mengindeks dan mempartisi data berdasarkan waktu penyerapan. Anda mengkueri data dengan menggunakan Bahasa Kueri Kusto.

Eventhouse sangat cocok untuk telemetri, log keamanan, catatan kepatuhan, dan transaksi keuangan di mana analitik latensi rendah dan penyerapan skala tinggi diperlukan.

Database SQL untuk beban kerja transaksi

Database SQL di Fabric mendukung beban kerja analitik transaksi dan operasional. Mereka memberikan pengalaman database relasional yang dikelola sepenuhnya dengan dukungan untuk T-SQL, termasuk kemampuan definisi data (DDL), manipulasi (DML), dan kueri (DQL). Anda dapat menggunakan prosedur, tampilan, dan fungsi tersimpan untuk membangun solusi transaksional dan analitis.

Database SQL menggunakan layanan pencerminan otomatis untuk mereplikasi tabel transaksional ke OneLake untuk analitik. Saat Anda membuat database SQL, Fabric memulai mesin replikasi yang menangkap operasi sisipan, pembaruan, dan penghapusan melalui umpan perubahan mesin SQL dan menulis perubahan tersebut ke OneLake sebagai file Delta Parquet. Replikasi terjadi mendekati real time dan dimulai secara otomatis. Semua tabel yang didukung dicerminkan secara default. Perilaku ini memastikan bahwa salinan OneLake tetap disinkronkan dengan database operasional.

Database SQL terintegrasi dengan pengalaman Fabric lainnya seperti Power BI, notebook, fungsi data pengguna, alur, dan alat eksternal melalui protokol TDS. Integrasi ini memungkinkan Anda membangun solusi end-to-end, dari penyerapan dan transformasi data ke visualisasi dan pelaporan, tanpa meninggalkan lingkungan Fabric. Platform ini secara otomatis menangani pengindeksan dan pengoptimalan performa, sehingga Anda tidak perlu menyetel atau mengelola infrastruktur secara manual.

Cosmos DB untuk beban kerja NoSQL terdistribusi

Cosmos DB di Microsoft Fabric adalah database NoSQL terkelola dan terdistribusi sepenuhnya yang dirancang untuk aplikasi throughput tinggi dan terdistribusi secara global. Ini mendukung model skema fleksibel dan data JSON semi-terstruktur.

Cosmos DB secara otomatis dicerminkan ke dalam OneLake dalam format Delta untuk mendukung analitik tanpa memengaruhi performa operasional. Replikasi berkelanjutan dan mendekati real time dan tidak memerlukan konfigurasi manual.

Setelah replikasi, data dapat diakses melalui titik akhir analitik SQL. Anda bisa mengkueri data dengan menggunakan Transact-SQL, membuat tampilan, dan mengintegrasikan dengan Power BI, buku catatan, dan alur.

Titik akhir analitik SQL menyediakan antarmuka baca-saja ke data yang dicerminkan, memastikan bahwa kueri analitik tidak mengganggu operasi transaksional. Arsitektur ini mendukung pemrosesan transaksional dan analitik hibrid (HTAP), sehingga Anda dapat menyatukan beban kerja operasional dan analitik dalam satu platform.

Model semantik untuk logika dan pelaporan bisnis

Model semantik menyediakan lapisan terstruktur dan dikumpulkan yang menentukan logika bisnis, ukuran, hierarki, hubungan, dan metadata di atas data mentah di Microsoft Fabric. Mereka membuat data dapat ditafsirkan dan dapat digunakan kembali di seluruh platform untuk pengalaman analitik.

Model semantik dalam Fabric terintegrasi erat dengan model kapasitas platform dan struktur ruang kerja. Model semantik mendukung tiga mode kueri: Impor, DirectQuery, dan Direct Lake. Setiap mode menawarkan trade-off yang berbeda antara performa, kesegaran, dan skalabilitas:

  • Mode impor menyalin data dari sumber ke dalam model semantik selama refresh terjadwal atau manual. Mode ini menawarkan performa kueri tercepat karena Power BI beroperasi pada data dalam memori, tetapi memperkenalkan latensi antara pembaruan sumber dan visibilitas laporan. Mode impor sangat ideal untuk dasbor berkinerja tinggi di mana data real-time tidak penting.

  • Mode DirectQuery mengirimkan kueri langsung ke sistem sumber saat runtime tanpa menyimpan data dalam model semantik. Pendekatan ini memastikan hasil yang terbaru tetapi dapat menyebabkan kinerja yang lebih lambat tergantung pada responsivitas sistem sumber. DirectQuery cocok untuk skenario di mana kesegaran data lebih penting daripada kecepatan, seperti pelaporan operasional.

  • Mode Direct Lake memungkinkan Power BI untuk mengkueri tabel Delta yang disimpan di OneLake secara langsung. Ini menggabungkan karakteristik kinerja Impor dengan keunggulan penyegaran dari DirectQuery. Ini menghindari duplikasi data dan menggunakan arsitektur lake-native untuk analitik yang dapat diskalakan, yakni hampir real-time. Direct Lake direkomendasikan untuk analitik skala besar pada data yang dikelola Fabric.

Model semantik juga mengaktifkan AI percakapan, pencarian semantik, pelaporan perusahaan, dan penalaran lintas domain dengan menyatukan fitur canggih seperti Fabric Data Agents, Power BI Copilot, Ontologies, dan laporan Power BI. Pengguna bisnis juga dapat mengakses model semantik melalui Excel, di mana mereka dapat menjelajahi data dan wawasan dalam antarmuka PivotTable yang menggunakan data langsung dari model semantik.

Panduan keputusan: Pilih penyimpanan data yang tepat

Microsoft Fabric menyediakan beberapa opsi penyimpanan data, masing-masing dioptimalkan untuk beban kerja tertentu:

  • Lakehouse untuk rekayasa data skala besar dan penyimpanan format terbuka seperti Delta dan Iceberg, dengan dukungan untuk mesin Spark dan SQL.
  • Gudang untuk analitik relasional terstruktur dengan kemampuan SQL berkinerja tinggi dan pelaporan perusahaan.
  • Eventhouse untuk telemetri waktu nyata dan analisis log dengan menggunakan Bahasa Kueri Kusto.
  • Database SQL untuk beban kerja transaksi dan analitik operasional.
  • Cosmos DB untuk aplikasi NoSQL yang didistribusikan secara global, aplikasi multi-model dengan akses latensi rendah.
  • Pintasan OneLake untuk akses tanpa salin ke data di penyimpanan eksternal atau tenant lainnya di Fabric, ketika Anda tidak memerlukan salinan terpisah dan ingin mempertahankan satu versi kebenaran yang sama.

Memilih penyimpanan yang sesuai tergantung pada struktur data, persyaratan latensi, kompleksitas kueri, dan kebutuhan integrasi. Ketika data yang Anda butuhkan sudah ada di lokasi yang dapat diakses, pintasan dapat menghilangkan kebutuhan akan replikasi sepenuhnya. Untuk panduan selengkapnya, lihat Memilih toko yang tepat.