Pobieranie danych do usługi Microsoft Fabric

Usługa Microsoft Fabric oferuje wiele sposobów uwzględnienia danych w środowisku analitycznym. Niezależnie od tego, czy musisz przetwarzać zdarzenia przesyłania strumieniowego w czasie rzeczywistym, replikować operacyjne bazy danych, organizować potoki wsadowe lub uzyskać do nich dostęp bez kopiowania, Fabric oferuje wbudowane funkcje do obsługi każdego scenariusza. Fabric obsługuje także wzorce zarządzania udostępnianiem danych przez OneLake, umożliwiając dostęp między tenantami i przestrzeniami roboczymi do zestawów danych na żywo bez ich duplikacji.

W tym artykule opisano główne opcje pozyskiwania i przenoszenia danych w Fabric. Obejmuje:

  • Pozyskiwanie w czasie rzeczywistym za pomocą Eventstreams i Eventhouse
  • Orkiestracja wsadowa za pomocą potoków Azure Data Factory i zadań kopiowania
  • Replikacja niemal w czasie rzeczywistym przy użyciu Mirroringu
  • Wirtualizacja danych za pomocą skrótów onelake

Ten przegląd umożliwia zrozumienie sposobu działania poszczególnych metod i wybór strategii, która najlepiej pasuje do wymagań dotyczących obciążeń pod kątem opóźnień, transformacji i złożoności operacyjnej.

Pozyskiwanie danych w czasie rzeczywistym

Strumienie wydarzeń i elementy Eventhouse w obciążeniu Real-Time Intelligence obsługują scenariusze przesyłania danych strumieniowo. Strumienie zdarzeń pobierają i przetwarzają zdarzenia w czasie rzeczywistym, a Eventhouses przechowują te zdarzenia i umożliwiają wysyłanie zapytań na dużą skalę. Zazwyczaj używasz Eventstream do przechwytywania i kierowania danych do Eventhouse. Możesz również użyć każdej funkcji niezależnie na podstawie wymagań. Na poniższym diagramie pokazano, jak zestawy danych czasu rzeczywistego przepływają do Eventstream i Eventhouse w Fabric.

Diagram przepływu zestawów danych w czasie rzeczywistym do strumienia zdarzeń lub domu zdarzeń.

Pozyskiwanie i kierowanie zdarzeń za pomocą Eventstream

Eventstream zapewnia doświadczenie bez kodu do pozyskiwania zdarzeń do Fabric, stosowania przekształceń w trakcie strumieniowania oraz kierowania danych do wielu miejsc docelowych. Strumień zdarzeń działa jako potok przetwarzania danych w czasie rzeczywistym. Tworzysz Eventstream i dodajesz co najmniej jeden łącznik źródłowy. Sieć szkieletowa obsługuje wiele źródeł przesyłania strumieniowego, w tym wewnętrzne zdarzenia sieci szkieletowej, takie jak zdarzenia obszaru roboczego sieci szkieletowej, zdarzenia plików OneLake i zdarzenia zadania potoku.

Po rozpoczęciu przepływu zdarzeń można zastosować opcjonalne przekształcenia w czasie rzeczywistym za pomocą edytora przeciągania i upuszczania. Można na przykład filtrować zdarzenia, agregować przedziały czasu obliczeniowego, łączyć wiele strumieni lub przekształcać pola bez konieczności pisania kodu.

Przetworzony strumień można wysłać do co najmniej jednego obsługiwanego miejsca docelowego. Strumienie zdarzeń Apache Kafka mogą uwidaczniać punkty końcowe za pośrednictwem niestandardowych źródeł i miejsc docelowych. Ta funkcja umożliwia producentom Kafka przesyłanie strumieniowe zdarzeń do Fabric i odbiorcom Kafka konsumpcję zdarzeń z Fabric.

Strumienie zdarzeniowe nie przechowują danych na stałe. Przesyłają strumieniowo zdarzenia przez pamięć i przekazują je do skonfigurowanych docelowych lokalizacji. Ta koncepcja sprawia, że strumienie zdarzeń są odpowiednie dla scenariuszy ETL (wyodrębnianie, przekształcanie, ładowanie) w czasie rzeczywistym oraz dystrybucji danych strumieniowych do wielu odbiorców. Na przykład można pozyskiwać dane telemetryczne z czujników Internetu rzeczy (IoT), filtrować i agregować dane w czasie rzeczywistym, wysyłać uściślone strumienie do usługi Eventhouse na potrzeby analizy i kierować zdarzenia anomalii do aktywatora w celu wysyłania alertów.

Importowanie danych bezpośrednio do Eventhouse

Eventhouses mogą pozyskiwać dane bezpośrednio z wielu źródeł. Platforma Fabric obejmuje zintegrowane środowisko pobierania danych w usłudze Eventhouse. Kreator łączy się ze źródłami, takimi jak pliki lokalne, Azure Storage, Amazon S3, Azure Event Hubs i OneLake. Dane można załadować do tabeli bazy danych języka Kusto Query Language (KQL) w czasie rzeczywistym lub w trybie wsadowym przy użyciu interfejsu użytkownika usługi Eventhouse.

Możesz również wybrać istniejący Eventstream na platformie Fabric jako źródło. Jeśli na przykład używasz Eventstream, który pozyskuje dane z IoT Hub lub Kafka, możesz kierować jego dane wyjściowe bezpośrednio do tabeli bazy danych KQL bez dodatkowej konfiguracji.

Pozyskiwanie danych wsadowych

Usługa Data Factory zapewnia podstawowe środowisko dla tradycyjnych potoków ETL (wyodrębnianie, przekształcanie, ładowanie) i ELT (wyodrębnianie, ładowanie, przekształcanie). Zawiera on dużą bibliotekę łączników. Usługa Fabric Data Factory udostępnia listę łączników natywnych dla lokalnych i w chmurze magazynów danych, w tym baz danych, aplikacji SaaS (software as a service) i systemów opartych na plikach. Te łączniki ułatwiają nawiązywanie połączenia z niemal dowolnym systemem źródłowym.

Zarządzanie i koordynowanie przenoszenia danych za pomocą potoków

Potoki korzystające z tych łączników można tworzyć do kopiowania lub przenoszenia danych do magazynów oneLake lub analitycznych. To podejście obsługuje:

  • Zestawy danych bez struktury, takie jak obrazy, wideo i dźwięk
  • Częściowo ustrukturyzowane zestawy danych, takie jak JSON, CSV i XML
  • Zestawy danych ze strukturą z obsługiwanych systemów relacyjnych baz danych

W przepływie łączysz wiele składników orkiestracji, w tym:

Można uruchamiać rurociąg danych na żądanie, zgodnie z harmonogramem lub w odpowiedzi na zdarzenia. Możesz na przykład zaplanować uruchamianie potoku co dwie godziny w dni robocze lub wyzwolić go po utworzeniu nowego pliku w usłudze OneLake.

Upraszczanie przenoszenia danych za pomocą zadania kopiowania

Zadanie kopiowania obsługuje wiele wzorców dostarczania danych, w tym kopiowanie zbiorcze, kopiowanie przyrostowe i replikację przechwytywania zmian danych (CDC). Za pomocą zadania kopiowania można przenosić dane ze źródła do usługi OneLake bez tworzenia potoku, a jednocześnie uzyskiwać dostęp do zaawansowanych opcji konfiguracji. Operacja kopiowania obsługuje wiele źródeł i miejsc docelowych. Zapewnia większą kontrolę niż dublowanie i mniejszą złożoność operacyjną niż zarządzanie potokami korzystającymi z działania Kopiowania.

Replikowanie danych za pomocą funkcji dublowania

Mirroring replikuje dane z systemów zewnętrznych do Fabric prawie w czasie rzeczywistym z automatyczną konfiguracją. Nawiązujesz połączenie z systemem zewnętrznym, takim jak Azure SQL Database, SQL Server, Oracle, SAP lub Snowflake. Fabric stale replikuje dane lub metadane do OneLake. Mirroring obsługuje trzy typy:

  • Dublowanie bazy danych replikuje całe bazy danych i tabele.
  • Dublowanie metadanych synchronizuje metadane, takie jak nazwy katalogów, schematy i tabele, zamiast fizycznie przenosić dane. To podejście wykorzystuje skróty, dzięki czemu dane pozostają w swoim pierwotnym systemie, a jednocześnie są dostępne w Fabric.
  • Otwarte dublowanie używa otwartego formatu tabeli Delta Lake. Deweloperzy mogą zapisywać zmiany aplikacji bezpośrednio w zwierciadlanej bazie danych w OneLake, korzystając z publicznych interfejsów API.

System nasłuchuje zmian w systemie źródłowym (poprzez przechwytywanie zmian danych lub podobne metody) i stosuje te zmiany niemal w czasie rzeczywistym do zduplikowanej kopii. Wynikiem jest dynamiczny zestaw danych z możliwością wykonywania zapytań, który pozostaje zsynchronizowany z małymi opóźnieniami bez złożonych potoków ETL.

Funkcja dublowania obsługuje obecnie różne źródła, w tym azure SQL Database, SQL Managed Instance, Azure Cosmos DB, Azure Database for PostgreSQL, Google BigQuery, Oracle, SAP, Snowflake i SQL Server. Obsługuje również źródła danych z rozwiązań partnerskich, które zaimplementowały interfejs API open mirroring. Dane lustrzane są przechowywane w usłudze OneLake jako aktualne tabele Delta. Sieć szkieletowa automatycznie obsługuje te tabele, dzięki czemu można ich używać do analizy w czasie rzeczywistym lub łączyć je z innymi danymi sieci szkieletowej. Ta funkcja obsługuje hybrydowe scenariusze przetwarzania transakcyjnego i analitycznego, w których dane operacyjne stale przepływają do platformy analitycznej.

Odwzorowywanie eliminuje konieczność ręcznego tworzenia potoków ładowania przyrostowego. Z punktu widzenia kosztu odbicia operacje obliczeniowe utrzymujące bazy danych w synchronizacji nie używają jednostek pojemności (CU) z pojemności Fabryki. Dublowany magazyn danych w usłudze OneLake jest również bezpłatny do limitu terabajtów w jednostce SKU sieci szkieletowej (na przykład F64 obejmuje 64 TB wolnego dublowanego magazynu bazy danych).

Uzyskiwanie dostępu do danych zewnętrznych za pomocą skrótów

Platforma udostępnia skróty umożliwiające wirtualizację danych. Skrót w usłudze OneLake odwołuje się do danych przechowywanych w systemie zewnętrznym, takich jak Azure Data Lake Storage Gen2, Amazon S3 lub SharePoint. Skróty mogą również odwoływać się do danych w obrębie samej usługi OneLake, w tym danych z innych przestrzeni roboczych i danych udostępnianych między klientami za pośrednictwem usługi udostępniania danych OneLake. Zamiast kopiować dane, skróty umożliwiają usłudze OneLake odwołanie się do plików zewnętrznych i wewnętrznych w ramach jednolitego magazynu danych. Możesz wykonywać zapytania lub łączyć dane zewnętrzne z danymi lokalnymi bez przeprowadzania migracji początkowej. Takie podejście do pozyskiwania bez kopiowania jest przydatne, gdy wymagania dotyczące rezydencji danych lub problemy z duplikacją uniemożliwiają przenoszenie danych. Na poniższym diagramie przedstawiono sposób łączenia skrótów z zewnętrznymi systemami przechowywania danych z elementami struktury sieciowej bez kopiowania danych.

Diagram architektury skrótów do zewnętrznej pamięci masowej.

Usługa OneLake może wykryć typ danych, do którego odwołuje się skrót, i zastosować przekształcenia plików lub przekształcenia sztucznej inteligencji bez konieczności używania potoku lub kodu niestandardowego. Te transformacje działają na każdym docelowym skrócie, w tym na danych udostępnianych przez innych dzierżawców za pomocą OneLake. Usługa OneLake automatycznie utrzymuje wynikową tabelę Delta zsynchronizowaną ze źródłem. Możesz na przykład przekonwertować .csv pliki na tabele delty lub zastosować analizę sentymentu opartą na sztucznej inteligencji do .txt plików w folderze.

Po połączeniu z Mirroringiem skróty zapewniają elastyczne wzorce dostępu do danych. Dane można przechowywać przy użyciu skrótów lub replikować dane przy użyciu funkcji dublowania. W obu przypadkach dane są gotowe do analizy w narzędziach Fabric bez złożonego procesu ETL.

Przewodnik po decyzjach: wybieranie strategii przenoszenia danych

Usługa Microsoft Fabric oferuje kilka opcji instalowania danych w sieci szkieletowej, w tym strumieni zdarzeń na potrzeby przetwarzania w czasie rzeczywistym, dublowania, potoków z działaniami kopiowania, zadaniem kopiowania i skrótami. Każda opcja zapewnia inną równowagę między kontrolą, automatyzacją i złożonością operacyjną. Jeśli potrzebujesz bezpośredniego i zarządzanego dostępu do danych, które już znajdują się w OneLake (zarówno w tej samej dzierżawie, jak i udostępnionych przez inną organizację), rozważ połączenie udostępniania danych w OneLake ze skrótami zamiast replikowania danych.

Aby uzyskać wskazówki dotyczące wybierania odpowiedniego podejścia dla danego scenariusza, zobacz Przewodnik po decyzjach usługi Microsoft Fabric: Wybieranie strategii przenoszenia danych.