Kompleksowa analiza z Microsoft Fabric

Microsoft Fabric
Azure Cosmos DB
Analiza w czasie rzeczywistym
Azure Databricks
Azure Event Hubs

Rozwiązanie w tym artykule łączy szereg usług Microsoft do pozyskiwania, przechowywania, przetwarzania, wzbogacania i udostępniania danych i wniosków z różnych źródeł. Źródła te obejmują formaty strukturalne, częściowo ustrukturyzowane, nieustrukturyzowane i przesyłane strumieniowo.

Architecture

Architecture diagram przedstawiający nowoczesną platformę danych korzystającą z Microsoft Fabric.

Na diagramie przedstawiono szczegółową architekturę rozwiązania opartego na Microsoft Fabric. Po lewej stronie architektura zaczyna się od różnych źródeł danych, które obejmują systemy lokalne, Amazon Simple Storage Service (AWS S3), Google Cloud Storage oraz ustrukturyzowane i nieustrukturyzowane dane. Strumienie zdarzeń przetwarzają dane w czasie rzeczywistym, a lokalne bazy danych odzwierciedlają dane na platformach w chmurze, takich jak Azure SQL Database, Azure Databricks i Snowflake. Usługa Lakehouse przechowuje nieprzetworzone i częściowo ustrukturyzowane formaty oraz Fabric Data Warehouse przechowuje analizy ustrukturyzowane, a skróty umożliwiają dostęp między środowiskami w celu zwiększenia elastyczności i integracji. Po prawej stronie notesy, procedury składowane, DataFlow Gen2 w Fabric i potoki w Fabric przetwarzają przechowywane dane. Zaawansowane modele analityczne i uczenia maszynowego wzbogacają dane przed ich udostępnieniem użytkownikom i po nim. Usługa Lakehouse i punkty końcowe SQL Analytics, agenci danych oraz Power BI udostępniają przetworzone dane i wizualizacje, zapewniając wysokiej jakości, realizowalne wnioski. W dolnej części warstwa platformy wspiera całą architekturę z usługami, takimi jak Microsoft Purview do zarządzania, Microsoft Entra ID do zarządzania tożsamościami i Azure Key Vault na potrzeby bezpiecznych sekretów. GitHub i Azure DevOps umożliwiają ciągłą integrację i ciągłe wdrażanie (CI/CD). Azure Policy wymusza zgodność, funkcja monitorowania obszaru roboczego w Fabric zapewnia monitorowanie, a Copilot w Fabric zapewnia programowanie wspomagane przez sztuczną inteligencję.

Amazon Simple Storage Service (AWS S3), Amazon Web Services (AWS), AWS Kinesis, Google Cloud Storage, Google Cloud Pub/Sub i Snowflake są zastrzeżonymi znakami towarowymi lub znakami towarowymi odpowiednich właścicieli. Apache® i Apache Kafka są zastrzeżonymi znakami towarowymi lub znakami towarowymi platformy Apache Software Foundation w Stany Zjednoczone i/lub innych krajach. Nie jest sugerowane poparcie ze strony odpowiednich właścicieli znaków towarowych na skutek używania tych znaków.

Pobierz plik Visio tej architektury.

Przepływ danych

W poniższych sekcjach opisano, jak usługa OneLake służy jako strona główna danych na różnych etapach cyklu życia danych. OneLake to ujednolicony system klasy korporacyjnej data lake wbudowany w Microsoft Fabric, który służy jako scentralizowana warstwa magazynu dla wszystkich obciążeń danych, w tym Fabric inżynierowie danych, Fabric Data Factory, Fabric Data Science, Fabric Data Warehouse, Inteligencja w Czasie Rzeczywistym Fabric, Bazy Danych Fabric i Power BI.

Lakehouse

Korzystaj z usługi Lakehouse , gdy potrzebujesz ujednoliconej, skalowalnej i elastycznej platformy. Idealnie nadaje się do zarządzania danymi ustrukturyzowanymi, częściowo ustrukturyzowanymi i bez struktury w celu obsługi analiz, uczenia maszynowego i raportowania. Organizuj dane za pomocą architektury medalonu i używaj warstw Brązowa (nieprzetworzona), Srebrna (zweryfikowana) i Złota (przygotowana do potrzeb biznesowych) między folderami i plikami, bazami danych i tabelami.

Magazyn

Użyj Data Warehouse, gdy potrzebujesz w pełni zarządzanego, wysokowydajnego rozwiązania do analizy opartej na języku SQL, aby zarządzać danymi ustrukturyzowanymi i częściowo ustrukturyzowanymi, organizując je w bazach danych, schematach i tabelach. Ma pełną obsługę języka T-SQL, w tym tworzenie procedur składowanych, widoków i złączeń.

Eventhouse

Za pomocą magazynu zdarzeń można zarządzać danymi zdarzeń w czasie rzeczywistym i analizować je. Obsługuje ona dane ustrukturyzowane, częściowo ustrukturyzowane i nieustrukturyzowane, takie jak dzienniki i dane telemetryczne, organizując je w bazach danych, schematach i tabelach.

Baza danych SQL w usłudze Fabric

Użyj bazy danych SQL w bazie danych Fabric gdy konieczne jest ujednolicenie obciążeń transakcyjnych i analitycznych. Działa on na tym samym silniku co Azure SQL Database, zapewnia pełną obsługę języka T-SQL i umożliwia integrację z rozszerzonym ekosystemem Fabric.

Bazy danych Azure, zewnętrzne źródła danych i relacyjne bazy danych

W tej sekcji wyjaśniono, jak przenieść dane z baz danych i platform Azure, takich jak Azure Databricks, a także platform innych niż Microsoft, takich jak Snowflake, do Fabric.

Ingest

Fabric zapewnia wiele metod pozyskiwania danych z relacyjnych baz danych. Użyj mirroringu, aby replikować istniejący zasób danych do usługi OneLake niemal w czasie rzeczywistym bez złożonych procesów wyodrębniania, przekształcania i ładowania (ETL). Aby uzyskać więcej informacji, zobacz Obsługiwane źródła danych do mirrorowania.

Potoki usługi Data Factory umożliwiają również pozyskiwanie danych z szerokiej gamy baz danych, zarówno lokalnych, jak i w chmurze. Aby pozyskać dane, można użyć różnych metod, takich jak działanie kopiowania, zadanie kopiowania lub przepływ danych Gen2. Te opcje zapewniają również możliwości orkiestracji, transformacji i planowania. Aby uzyskać więcej informacji, zobacz Obsługiwane łączniki.

W przypadku pozyskiwania danych opartych na języku SQL użyj funkcji języka T-SQL , aby ładować dane na dużą skalę z istniejących magazynów i magazynów typu lakehouse. Możesz utworzyć nowe wersje tabeli, które mają zagregowane dane, odfiltrowane podzestawy lub wyniki z złożonych zapytań.

Store

Funkcja dublowania umożliwia utworzenie repliki źródłowej bazy danych tylko do odczytu i ciągłe synchronizowanie jej z systemem źródłowym za pomocą replikacji niemal w czasie rzeczywistym. Odbicie lustrzane przechowuje dane w formacie Delta Lake w usłudze OneLake.

Możesz również użyć działania kopiowania danych lub zadania kopiowania z potoku Data Factory, aby przygotować dane skopiowane z relacyjnych baz danych do magazynu jeziorowego lub hurtowni danych. Architektura OneLake używa formatu usługi Delta Lake, który zapewnia elastyczność implementacji magazynów typu lakehouse przy użyciu platformy medalionu lub korzystania z modelu magazynu zgodnego z potrzebami organizacji.

Process

Każda dublowana baza danych zawiera automatycznie wygenerowany punkt końcowy SQL na potrzeby wykonywania zapytań. Punkt końcowy analizy SQL tylko do odczytu obsługuje dostęp za pośrednictwem SQL Server Management Studio, Otwarta Łączność z Bazą Danych (ODBC), lub dowolnego narzędzia do wykonywania zapytań za pomocą SQL parametry połączenia lub rozszerzenia MSSQL z Visual Studio Code (VS Code). Uruchom złożone agregacje przy użyciu języka T-SQL lub eksploruj dane przy użyciu notebooków Apache Spark. Zapytania obejmujące wiele baz danych umożliwiają uzyskiwanie dostępu do danych z dublowanych baz danych i łączenie ich z innymi źródłami danych Fabric, takimi jak magazyny typu lakehouse i magazyny. Procedury składowane automatyzują logikę SQL na potrzeby przekształceń danych i agregacji, co zwiększa możliwość ponownego używania i scentralizowanie logiki dla powtarzających się zadań.

Funkcja dublowania tworzy pełną migawkę wybranych tabel z źródłowej bazy danych. Po początkowym załadowaniu Fabric używa przechwytywania zmian w źródłowej bazie danych (CDC) do śledzenia wstawiania, aktualizacji i usuwania. Stale replikuje te zmiany w usłudze OneLake z małym opóźnieniem i niemal synchronizacją w czasie rzeczywistym. Skróty do tabel dublowanych można tworzyć w usłudze Lakehouse i wykonywać zapytania za pośrednictwem notesów platformy Spark.

Przepływ danych Gen2 czyści i kształtuje analizowane dane przy jednoczesnym wykrywaniu niespójności schematu, wartości null lub wartości odstających. Po profilowaniu i przekształcaniu danych zapisz przetworzone dane do tabel Data Warehouse.

Notatniki Spark wzbogacają dane przez załadowanie ich z platformy lakehouse lub magazynów. Trenowanie lub ładowanie modeli uczenia maszynowego przy użyciu bibliotek, takich jak scikit-learn, XGBoost lub SynapseML. Używanie biblioteki MLflow do śledzenia eksperymentów i rejestrowania modeli. Ocenianie danych za pomocą skalowalnych przewidywań wsadowych i przewidywań w czasie rzeczywistym.

Serve

Dublowana baza danych generuje element dublowanej bazy danych SQL i punkt końcowy analizy SQL , którego można użyć do uruchamiania zapytań tylko do odczytu. Wyświetlanie danych za pośrednictwem podglądu danych lub eksplorowanie bezpośrednio w usłudze OneLake. Edytor zapytań SQL umożliwia tworzenie zapytań T-SQL względem danych w elemencie dublowanej bazy danych. Można uzyskać dostęp do zmirrorowanych danych, używając skrótu lakehouse i zapytań Spark do przetwarzania danych.

Zazwyczaj te dane będą dostępne w Power BI. W tym celu utwórz semantyczne modele , aby uprościć analizę danych biznesowych i relacji. Analitycy biznesowi używają raportów i pulpitów nawigacyjnych Power BI do analizowania danych i uzyskiwania informacji biznesowych, korzystając z trybu Direct Lake dla lakehouse lub punktu końcowego SQL dla hurtowni danych. Użyj Data Activator aby skonfigurować alerty dotyczące wizualizacji Power BI do monitorowania często zmieniających się metryk, definiowania warunków alertu i odbierania wiadomości e-mail lub powiadomień Microsoft Teams.

Udostępnianie danych zewnętrznych w Fabric umożliwia użytkownikowi w jednej dzierżawie Fabric (dostawcy) udostępnianie danych użytkownikowi w innej dzierżawie Fabric (odbiorcy). Ta funkcja obsługuje współpracę między organizacjami przy zachowaniu granic ładu i zabezpieczeń. Konsumenci danych uzyskują dostęp do danych tylko do odczytu za pomocą skrótów OneLake we własnych magazynach typu lakehouse i własnych magazynach danych oraz w bazach danych SQL i ich kopii. API Fabric dla języka GraphQL ujawnia dane z obsługiwanych źródeł danych Fabric za pomocą pojedynczego, elastycznego punktu końcowego API. Ta funkcja jest idealna do tworzenia nowoczesnych aplikacji, które wymagają wydajnego, w czasie rzeczywistym dostępu do danych strukturalnych.

Modele uczenia maszynowego obsługują przewidywania w czasie rzeczywistym z dowolnego zarejestrowanego modelu uczenia maszynowego przy użyciu bezpiecznych, skalowalnych punktów końcowych uczenia maszynowego online , które są konfigurowane automatycznie. W przypadku natywnego wdrożenia w czasie rzeczywistym w Fabric, te punkty końcowe są wbudowanymi właściwościami większości modeli Fabric. Można je wywoływać z innych silników Fabric lub aplikacji zewnętrznych w celu szerszego, niezawodnego wykorzystania. Agent danych Fabric umożliwia komunikację opartą na języku naturalnym z danymi z systemu lakehouse lub magazynu danych, tłumacząc zapytania w języku naturalnym na odpowiednie zapytania. Copilot w Fabric przekształca pytania języka naturalnego w język SQL, naprawia błędy, zawiera wyjaśnienia zapytań SQL i pomaga w uzupełnianiu kodu.

Platforma danych oparta na chmurze dla usługi Dataverse

W tej sekcji wyjaśniono, jak przenieść dane z usługi Dataverse do Fabric.

Ingest

Dataverse Link do Fabric udostępnia dane Dynamics 365 i Dataverse niemal w czasie rzeczywistym w Fabric bez konieczności kopiowania danych ani stosowania ETL. Usługa Dataverse Link do Fabric umożliwia inżynierom danych wykonywanie zapytań dotyczących danych przy użyciu języka SQL, stosowanie sztucznej inteligencji, łączenie zestawów danych, przekształcanie informacji i tworzenie podsumowań bezpośrednio w Fabric.

Store

Gdy używasz Dataverse Link to Fabric, usługa Dataverse tworzy lakehouse w OneLake, który ma skróty do tabel Dataverse, bez konieczności fizycznego przenoszenia danych.

Process

Wyświetl usługę Lakehouse wygenerowaną przez usługę Dataverse , aby eksplorować tabele połączone ze środowiskiem usługi Dataverse. Wykonaj zapytanie względem usługi Lakehouse wygenerowanej przez usługę Dataverse przy użyciu punktu końcowego SQL eksploruj dane przy użyciu notesów Spark i uzyskaj dostęp do danych za pośrednictwem SQL Server Management Studio lub edytora SQL. Odnosić się do danych usługi Dataverse w innych magazynach typu lakehouse, używając skrótów w celu ponownego wykorzystania tych samych danych bez ich kopiowania lub duplikowania.

Wzbogacanie danych przy użyciu narzędzia Data Wrangler, narzędzia o niskim kodzie i braku kodu w notesach Fabric. Umożliwia ona eksplorowanie, przygotowywanie i kształtowanie danych na potrzeby eksploracyjnej analizy. Operacje generują kod w bibliotece pandas lub PySpark i można zapisać kod w notebooku jako funkcję wielokrotnego użytku.

Serve

Skróty do tabel Dataverse utworzonych w usłudze OneLake obsługują format usługi Delta Lake. Te dane można wypełnić w raporcie Power BI z domyślnego zestawu danych generowanego przez usługę Dataverse w obszarze roboczym Fabric.

Możesz również użyć Aktywatora Danych do konfigurowania alertów dotyczących wizualizacji Power BI, monitorowania często zmieniających się metryk, definiowania warunków alertów i otrzymywania powiadomień e-mail lub Teams.

Źródła danych z częściową strukturą i nieustrukturyzowane

W tej sekcji opisano sposób pozyskiwania częściowo ustrukturyzowanych i nieustrukturyzowanych danych do Fabric.

Ingest

Potoki usługi Data Factory umożliwiają pobieranie danych z szerokiego zakresu półstrukturalnych źródeł dostępnych lokalnie i w chmurze. Aby ściągnąć dane, możesz użyć różnych metod, takich jak działanie kopiowania, zadanie kopiowania, Dataflow Gen2, Notesy Spark lub przesyłanie plików do lakehouse. Rozważ następujące obsługiwane źródła:

  • Wczytywane dane ze źródeł plikowych zawierające pliki CSV lub JSON

  • Pliki XML ze starszych systemów

  • Pliki Parquet z kont pamięci masowej

  • PDF, MP3, obrazy, dzienniki, dokumenty i inne pliki binarne

  • Fabric interfejsy REST API jako źródło danych dla potoku

Użyj instrukcji COPY INTO , aby pozyskiwać dane z zewnętrznego konta magazynu na potrzeby obciążeń SQL o wysokiej przepływności. Deklaracja obsługuje formaty plików Parquet i CSV. Utwórz skróty w usłudze OneLake do źródeł zewnętrznych, w tym Azure Data Lake Storage, kont magazynu usługi Amazon Simple Storage Service (AWS S3), kont usługi Google Cloud Storage i innych obsługiwanych opcji magazynu zewnętrznego w celu umożliwienia dostępu bez kopiowania i unikania duplikacji. Programowe lub ręczne przekazywanie plików do folderu lakehouse. Uruchamiaj potoki Trigger gdy nadejdą nowe pliki przy wykorzystaniu orkiestracji zdarzeń w Fabric.

Store

Zorganizuj swoje dane w ujednoliconym jeziorze danych Fabric OneLake. Postępuj zgodnie z najlepszymi rozwiązaniami dotyczącymi tworzenia warstw, struktur folderów, które mają być używane w każdej warstwie i które formaty plików mają być używane w każdym scenariuszu analizy. Przechowuj dane bez struktury w strefie Brązowe, aby zachować nieprzetworzone dane w oryginalnym formacie. Użyj systemu przechowywania zdarzeń do składowania danych telemetrycznych, dzienników lub szeregów czasowych.

Process

Notatniki platformy Spark analizują i przekształcają dane półstrukturalne. Na przykład można spłaszczać zagnieżdżone struktury JSON, konwertować kod XML na format tabelaryczny lub wyodrębniać pola kluczy z plików dziennika. Notesy platformy Spark wyodrębniają również zawartość i przekształcają dane bez struktury za pomocą ramek danych platformy Spark.

Pozyskiwanie T-SQL ładuje dane z istniejących tabel w Fabric magazynach lub magazynach. Dataflow Gen2 czyści i kształtuje parsowane dane, gdy wykrywa niespójności schematu, puste wartości lub wartości odstające. Po profilowaniu i przekształcaniu danych zapisz je w tabelach lakehouse. Skróty wewnętrzne w referencyjnych danych Fabric, przechowywanych w magazynie danych typu lakehouse.

Notatniki Spark wzbogacają dane podczas ich przetwarzania. Załaduj dane z magazynów lub magazynów typu lakehouse, a następnie wytrenuj lub załaduj modele uczenia maszynowego przy użyciu bibliotek, takich jak scikit-learn, XGBoost lub SynapseML. Platforma MLflow śledzi eksperymenty i rejestruje modele. Ocenianie danych przy użyciu skalowalnych przewidywań wsadowych lub przewidywań w czasie rzeczywistym.

Serve

Język T-SQL wysyła zapytania do tabel lakehouse za pośrednictwem punktu końcowego analizy SQL Fabric. Punkt końcowy analizy SQL obsługuje modele semantyczne i raporty Power BI. Tryb Direct Lake zapewnia analizę o wysokiej wydajności. Możesz również skonfigurować alerty dotyczące wizualizacji Power BI przy użyciu funkcji Data Activator, aby monitorować często zmieniające się metryki, definiować warunki alertów i otrzymywać powiadomienia e-mail lub Teams.

Udostępnianie danych zewnętrznych w Fabric umożliwia użytkownikowi w jednej dzierżawie Fabric (dostawcy) udostępnianie danych użytkownikowi w innej dzierżawie Fabric (użytkownik). Ta funkcja obsługuje współpracę między organizacjami, zachowując ład i granice zabezpieczeń. Użytkownicy danych mają dostęp do danych tylko do odczytu przy użyciu skrótów OneLake we własnych lakehouse'ach.

Interfejs API Fabric dla języka GraphQL uwidacznia dane z obsługiwanych źródeł danych Fabric za pośrednictwem pojedynczego, elastycznego punktu końcowego interfejsu API. Takie podejście jest idealne do tworzenia nowoczesnych aplikacji, które wymagają wydajnego, w czasie rzeczywistym dostępu do danych ustrukturyzowanych.

Obsługa przewidywań w czasie rzeczywistym z dowolnego zarejestrowanego modelu uczenia maszynowego przy użyciu bezpiecznych, skalowalnych punktów końcowych uczenia maszynowego w trybie online, które są automatycznie konfigurowane. W przypadku wdrożenia natywnego dla Fabric w czasie rzeczywistym użyj tych punktów końcowych jako wbudowanych właściwości większości modeli Fabric. Wywoływanie ich z innych aparatów Fabric lub aplikacji zewnętrznych w celu zapewnienia niezawodnego, szerokiego użycia. Utwórz model semantyczny na podstawie danych przewidywania i wizualizuj wyniki w raporcie Power BI.

Agent danych Fabric to konfigurowalny interfejs konwersacyjny oparty na sztucznej inteligencji, który tłumaczy zapytania języka naturalnego na praktyczne szczegółowe informacje dotyczące danych usługi OneLake. Copilot upraszcza zadania analizy danych i wizualizacji. Zadaj pytania dotyczące tabel typu lakehouse, biblioteki pandas i ramek danych platformy Spark bezpośrednio w notesach. Copilot odpowiada za pomocą wyjaśnień języka naturalnego. Użytkownicy biznesowi mogą za pomocą okienka Copilot zadawać pytania dotyczące zawartości raportu i szybko podsumowywać kluczowe szczegółowe informacje. Mogą również użyć sekcji Copilot, aby odnaleźć informacje, do których już mają dostęp.

Streaming

W tej sekcji opisano, jak wprowadzać strumieniowo dane szeregów czasowych o dużej skali do Fabric.

Ingest

Użyj Real-Time Intelligence do pozyskiwania danych w czasie rzeczywistym za pośrednictwem strumienia zdarzeń. Pobierz dane z szerokiej gamy źródeł danych, takich jak Internet rzeczy (IoT), aplikacje, zewnętrzne centra zdarzeń i zdarzenia Fabric, takie jak zdarzenia elementów roboczych, zdarzenia OneLake i zdarzenia zadań. Jeśli musisz odwołać się do źródłowej bazy danych języka zapytań Kusto (KQL), takiej jak istniejąca baza danych Azure Data Explorer w Real-Time Intelligence, możesz utworzyć skrót bazy danych aby uzyskać dostęp do danych bez duplikowania lub ponownego pozyskiwania.

Store

Eventstream obsługuje trasowanie danych do różnych celów. Przechowuj duże ilości danych w magazynie zdarzeń, który jest rozwiązaniem magazynu o wysokiej wydajności, zoptymalizowanym i skalowalnym. Bazę danych KQL można utworzyć w eventhouse, który jest wyspecjalizowaną bazą danych zaprojektowaną do analizy danych opartych na zdarzeniach z użyciem języka KQL.

Process

Użyj zestawu zapytań KQL , aby zapisywać, uruchamiać zapytania KQL i zarządzać nimi w różnych źródłach danych w czasie rzeczywistym. Zestaw zapytań KQL to centralne narzędzie w kontekście analizy w czasie rzeczywistym. Umożliwia użytkownikom eksplorowanie, analizowanie i wizualizowanie danych przesyłania strumieniowego lub szeregów czasowych. Do wykonywania zapytań dotyczących danych przesyłanych strumieniowo przechowywanych w bazach danych KQL można użyć języka T-SQL w Real-Time Intelligence . Język KQL to język podstawowy do analizy w czasie rzeczywistym, ale Fabric obsługuje również język T-SQL dla użytkowników zaznajomionych z analizą opartą na języku SQL.

W przypadku przetwarzania między aparatami włącz dostępność usługi OneLake, aby utworzyć logiczną kopię danych bazy KQL. Możesz wykonywać zapytania dotyczące danych w formacie Delta Lake z innych silników Fabric, takich jak tryb Direct Lake w Power BI, magazyny danych, lakehouses i notesy.

Serve

Analitycy biznesowi mogą utworzyć pulpit nawigacyjny analizy Real-Time, który jest kolekcją kafelków opartych na zapytaniach KQL. Kafelki można organizować na stronach i łączyć je ze źródłami danych. Pulpit nawigacyjny zostanie automatycznie zaktualizowany, co zapewnia niemal natychmiastowy wgląd w dane w miarę przepływu przez system. Możesz również dodać Data Activator do kafelka pulpitu nawigacyjnego, aby monitorować często zmieniające się metryki. Możesz definiować warunki alertów i otrzymywać powiadomienia e-mail lub Teams. Utwórz raport Power BI w celu wygenerowania raportów na podstawie modeli semantycznych utworzonych na podstawie bazy danych KQL jako źródła.

Zewnętrzne udostępnianie danych w Fabric pozwala użytkownikowi w jednej dzierżawie Fabric (dostawcy) na udostępnianie danych odbiorcy w innej dzierżawie Fabric (odbiorcy). Obsługuje on współpracę między organizacjami przy zachowaniu granic ładu i zabezpieczeń. Użytkownicy danych uzyskują dostęp do danych tylko do odczytu za pomocą skrótów OneLake we własnych bazach danych KQL.

Agent danych Fabric może współpracować z bazami danych KQL, aby umożliwić użytkownikom zadawanie pytań, co ułatwia korzystanie z danych w czasie rzeczywistym dla użytkowników nietechnicznych. Copilot może przetłumaczać zapytania języka naturalnego na KQL, które można uruchomić.

Components

Ta architektura korzysta z następujących usług Fabric i Azure:

  • Copilot w Fabric jest asystentem AI generatywnej zintegrowanym z platformą Fabric. W tej architekturze ułatwia tworzenie skalowalnych potoków danych, tworzenie kodu Platformy Spark na potrzeby przekształceń danych, generowanie zoptymalizowanego kodu SQL na potrzeby Data Warehouse, pisanie zapytań KQL na potrzeby Real-Time Intelligence oraz tworzenie modeli semantycznych i miar języka DAX (Data Analysis Expressions) na potrzeby raportowania.

  • Agent danych Fabric to funkcja oparta na sztucznej inteligencji, która ułatwia użytkownikom interakcję z danymi organizacji przy użyciu języka naturalnego. W tej architekturze agenci danych służą jako interfejs konwersacyjny do tłumaczenia pytań w języku naturalnym na zapytania ustrukturyzowane, takie jak SQL, DAX lub KQL.

  • Microsoft Purview to ujednolicona platforma do zapewniania ładu, zabezpieczeń i zgodności danych. W tej architekturze Microsoft Purview zarządza całym zasobem danych i ich pochodzeniem od źródła danych do raportu Power BI.

  • Zewnętrzne udostępnianie danych w Fabric to funkcja, która umożliwia bezpieczną współpracę między dzierżawcami, pozwalając użytkownikom udostępniać dane ze swojego środowiska Fabric użytkownikom w innym środowisku Fabric. W tej architekturze organizacje mogą współpracować w granicach dzierżaw bez duplikowania danych.

  • Interfejs API Fabric dla języka GraphQL to funkcja umożliwiająca deweloperom uwidacznianie danych i interakcję z nimi przy użyciu języka zapytań GraphQL. W tej architekturze umożliwia użytkownikom tworzenie aplikacji danych.

  • Real-Time Intelligence to oparte na zdarzeniach rozwiązanie analityczne przeznaczone do przetwarzania, analizowania i wykonywania działań na danych przesyłanych strumieniowo. W tej architekturze przetwarza ona duże ilości danych przesyłanych strumieniowo i udostępnia pulpity nawigacyjne w czasie rzeczywistym złożone z kafelków, które wizualizują bazowe zapytania.

  • Power BI to platforma analizy biznesowej i wizualizacji danych. W tej architekturze łączy się z usługą OneLake w celu tworzenia pulpitów nawigacyjnych i raportów.

  • Microsoft Foundry to ujednolicona platforma jako usługa (PaaS) do tworzenia, wdrażania i zarządzania aplikacjami i agentami sztucznej inteligencji w skali przedsiębiorstwa. W tej architekturze agenci usługi Foundry wzbogacają i włączają wiele systemów agentów, a agenci danych Fabric służą jako eksperci w dziedzinie wraz z innymi agentami.

  • Azure Machine Learning to usługa w chmurze klasy korporacyjnej do zarządzania całym cyklem życia uczenia maszynowego, od przygotowywania i eksperymentowania danych do trenowania, wdrażania i monitorowania modeli. W tej architekturze można umożliwić użytkownikom uruchamianie modeli uczenia maszynowego przy użyciu punktów końcowych wsadowych. Skróty OneLake pozwalają usługom Machine Learning i Fabric współdzielić to samo podstawowe wystąpienie Data Lake Storage, dzięki czemu obie usługi mogą odczytywać i zapisywać dane bez ich powielania.

  • Microsoft Cost Management to usługa, która ułatwia śledzenie, analizowanie i optymalizowanie faktur zasobów Microsoft Azure. W tej architekturze analiza kosztów i faktura w usłudze Cost Management wyświetlają wiele mierników powiązanych z zasobem pojemności „Fabric”.

  • Azure Key Vault to oparta na chmurze usługa do bezpiecznego przechowywania poufnych informacji, takich jak wpisy tajne, klucze i certyfikaty, oraz zarządzanie nimi. W tej architekturze zarządza poświadczeniami używanymi w połączeniach do Fabric i bramach.

  • Azure Policy to narzędzie do zapewniania ładu, które wymusza reguły ładu między zasobami Azure. W tej architekturze zapewnia ona zgodność, nadzór nad danymi i kontrolę kosztów na platformie danych Fabric.

  • Microsoft Entra ID to oparte na chmurze rozwiązanie do zarządzania tożsamościami i dostępem, które zapewnia bezpieczny dostęp dla użytkowników, urządzeń i obciążeń. W tej architekturze umożliwia użytkownikom logowanie się do Fabric przy użyciu poświadczeń Microsoft Entra przy jednoczesnym wymuszaniu kontroli dostępu Zero Trust.

  • Azure DevOps to pakiet narzędzi programistycznych i usług, które Microsoft zapewnia obsługę całego cyklu życia tworzenia oprogramowania. W tej architekturze Azure DevOps integruje się z obszarami roboczymi Fabric w celu zarządzania cyklem życia i zapewniania kontroli źródła.

  • GitHub to oparta na chmurze platforma do kontroli wersji i współpracy, która umożliwia deweloperom przechowywanie i śledzenie zmian w kodzie oraz zarządzanie nimi. W tej architekturze GitHub integruje się z obszarami roboczymi Fabric w celu obsługi zarządzania cyklem życia i kontroli źródła.

  • Funkcja monitorowania obszaru roboczego w programie Fabric umożliwia zbieranie, analizowanie, wizualizowanie dzienników i metryk z elementów Fabric w obszarze roboczym. Ta architektura ułatwia diagnozowanie zapytań w środowisku Fabric, identyfikowanie problemów, tworzenie dostosowanych pulpitów nawigacyjnych monitorowania i ustawianie alertów.

Alternatives

Fabric udostępnia zestaw narzędzi do wydajnego zarządzania obciążeniami danych i analiz. Dzięki tak wielu dostępnym opcjom wybranie odpowiedniego narzędzia może być trudne. Te przewodniki po decyzjach zawierają plan, który pomoże Ocenić wybory i określić najbardziej efektywną strategię.

Szczegóły scenariusza

W tym przykładowym scenariuszu pokazano, jak Fabric ułatwia przedsiębiorstwom tworzenie ujednoliconej, nowoczesnej platformy danych, która upraszcza integrację, przyspiesza szczegółowe informacje i zmniejsza złożoność operacyjną. Pomaga to organizacjom przezwyciężyć typowe wyzwania związane z danymi, jednocześnie zwiększając skalowalność, ład i efektywność kosztową.

Potencjalne przypadki użycia

  • Modernizowanie platformy danych przedsiębiorstwa przez zastąpienie pofragmentowanych narzędzi ujednoliconym rozwiązaniem.

  • Ustanów architekturę typu medallion lake przy użyciu Fabric lakehouses, z warstwą Brązową do pozyskiwania danych pierwotnych, warstwą Srebrną do czyszczenia i przekształcania danych oraz warstwą Złotą dla danych gotowych do analizy biznesowej, wykorzystywane w analizie i sztucznej inteligencji. Twórz magazyny jako rozwiązania specyficzne dla dziedziny lub domeny, zaprojektowane dla tematów wymagających dostosowanej analizy.

  • Integrowanie relacyjnych źródeł danych z nieustrukturyzowanymi zbiorami danych przy użyciu silników obliczeniowych Fabric.

  • Dostarczaj analizę operacyjną w czasie rzeczywistym, aby monitorować i podejmować działania na danych przesyłanych strumieniowo za pomocą technologii Real-time Intelligence.

  • Generowanie szczegółowych informacji o klientach opartych na sztucznej inteligencji w celu wzbogacania danych i napędzania wartości biznesowych.

  • Zapewnienie raportowania dla przedsiębiorstw i samoobsługowej analizy danych biznesowych za pomocą modelowania semantycznego i zaawansowanych narzędzi wizualizacji.

  • Włącz udostępnianie danych między dzierżawami za pomocą skrótów OneLake i usługi zewnętrznego udostępniania danych.

  • Integrowanie agentów danych Fabric z Microsoft Foundry lub Microsoft Copilot Studio w celu tworzenia inteligentnych, konwersacyjnych i kontekstowych rozwiązań sztucznej inteligencji dla użytkowników i aplikacji biznesowych.

Recommendations

Rozważmy następujące zalecenia.

Odkrywaj i zarządzaj

Nadzór nad danymi jest częstym wyzwaniem w dużych środowiskach przedsiębiorstwa. Analitycy biznesowi muszą odnajdywać i rozumieć zasoby danych w celu rozwiązywania problemów biznesowych, podczas gdy dyrektorzy danych szukają szczegółowych informacji na temat prywatności i bezpieczeństwa danych biznesowych.

Microsoft Purview

Microsoft Purview zarządzanie danymi składa się z dwóch rozwiązań. Ujednolicony wykaz i mapa danych zapewniają nowoczesne środowisko zapewniania ładu, konsolidując metadane z różnych katalogów i źródeł. Ta integracja umożliwia widoczność, zwiększa pewność danych i wspiera odpowiedzialne innowacje w całym przedsiębiorstwie.

Zachowaj terminy słownika z konkretną terminologią biznesową, którą użytkownicy potrzebują do zrozumienia semantyki i wykorzystania zestawów danych w całej organizacji. Rejestruj źródła danych i organizuj je w kolekcje, które również służą jako granice zabezpieczeń metadanych. Skonfiguruj regularne skanowania , aby automatycznie katalogować i aktualizować odpowiednie metadane dotyczące zasobów danych organizacji. Po skanowaniu dzierżawy Fabric metadane i pochodzenie z zasobów Fabric, w tym Power BI, są automatycznie wprowadzane do ujednoliconego wykazu danych Microsoft Purview. Automatyczne przypisywanie etykiet klasyfikacji danych i poufności danych do zasobów danych na podstawie wstępnie skonfigurowanych lub niestandardowych reguł podczas skanowania.

Zarządzanie kondycją ujednoliconego wykazu umożliwia monitorowanie ogólnej kondycji środowiska danych i ochronę organizacji przed zagrożeniami bezpieczeństwa i prywatnością. Wbudowany katalog OneLake w ramach platformy Fabric udostępnia informacje o zasobach danych, etykietach poufności i promowaniu. Służy jako brama do łączenia się z szerszymi możliwościami Microsoft Purview.

Usługi platformy

Fabric obsługuje kilka wzorców wdrażania które pomagają organizacjom dostosować architekturę danych do potrzeb biznesowych, modeli ładu i wymagań dotyczących wydajności. Te wzorce są definiowane na poziomie dzierżawy, pojemności, obszaru roboczego i elementów wdrożenia. Każdy wzorzec zapewnia różne kompromisy w skalowalności, izolacji, kosztach i złożoności operacyjnej.

Projekt obejmuje kilka podstawowych usług Azure. Microsoft Entra ID zapewnia usługi tożsamości, jednokrotne logowanie (SSO) i uwierzytelnianie wieloskładnikowe w obciążeniach Azure. Usługa Cost Management zapewnia nadzór finansowy dla obciążeń Azure. Key Vault bezpiecznie zarządza poświadczeniami i certyfikatami. Podczas konfigurowania key vault w Fabric można pobrać poświadczenia i certyfikaty z usługi Key Vault. Te poświadczenia służą do uzyskiwania dostępu do magazynów danych, które nie obsługują zintegrowanego uwierzytelniania, takiego jak lokalne lub zewnętrzne źródła.

Użyj usługi Azure Network Security Perimeter (NSP), aby zmniejszyć narażenie publicznego punktu końcowego na ogólnie dostępne zasoby PaaS w tej architekturze, takie jak Azure Event Hubs, Azure Key Vault i konta Azure Storage. W przypadku dostępu przychodzącego preferuj reguły oparte na subskrypcji dla producentów hostowanych Azure i użytkowników, gdy wychodzące adresy IP nie są stabilne w usługach. Używaj reguł opartych na adresach IP tylko dla źródeł, które mają stabilne, znane zakresy adresów IP ruchu wychodzącego.

Azure Monitor zbiera, analizuje i działa na telemetrii z zasobów Azure, aby aktywnie identyfikować problemy i maksymalizować wydajność i niezawodność. Azure DevOps i GitHub Enterprise implementują operacje programowania (DevOps) w celu wymuszania automatyzacji i zgodności w potokach tworzenia i wdrażania obciążeń Fabric. Takie podejście umożliwia kontrolę wersji, współpracę i zarządzanie cyklem życia. Azure Policy wymusza standardy organizacyjne i ład w celu zapewnienia spójności zasobów, zgodności z przepisami, zabezpieczeń, kontroli kosztów i zarządzania.

Considerations

Te zagadnienia implementują filary struktury Azure Well-Architected, która jest zestawem wytycznych, których można użyć do poprawy jakości obciążenia. Aby uzyskać więcej informacji, zobacz Well-Architected Framework.

Optymalizacja kosztów

Optymalizacja kosztów koncentruje się na sposobach zmniejszenia niepotrzebnych wydatków i poprawy wydajności operacyjnej. Aby uzyskać więcej informacji, zobacz Lista kontrolna przeglądu projektu dotycząca optymalizacji kosztów.

Aby oszacować koszty, użyj tego prekonfigurowanego oszacowania w kalkulatorze cen Azure. Dostosuj wartości, aby zobaczyć, jak zmieniają się koszty na podstawie określonych wymagań. Idealna warstwa cenowa i całkowity koszt każdej usługi w architekturze zależą od ilości przetwarzanych i przechowywanych danych oraz oczekiwanego poziomu wydajności.

Note

Szacowanie cen nie obejmuje Azure DevOps, GitHub Enterprise ani Copilot w Fabric, ponieważ te usługi mają oddzielne licencjonowanie. Podstawowa Azure Policy ocena jest bezpłatna, ale niektóre możliwości, takie jak oceny zgodności z przepisami, mogą powodować naliczanie opłat.

Skorzystaj z następującego przewodnika, aby zapoznać się z najlepszymi strategiami optymalizacji kosztów dla Fabric:

  • Fabric pojemność to udostępniona pula, która zasila wszystkie możliwości Fabric, od inżynierii danych i magazynowania danych po modelowanie danych, analizę biznesową i zastosowania sztucznej inteligencji. Microsoft ceni jednostki pojemności (CU) za godzinę, oferując opcje płatności za rzeczywiste zużycie lub rezerwacje. Płać za zużycie zapewnia elastyczność płacenia tylko za godziny, w których korzystasz z pojemności Fabric. Można wstrzymać wydajność, gdy nie jest używana, aby kontrolować koszty, bez konieczności miesięcznego lub rocznego zobowiązania. Rezerwacje zapewniają przewidywalne rozliczenia oraz zwykle umożliwiają oszczędności dla stabilnych obciążeń. Magazyn OneLake umożliwia przetrzymywanie jednej kopii danych dla wszystkich silników analitycznych, bez konieczności przenoszenia lub duplikowania danych.

  • Narzędzie do szacowania wydajności Fabric pomaga oszacować potrzeby pojemności i określić odpowiednie wymagania dotyczące jednostki SKU i magazynu na podstawie właściwości obciążenia. Monitoruj użycie i zużycie przy użyciu aplikacji Fabric Capacity Metrics aby pokazać wykorzystanie pojemności. Usługa Cost Management śledzi użycie i ustawia alerty budżetowe. Aby uzyskać więcej informacji, zobacz Zrozum swoje rachunki Azure dla pojemności Fabric. Przewodniki rozwiązywania problemów z pojemnością Fabric zapewniają zasoby do monitorowania i proaktywnego optymalizowania użycia pojemności.

  • Aplikacja Fabric Chargeback (wersja zapoznawcza) ułatwia organizacjom śledzenie, analizowanie i przydzielanie kosztów użycia pojemności w jednostkach biznesowych, użytkownikach i obciążeniach korzystających z Fabric. Obsługuje modele chargeback i showback, umożliwiając przejrzysty i sprawiedliwy rozkład kosztów na podstawie rzeczywistego zużycia. Microsoft Purview0 cennik zależy od liczby zasobów danych w katalogu i mocy obliczeniowej wymaganej do ich skanowania.

Doskonałość operacyjna

Doskonałość operacyjna obejmuje procesy operacyjne, które wdrażają aplikację i działają w środowisku produkcyjnym. Aby uzyskać więcej informacji, zobacz Lista kontrolna przeglądu projektu dotycząca doskonałości operacyjnej.

  • Zastosuj spójną metodologię zarządzania infrastrukturą jako kodem (IaC) do aprowizowania pojemności Fabric, korzystając z Bicep, szablonów Azure Resource Manager (szablonów ARM) i Terraform. Integracja obszarów roboczych Fabric z Git do zarządzania cyklem życia aplikacji Fabric oraz używania potoków wdrażania do ciągłej integracji i ciągłego wdrażania (CI/CD).

  • Użyj centrum monitorowania aby monitorować działania Fabric. Obszar roboczy monitorowania admin udostępnia dedykowany obszar roboczy dla administratorów Fabric do nadzorowania operacji dzierżawy i zarządzania nimi. Udostępnia wbudowane raporty na potrzeby przeglądu działań, szczegółów działań i ładu, co umożliwia administratorom efektywne monitorowanie obciążeń i użycia. Wysyłanie wiadomości Teams w czatach grupowych lub kanałach w celu powiadamiania o statusie potoku. W przypadku powiadomień e-mail użyj działania Microsoft 365 Outlook.

  • Stosowanie zasad zarządzania za pośrednictwem Microsoft Purview. Zaplanuj regularne przeglądy Well-Architected i sprinty optymalizacyjne. Aby uzyskać więcej informacji na temat nowych funkcji w Fabric i kiedy ich oczekiwać, zobacz plan Fabric. Zaimplementuj podobną architekturę w środowiskach przedprodukcyjnych, w których tworzysz i testujesz platformę. Rozważ konkretne wymagania platformy i możliwości każdej usługi, aby utworzyć ekonomiczne środowisko przedprodukcyjne.

Contributors

Microsoft aktualizuje ten artykuł. Następujący współautorzy napisali ten artykuł.

Główni autorzy:

Aby wyświetlić profile LinkedIn niepublikacyjnych, zaloguj się do LinkedIn.

Dalsze kroki