Wprowadzenie do usługi Azure Data Lake Storage

Usługa Azure Data Lake Storage to zestaw funkcji przeznaczonych do analizy danych big data opartych na usłudze Azure Blob Storage. W tym artykule przedstawiono kluczowe funkcje, obsługiwane integracje i architekturę Azure Data Lake Storage, które ułatwiają ocenę obciążeń analitycznych.

Azure Data Lake Storage opiera się na możliwościach zapoczątkowanych przez Azure Data Lake Storage Gen1, łącząc je z usługą Azure Blob Storage. Na przykład usługa Data Lake Storage zapewnia semantykę systemu plików, zabezpieczenia na poziomie plików i zdolność do skalowania. Ponieważ te możliwości są oparte na Blob Storage, można również uzyskać tanie, warstwowe magazyny z wysoką dostępnością i możliwościami odzyskiwania po awarii.

Usługa Data Lake Storage sprawia, że usługa Azure Storage stanowi podstawę do tworzenia magazynów danych przedsiębiorstwa na platformie Azure. Zaprojektowano od początku do obsługi wielu petabajtów informacji przy jednoczesnym utrzymaniu setek gigabitów przepływności, usługa Data Lake Storage umożliwia łatwe zarządzanie ogromnymi ilościami danych.

Co to jest magazyn typu „data lake”?

Usługa Data Lake to pojedyncze, scentralizowane repozytorium, w którym można przechowywać wszystkie dane, zarówno ustrukturyzowane, jak i bez struktury. Usługa Data Lake umożliwia organizacji szybkie i łatwiejsze przechowywanie, uzyskiwanie dostępu i analizowanie szerokiej gamy danych w jednej lokalizacji. Jezioro danych pozwala na gromadzenie danych bez konieczności ich dostosowywania do istniejącej struktury. Zamiast tego dane można przechowywać w formacie nieprzetworzonym lub natywnym, zwykle jako pliki lub jako obiekty binarne (obiekty blob).

Usługa Azure Data Lake Storage to oparte na chmurze rozwiązanie typu data lake przedsiębiorstwa. Jest ona zaprojektowana do przechowywania ogromnych ilości danych w dowolnym formacie i ułatwiania obciążeń analitycznych danych big data. Służy do przechwytywania danych dowolnego typu i szybkości pozyskiwania w jednej lokalizacji w celu łatwego dostępu i analizy przy użyciu różnych struktur.

Możliwości usługi Azure Data Lake Storage

Usługa Azure Data Lake Storage nie jest dedykowaną usługą ani typem konta. Zamiast tego jest implementowany jako zestaw funkcji używanych z usługą Blob Storage konta usługi Azure Storage. Odblokuj te możliwości, włączając ustawienie hierarchicznej przestrzeni nazw.

Usługa Data Lake Storage oferuje następujące możliwości.

  • Dostęp zgodny z usługą Hadoop

  • Hierarchiczna struktura katalogów

  • Zoptymalizowany koszt i wydajność

  • Model bezpieczeństwa z drobniejszym poziomem szczegółowości

  • Ogromna skalowalność

Dostęp zgodny z usługą Hadoop

Usługa Azure Data Lake Storage jest przeznaczona głównie do pracy z usługą Hadoop i wszystkimi strukturami korzystającymi z rozproszonego systemu plików Apache Hadoop (HDFS) jako warstwy dostępu do danych. Dystrybucje Hadoop obejmują sterownik ABFS, który umożliwia wielu aplikacjom i frameworkom bezpośredni dostęp do danych Azure Blob Storage. Sterownik ABFS jest zoptymalizowany specjalnie pod kątem analizy danych big data. Odpowiednie interfejsy API REST są dostępne za pośrednictwem punktu końcowego dfs.core.windows.net.

Struktury analizy danych korzystające z systemu plików HDFS jako warstwy dostępu do danych mogą uzyskiwać bezpośredni dostęp do danych usługi Azure Data Lake Storage za pośrednictwem systemu ABFS. Aparat analizy platformy Apache Spark i aparat zapytań Presto SQL to przykłady takich struktur.

Aby uzyskać więcej informacji na temat obsługiwanych usług i platform, zobacz Usługi platformy Azure obsługujące usługę Azure Data Lake Storage i platformy typu open source obsługujące usługę Azure Data Lake Storage.

Hierarchiczna struktura katalogów

Hierarchiczna przestrzeń nazw to kluczowa funkcja, która umożliwia usłudze Azure Data Lake Storage zapewnienie wysokiej wydajności dostępu do danych w skali i cenie magazynu obiektów. Użyj tej funkcji, aby uporządkować wszystkie obiekty i pliki w ramach konta magazynu w hierarchię katalogów i zagnieżdżonych podkatalogów. Innymi słowy, dane usługi Azure Data Lake Storage są zorganizowane w taki sam sposób, jak pliki są zorganizowane na komputerze.

Operacje takie jak zmiana nazwy lub usunięcie katalogu stają się pojedynczymi atomowymi operacjami na metadanych katalogu. Nie ma potrzeby wyliczania i przetwarzania wszystkich obiektów, które współużytkują prefiks nazwy katalogu.

Zoptymalizowany koszt i wydajność

Usługa Azure Data Lake Storage jest wyceniona na poziomach usługi Azure Blob Storage. Opiera się ona na możliwościach usługi Azure Blob Storage, takich jak zautomatyzowane zarządzanie zasadami cyklu życia i warstwowanie na poziomie obiektu, aby zarządzać kosztami przechowywania dużych zbiorów danych.

Wydajność poprawia się, ponieważ nie trzeba kopiować ani przekształcać danych przed analizą. Hierarchiczna funkcja przestrzeni nazw usługi Azure Data Lake Storage umożliwia wydajny dostęp i nawigację. Ta architektura oznacza, że przetwarzanie danych wymaga mniejszej liczby zasobów obliczeniowych, co zmniejsza zarówno czas, jak i koszt uzyskiwania dostępu do danych.

Model bezpieczeństwa z drobniejszym poziomem szczegółowości

Model kontroli dostępu w usłudze Azure Data Lake Storage obsługuje zarówno kontrolę dostępu opartą na rolach Azure (Azure RBAC), jak i listy kontroli dostępu POSIX (Portable Operating System Interface dla UNIX). Istnieje również kilka dodatkowych ustawień zabezpieczeń specyficznych dla usługi Azure Data Lake Storage. Ustaw uprawnienia na poziomie katalogu lub pliku. Azure Data Lake Storage szyfruje wszystkie dane magazynowane przy użyciu kluczy szyfrowania zarządzanych przez Microsoft lub zarządzanych przez klienta.

Ogromna skalowalność

Usługa Azure Data Lake Storage oferuje ogromny magazyn i akceptuje wiele typów danych na potrzeby analizy. Nie nakłada żadnych ograniczeń dotyczących rozmiarów kont, rozmiarów plików ani ilości danych, które mogą być przechowywane w usłudze Data Lake. Poszczególne pliki mogą mieć rozmiary z zakresu od kilku kilobajtów (KB) do setek terabajtów (TB). Azure Data Lake Storage przetwarza żądania przy niemal stałym opóźnieniu poszczególnych żądań mierzonych na poziomie usługi, konta i pliku.

Ten projekt oznacza, że usługa Azure Data Lake Storage może łatwo i szybko skalować w górę, aby sprostać najbardziej wymagającym obciążeniom. Może również, z równą łatwością, zmniejszyć skalę, gdy zapotrzebowanie spadnie.

Oparta na usłudze Azure Blob Storage

Dane, które pozyskujesz, są przechowywane jako obiekty blob na koncie magazynowym. Usługa, która zarządza obiektami blob, jest usługą Azure Blob Storage. Data Lake Storage opisuje możliwości lub "ulepszenia" tej usługi, które zaspokajają wymagania obciążeń analitycznych danych big data.

Ponieważ te funkcje są oparte na usłudze Blob Storage, funkcje takie jak rejestrowanie diagnostyczne, warstwy dostępu i zasady zarządzania cyklem życia są dostępne dla Twojego konta. Większość funkcji usługi Blob Storage jest w pełni obsługiwana, ale niektóre funkcje mogą być obsługiwane tylko na poziomie wersji zapoznawczej i istnieje kilka z nich, które nie są jeszcze obsługiwane. Aby uzyskać pełną listę instrukcji pomocy technicznej, zobacz Obsługa funkcji usługi Blob Storage na kontach usługi Azure Storage. Stan każdej wymienionej funkcji zmienia się wraz z upływem czasu, ponieważ wsparcie będzie nadal rozszerzane.

Terminologia: obiekty blob, pliki i kontenery

Spis treści usługi Azure Blob Storage zawiera dwie sekcje zawartości. Sekcja zawartości usługi Data Lake Storage zawiera najlepsze rozwiązania i wskazówki dotyczące korzystania z funkcji usługi Data Lake Storage. Sekcja dotycząca Blob Storage w treści zawiera wskazówki dotyczące funkcji kont, które nie są specyficzne dla usługi Data Lake Storage.

Podczas przechodzenia między sekcjami możesz zauważyć niewielkie różnice w terminologii. Na przykład treści przedstawione w dokumentacji Blob Storage używają terminu blob zamiast plik. Pliki, które technicznie ładujesz na swoje konto usługi magazynowej, stają się blobami na Twoim koncie. W związku z tym termin jest poprawny. Jednak termin blob może powodować nieporozumienie, jeśli jesteś przyzwyczajony do terminu plik. Zostanie również wyświetlony termin kontener używany do odwoływania się do systemu plików. Należy wziąć pod uwagę te terminy jako synonimy.

Zobacz też