Volba technologie úložiště pro velké objemy dat v Azure

Tento článek porovnává možnosti úložiště dat pro řešení pro velké objemy dat – konkrétně úložiště dat pro hromadný příjem dat a dávkové zpracování, nikoli analytické úložiště dat nebo příjem dat v reálném čase.

Jaké máte možnosti při výběru úložiště dat v Azure?

V závislosti na vašich potřebách existuje několik možností ingestování dat do Azure.

Jednotné logické datové jezero:

Úložiště souborů:

Databáze NoSQL:

Analytické databáze:

OneLake ve Fabric

OneLake in Fabric je jednotné a logické datové jezero, které je přizpůsobené celé organizaci. Slouží jako centrální centrum pro všechna analytická data a je součástí každého tenanta Microsoft Fabric. OneLake in Fabric je postaven na základu Data Lake Storage Gen2.

OneLake ve Fabricu:

  • Podporuje strukturované a nestrukturované typy souborů.
  • Ukládá všechna tabulková data ve formátu Delta Parquet.
  • Poskytuje jedno datové jezero v rámci hranic tenanta, které je ve výchozím nastavení spravováno.
  • Podporuje vytváření pracovních prostorů v rámci nájemce, aby organizace mohla distribuovat zásady vlastnictví a přístupu.
  • Podporuje vytváření různých datových položek, jako jsou jezera a sklady, ze kterých máte přístup k datům.

OneLake in Fabric slouží jako jednotné úložiště pro příjem dat, transformaci, analýzy v reálném čase a vizualizace v oblasti business intelligence. Centralizuje různé služby Fabric a ukládá datové položky, které všechny úlohy používají v prostředcích Fabric. Pro správnou volbu úložiště dat pro vaše úlohy ve službě Fabric si přečtěte průvodce rozhodováním: zvolte úložiště.

Objekty blob služby Azure Storage

Azure Storage je spravovaná služba úložiště, která je vysoce dostupná, zabezpečená, odolná, škálovatelná a redundantní. Microsoft se stará o údržbu a řeší za vás kritické problémy. Azure Storage je nejobvyklejším řešením úložiště, které Azure nabízí, protože s ním lze používat různé služby a nástroje.

K ukládání dat můžete použít různé služby Azure Storage. Nejflexibilnější možností pro ukládání objektů blob z mnoha zdrojů dat je úložiště objektů blob. Objekty blob jsou v podstatě soubory. Ukládají obrázky, dokumenty, soubory HTML, virtuální pevné disky (VHD), velké objemy dat, jako jsou protokoly, zálohy databází – prakticky cokoli. Objekty blob se ukládají v kontejnerech, které jsou obdobou složek. Kontejner poskytuje seskupení sady blobů. Účet úložiště může obsahovat neomezený počet kontejnerů, a kontejner může ukládat neomezený počet blobů.

Azure Storage je dobrou volbou pro řešení pro velké objemy dat a analýzy, protože je flexibilní, vysoká dostupnost a nízké náklady. Poskytuje horkou, studenou a archivní úroveň úložiště pro různé případy použití. Další informace viz Azure Blob Storage: Horké, studené a archivní vrstvy úložiště.

Ke službě Azure Blob Storage je možné přistupovat z Hadoopu (k dispozici prostřednictvím SLUŽBY HDInsight). HDInsight může jako výchozí systém souborů pro cluster používat kontejner objektů blob ve službě Azure Storage. Prostřednictvím rozhraní Systému souborů HDFS (Hadoop Distributed File System) poskytovaného ovladačem WASB může úplná sada komponent v HDInsight pracovat přímo se strukturovanými nebo nestrukturovanými daty uloženými jako objekty blob. Ke službě Azure Blob Storage lze přistupovat také prostřednictvím zástupce Blob Storage v Microsoft Fabric.

Mezi další funkce, díky kterým je Azure Storage dobrou volbou, patří:

Data Lake Storage Gen2

Data Lake Storage Gen2 je jediné centralizované úložiště, ve kterém můžete ukládat všechna data strukturovaná i nestrukturovaná. Datové jezero umožňuje vaší organizaci rychle a snadněji ukládat, přistupovat k široké škále dat a analyzovat je v jednom umístění. S datovým jezerem nemusíte své údaje přizpůsobovat tak, aby se vešly do existující struktury. Místo toho můžete data ukládat v nezpracovaný nebo nativní formát, obvykle jako soubory nebo jako binární velké objekty (objekty blob).

Data Lake Storage Gen2 konverguje možnosti Azure Data Lake Storage Gen1 se službou Azure Blob Storage. Například Data Lake Storage Gen2 poskytuje sémantiku systému souborů, zabezpečení na úrovni souborů a škálování. Protože jsou tyto funkce založeny na úložišti objektů Blob, získáte také nízkonákladové vrstvené úložiště s možností vysoké dostupnosti a zotavení po havárii.

Data Lake Storage Gen2 představuje Azure Storage základ pro vytváření podnikových datových jezer v Azure. Data Lake Storage Gen2 je navržen od začátku pro obsluhu několika petabajtů informací a udržení stovek gigabitů propustnosti, což umožňuje snadnou správu obrovských objemů dat.

Azure Cosmos DB

Azure Cosmos DB je globálně distribuovaná vícemodelová databáze Microsoftu. Azure Cosmos DB zaručuje latenci v řádu jednociferných milisekund na 99. percentilu kdekoli na světě, poskytuje různé dobře definované modely konzistence pro vyladění výkonu a zaručuje vysokou dostupnost pomocí schopnosti multi-homing.

Azure Cosmos DB je nezávislá na schématu. Automaticky indexuje všechna data, aniž byste museli řešit správu schémat a indexů. Je to také vícemodelový, nativně podpůrný dokument, klíč-hodnota, graf a sloupcové datové modely.

Funkce služby Azure Cosmos DB:

HBase v HDInsightu

Apache HBase je opensourcová databáze NoSQL založená na Hadoopu a modelovaná po Google BigTable. HBase poskytuje náhodný přístup a silnou konzistenci pro velké objemy nestrukturovaných a částečně strukturovaných dat v databázi bez schématu uspořádané podle rodin sloupců.

Data se ukládají na řádky tabulky a data v řádku jsou seskupena podle rodin sloupců. HBase je bez schématu v tom smyslu, že nemusíte definovat sloupce a typ dat uložených v nich, než je použijete. Kód open-source se škáluje lineárně pro manipulaci s petabajty dat na tisících uzlech. Může se spoléhat na redundanci dat, zpracování dávkou a další funkce, které jsou poskytovány pomocí distribuovaných aplikací v ekosystému Hadoop.

Implementace HDInsight používá škálovací architekturu HBase, aby poskytovala automatické rozdělování tabulek, silnou konzistenci pro čtení a zápisy a automatické převzetí služeb při selhání. Výkon je zvýšen ukládáním do mezipaměti pro čtení a vysokou propustností datových proudů pro zápis. Ve většině případů chcete vytvořit cluster HBase uvnitř virtuální sítě , aby ostatní clustery a aplikace HDInsight mohly k tabulkám přistupovat přímo.

Azure Data Explorer

Azure Data Explorer je rychlá a vysoce škálovatelná služba pro zkoumání dat protokolů a telemetrie. Pomáhá zpracovávat množství datových proudů vygenerovaných moderním softwarem, abyste mohli shromažďovat, ukládat a analyzovat data. Azure Data Explorer je ideální pro analýzu velkých objemů různých dat z libovolného zdroje dat, jako jsou weby, aplikace, zařízení IoT a další. Tato data se používají pro diagnostiku, monitorování, vytváření sestav, strojové učení a další možnosti analýzy. Azure Data Explorer usnadňuje ingestování těchto dat a umožňuje provádět složité neplánované dotazy na data za několik sekund.

Azure Data Explorer je možné lineárně škálovat pro zvýšení propustnosti příjmu dat a zpracování dotazů. Cluster Azure Data Exploreru je možné nasadit do virtuální sítě pro povolení privátních sítí.

Klíčová kritéria výběru

Pokud chcete zúžit možnosti, začněte zodpovězením těchto otázek:

  • Potřebujete jednotné datové jezero s podporou multicloudu, robustními zásadami správného řízení a integrací s analytickými nástroji? Pokud ano, zvolte OneLake in Fabric pro zjednodušenou správu dat a vylepšenou spolupráci.

  • Potřebujete spravované, vysokorychlostní cloudové úložiště pro libovolný typ textových nebo binárních dat? Pokud ano, zvolte jednu z možností úložiště souborů nebo analýz.

  • Potřebujete úložiště souborů optimalizované pro úlohy paralelní analýzy a vysokou propustnost nebo IOPS? Pokud ano, zvolte možnost, která je vyladěná na výkon analytických úloh.

  • Potřebujete do databáze bez schématu ukládat nestrukturovaná nebo částečně strukturovaná data? Pokud ano, vyberte jednu z nerelationálních nebo analytických možností. Porovnání možností indexování a databázových modelů V závislosti na typu dat, která potřebujete uložit, můžou být primární databázové modely největším faktorem.

  • Můžete službu použít ve své oblasti? Zkontrolujte dostupnost jednotlivých služeb Azure v jednotlivých oblastech. Další informace najdete v tématu Dostupné produkty v jednotlivých oblastech.

Matice schopností

Následující tabulky shrnují klíčové rozdíly v možnostech.

Schopnosti OneLake ve Fabric

Schopnost OneLake ve Fabric
Sjednocené datové jezero Poskytuje jedno sjednocené datové jezero pro celou organizaci, což eliminuje datové silos.
Podpora více cloudů Podporuje integraci a kompatibilitu s různými cloudovými platformami.
Zásady správného řízení dat Zahrnuje funkce, jako je rodokmen dat, ochrana dat, certifikace a integrace katalogu.
Centralizované datové centrum Funguje jako centralizované centrum pro zjišťování a správu dat.
Podpora analytického stroje Kompatibilní s několika analytickými moduly. Tato kompatibilita umožňuje, aby různé nástroje a technologie fungovaly na stejných datech.
Zabezpečení a dodržování předpisů Zajišťuje, aby citlivá data zůstala zabezpečená a přístup byl omezen pouze na oprávněné uživatele.
Jednoduché používání Poskytuje uživatelsky přívětivý návrh, který je automaticky dostupný pro každého tenanta Fabric a nevyžaduje žádné nastavení.
Škálovatelnost Dokáže zpracovat velké objemy dat z různých zdrojů.

Možnosti úložiště souborů

Schopnost Data Lake Storage Gen2 Kontejnery Azure Blob Storage
Účel Optimalizované úložiště pro úlohy analýzy velkých objemů dat Univerzální objektové úložiště pro širokou škálu scénářů ukládání
Případy použití Dávkové nebo streamované analýzy a data strojového učení, jako jsou soubory protokolů, data IoT, clickstreamy, velké datové sady Jakýkoli typ textových nebo binárních dat, jako jsou back-end aplikace, zálohovaná data, úložiště médií pro streamování a data pro obecné účely
Struktura Hierarchický systém souborů Úložiště objektů s jednoduchým oborem názvů
Ověřování Na základě identit Microsoft Entra Na základě sdílených tajných kódů Přístupové klíče účtu a klíčů sdíleného přístupového podpisu a Azure RBAC
Ověřovací protokol Open Authorization (OAuth) 2.0. Volání musí obsahovat platný JWT (JSON webový token) vydaný Microsoft Entra ID. Ověřovací kód zpráv založený na hodnotě hash (HMAC) Volání musí obsahovat SHA-256 hash kódovaný Base64 přes část požadavku HTTP.
Autorizace Seznamy řízení přístupu (ACL) rozhraní POSIX (Portable Operating System Interface). Seznamy ACL založené na identitách Microsoft Entra lze nastavit na úrovni souborů a složek. Pro autorizaci na úrovni účtu použijte přístupové klíče účtu. Pro účet, kontejner nebo autorizaci objektů blob použijte klíče sdíleného přístupového podpisu.
Auditování K dispozici. dostupný
Šifrování dat v klidu Transparentní, strana serveru Transparentní, serverová strana; Šifrování na straně klienta
Sady SDK pro vývojáře .NET, Java, Python, Node.js .NET, Java, Python, Node.js, C++, Ruby
Výkon analytických úloh Optimalizovaný výkon pro úlohy paralelní analýzy, vysokou propustnost a IOPS Neoptimalizuje se pro analytické úlohy
Omezení velikosti Žádné limity velikostí účtů, velikostí souborů nebo počtu souborů Konkrétní omezení zdokumentovaná tady
Geografická redundance Místně redundantní (místně redundantní úložiště (LRS)), geograficky redundantní (geograficky redundantní úložiště (GRS)), geograficky redundantní s přístupem pro čtení (geograficky redundantní úložiště s přístupem pro čtení (RA-GRS)), zónově redundantní (zónově redundantní úložiště (ZRS)). Místně redundantní (LRS), globálně redundantní (GRS), globálně redundantní s přístupem pro čtení (RA-GRS), zónově redundantní (ZRS). Další informace najdete v tématu Redundance služby Azure Storage.

Možnosti databáze NoSQL

Schopnost Azure Cosmos DB HBase v HDInsightu
Primární databázový model Datové úložiště, grafová databáze, úložiště klíč-hodnota, širokosloupcové úložiště Databáze s širokým sloupcovým úložištěm
Sekundární indexy Ano Ne
Podpora jazyka SQL Ano Ano (použití ovladače Phoenix JDBC)
Konzistence Silná, omezená zastaralost, relace, konzistentní předpona, eventuální Silné
Nativní integrace Azure Functions Ano Ne
Automatická globální distribuce Ano Není možné nakonfigurovat replikaci clusteru HBase napříč regiony s eventuální konzistencí.
Cenový model Elasticky škálovatelné jednotky žádostí (RU) účtované za sekundu podle potřeby, elasticky škálovatelné úložiště Ceny za minutu pro cluster HDInsight (horizontální škálování uzlů), úložiště

Možnosti analytické databáze

Schopnost Azure Data Explorer
Primární databázový model Relační (úložiště sloupců), telemetrie a úložiště časových řad
Podpora jazyka SQL Ano
Cenový model Elasticky škálovatelné instance clusteru
Ověřování Na základě identit Microsoft Entra
Šifrování dat v klidu Podporované klíče spravované zákazníkem
Výkon analytických úloh Optimalizovaný výkon pro úlohy paralelní analýzy
Omezení velikosti Lineární škálovatelnost

Přispěvatelé

Tento článek spravuje Microsoft. Původně byla napsána následujícími přispěvateli.

Hlavní autor:

Další kroky