Co je Apache HBase ve službě Azure HDInsight

Apache HBase je opensourcová databáze NoSQL postavená na Apache Hadoopu a modelovaná po Google BigTable. HBase poskytuje náhodný přístup a silnou konzistenci pro velké objemy dat v databázi bez schématu. Databáze je uspořádaná podle rodin sloupců.

Z pohledu uživatele se HBase podobá databázi. Data jsou uložená v řádcích a sloupcích tabulky a data v řádku jsou seskupené podle řady sloupců. HBase je databáze bez schématu. Sloupce a datové typy mohou být nedefinované před jejich použitím. Kód open-source se škáluje lineárně pro manipulaci s petabajty dat na tisících uzlech. Může spoléhat na redundanci dat, dávkové zpracování a další funkce poskytované distribuovanými aplikacemi v prostředí Hadoop.

Jak je Apache HBase implementovaný ve službě Azure HDInsight?

HDInsight HBase se nabízí jako spravovaný cluster, který je integrovaný do prostředí Azure. Clustery jsou nakonfigurované tak, aby ukládaly data přímo do azure Storage, což poskytuje nízkou latenci a zvýšenou elasticitu v možnostech výkonu a nákladů. Tato vlastnost umožňuje zákazníkům vytvářet interaktivní weby, které pracují s velkými datovými sadami. Vytváření služeb, které ukládají data ze snímačů a telemetrických dat z milionů koncových bodů A analyzovat tato data pomocí úloh Hadoopu. HBase a Hadoop jsou dobrými výchozími body pro projekt velkých objemů dat v Azure. Služby můžou umožnit aplikacím v reálném čase pracovat s velkými datovými sadami.

Implementace HDInsight používá architekturu škálování HBase k zajištění automatického rozdělování tabulek. Silná konzistence pro čtení i zápis a automatické převzetí funkcí při selhání. Výkon je zvýšen ukládáním do mezipaměti pro čtení a vysokou propustností datových proudů pro zápis. Cluster HBase můžete vytvořit uvnitř virtuální sítě. Podrobnosti najdete v tématu Vytváření clusterů HDInsight v síti Azure Virtual Network.

Jak se data spravují v HDInsight HBase?

Data je možné spravovat v HBase pomocí příkazů create, get, puta scan z prostředí HBase. Data se zapisují do databáze pomocí put a čtou pomocí get. Příkaz scan slouží k získání dat z více řádků v tabulce. Data je možné spravovat také pomocí rozhraní API jazyka C# HBase, které poskytuje klientskou knihovnu nad rozhraním HBase REST API. Databázi HBase lze také dotazovat pomocí Apache Hive. Úvod k těmto programovacím modelům najdete v tématu Začínáme používat Apache HBase s Apache Hadoopem ve službě HDInsight. K dispozici jsou také spoluprocesory, které umožňují zpracování dat v uzlech, které hostují databázi.

Poznámka:

Thrift není podporovaný HBase v HDInsight.

Případy použití Apache HBase

Kanonický případ použití, pro který byl BigTable (a rozšířením HBase) vytvořen z webového vyhledávání. Vyhledávací weby vytvářejí indexy, které mapují termíny na webové stránky, které je obsahují. Existuje však mnoho dalších případů použití, pro které je HBase vhodný – několik z nich je součástí této části.

Scénář Popis
Úložiště párů klíč-hodnota HBase se dá použít jako úložiště klíč-hodnota a je vhodný pro správu systémů zpráv. Facebook používá HBase pro svůj systém zasílání zpráv a je ideální pro ukládání a správu internetové komunikace. WebTable používá HBase k vyhledávání a správě tabulek extrahovaných z webových stránek.
Data ze snímačů HBase je užitečný pro zachytávání dat shromážděných přírůstkově z různých zdrojů. Tato data zahrnují sociální analýzy a časové řady. Aktualizace interaktivních řídicích panelů s trendy a čítači, a správa systémů auditních protokolů. Příkladem je terminál obchodníka Bloomberg a Open Time Series Database (OpenTSDB). OpenTSDB ukládá a poskytuje přístup k metrikám shromážděným o stavu serverových systémů.
Dotaz v reálném čase Apache Phoenix je dotazovací modul SQL pro Apache HBase. Je přístupný jako ovladač JDBC a umožňuje dotazování a správu tabulek HBase pomocí SQL.
HBase jako platforma Aplikace mohou běžet nad HBase používajíc ho jako datové úložiště. Mezi příklady patří Phoenix, OpenTSDB, Kijia Titan. Aplikace lze také integrovat s HBase. Mezi příklady patří: Apache Hive, Apache Pig, Solr, Apache Flume, Apache Impala, Apache Spark, Gangliaa Apache Drill.

Další kroky