Servizi di analisi su Azure e AWS

Questo articolo confronta i servizi di analisi su Amazon Web Services (AWS) e Azure. Vengono trattati l'inserimento e l'orchestrazione dei dati, i data lake, l'elaborazione batch, i data warehouse, l'elaborazione dei flussi, la governance, la condivisione e la business intelligence.

Per gli archivi dati relazionali e non relazionali operativi, vedere Servizi di database in Azure e AWS. Per i servizi di machine learning e di intelligenza artificiale delle applicazioni, vedere Servizi di intelligenza artificiale e Machine Learning in Azure e AWS.

Approcci alla piattaforma

AWS offre singoli servizi di analisi che si compongono in una soluzione. Microsoft Fabric offre carichi di lavoro integrati di Data Factory, Ingegneria dei dati, Data Warehouse, intelligence Real-Time, data science e Power BI su OneLake. Azure offre anche servizi autonomi, tra cui Azure Data Factory, Azure Databricks, Hub eventi di Azure, Analisi di flusso di Azure e Esplora dati di Azure.

Una piattaforma integrata non è automaticamente la scelta giusta per ogni carico di lavoro. Confrontare il supporto di origine e formato, i motori e le API necessari, l'isolamento della rete, la disponibilità a livello di area, i limiti di governance, il controllo operativo, le competenze esistenti e i prezzi. La capacità di Fabric è condivisa tra i workload di Fabric, mentre i servizi Azure autonomi hanno una propria capacità e modelli di fatturazione.

Integrazione e orchestrazione dei dati

Usare i servizi di integrazione dei dati per inserire, copiare, trasformare e orchestrare i dati tra sistemi operativi e archivi analitici.

Servizio AWS Servizio di Azure Linee guida per la selezione
AWS Glue Data Factory in Microsoft Fabric o Azure Data Factory Tutti e tre forniscono l'integrazione dei dati gestiti. Confrontare connettori, motori di trasformazione, rete privata, posizionamento del runtime, funzionalità di orchestrazione e integrazione con la piattaforma di analisi di destinazione.
Flussi di lavoro gestiti da Amazon per Apache Airflow Job di Apache Airflow in Microsoft Fabric Entrambi eseguono flussi di lavoro Apache Airflow. Convalidare le versioni di Airflow supportate, l'installazione dei pacchetti, la rete, l'identità, il ridimensionamento e i requisiti di migrazione.
AWS Servizio Migrazione del database Azure Servizio Migrazione del database o Fabric Migration Assistant per il Data Warehouse Questi strumenti hanno ambiti diversi. Usare Azure Servizio Migrazione del database per le coppie di database di origine e di destinazione supportate. Usare Fabric Migration Assistant per spostare gli schemi e i dati SQL supportati in Fabric Data Warehouse.
Flusso di applicazioni Amazon connettori di Data Factory o App per la logica di Azure Usa Data Factory per l'acquisizione e la trasformazione dei dati analitici. Usa Logic Apps per l'integrazione di applicazioni e processi aziendali. Verificare le operazioni del connettore, l'autenticazione e i requisiti del volume di dati.

Data lake e lakehouse

Amazon S3 offre in genere il livello di archiviazione per i data lake AWS. In Azure, Azure Data Lake Storage fornisce l'archiviazione degli oggetti con uno spazio dei nomi gerarchico. OneLake è il data lake logico incorporato in Microsoft Fabric.

Servizio AWS Servizio di Azure Linee guida per la selezione
Amazon S3 Azure Data Lake Storage Entrambi offrono un'archiviazione di oggetti durevole per i dati analitici. Confrontare il comportamento dello spazio dei nomi, la sicurezza, la gestione del ciclo di vita, la replica, l'integrazione dell'ecosistema e i costi di trasferimento dei dati.
Amazon S3 Microsoft OneLake OneLake fa parte di Fabric e fornisce l'archiviazione condivisa per i carichi di lavoro Fabric. OneLake non è un sostituto universale per tutti i carichi di lavoro S3. Usarlo quando Fabric è la piattaforma di analisi e la capacità, l'area, la sicurezza e il modello di carico di lavoro soddisfano i requisiti.
AWS Lake Formation Sicurezza di OneLake e Microsoft Purview in Fabric AWS Lake Formation gestisce l'accesso ai data lake basati su S3. Fabric separa le autorizzazioni di archiviazione, le autorizzazioni degli elementi e le funzionalità di governance. Mappare i requisiti di autorizzazione e governance invece di presumere l'esistenza di un singolo servizio equivalente.
Dati esterni amazon S3 Tasti di scelta rapida OneLake Le scorciatoie consentono di fare riferimento ai dati presenti in S3, Azure Data Lake Storage, Google Cloud Storage e altre posizioni di archiviazione senza copiarli. Usare invece lo spostamento dei dati quando sono necessarie trasformazioni complesse, pianificazione personalizzata o destinazione all'esterno di OneLake.

Ingegneria dei dati in batch

Servizio AWS Servizio di Azure Linee guida per la selezione
Amazon EMR Azure Databricks Entrambi supportano l'Apache Spark gestito e altri carichi di lavoro di ingegneria dei dati. Confrontare la compatibilità del runtime, il controllo del cluster, la scalabilità automatica, la governance, i notebook, i processi e le integrazioni dell'ecosistema.
Amazon EMR e sessioni interattive di AWS Glue ingegneria dei dati Fabric Fabric Data Engineering offre Spark, notebook, ambienti e processi gestiti integrati con OneLake. Non è una sostituzione diretta per ogni framework EMR o configurazione del cluster. Convalidare i requisiti di runtime, libreria, rete e prestazioni.
AWS Glue Studio Fabric Data Factory o Azure Data Factory Questi servizi offrono esperienze di trasformazione dei dati visiva e basata su codice. Selezionare in base al motore di trasformazione, all'orchestrazione, al supporto di origine e destinazione e al modello operativo.

Data warehouse e analisi SQL

Servizio AWS Servizio di Azure Linee guida per la selezione
Amazon Redshift Fabric Data Warehouse Entrambi forniscono data warehouse SQL distribuiti. Confrontare la compatibilità SQL, l'isolamento del carico di lavoro, il ridimensionamento, l'inserimento, la condivisione dei dati, la concorrenza, la governance e i prezzi. Fabric Data Warehouse funziona su OneLake e consuma la capacità di Fabric.
Amazon Redshift Azure Databricks SQL Prendere in considerazione Azure Databricks SQL quando il carico di lavoro usa un'architettura lakehouse e Databricks è la piattaforma dati primaria. Non è una sostituzione del motore relazionale per tutti i carichi di lavoro di Redshift.
Amazon Redshift Spectrum Fabric lakehouse, collegamenti a OneLake e Direct Lake Redshift Spectrum esegue query su dati in S3. Fabric offre funzionalità separate di archiviazione, calcolo e modello semantico. Direct Lake richiede tabelle Delta supportate e capacità di Fabric. Verifica i formati sorgente e i limiti di capacità.
Amazon Atena endpoint di analisi SQL per lakehouse di Fabric o Azure Databricks SQL Athena è un servizio SQL serverless per i dati in S3. Le opzioni di Azure si differenziano per archiviazione, metadati, capacità di calcolo e fatturazione. Selezionare in base alla posizione dei dati, alla compatibilità SQL, alla latenza, alla concorrenza e alla governance.

Analisi in tempo reale

Separare l'inserimento di eventi dall'elaborazione del flusso e dall'archiviazione analitica quando si confrontano i servizi. Un endpoint compatibile con Kafka non fornisce tutte le funzionalità del broker Apache Kafka.

Servizio AWS Servizio di Azure Linee guida per la selezione
Flussi di dati Amazon Kinesis Hub eventi di Azure Sia l'inserimento che il mantenimento di flussi di eventi con velocità effettiva elevata per i consumer indipendenti. Confrontare partizionamento, conservazione, riproduzione, velocità effettiva, protocolli e scalabilità.
Amazon Managed Service for Apache Flink Analisi di flusso di Azure o Fabric flussi di eventi Questi servizi elaborano i flussi, ma usano linguaggi diversi e modelli di esecuzione. Analisi di flusso usa un linguaggio di query basato su SQL. I flussi di eventi di Fabric offrono acquisizione, trasformazioni senza codice e instradamento all'interno di Fabric.
Amazon Managed Streaming per Apache Kafka Hub eventi per Apache Kafka Amazon MSK utilizza Apache Kafka open-source. Hub eventi fornisce un endpoint compatibile con Kafka e non è un cluster Apache Kafka. Convalidare le funzionalità del protocollo, le transazioni, la compressione, il supporto di Kafka Streams, la conservazione, le quote e i requisiti di livello.
Servizio OpenSearch di Amazon Esplora dati di Azure o Fabric eventhouse Usare Esplora dati di Azure o Eventhouse per l'analisi di log, telemetria e serie temporali con il linguaggio di query Kusto. OpenSearch offre anche funzionalità di ricerca full-text, quindi questi servizi non sono sostituzioni complete per i carichi di lavoro di ricerca.
Amazon Timestream Esplora dati di Azure o Fabric eventhouse Questi servizi supportano l'analisi delle serie temporali. Confrontare protocolli di inserimento, linguaggio di query, conservazione, suddivisione in livelli, comportamento di aggiornamento e requisiti di integrazione.

Business intelligence e condivisione dei dati

Servizio AWS Servizio di Azure Linee guida per la selezione
Amazon QuickSight Power BI Entrambi forniscono modellazione semantica, report, dashboard, condivisione e analisi incorporata. Confronta i requisiti di licenza, capacità, identità, governance, creazione di contenuti e incorporamento.
Grafana gestito da Amazon Grafana con gestione Azure Entrambi offrono un servizio gestito di Grafana. Confronta le integrazioni delle origini dati, l'autenticazione, il networking privato, l'alta disponibilità, i plug-in e i piani tariffari.
AWS Scambio di dati Microsoft Marketplace e Fabric condivisione dei dati esterni AWS Data Exchange unisce un marketplace dei dati alla distribuzione. Microsoft Marketplace e la condivisione dei dati in Fabric affrontano parti diverse di quel flusso di lavoro. La condivisione esterna dei dati di Fabric consente un accesso tra tenant controllato per gli elementi Fabric supportati, ma non è un marketplace dei dati.

Governo dei dati

Microsoft Purview e una combinazione di servizi AWS offrono funzionalità di individuazione dei dati, classificazione, derivazione, governance dell'accesso e conformità. AWS combina spesso Glue Data Catalog, Lake Formation, Amazon Macie, AWS Identity and Access Management e AWS Config. Microsoft Purview offre un catalogo unificato e funzionalità di governance per le origini supportate di Azure, Fabric, on-premises, multicloud e software as a service.

La copertura della governance dipende dalla fonte e dalla funzionalità. Verificare il supporto per la scansione, la raccolta della derivazione dei dati, l'applicazione dei criteri, le etichette di riservatezza, l'accesso alla rete e la disponibilità a livello di area geografica per ogni origine dati nell'architettura.

Considerazioni sulla migrazione

Non eseguire la migrazione di una piattaforma di analisi come una semplice lista di sostituzioni uno a uno tra servizi. Censire origini dati, formati, tipi di tabelle, pipeline, dipendenze di orchestrazione, codice di trasformazione, dialetti di query, modelli semantici, report, criteri di sicurezza, residenza dei dati, obiettivi di livello del servizio e processi operativi. Usare test di prestazioni e costi rappresentativi prima di selezionare i servizi di destinazione.