Come funziona Esplora dati di Azure

Azure Esplora dati offre prestazioni senza precedenti per l'inserimento e l'esecuzione di query su dati di telemetria, log, eventi, tracce e serie temporali. Presenta formati di archiviazione ottimizzati, indici e utilizza statistiche avanzate sui dati per una pianificazione efficiente delle query e l'esecuzione di query compilate just-in-time.

Archiviazione e calcolo

Azure Esplora dati separa le risorse di archiviazione e calcolo. I dati persistenti risiedono in Archiviazione BLOB di Azure, mentre le risorse di calcolo possono archiviare dati temporanei o fungere da cache per l'archiviazione permanente.

Questa separazione offre i vantaggi seguenti:

  • Scalabilità orizzontale indipendente delle risorse di archiviazione e calcolo.
  • Accessibilità a dati identici in più cluster di calcolo. Per altre informazioni, vedere Condivisione dati.
  • Ottimizzazione dello SKU. Per altre informazioni, vedi Selezionare un codice SKU per il cluster.

Archiviazione di dati

Esplora dati di Azure suddivide tutti i dati acquisiti in extents, o frammenti di dati, che sono sezioni orizzontali della tabella di destinazione. Un'estensione può essere piccola quanto un singolo record. Man mano che i dati si accumulano nella tabella, Esplora dati di Azure unisce automaticamente gli extent finché non arrivano a contenere milioni di record. Ogni extent viene codificato e indicizzato indipendentemente da altri extent. Questa funzionalità contribuisce alla scalabilità lineare del throughput di ingestione.

Gli extent vengono distribuiti uniformemente tra i nodi del cluster, dove vengono memorizzati nella cache sia sull'SSD locale sia in memoria. Questa distribuzione migliora la capacità di preparare ed eseguire query altamente distribuite e parallele.

Per ulteriori informazioni sull'archiviazione dei dati, consulta Panoramica degli extent.

Nota

Esplora dati di Azure conserva anche metadati essenziali, come gli schemi delle tabelle e gli oggetti criterio. Per un elenco dei criteri, vedere Panoramica dei criteri.

Cache dei dati

Esplora dati di Azure usa un sistema di cache dei dati multilivello per mantenere i dati più rilevanti il più vicino possibile alla CPU. Questo sistema di cache si basa sull'immutabilità degli extent e funziona interamente con i dati compressi. Per migliorare le prestazioni delle query, i dati rimangono compressi anche in RAM e vengono decompressi solo quando è necessaria una query.

Per altre informazioni sulla memorizzazione nella cache, vedere Criteri di cache.

Indicizzazione del testo

Esplora dati di Azure è progettato per indicizzare in modo efficiente le colonne di testo libero (string) e simili a JSON (dynamic) in fase di acquisizione dei dati. Gli indici mantengono un livello di granularità che consente la valutazione di parti della query in base all'indice senza analizzare i dati.

L'ottimizzazione continua in background degli extent mediante fusione migliora la compressione e l'indicizzazione, garantendo un'archiviazione efficiente e una latenza ridotta delle query. Dopo che gli extent raggiungono una determinata dimensione, solo gli indici si uniscono per migliorare le prestazioni delle query senza compromettere l'efficienza.

Per altre informazioni sull'unione di extent e indice, vedere Criteri di unione.

Archivio a righe

Esplora dati di Azure offre una soluzione di archiviazione intermedia chiamata row store. L'archivio per righe consente l'acquisizione efficiente di piccole quantità di dati e garantisce che questi dati siano immediatamente disponibili per l'interrogazione. Quando si abilita l'acquisizione in streaming nel cluster, i dati vengono inizialmente acquisiti nel row store e quindi spostati negli extent del column store.

Per altre informazioni, vedere Acquisizione in batch vs. acquisizione in streaming.

Compressione delle colonne

Azure Esplora dati mantiene i dati in uno stato compresso, riducendo la quantità di memoria necessaria per archiviare ed elaborare i dati. Questo comportamento comporta prestazioni delle query più veloci e un uso più efficiente delle risorse di sistema.

Esplora dati di Azure evita la compressione verticale, che comporta l'ordinamento dei dati per migliorarne la compressione, a causa dell'alto costo in termini di CPU negli scenari con dati di testo libero o semi-strutturati. È invece possibile specificare l'ordinamento dei dati preferito per gli scenari con modelli di query dominanti. Questo compromesso assegna priorità alla disponibilità rapida dei dati per le query.

Per altre informazioni sulla specifica dell'ordinamento dei dati, vedere Criteri di ordinamento delle righe.

Query sui dati distribuiti

Esplora dati di Azure usa una tecnologia di query distribuita dei dati per analisi ad hoc rapide su grandi set di dati non strutturati. Le funzionalità principali di questa tecnologia includono:

  • I dati temporanei generati da query vengono archiviati in RAM aggregata
  • Gli extent pertinenti sono contrassegnati in un piano di query, fornendo l'isolamento dello snapshot
  • Le query veloci ed efficienti sono classificate in ordine di priorità con timeout predefiniti brevi
  • Supporto nativo per query tra cluster che riduce al minimo lo scambio di dati tra cluster
  • Le query vengono compilate just-in-time nel codice del computer altamente efficiente, usando le statistiche dei dati di tutti gli extent e personalizzate in base alle specifiche di codifica delle colonne

Nota

Esplora dati di Azure è progettato per funzionare con il linguaggio di query Kusto (KQL), sviluppato appositamente per Esplora dati di Azure. Inoltre, T-SQL è supportato.