Ottenere e preparare i dati
I dati sono la base del Machine Learning. Sia la quantità di dati che la qualità dei dati influiscono sull'accuratezza del modello.
Per eseguire il training di un modello di Machine Learning, è necessario:
- Identificare l'origine e il formato dei dati.
- Scegliere come servire i dati.
- Progettare una soluzione di inserimento dati.
Per ottenere e preparare i dati usati per eseguire il training del modello di Machine Learning, è necessario estrarre i dati da un'origine e renderli disponibili al servizio di Azure che si vuole usare per eseguire il training dei modelli o eseguire stime.
Identificare l'origine e il formato dei dati
Prima di tutto, è necessario identificare l'origine dati e il relativo formato di dati corrente.
| Identificare il | Esempi |
|---|---|
| Fonte dati | Ad esempio, i dati possono essere archiviati in un sistema CRM (Customer Relationship Management), in un database transazionale come un database SQL o essere generati da un dispositivo IoT (Internet delle cose). |
| Formato dei dati | È necessario comprendere il formato corrente dei dati, che possono essere tabulari o strutturati, semi-strutturati o non strutturati. |
È quindi necessario decidere quali dati sono necessari per eseguire il training del modello e in quale formato si vuole che i dati vengano serviti al modello.
Progettare una soluzione di inserimento dati
In generale, è consigliabile estrarre i dati dall'origine prima di analizzarli. Indipendentemente dal fatto che si usino i dati per ingegneria dei dati, analisi dei dati o data science, è consigliabile estrarre i dati dall'origine, trasformarli e caricarli in un livello di servizio. Un processo di questo tipo viene anche definito ELT (Extract, Transform e Load) o Extract, Load e Transform (ELT). Il livello di serving rende i dati disponibili per il servizio che utilizzi per un'ulteriore elaborazione dei dati, come l'addestramento di modelli di machine learning.
Per spostare e trasformare i dati, è possibile usare una pipeline di inserimento dati. Una pipeline di inserimento dati è una sequenza di attività che spostano e trasformano i dati. Creando una pipeline, è possibile scegliere di attivare manualmente le attività o pianificare la pipeline quando si vuole automatizzare le attività. È possibile creare queste pipeline con servizi di Azure come Azure Synapse Analytics, Azure Databricks e Azure Machine Learning.
Un approccio comune per una soluzione di inserimento dati consiste nel:
- Estrarre dati non elaborati dalla fonte, ad esempio un sistema CRM o un dispositivo IoT.
- Copiare e trasformare i dati con Azure Synapse Analytics.
- Archivia i dati preparati in Archiviazione BLOB di Azure.
- Esegui l'addestramento del modello con Azure Machine Learning.
Esplorare un esempio
Si supponga di voler eseguire il training di un modello di previsioni meteo. Preferisci un'unica tabella in cui sono raggruppate tutte le misurazioni della temperatura per macchina. Si vogliono creare aggregazioni dei dati e avere una tabella della temperatura media per computer al minuto. Per creare la tabella, è necessario trasformare in dati tabulari i dati semi-strutturati acquisiti dal dispositivo IoT che misura la temperatura a intervalli.
Ad esempio, per creare un set di dati che è possibile usare per eseguire il training del modello di previsioni, è possibile:
- Estrarre le misurazioni dei dati come oggetti JSON dai dispositivi IoT.
- Convertire gli oggetti JSON in una tabella.
- Trasformare i dati per ottenere la temperatura per computer al minuto.
Verranno ora esaminati i servizi che è possibile usare per eseguire il training di modelli di Machine Learning.