Nota
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare ad accedere o modificare le directory.
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare a modificare le directory.
Importante
Questa funzionalità è in Anteprima Pubblica.
Il runtime di intelligenza artificiale è un'offerta di calcolo di Databricks destinata ai carichi di lavoro di Deep Learning e offre il supporto GPU per Databricks Serverless. È possibile usare il runtime di intelligenza artificiale per eseguire il training e ottimizzare i modelli personalizzati usando i framework preferiti e ottenere efficienza, prestazioni e qualità all'avanguardia. Per una panoramica del modo in cui il calcolo serverless rientra nell'architettura di Databricks, vedere Architettura dell'area di lavoro serverless.
Funzionalità principali
AI Runtime combina l'infrastruttura GPU gestita con un runtime progettato per il deep learning:
- Infrastruttura GPU completamente gestita: accesso serverless, flessibile alle GPU e nessuna configurazione del cluster, selezione dei driver o criteri di scalabilità automatica da gestire.
- Un ambiente di runtime dedicato al deep learning: scegli un ambiente Standard essenziale per la massima flessibilità nella gestione delle dipendenze oppure un ambiente IA completo, precaricato con i framework di ML più diffusi.
- Integrato in modo nativo tra notebook, processi, catalogo Unity e MLflow per lo sviluppo, l'accesso ai dati e il rilevamento degli esperimenti senza problemi.
Opzioni hardware
Tutti gli acceleratori di runtime di intelligenza artificiale effettuano il provisioning di un singolo nodo. Il numero di GPU in tale nodo dipende dal tipo di acceleratore:
| Acceleratore | GPU per nodo | Memoria GPU | Ideale per | Training distribuito |
|---|---|---|---|---|
| 1xA10 | 1 | 24 GB | Attività ML di piccole e medie dimensioni, ad esempio modelli ML classici o il perfezionamento di modelli linguistici più piccoli | Non supportato (gpu singola) |
| 1xH100 | 1 | 80 GB | Carichi di lavoro che richiedono più memoria GPU di quella offerta da 1xA10, ma non richiedono l'addestramento distribuito multi-GPU, come il fine-tuning di modelli linguistici di medie dimensioni | Non supportato (gpu singola) |
| 8xH100 | 8 | 80 GB per GPU | Carichi di lavoro di intelligenza artificiale su larga scala, inclusi il training o l'ottimizzazione di modelli di grandi dimensioni o l'esecuzione di attività avanzate di Deep Learning | Supportato l'uso del decorator @distributed con gpus=8 |
Tip
Solo 8xH100 supporta l'addestramento distribuito multi-GPU. Per carichi di lavoro con una singola GPU, scegli 1xA10 o 1xH100 in base alla memoria GPU di cui il modello ha bisogno.
Casi d'uso consigliati
Databricks consiglia AI Runtime per qualsiasi caso di utilizzo relativo al training di modelli personalizzati che coinvolgono deep learning, carichi di lavoro classici di larga scala o che utilizzano GPU.
Per esempio:
- Ottimizzazione LLM (LoRA, QLoRA, ottimizzazione completa)
- Visione artificiale (rilevamento degli oggetti, classificazione delle immagini)
- Sistemi di raccomandazione basati su Deep Learning
- Apprendimento per rinforzo
- Previsione di serie temporali basate su Deep Learning
Requisiti
Prima di iniziare, verifica che il tuo spazio di lavoro soddisfi questi requisiti:
- Controlla la disponibilità di AI Runtime per Geo per i Geo supportati e i requisiti di elaborazione cross-Geo. La disponibilità della GPU varia a seconda dello spazio di lavoro.
- Un amministratore dello spazio di lavoro deve abilitare l'anteprima di AI Runtime nelle impostazioni dello spazio di lavoro. Vedi Gestire le anteprime di Databricks.
Limitations
Tieni a mente le seguenti limitazioni quando pianifichi un carico di lavoro AI Runtime:
- Il runtime di intelligenza artificiale supporta solo acceleratori A10 e H100.
- Il runtime di intelligenza artificiale non supporta il profilo di sicurezza della conformità per gli standard FedRAMP High o DoD IL5.
- L'aggiunta di dipendenze tramite il pannello Ambienti non è supportata per i processi pianificati del runtime di intelligenza artificiale. Installare le dipendenze tramite codice usando
%pip installinvece nel notebook. - Per i processi pianificati in runtime di intelligenza artificiale, il comportamento di ripristino automatico per le versioni di pacchetti incompatibili associate al notebook non è supportato.
- I tentativi di connessione ad AI Runtime vengono interrotti dopo 15 minuti per i notebook interattivi e dopo 24 ore per i job dei notebook o i job CLI. Le sessioni di notebook connessi e i job di notebook possono durare fino a due giorni, mentre i job CLI possono durare fino a 14 giorni. Per i processi di addestramento dei modelli di lunga durata, implementa il checkpointing e riavvia il processo quando viene raggiunto il tempo di esecuzione massimo.
- Il runtime di intelligenza artificiale fornisce l'accesso su richiesta alle risorse GPU. Anche se ciò comporta un accesso semplice e flessibile alle GPU, potrebbero verificarsi periodi in cui la capacità è vincolata o non disponibile nell'area.
- Il runtime di intelligenza artificiale sfrutta le GPU tra aree in determinati casi durante i momenti di elevata domanda. Potrebbero esserci costi in uscita associati a tale utilizzo e la connettività di rete tra aree potrebbe essere limitata in determinati momenti.
Connettersi al runtime di intelligenza artificiale
È possibile connettersi al runtime di intelligenza artificiale in modo interattivo dai notebook, da un terminale IDE usando un tunnel SSH, processi pianificati, l'API processi e bundle di automazione dichiarativa. Per istruzioni passo dopo passo, vedi Connetti al runtime AI da un notebook.
Set up environment (Configurare l'ambiente)
AI Runtime offre due ambienti Python gestiti: un ambiente Standard essenziale e un ambiente Databricks AI completo, precaricato con i più diffusi framework di machine learning come PyTorch e Transformers. Per informazioni dettagliate sulla scelta di un ambiente, il comportamento di memorizzazione nella cache, l'importazione di moduli personalizzati e le limitazioni note, vedere Configurare l'ambiente.
Tip
Scegli l'ambiente Standard per il pieno controllo del tuo stack di dipendenze, oppure l'ambiente AI Databricks per saltare l'installazione di framework comuni come PyTorch e Transformers.
Caricare i dati nel runtime di intelligenza artificiale
Comprendere il funzionamento dell'accesso ai dati in Ai Runtime è essenziale per un'esperienza uniforme. Per informazioni dettagliate, vedere Caricare i dati nel runtime di intelligenza artificiale.
Training distribuito
Il runtime di intelligenza artificiale supporta il training distribuito tra più GPU nel singolo nodo a cui è connesso il notebook. Usando l'elemento Decorator dall'API @distributedserverless_gpu Python, è possibile avviare carichi di lavoro con più GPU con PyTorch DDP, FSDP o DeepSpeed con una configurazione minima. Per maggiori dettagli, vedi Addestramento distribuito nei notebook.
Tip
Valida il carico di lavoro su una singola GPU prima di scalare a 8xH100 con il @distributed decorator.
Runtime di Ray su AI
AI Runtime supporta Ray per carichi di lavoro distribuiti per GPU, inclusi Ray Core, Ray Data, Ray Train e Ray Tune. Puoi eseguire processi Ray a nodo singolo e multinodo su risorse di calcolo GPU serverless senza dover configurare alcun cluster. Per dettagli ed esempi, vedi Ray on AI Runtime.
Rilevamento e osservabilità dell'esperimento
Per l'integrazione MLflow, la visualizzazione dei log e il monitoraggio GPU, vedi Tracciamento e osservabilità degli esperimenti. Per il salvataggio dei checkpoint del modello, vedi Migliorare le prestazioni e la resilienza dell'addestramento su AI Runtime.
Portare in produzione i carichi di lavoro di addestramento
Distribuisci un carico di lavoro in runtime AI con Declarative Automation Bundles per eseguire il tuo codice di addestramento, crea compiti multi-tasco che combinano compiti GPU e CPU, pianifica pipeline e promuovi dallo sviluppo alla produzione. Vedere Pianificare i carichi di lavoro GPU e creare task.
Codice Genie per l'apprendimento avanzato
Genie Code può aiutare a sviluppare e risolvere i carichi di lavoro di deep learning su AI Runtime. Può generare codice di addestramento distribuito, risolvere problemi di ambiente e dipendenze, e indagare su fallimenti di GPU e carichi di lavoro distribuiti. Vedi Usa il codice Genie con il runtime di IA.
Guides
Per la migrazione da carichi di lavoro classici, notebook di esempio e risoluzione dei problemi, vedere Guide utente per il runtime di intelligenza artificiale. Per trasferire un carico di lavoro di addestramento Slurm esistente a AI Runtime, vedi Migrate from Slurm.