Elaborazione in batch

Importante

Questa funzionalità è in Anteprima Pubblica.

Questi notebook eseguono inferenza batch su larga scala sulle GPU serverless di AI Runtime. Coprono una gamma di modalità, come la generazione di testo LLM e il speech-to-text, utilizzando framework come Ray Data, vLLM e Transformers.

Tutorial Description
Inferenza in batch con Qwen2.5-32B, Ray Data e vLLM Esegui inferenza batch multilingue con otto repliche vLLM persistenti di Qwen2.5-32B-Instruct su 8 GPU H100 e salva i risultati nel Catalogo Unity.
Conversione batch da voce a testo con Whisper Trascrivi audio in lotti con OpenAI Whisper large-v3-turbo su GPU serverless, utilizzando librerie preinstallate in AI Runtime.