Nota
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare ad accedere o modificare le directory.
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare a modificare le directory.
Importante
Questa funzionalità è in Anteprima Pubblica.
Questi notebook eseguono inferenza batch su larga scala sulle GPU serverless di AI Runtime. Coprono una gamma di modalità, come la generazione di testo LLM e il speech-to-text, utilizzando framework come Ray Data, vLLM e Transformers.
| Tutorial | Description |
|---|---|
| Inferenza in batch con Qwen2.5-32B, Ray Data e vLLM | Esegui inferenza batch multilingue con otto repliche vLLM persistenti di Qwen2.5-32B-Instruct su 8 GPU H100 e salva i risultati nel Catalogo Unity. |
| Conversione batch da voce a testo con Whisper | Trascrivi audio in lotti con OpenAI Whisper large-v3-turbo su GPU serverless, utilizzando librerie preinstallate in AI Runtime. |