Nota
O acesso a esta página requer autorização. Pode tentar iniciar sessão ou alterar os diretórios.
O acesso a esta página requer autorização. Pode tentar alterar os diretórios.
Estes notebooks executam inferência em lote à grande escala em GPUs serverless do AI Runtime. Abrangem uma variedade de modalidades, como geração de texto LLM e speech-to-text, utilizando frameworks como Ray Data, vLLM e Transformers.
| Tutorial | Description |
|---|---|
| Inferência em lote com Qwen2.5-32B, Ray Data e vLLM | Execute inferência em lote multilíngue com oito réplicas vLLM persistentes do Qwen2.5-32B-Instruct em 8 GPUs H100 e guarde os resultados no Unity Catalog. |
| Conversão de fala em texto em lote com Whisper | Transcreve áudio em lotes com o OpenAI Whisper large-v3-turbo em GPUs sem servidor, usando bibliotecas pré-instaladas no AI Runtime. |