Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
Importante
Esse recurso está em Visualização Pública.
Esses notebooks executam inferência em lote em larga escala nas GPUs serverless do AI Runtime. Eles abrangem uma variedade de modalidades, como geração de texto em LLM e fala para texto, utilizando frameworks como Ray Data, vLLM e Transformers.
| Tutorial | Description |
|---|---|
| Inferência em lote Qwen2.5-32B com Ray Data e vLLM | Execute inferência em lote multilíngue com oito réplicas vLLM persistentes do Qwen2.5-32B-Instruct em 8 GPUs H100 e salve os resultados no Unity Catalog. |
| Conversão de fala em texto em lote com Whisper | Transcreva áudio em lotes com o OpenAI Whisper large-v3-turbo em GPUs serverless, usando bibliotecas pré-instaladas no AI Runtime. |