Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
O planejamento efetivo de capacidade ajuda a garantir que suas cargas de trabalho Lote do Azure tenham os recursos de computação necessários quando precisarem delas. Este artigo explica como a capacidade do Batch é estruturada, como planejar a cota necessária para suas cargas de trabalho e como reduzir o risco de falhas de alocação.
Uma cota é um limite, e não uma garantia de capacidade. Planejar com antecedência ajuda você a solicitar a cota apropriada, escolher configurações resilientes e reagir normalmente quando a capacidade for restrita. Para obter os valores padrão e máximos específicos, consulte cotas e limites do serviço Batch.
Confirme que esse lote se encaixa na sua carga de trabalho
Use o Batch quando quiser que o Azure ofereça agendamento como um serviço e sua aplicação pode organizar o trabalho em pools, jobs e tarefas. Antes de planejar a capacidade em lote, considere estas alternativas:
- Escolha o Azure CycleCloud quando precisar operar um agendador HPC específico, personalizar a topologia do cluster e a pilha de software, ou alinhar-se de perto com os fluxos de trabalho existentes on-premises.
- Escolha o Azure CycleCloud Workspace para Slurm quando quiser um ambiente Slurm pronto para implantar, com componentes de rede, armazenamento e acesso provisionados na sua assinatura.
Se o Batch for o modelo operacional correto, use as seguintes seções para estimar a demanda máxima, selecionar VMs, calcular cotas e definir reservas antes de criar pools de produção.
Hierarquia de capacidade
A capacidade do lote é regida em várias camadas, em que cada camada restringe a que está abaixo dela. Sua capacidade efetiva é aquela que o limite mais restritivo na cadeia permite.
Na parte superior, a região Azure fornece a capacidade do datacenter físico disponível para cada família de VMs. A capacidade regional não é um valor fixo que você controla; varia ao longo do tempo e por série de VMs. Sua cota de assinatura define o limite de núcleo permitido por família de VM por região. No Modo de alocação por pool da assinatura do usuário, essas cotas da assinatura se aplicam diretamente aos pools do Batch. A Cota da conta do Batch define os núcleos, pools e tarefas ativas permitidos por conta do Lote. No modo de alocação do pool de serviços do Batch, aplicam-se estas cotas no nível da conta. Por fim, os limites de pool restringem o número de nós por pool, com base na cota aplicada ao pool e nos limites de tamanho do pool definidos pelo serviço Batch.
Entender qual camada se aplica à sua conta depende do modo de alocação do pool. Para obter mais informações, consulte contas do Batch e modos de alocação de pools.
Planejar seus requisitos de capacidade
Antes de criar pools de produção, estime os recursos de que sua carga de trabalho precisa. Trabalhe com as seguintes perguntas para converter as características da carga de trabalho em uma solicitação de cota:
- Perfil de carga de trabalho. Qual é o número máximo de tarefas e trabalhos simultâneos? Qual é a duração média da tarefa e o requisito de memória? As tarefas precisam de GPUs ou de coordenação com MPI (múltiplos nós)?
- Seleção de VM. Qual família e tamanho de VM melhor correspondem à carga de trabalho? Quantos núcleos e quanta memória cada VM fornece?
- Dimensionamento do pool. Quantas tarefas são executadas simultaneamente por nó (até quatro vezes o número de núcleos do nó, limitado a 256 slots de tarefas por nó)? Com base no número máximo de tarefas simultâneas, de quantos nós você precisa? Como você divide a capacidade entre nós Dedicados e Spot?
- Exigência de cota. Multiplique o número máximo de nós pelo número de núcleos por VM para obter o total de núcleos necessários. Compare esse total com a cota atual para determinar o aumento da solicitação.
- Estimativa de custo. Use a taxa por hora da VM e o tempo de execução esperado para estimar o custo diário e mensal. Para obter mais informações, consulte Planejar o gerenciamento de custos para Lote do Azure.
Para verificar suas cotas atuais e solicitar um aumento, consulte Exibir cotas do Lote e Aumentar uma cota. Envie solicitações de cota com bastante antecedência e comece com aumentos incrementais modestos. Grandes aumentos de cota podem exigir revisão manual e podem levar vários dias a várias semanas.
Gerenciar a capacidade proativamente
Planeje a capacidade antes de se tornar uma restrição:
- Monitorar o uso da cota. Acompanhe o uso de núcleos em relação à sua cota e gere um alerta quando o uso se aproximar do limite, por exemplo, em 70–80%. Para obter mais informações, consulte Monitorar soluções do Lote.
- Use o redimensionamento automático. Configure o dimensionamento automático para que os pools cresçam e diminuam com a demanda em vez de manter uma contagem de nós fixa e superprovisionada. Um padrão comum mantém uma base de nós dedicados para capacidade garantida e recorre a nós Spot para obter capacidade adicional.
- Espalhe entre regiões e contas. Distribua cargas de trabalho entre várias regiões ou contas do Batch para acessar maior capacidade agregada. Cotas de serviço, como trabalhos ativos e pools, se aplicam a cada conta do Lote diferente.
Lidar com restrições de capacidade
Mesmo com o planejamento, você pode encontrar falhas de alocação. Projete seu fluxo de trabalho para ser resiliente:
- Tente novamente e diversifique. Se um pool não conseguir atingir seu tamanho de destino, tente novamente após alguns minutos, tente um tamanho de VM diferente ou tente uma região diferente. Alterações de disponibilidade de recursos ao longo do tempo.
- Redirecionar tarefas. Evite depender de um único pool estático. Verifique se você pode redirecionar trabalhos para um pool diferente, possivelmente com um tamanho de VM diferente, se um pool não puder crescer. Para obter mais informações, consulte Lote do Azure práticas recomendadas.
- Crie para preempção de Spot.Nós Spot podem sofrer preempção quando o Azure precisar recuperar a capacidade. Use nós Spot apenas para cargas de trabalho tolerantes a falhas e combine-os com nós dedicados e escala automática para que o conjunto se recupere automaticamente.
Para obter sintomas detalhados, causas e resoluções de erros de alocação e cota, consulte as diretrizes de solução de problemas:
- Erros de pool e nó
- Falha no redimensionamento do pool do Lote do Azure
- Lote do Azure falha na criação do pool
Validar a capacidade antes da produção
Executar uma prova de conceito com uma carga de trabalho representativa, seu volume de dados esperado e a configuração do pool de produção. Não aprove o projeto para produção até conseguir registrar evidências para todos os critérios:
| Criterion | Evidências a registrar |
|---|---|
| Carga de trabalho concluída | O trabalho é concluído corretamente com dependências de tarefas de produção, pacotes de aplicação e caminhos de dados de entrada e saída. |
| Escala e cota | O pool atinge a contagem de nós necessária na região pretendida sem exceder a conta Batch, assinatura ou cota da família VM. |
| Performance | O tempo total do trabalho de ponta a ponta atende à meta, incluindo a alocação do pool, a transferência de dados, o processamento e a persistência dos resultados. |
| Recovery | Após uma perda de nó, falha de tarefa ou preempção de Spot, caso seja usada, o trabalho permanece dentro do tempo máximo de recuperação registrado e da perda de checkpoint permitida, cumpre o prazo de conclusão e usa com sucesso o tamanho de VM ou o pool de contingência planejado. |
| Custo | O custo medido de computação, armazenamento, rede e licença por trabalho concluído atinge a meta na frequência de execução esperada. |
| Operações | Alertas identificam pressão de cota, falhas de alocação e tarefas falhadas, e o proprietário pode redirecionar ou recuperar a carga de trabalho. |
Se um critério falhar, revise o tamanho do pool, a seleção da VM, o caminho de armazenamento, o comportamento de nova tentativa ou a alternativa regional e repita o mesmo trabalho. Um pequeno teste funcional não estabelece a capacidade de produção porque não exerce escala máxima, cota ou movimentação de dados.
Práticas Recomendadas
| Prática | Description |
|---|---|
| Solicite cota com antecedência | Enviar solicitações de cota com antecedência; grandes aumentos podem levar vários dias a várias semanas. |
| Planeje uma margem de capacidade | Solicite um pouco mais de cota do que o pico atual para permitir o crescimento. |
| Usar várias regiões | Espalhe cargas de trabalho entre regiões para acessar mais capacidade de agregação. |
| Monitorar o uso | Alerta quando o uso principal atinge de 70 a 80% de sua cota. |
| Dimensionar corretamente as VMs | Combine a família e o tamanho da VM à carga de trabalho, em vez de superprovisionar. |
| Use o Spot com sabedoria | Reserve nós Spot para cargas de trabalho tolerantes a falhas e combine-os com nós dedicados. |
| Limpar os recursos | Exclua pools não utilizados para liberar a cota da conta. |