Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
Эффективное планирование емкости помогает гарантировать, что пакетная служба Azure рабочие нагрузки имеют необходимые вычислительные ресурсы, когда им нужны. В этой статье объясняется, как устроена емкость службы Batch, как спланировать квоты для ваших рабочих нагрузок и как снизить риск сбоев выделения ресурсов.
Квота — это лимит, а не гарантия наличия ресурсов. Планирование позволяет запрашивать соответствующую квоту, выбирать устойчивые конфигурации и реагировать корректно, когда емкость ограничена. Для конкретных значений по умолчанию и максимальных значений см. квоты и ограничения пакетной службы.
Убедитесь, что Batch подходит для вашей нагрузки
Используйте Batch, если вы хотите, чтобы Azure предоставлял планирование как службу, а ваше приложение может организовать работу в пулы, задания и задачи. Прежде чем планировать пакетную вместимость, рассмотрите следующие варианты:
- Выбирайте Azure CycleCloud, когда нужно управлять конкретным планировщиком HPC, настраивать топологию кластера и стек программного обеспечения или строго согласовать с существующими локальными рабочими процессами.
- Выберите Azure CycleCloud Workspace for Slurm, если вам нужна готовая к развертыванию среду Slurm с сетевыми компонентами, хранением и доступом, предусмотренными в вашей подписке.
Если пакетная модель — подходящая, используйте следующие разделы для оценки пикового спроса, выбора виртуальных машин, расчёта квот и определения запасных вариантов перед созданием производственных пулов.
Иерархия емкости
Пропускная способность пакетной обработки определяется на нескольких уровнях, при этом каждый уровень ограничивает нижележащий. Ваша фактическая ёмкость определяется тем, что допускает наиболее жёсткое ограничение в цепочке.
В верхней части страницы регион Azure показывает доступные физические мощности центра обработки данных для каждого семейства виртуальных машин. Доступная ёмкость в регионе не является фиксированной величиной, которой можно управлять; она меняется со временем и зависит от серии виртуальных машин. Затем квота подписки задает допустимое ограничение ядра для каждого семейства виртуальных машин в каждом регионе. В режиме распределения из пула подписок пользователей эти квоты подписок применяются непосредственно к вашим пулам Batch. Квота учетной записи пакетной службы задает ядра, пулы и активные задания, разрешенные для учетной записи пакетной службы. В режиме выделения пула службы Batch действуют эти квоты уровня учетной записи. Наконец, ограничения пула ограничивают количество узлов в каждом пуле на основе квоты, действующей на уровне выше пула, и ограничений размера пула, заданных службой Batch.
Понимание того, какой уровень применяется к вашей учетной записи, зависит от режима выделения пула. Дополнительные сведения см. в разделе Учетные записи пакетной службы и режимы выделения пула.
Планирование требований к емкости
Перед созданием промышленных пулов оцените, какие ресурсы требуются вашей рабочей нагрузке. Чтобы преобразовать характеристики рабочей нагрузки в запрос квоты, выполните следующие действия.
- Профиль рабочей нагрузки. Что такое пиковое число параллельных заданий и задач? Каковы средние требования к длительности и памяти задачи? Требуются ли задачам GPU или многоузловая координация (MPI)?
- Выбор виртуальной машины. Какое семейство и размер виртуальной машины лучше всего соответствует рабочей нагрузке? Сколько ядер и сколько памяти предоставляет каждая виртуальная машина?
- Размер пула. Сколько задач выполняется одновременно на узел (до четырех раз больше числа ядер узлов, ограничено 256 слотами задач на узел)? Учитывая пиковое число одновременных задач, сколько узлов вам нужно? Как разделить емкость между выделенными и точечными узлами?
- Требование квоты. Умножьте максимальное количество узлов на количество ядер в каждой виртуальной машине, чтобы получить общее требуемое количество ядер. Сравните это общее значение с текущей квотой, чтобы определить, какое увеличение следует запросить.
- Оценка стоимости. Используйте почасовую ставку виртуальной машины и ожидаемое время выполнения, чтобы оценить ежедневные и ежемесячные затраты. Дополнительные сведения см. в разделе "Планирование управления затратами на пакетная служба Azure".
Чтобы проверить текущие квоты и запросить увеличение квоты, см. Просмотр квот пакетной службы и Увеличение квоты. Отправьте запросы квоты заранее и начните с скромных, добавочных увеличений. Увеличение больших квот может потребовать ручной проверки и может занять несколько дней до нескольких недель.
Упреждающее управление емкостью
Планируйте емкость перед тем, как она станет ограничением:
- Мониторинг использования квоты. Отслеживайте использование ядер по отношению к вашей квоте и настройте оповещение, когда использование приближается к пределу, например на уровне 70–80%. Дополнительные сведения см. в статье Мониторинг решений Batch.
- Используйте автомасштабирование. Настройте автоматическое масштабирование , чтобы пулы росли и сокращались с спросом, а не удерживая фиксированное количество избыточных узлов. Распространённый подход предполагает поддержание базового уровня выделенных узлов для гарантированного выполнения задач и задействование Spot-узлов при пиковых нагрузках для повышения пропускной способности.
- Распределяется по регионам и учетным записям. Распределяйте рабочие нагрузки между несколькими регионами или учетными записями Batch, чтобы получить доступ к более высокой совокупной емкости. Квоты службы, такие как активные задания и пулы, применяются к каждой отдельной учетной записи Batch.
Управление ограничениями пропускной способности
Даже при планировании могут возникнуть сбои выделения. Создайте рабочий процесс, чтобы обеспечить устойчивость:
- Повторите попытку и используйте разные варианты. Если пул не может достичь целевого размера, повторите попытку через несколько минут, попробуйте другой размер виртуальной машины или попробуйте другой регион. С течением времени доступность ресурсов изменяется.
- Переназначить задания. Избегайте использования одного статического пула. Убедитесь, что можно перенацелить задания в другой пул, возможно, с другим размером виртуальной машины, если пул не может расти. Дополнительные сведения см. в рекомендациях по использованию пакетная служба Azure.
- Учитывайте возможность вытеснения spot-узлов.Spot-узлы могут быть вытеснены, когда Azure потребуется вернуть эти ресурсы. Используйте узлы Spot только для отказоустойчивых задач и используйте их вместе с выделенными узлами и автомасштабированием, чтобы пул автоматически восстанавливался.
Подробные симптомы, причины и разрешения ошибок выделения и квоты см. в руководстве по устранению неполадок:
- Ошибки пула и узлов
- сбой при изменении размера пула пакетная служба Azure
- Сбой создания пула пакетная служба Azure
Проверка мощности перед производством
Запустите пилотный проект с репрезентативным заданием, ожидаемым для него объёмом данных и конфигурацией производственного пула. Не утверждайте дизайн для производства, пока не сможете зафиксировать доказательства по каждому критериу:
| Criterion | Доказательства для регистрации |
|---|---|
| Выполнение рабочей нагрузки | Задача выполняется корректно с помощью зависимостей производственных задач, пакетов приложений, а также путей входных и выводных данных. |
| Масштаб и квота | Пул достигает требуемого количества узлов в целевом регионе, не превышая квоты учётной записи Batch, подписки или семейства виртуальных машин. |
| Performance | Полное время выполнения задания соответствует целевому значению, включая выделение пула ресурсов, передачу данных, вычисления и сохранение результатов. |
| Recovery | После потери узла, сбоя задачи или спотового прерывания, если это используется, задание остаётся в пределах зафиксированного максимального времени восстановления и разрешённых потерь на контрольной точке, соблюдает срок завершения и успешно использует запланированный резервный размер или пул виртуальной машины. |
| Cost | Измеренная стоимость вычислений, хранения, сетей и лицензии за выполненное задание достигает цели при ожидаемой частоте запуска. |
| Операции | Оповещения выявляют давление по квотам, сбои в распределении и неудачные задачи, а владелец может перенацеливать или восстанавливать нагрузку. |
Если критерий не работает, пересмотрите размер пула, выбор виртуальной машины, путь хранения, повторное поведение или региональный резерв и повторите ту же задачу. Небольшой функциональный тест не определяет производственную мощность, потому что не определяет максимальный масштаб, квоту или перемещение данных.
Лучшие практики
| Практика | Описание |
|---|---|
| Запросите квоту заранее | Заранее отправьте запросы на квоту; Большое увеличение может занять несколько дней до нескольких недель. |
| Планирование головного помещения | Запросите квоту немного выше вашего текущего пикового уровня использования, чтобы учесть возможный рост. |
| Использование нескольких регионов | Распределить рабочие нагрузки между регионами, чтобы получить доступ к большей совокупной емкости. |
| Мониторинг использования | Оповещение, когда основное использование достигает 70–80% квоты. |
| Оптимизация размера виртуальных машин | Подбирайте семейство и размер виртуальной машины в соответствии с рабочей нагрузкой вместо избыточного выделения ресурсов. |
| Используйте Spot с умом | Зарезервируйте спотовые узлы для отказоустойчивых рабочих нагрузок и сочетайте их с выделенными узлами. |
| Очистите ресурсы | Удалите неиспользуемые пулы, чтобы освободить квоту учётной записи. |