Ограничения конвейера

Ниже перечислены ограничения конвейеров Lakeflow, о которых важно знать при разработке конвейеров.

  • Рабочая область Azure Databricks ограничена 1000 параллельными обновлениями конвейера. Количество наборов данных, которые может содержать один конвейер, определяется конфигурацией конвейера и сложностью рабочей нагрузки.

  • Конфигурация конвейера содержит ссылки на исходные файлы и папки.

    • Если конфигурация ссылается только на отдельные записные книжки или файлы, ограничение на конвейер составляет 100 исходных файлов.

    • Если конфигурация содержит папки, можно включить до 50 исходных записей, состоящих из файлов или папок.

      Ссылка на папку косвенно ссылается на файлы в этой папке. В этом случае ограничение на количество файлов, на которые ссылается (прямо или косвенно), равно 1000.

    Если вам требуется более 100 исходных файлов, разместите их в папки. Чтобы узнать, как использовать папки для размещения исходных файлов, см. раздел Pipeline asset browser в редакторе конвейера Lakeflow.

  • Наборы данных конвейера можно задать только один раз. Из-за этого они могут быть мишенью только одной операции во всех конвейерах. Исключением являются потоковые таблицы с обработкой потока добавления данных, которая позволяет записывать в потоковую таблицу из нескольких потоковых источников. См. потоки по умолчанию и добавляемые потоки.

  • Колонки идентификаторов имеют следующие ограничения. Дополнительные сведения о столбцах идентификаторов в таблицах Delta см. в разделе Столбцы идентификаторов.

    • Идентификационные столбцы не поддерживаются в таблицах, предназначенных для обработки AUTO CDC.
    • Столбцы идентификаторов могут быть пересчитаны во время обновления материализованных представлений. Из-за этого Databricks рекомендует использовать идентичные столбцы в пайплайнах только с потоковыми таблицами.
  • По умолчанию материализованные представления и потоковые таблицы доступны только клиентам и приложениям Azure Databricks. Чтобы сделать их доступными для внешних систем, см. статью Доступ к материализованным представлениям и потоковым таблицам с помощью внешних систем.

  • Существуют ограничения для вычислительных ресурсов Databricks, необходимых для запуска и выполнения запросов в конвейерах Unity Catalog. Ознакомьтесь с требованиями к каналам, размещающим данные в Unity Catalog.

  • Запросы с временным переходом Delta Lake поддерживаются только в потоковых таблицах и не поддерживаются с материальными представлениями. См. статью "Работа с журналом таблиц".

  • Функция pivot() не поддерживается. Операция pivot в Spark требует активной загрузки входных данных для вычисления выходной схемы. Эта возможность не поддерживается в конвейерах.

Квоты ресурсов конвейеров Lakeflow см. в разделе "Ограничения ресурсов".