Что такое Data Engineering Microsoft Fabric?

Microsoft Fabric Data Engineering позволяет пользователям проектировать, создавать и поддерживать инфраструктуры и системы, которые позволяют их организациям собирать, хранить, обрабатывать и анализировать большие объемы данных.

Fabric предоставляет различные возможности инженерии данных, чтобы ваши данные были легко доступны, хорошо организованы и качественны. Чтобы получить доступ к домашней странице инженерии данных, выберите Рабочие нагрузки в области навигации, а затем щелкните плитку Инженерия данных. На главной странице инженерии данных можно:

  • Создание данных и управление ими с помощью lakehouse

  • Проектирование конвейеров для копирования данных в lakehouse

  • Использование определений заданий Spark для отправки задания пакетной или потоковой передачи в кластер Spark

  • Использование записных книжек для записи кода для приема данных, подготовки и преобразования

    Снимок экрана: объекты инженерии данных.

Лейкхаус

Lakehouse — это архитектуры данных, которые позволяют организациям хранить структурированные и неструктурированные данные в одном расположении, используя различные инструменты и платформы для обработки и анализа данных. Эти средства и платформы могут включать запросы и аналитику на основе SQL, а также машинное обучение и другие методы расширенной аналитики.

Определение задания Apache Spark

Определения заданий Spark — это набор инструкций, определяющих выполнение задания в кластере Spark. Она содержит такие сведения, как источники входных и выходных данных, преобразования и параметры конфигурации для приложения Spark. Определение задания Spark позволяет отправлять пакетное или потоковое задание в кластер Spark, применять другую логику преобразования к данным, размещенным в lakehouse, вместе со многими другими вещами.

Записная книжка

Записные книжки — это интерактивная среда вычислений, которая позволяет пользователям создавать и совместно использовать документы, содержащие динамический код, уравнения, визуализации и текст повествования. Они позволяют пользователям писать и выполнять код на различных языках программирования, включая Python, R и Scala. Записные книжки можно использовать для приема данных, подготовки, анализа и других задач, связанных с данными.

Pipeline

Конвейеры — это ряд шагов, которые могут собирать, обрабатывать и преобразовывать данные из необработанной формы в формат, который можно использовать для анализа и принятия решений. Они являются критически важным компонентом проектирования данных, так как они предоставляют способ перемещения данных из источника в его назначение в надежный, масштабируемый и эффективный способ.

Вы можете бесплатно воспользоваться Data Engineering при регистрации на пробный период Fabric. Вы также можете приобрести Fabric capacity или Fabric reserved

Начало работы с инженерией данных: