Прием данных в OneLake и анализ с помощью Azure Databricks

В руководстве описаны следующие действия:

  • Создайте конвейер в рабочей области и загрузите данные в OneLake в формате Delta.

  • Чтение и изменение таблицы Delta в OneLake с помощью Azure Databricks.

Предварительные требования

Перед началом работы необходимо:

  • Рабочая область с элементом Lakehouse.

  • Рабочая область Azure Databricks уровня "Премиум". Только рабочие области Azure Databricks класса Premium поддерживают сквозную передачу учетных данных Microsoft Entra. При создании кластера включите сквозную передачу учетных данных Azure Data Lake Storage в разделе Дополнительные параметры.

Загрузите данные и измените таблицу Delta

  1. Перейдите к вашему Lakehouse в службе Power BI, выберите Получить данные, затем выберите Создать конвейер.

    Снимок экрана, демонстрирующий, как перейти к новому параметру конвейера из пользовательского интерфейса.

  2. В командной строке "Создать конвейер" введите имя нового конвейера и нажмите кнопку "Создать".

  3. Для этого упражнения выберите NYC Taxi — зеленый пример данных в качестве источника данных.

    Снимок экрана, показывающий, как выбрать образец семантической модели NYC.

  4. На экране предварительного просмотра нажмите кнопку "Далее".

  5. В качестве назначения данных выберите имя lakehouse, которое вы хотите использовать для хранения данных таблицы Delta в OneLake. Вы можете выбрать существующий «lakehouse» или создать новый.

    Снимок экрана: выбор целевого озера.

  6. Выберите место для хранения выходных данных. Выберите таблицы в качестве корневой папки. Введите "nycsample" в качестве имени таблицы и нажмите кнопку "Далее".

  7. На экране "Проверка и сохранение" выберите "Сразу начать передачу данных", а затем выберите "Сохранить и запустить".

    Снимок экрана: ввод имени таблицы.

  8. Когда задание будет завершено, перейдите в свой lakehouse и просмотрите таблицу Delta, указанную в папке /Tables.

  9. Щелкните правой кнопкой мыши имя созданной таблицы, выберите "Свойства" и скопируйте путь файловой системы BLOB-объектов Azure (ABFS).

  10. Откройте записную книжку Azure Databricks. Прочитайте таблицу Delta в OneLake.

    olsPath = "abfss://<replace with workspace name>@onelake.dfs.fabric.microsoft.com/<replace with item name>.Lakehouse/Tables/nycsample" 
    df=spark.read.format('delta').option("inferSchema","true").load(olsPath)
    df.show(5)
    
  11. Обновите данные таблицы Delta, изменив значение поля.

    %sql
    update delta.`abfss://<replace with workspace name>@onelake.dfs.fabric.microsoft.com/<replace with item name>.Lakehouse/Tables/nycsample` set vendorID = 99999 where vendorID = 1;