Памятка по подготовке данных

Высокая производительность бизнес-аналитики зависит от того, насколько эффективно данные подготовлены и доставлены из Lakehouse. Внедряя архитектурные шаблоны, применяя семантические структуры и используя целевые оптимизации, вы можете уменьшить сложность запросов, повысить скорость реагирования на панель мониторинга и снизить затраты на вычисления.

В следующей таблице приведены рекомендации, ожидаемые последствия, связанная документация и связанные элементы действий. Это содержимое предназначено для разработчиков данных, разработчиков бизнес-аналитики и авторов панелей мониторинга, которые разрабатывают, оптимизируют и поддерживают рабочие нагрузки аналитики в Lakehouse.

Подготовка данных

Лучшие практики Воздействие Docs Элементы действия
Внедрение архитектуры медальона Ускоряет преобразование необработанных данных в готовые к использованию надежные продукты данных для простого потребления. Просмотр и реализация уровней медальона
Использование жидкой кластеризации Повышает производительность запросов с помощью пропуска файлов и данных. Применение к большим таблицам с шаблонами фильтров
Использование управляемых таблиц Azure Databricks автоматически управляет и оптимизирует уровень хранения и производительность запросов. Создание управляемых таблиц для данных
Использование прогнозной оптимизации или оптимизации таблиц вручную Обеспечивает более высокую производительность запросов, оптимизируя размеры файлов и макет, удаляя старые файлы и обновляя статистику. Включение рабочих таблиц или планирование регулярной оптимизации и анализа таблиц после изменений данных
Моделируйте данные по шаблону звездной схемы Упрощает запрос и использование данных. Разработка таблиц фактов и измерений
Избегайте широких типов данных и столбцов с высокой кардинальностью Оптимизирует размер модели данных и потребление памяти и повышает эффективность запросов. Обзор типов данных и кардинальности
Объявление первичных и внешних ключей (с ПОМОЩЬЮ RELY) Оптимизирует запросы, устраняя ненужные соединения и агрегаты. Определение ключей для таблиц фактов и измерений
Использование автоматически созданных столбцов Сокращает необходимость вычисления значений во время запроса. Определение часто вычисляемых полей
Использование материализованных представлений и сохраненных таблиц Повышает производительность путем предварительной агрегирования данных для наиболее распространенных и ресурсоемких запросов. Создание агрегированных представлений для распространенных запросов