Использование примера набора данных TPC-DS для оценки производительности системы

Azure Databricks предоставляет доступ к набору данных теста TPC-DS, широко используемому тесту для тестирования производительности систем, созданных для хранения данных и аналитики. Набор данных доступен по умолчанию в двух размерах в каждой рабочей области с поддержкой каталога Unity. Эти наборы данных идеально подходят для тестирования производительности Azure Databricks на стандартизованном тесте, который имитирует реалистичные бизнес-сценарии розничной и электронной коммерции. Дополнительные сведения об этом наборе данных см. в документации по TPC-DS бенчмарку.

Включенные сведения

Наборы данных TPC-DS доступны в каталоге samples со следующими схемами:

  • tpcds_sf1 — небольшой набор данных (примерно 1 ГБ)
  • tpcds_sf1000 — масштабируемый набор данных (примерно 1 ТБ)

Оба набора данных имеют следующие качества:

  • Доступны только для чтения и запрашиваются всеми пользователями в рабочей области.
  • Совместимы с хранилищами SQL и кластерами всех целей
  • Следуйте спецификации TPC-DS для стандартизированного тестирования

Предпосылки

У вас должен быть доступ к хранилищу SQL или кластеру всех целей.

Предварительный просмотр данных

Чтобы просмотреть данные в пользовательском интерфейсе обозревателя каталогов, выполните следующие действия.

  1. Щелкните значок данных.Каталог на боковой панели.
  2. Введите tpcds в строке поиска. Обе схемы находятся в каталоге samples . Щелкните имя схемы, которую вы хотите просмотреть.
  3. На вкладке "Обзор" перечислены все таблицы в схеме. Щелкните имя таблицы, чтобы открыть обзор столбцов и типов данных в этой таблице.
  4. Используйте верхнюю навигацию для просмотра примеров данных или сведений таблицы.

Запрос данных

В следующих запросах используется меньший масштабируемый набор tpcds_sf1данных. Чтобы использовать более крупный масштабируемый набор данных, замените имя схемы на tpcds_sf1000. Щелкните значок редактора SQLSQL Editor на боковой панели, чтобы открыть редактор SQL. Затем используйте следующие запросы, чтобы начать изучение данных.

Предварительные версии таблиц

SHOW TABLES IN samples.tpcds_sf1;

Изучение таблицы

DESCRIBE TABLE samples.tpcds_sf1.customer;
SELECT * FROM samples.tpcds_sf1.customer LIMIT 10;

Пример соединения и агрегирования

SELECT
  i_category,
  d_year,
  SUM(ss_net_paid) AS total_revenue
FROM samples.tpcds_sf1.store_sales ss
JOIN samples.tpcds_sf1.item i ON ss.ss_item_sk = i.i_item_sk
JOIN samples.tpcds_sf1.date_dim d ON ss.ss_sold_date_sk = d.d_date_sk
WHERE d.d_year = 2001
GROUP BY i_category, d_year
ORDER BY total_revenue DESC
LIMIT 10;

Лучшие практики

  • Используйте журнал запросов и профиль запросов , чтобы понять характеристики производительности и определить возможности оптимизации.
  • Начните с меньшего tpcds_sf1 набора данных для первоначального тестирования, а затем масштабируйте до tpcds_sf1000 комплексной оценки производительности.
  • Сравните производительность запросов в разных размерах хранилища SQL, чтобы определить оптимальные конфигурации для рабочих нагрузок.
  • Используйте эти стандартизированные наборы данных для создания базовых показателей производительности и отслеживания улучшений с течением времени.