Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
Azure Databricks предоставляет доступ к набору данных теста TPC-DS, широко используемому тесту для тестирования производительности систем, созданных для хранения данных и аналитики. Набор данных доступен по умолчанию в двух размерах в каждой рабочей области с поддержкой каталога Unity. Эти наборы данных идеально подходят для тестирования производительности Azure Databricks на стандартизованном тесте, который имитирует реалистичные бизнес-сценарии розничной и электронной коммерции. Дополнительные сведения об этом наборе данных см. в документации по TPC-DS бенчмарку.
Включенные сведения
Наборы данных TPC-DS доступны в каталоге samples со следующими схемами:
-
tpcds_sf1— небольшой набор данных (примерно 1 ГБ) -
tpcds_sf1000— масштабируемый набор данных (примерно 1 ТБ)
Оба набора данных имеют следующие качества:
- Доступны только для чтения и запрашиваются всеми пользователями в рабочей области.
- Совместимы с хранилищами SQL и кластерами всех целей
- Следуйте спецификации TPC-DS для стандартизированного тестирования
Предпосылки
У вас должен быть доступ к хранилищу SQL или кластеру всех целей.
Предварительный просмотр данных
Чтобы просмотреть данные в пользовательском интерфейсе обозревателя каталогов, выполните следующие действия.
- Щелкните
Каталог на боковой панели.
- Введите tpcds в строке поиска. Обе схемы находятся в каталоге
samples. Щелкните имя схемы, которую вы хотите просмотреть. - На вкладке "Обзор" перечислены все таблицы в схеме. Щелкните имя таблицы, чтобы открыть обзор столбцов и типов данных в этой таблице.
- Используйте верхнюю навигацию для просмотра примеров данных или сведений таблицы.
Запрос данных
В следующих запросах используется меньший масштабируемый набор tpcds_sf1данных. Чтобы использовать более крупный масштабируемый набор данных, замените имя схемы на tpcds_sf1000. Щелкните
SQL Editor на боковой панели, чтобы открыть редактор SQL. Затем используйте следующие запросы, чтобы начать изучение данных.
Предварительные версии таблиц
SHOW TABLES IN samples.tpcds_sf1;
Изучение таблицы
DESCRIBE TABLE samples.tpcds_sf1.customer;
SELECT * FROM samples.tpcds_sf1.customer LIMIT 10;
Пример соединения и агрегирования
SELECT
i_category,
d_year,
SUM(ss_net_paid) AS total_revenue
FROM samples.tpcds_sf1.store_sales ss
JOIN samples.tpcds_sf1.item i ON ss.ss_item_sk = i.i_item_sk
JOIN samples.tpcds_sf1.date_dim d ON ss.ss_sold_date_sk = d.d_date_sk
WHERE d.d_year = 2001
GROUP BY i_category, d_year
ORDER BY total_revenue DESC
LIMIT 10;
Лучшие практики
- Используйте журнал запросов и профиль запросов , чтобы понять характеристики производительности и определить возможности оптимизации.
- Начните с меньшего
tpcds_sf1набора данных для первоначального тестирования, а затем масштабируйте доtpcds_sf1000комплексной оценки производительности. - Сравните производительность запросов в разных размерах хранилища SQL, чтобы определить оптимальные конфигурации для рабочих нагрузок.
- Используйте эти стандартизированные наборы данных для создания базовых показателей производительности и отслеживания улучшений с течением времени.