Индексы фильтров Блума (устаревшие)

Important

Не используйте индексы фильтров Блум. Azure Databricks не рекомендует эту функцию и рекомендует удалить все существующие индексы фильтров Блум из таблиц.

Индексы Bloom-фильтров являются устаревшим механизмом пропуска данных, который Azure Databricks больше не рекомендует использовать для любых рабочих нагрузок. Они добавляют затраты на запись, трудно настроить и заменяются более эффективными альтернативами.

Используйте следующие функции.

  • Прогнозный ввод-вывод: при вычислении с поддержкой Photon с databricks Runtime 12.2 и более поздних версий прогнозный ввод-вывод выполняет пропуск файлов во всех столбцах автоматически. Полностью заменяет индексы фильтров Блум, которые добавляют только нагрузку на запись при включении Photon.
  • Кластеризация жидкости. В Databricks Runtime 13.3 и более поздних версиях кластеризация жидкости улучшает пропуск данных путем организации данных на основе часто фильтруемых столбцов.

Удаление существующих индексов фильтров Блума

Если у вас есть индексы фильтров Блум в таблицах, удалите их, чтобы исключить ненужные затраты на запись:

DROP BLOOMFILTER INDEX ON TABLE table_name

Сведения о синтаксисе см. в DROP BLOOM FILTER INDEX.

После удаления всех индексов фильтров Блум выполните команду VACUUM , чтобы очистить базовые файлы индексов в каталоге _delta_index .