Azure Cosmos DB (облачная база данных)

Внимание

Эта документация устарела и может не обновляться в дальнейшем. Смотрите официальный репозиторий Github соединителя Cosmos DB Spark.

Azure Cosmos DB — это глобально распределенная база данных Майкрософт с несколькими моделями. Azure Cosmos DB позволяет эластично и независимо масштабировать пропускную способность и хранилище в любом количестве географических регионов Azure. Она гарантирует пропускную способность, задержку, доступность и согласованность в соответствии с комплексными Соглашениями об уровне обслуживания (SLA). Azure Cosmos DB предоставляет API с пакетами SDK, доступными на нескольких языках, для следующих моделей данных:

  • API SQL
  • API MongoDB
  • API Cassandra
  • API Graph (Gremlin);
  • API таблиц

В этой статье объясняется, как считывать данные из и записывать их в Azure Cosmos DB с помощью Azure Databricks. Для получения более актуальной и подробной информации об Azure Cosmos DB см. Ускорение аналитики больших данных с помощью соединителя Apache Spark для Azure Cosmos DB.

Ресурсы:

Внимание

Этот соединитель поддерживает основной API (SQL) Azure Cosmos DB. Для API Cosmos DB для MongoDB используйте соединитель MongoDB Spark. Для API Cassandra в Cosmos DB используйте Cassandra Spark-коннектор.

Создание и присоединение необходимых библиотек

  1. Скачайте последнюю версию библиотеки azure-cosmosdb-spark для версии Apache Spark, которую вы используете.
  2. Отправьте скачанные JAR-файлы в Databricks. См. раздел "Установка библиотек".
  3. Установка загруженных библиотек в кластер Databricks.