Перейти к основному содержанию
Azure Synapse — это интегрированный сервис аналитики, который объединяет большие данные, data science и хранилища данных, обеспечивая быстрый анализ данных в большом масштабе. В Synapse пулы Spark предоставляют масштабируемые кластеры Apache Spark по запросу, позволяя выполнять сложные преобразования данных, задачи машинного обучения и интеграции с внешними системами. В этой статье показано, как использовать коннектор ClickHouse Spark при работе с Apache Spark в Azure Synapse.

Добавьте зависимости коннектора

Azure Synapse поддерживает три уровня управления пакетами:
  1. Пакеты по умолчанию
  2. Уровень пула Spark
  3. Уровень сеанса

Следуйте руководству Manage libraries for Apache Spark pools и добавьте в приложение Spark следующие обязательные зависимости Ознакомьтесь с нашей документацией Матрица совместимости коннектора Spark, чтобы понять, какие версии лучше всего подходят для ваших задач.

Добавьте ClickHouse как каталог

Добавить конфигурации Spark в ваш сеанс можно несколькими способами:
  • Использовать пользовательский файл конфигурации, загружаемый вместе с сеансом
  • Добавить конфигурации через интерфейс Azure Synapse
  • Добавить конфигурации в ноутбуке Synapse
Следуйте руководству Manage Apache Spark configuration и добавьте требуемые коннектором конфигурации Spark. Например, сеанс Spark в ноутбуке можно настроить с помощью следующих параметров:
Убедитесь, что в первой ячейке указано следующее: Дополнительные настройки см. на странице конфигурации ClickHouse Spark.
При работе с ClickHouse Cloud обязательно задайте необходимые настройки Spark.

Проверка настройки

Чтобы убедиться, что зависимости и конфигурации заданы успешно, откройте Spark UI для вашего сеанса и перейдите на вкладку Environment. Там найдите параметры, связанные с ClickHouse:

Дополнительные ресурсы

Последнее изменение 12 июня 2026 г.