Pular para o conteúdo principal
A fundação Apache lançou vários formatos de dados amplamente usados em ambientes de analytics, incluindo os populares Avro, Arrow e Orc. O ClickHouse oferece suporte à importação e à exportação de dados usando qualquer um deles.

Importando e exportando no formato Avro

O ClickHouse oferece suporte à leitura e à gravação de arquivos de dados Apache Avro, amplamente utilizados em sistemas Hadoop. Para importar de um arquivo Avro, devemos usar o formato Avro na instrução INSERT:
Com a função file(), também podemos explorar arquivos Avro antes de importar os dados de fato:
Para exportar para um arquivo Avro:

Avro e os tipos de dados do ClickHouse

Considere a correspondência entre tipos de dados ao importar ou exportar arquivos Avro. Use conversão explícita de tipos ao carregar dados de arquivos Avro:

Mensagens Avro no Kafka

Quando as mensagens do Kafka usam o formato Avro, ClickHouse pode ler esses fluxos usando o formato AvroConfluent e o motor Kafka:

Trabalhando com o formato Arrow

Outro formato colunar é o Apache Arrow, também suportado pelo ClickHouse para importação e exportação. Para importar dados de um arquivo Arrow, usamos o formato Arrow:
A exportação para arquivo Arrow funciona da mesma forma:
Além disso, consulte correspondência entre tipos de dados para saber se algum deles precisa ser convertido manualmente.

Streaming de dados Arrow

O formato ArrowStream pode ser usado para trabalhar com streaming do Arrow (usado para processamento em memória). O ClickHouse pode ler e gravar streams Arrow. Para demonstrar como o ClickHouse pode transmitir dados Arrow, vamos redirecioná-los para o seguinte script Python (ele lê o stream de entrada no formato Arrow streaming e gera o resultado como uma tabela do Pandas):
Agora podemos transmitir dados do ClickHouse canalizando sua saída para o script:
O ClickHouse também pode ler streams do Arrow usando o mesmo formato ArrowStream:
Usamos arrow-stream como uma possível fonte de dados Arrow em streaming.

Importação e exportação de dados ORC

O Apache ORC é um formato de armazenamento colunar normalmente usado no Hadoop. O ClickHouse oferece suporte tanto à importação quanto à exportação de dados ORC usando o formato ORC:
Além disso, consulte correspondência entre tipos de dados e configurações adicionais para ajustar a exportação e a importação.

Leitura adicional

O ClickHouse oferece suporte a muitos formatos, tanto de texto quanto binários, para atender a diversos cenários e plataformas. Explore mais formatos e maneiras de trabalhar com eles nos artigos a seguir: Confira também o clickhouse-local - uma ferramenta portátil e completa para trabalhar com arquivos locais/remotos sem a necessidade do servidor ClickHouse.
Última modificação em 12 de junho de 2026