메인 콘텐츠로 건너뛰기
전 세계 데이터의 상당수는 Amazon S3 버킷에 저장되어 있습니다. 이 가이드에서는 chDB를 사용해 해당 데이터를 쿼리하는 방법을 알아봅니다.

설정

먼저 가상 환경을 생성합니다:
이제 chDB를 설치하겠습니다. 버전 2.0.2 이상인지 확인하십시오:
이제 IPython을 설치합니다:
이 가이드의 나머지 부분에 나오는 명령은 ipython으로 실행하며, 다음 명령으로 시작할 수 있습니다:
Python 스크립트나 자주 사용하는 노트북에서도 이 코드를 사용할 수 있습니다.

Parquet 메타데이터 살펴보기

Amazon 리뷰 데이터셋의 Parquet 파일을 살펴보겠습니다. 먼저 chDB를 설치합니다:
Parquet 파일을 쿼리할 때 ParquetMetadata 입력 형식을 사용하면 파일 내용 대신 Parquet 메타데이터를 반환할 수 있습니다. 이 포맷을 사용할 때 반환되는 필드를 확인하기 위해 DESCRIBE 절을 사용해 보겠습니다:
이제 이 파일의 메타데이터를 살펴보겠습니다. columnsrow_groups는 모두 많은 속성을 담은 튜플 배열을 포함하므로, 지금은 제외하겠습니다.
이 출력에서 이 Parquet 파일에는 4천만 개가 넘는 행이 있으며, 42개의 row group으로 나뉘어 있고 각 행에는 15개의 데이터 컬럼이 있음을 알 수 있습니다. row group은 데이터를 행 단위로 논리적으로 수평 분할한 단위입니다. 각 row group에는 관련 메타데이터가 있으며, 쿼리 도구는 이 메타데이터를 활용해 파일을 효율적으로 쿼리할 수 있습니다. 이제 row group 중 하나를 살펴보겠습니다:

Parquet 파일 쿼리하기

다음으로 파일의 내용을 쿼리해 보겠습니다. 이를 위해 앞의 쿼리에서 ParquetMetadata를 제거한 뒤, 예를 들어 모든 리뷰에서 가장 많은 star_rating을 계산할 수 있습니다:
흥미롭게도 별 5개 리뷰가 다른 모든 평점을 합친 것보다 더 많습니다! 사람들이 Amazon의 상품을 좋아하는 듯하며, 그렇지 않더라도 아예 평점을 남기지 않는 것 같습니다.
마지막 수정일 2026년 6월 12일