Skip to main content
Значительная часть мировых данных хранится в бакетах Amazon S3. В этом руководстве мы рассмотрим, как выполнять запросы к этим данным с помощью chDB.

Подготовка

Сначала создадим виртуальное окружение:
А теперь установим chDB. Убедитесь, что у вас установлена версия 2.0.2 или выше:
Теперь установим IPython:
Мы будем использовать ipython для выполнения команд в оставшейся части этого руководства. Запустить его можно так:
Вы также можете использовать этот код в Python-скрипте или в привычном ноутбуке.

Изучение метаданных Parquet

Мы рассмотрим файл Parquet из датасета Amazon reviews. Но сначала установим chDB:
При выполнении запросов к файлам Parquet можно использовать входной формат ParquetMetadata, чтобы он возвращал метаданные Parquet вместо содержимого файла. Давайте используем инструкцию DESCRIBE, чтобы посмотреть, какие поля возвращаются при использовании этого формата:
Теперь давайте рассмотрим метаданные этого файла. И columns, и row_groups содержат массивы кортежей со множеством свойств, поэтому пока исключим их из рассмотрения.
Из этого вывода видно, что этот файл Parquet содержит более 40 миллионов строк, распределённых по 42 группам строк, с 15 столбцами данных в каждой строке. Группа строк — это логическое горизонтальное разбиение данных на строки. С каждой группой строк связаны метаданные, и инструменты запросов могут использовать их для эффективной работы с файлом. Давайте рассмотрим одну из групп строк:

Выполнение запросов к файлам Parquet

Далее выполним запрос к содержимому файла. Для этого изменим приведённый выше запрос: уберём ParquetMetadata и, например, вычислим самое популярное значение star_rating среди всех отзывов:
Интересно, что отзывов с 5 звёздами больше, чем всех остальных оценок вместе взятых! Похоже, людям нравятся товары на Amazon, а если не нравятся, они просто не ставят оценку.
Последнее изменение 10 июня 2026 г.