pg_parquet
概览
| 扩展包名 | 版本 | 分类 | 许可证 | 语言 |
|---|---|---|---|---|
pg_parquet | 0.5.1 | OLAP | PostgreSQL | Rust |
| ID | 扩展名 | Bin | Lib | Load | Create | Trust | Reloc | 模式 |
|---|---|---|---|---|---|---|---|---|
| 2480 | pg_parquet | 否 | 是 | 是 | 是 | 否 | 否 | - |
| 相关扩展 | file_fdw aws_s3 pg_bulkload pg_lake pg_ducklake pg_duckdb pg_mooncake pg_fact_loader pg_csv omni_csv |
|---|
版本
| 类型 | 仓库 | 版本 | PG 大版本 | 包名 | 依赖 |
|---|---|---|---|---|---|
| EXT | PIGSTY | 0.5.1 | 1817161514 | pg_parquet | - |
| RPM | PIGSTY | 0.5.1 | 1817161514 | pg_parquet_$v | - |
| DEB | PIGSTY | 0.5.1 | 1817161514 | postgresql-$v-pg-parquet | - |
构建
您可以使用 pig build 命令构建 pg_parquet 扩展的 RPM / DEB 包:
安装
您可以直接安装 pg_parquet 扩展包的预置二进制包,首先确保 PGDG 和 PIGSTY 仓库已经添加并启用:
使用 pig 或者是 apt/yum/dnf 安装扩展:
预加载配置:
创建扩展:
用法
pg_parquet 主要提供以下三项功能:
- 将 PostgreSQL 表/查询结果导出为 Parquet 文件,
- 将 Parquet 文件中的数据导入到 PostgreSQL 表中,
- 查看 Parquet 文件的模式与元数据信息。
使用 COPY 在 Parquet 文件与 PostgreSQL 表之间导入导出
可以使用 PostgreSQL 的 COPY 命令来读写 Parquet 文件。以下示例演示了如何将包含复合类型的 PostgreSQL 表写入 Parquet 文件,然后再将该 Parquet 文件的内容读回同一张表。
此外,也可以使用 COPY 命令通过标准输入/输出读写 Parquet 流。以下是使用示例(必须指定 format = parquet):
查看 Parquet 文件模式
调用 SELECT * FROM parquet.schema(<uri>) 可查看指定 URI 处 Parquet 文件的模式信息。
查看 Parquet 元数据
调用 SELECT * FROM parquet.metadata(<uri>) 可查看指定 URI 处 Parquet 文件的详细元数据,例如列统计信息等。
调用 SELECT * FROM parquet.file_metadata(<uri>) 可查看指定 URI 处 Parquet 文件的文件级元数据,例如格式版本等。
调用 SELECT * FROM parquet.kv_metadata(<uri>) 可查询指定 URI 处 Parquet 文件的自定义键值元数据。
查看 Parquet 列统计信息
调用 SELECT * FROM parquet.column_stats(<uri>) 可查看指定 URI 处 Parquet 文件的列统计信息,例如列的最小值和最大值等。
这个页面对您有帮助吗?
感谢反馈,我们会据此改进这篇文档。
哪里没有解决?(可选)