datasketches
PostgreSQL 近似分析摘要数据结构与聚合函数
仓库
apache/datasketches-postgresql
https://github.com/apache/datasketches-postgresql
源码
apache-datasketches-postgresql-1.7.0-src.tar.gz
apache-datasketches-postgresql-1.7.0-src.tar.gz
概览
| 扩展包名 | 版本 | 分类 | 许可证 | 语言 |
|---|---|---|---|---|
datasketches | 1.7.0 | FUNC | Apache-2.0 | C++ |
| ID | 扩展名 | Bin | Lib | Load | Create | Trust | Reloc | 模式 |
|---|---|---|---|---|---|---|---|---|
| 4690 | datasketches | 否 | 是 | 否 | 是 | 否 | 是 | - |
Built against Apache DataSketches C++ core 5.0.0.
版本
| 类型 | 仓库 | 版本 | PG 大版本 | 包名 | 依赖 |
|---|---|---|---|---|---|
| EXT | PIGSTY | 1.7.0 | 1817161514 | datasketches | - |
| RPM | PIGSTY | 1.7.0 | 1817161514 | datasketches_$v | - |
| DEB | PIGSTY | 1.7.0 | 1817161514 | postgresql-$v-datasketches | - |
构建
您可以使用 pig build 命令构建 datasketches 扩展的 RPM / DEB 包:
安装
您可以直接安装 datasketches 扩展包的预置二进制包,首先确保 PGDG 和 PIGSTY 仓库已经添加并启用:
使用 pig 或者是 apt/yum/dnf 安装扩展:
安装
pig
dnf
apt
创建扩展:
用法
来源:README, latest release 1.7.0, Apache DataSketches
datasketches 为 PostgreSQL 增加近似分析 sketch 类型与聚合。上游 README 列出 CPC、HLL、Theta、Array Of Doubles、KLL、Quantiles 与 Frequent Strings sketch;GitHub 最新正式 release 为 1.7.0,默认分支已经推进到 1.8.0-SNAPSHOT。
核心 Sketch 家族
cpc_sketch与hll_sketch用于近似去重计数。theta_sketch用于去重计数,并支持 union、intersection、A-not-B 等集合运算。aod_sketch用于按标识符维护 double 数组形式的 tuple 指标。kll_*_sketch与quantiles_*_sketch用于分位数、rank、PMF 与 CDF。frequent_strings_sketch用于检测 high-hitter。
常见模式
从原始值构建 sketch:
使用一次性近似聚合:
在分组或 cube 维度之间合并 sketch:
对 Theta sketch 执行集合运算:
查找超过阈值的高频项:
注意事项
- 上游文档要求 PostgreSQL 9.6+,并依赖 Boost 1.75.0 与 DataSketches C++ core 5.0.0 或更高版本。
- 这些结构是可跨维度合并的近似结构,不是
COUNT(DISTINCT ...)或精确直方图的直接替代。
这个页面对您有帮助吗?
感谢反馈,我们会据此改进这篇文档。
哪里没有解决?(可选)