工程设计
Cluster Key 最佳实践:列怎么选、顺序怎么排与粒度设计
不要把所有高频过滤列依次写进 CLUSTER BY。先找到累计扫描成本最高的一组查询,再选择它们长期共享、能够排除大量 Blocks 的谓词;根据典型查询窗口确定时间粒度,根据访问路径决定复合 Key 顺序;最后同时使用 clustering_information 和 EXPLAIN ANALYZE 验证数据布局与实际扫描收益。本文面向熟悉 SQL、过滤谓词和基本 OLAP 查询分析的数据工程师。文中的实验来自特定版本和受控数据布局,重点是展示选择方法,不是给出一组可以直接外推到所有 Workloads 的性能数字。






