数据仓库服务 GAUSSDB(DWS)-案例:选择合适的分布列:优化前

时间:2024-07-01 10:52:16

优化前

将a作为t1和t2的分布列,表定义如下:

1
2
CREATE TABLE t1 (a int, b int) DISTRIBUTE BY HASH (a);
CREATE TABLE t2 (a int, b int) DISTRIBUTE BY HASH (a);

执行如下查询:

1
SELECT * FROM t1, t2 WHERE t1.a = t2.b;

则执行计划存在“Streaming(type: REDISTRIBUTE)”,即DN根据选定的列把数据重分布到所有的DN,这将导致DN之间存在较大通信数据量,如图1所示。

图1 选择合适的分布列案例(一)
support.huaweicloud.com/performance-dws/dws_10_0042.html