网站首页 > 知识剖析 正文
mysql支持的join算法
- Nested Loop Join
- Index Nested-Loop Join
- Block Nested-Loop Join
Index Nested-Loop Join 和 Block Nested-Loop Join是在Nested-Loop Join基础上做了优化。
Nested Loop Join
Nested-Loop Join的思想就是通过双层循环比较数据来获得结果; 其中左表为外循环,右表为内循环,左表为驱动表。其实现逻辑简单粗暴,可以理解为两层for循环,小表在外环,大表在内环,数据比较的次数 = 小表记录数 * 大表记录数。
//select * from t1 inner join t2 on t1.a= t2.a;
List<结果> lists = new ArrayList<>();
for(t2 t2 : t2){ //外层循环
for(t1 t1 : t1){ //内循环
if(t2.a().equals(t1.a())){ //条件匹配
//存放结果到结果集
结果 = t1的字段 + t2的字段
lists.add(结果集);
}
}
}
索引嵌套循环连接 Index Nested-Loop Join
优化思路:内表为大表,可在join字段上建立索引,减少内表数据的扫描次数。
执行流程:
0.前置条件:外表 t2 已在连接用的 a 字段以建立索引;
1.从外表 t1 中读取一行数据 R;
2.使用 R 中的a 字段和内表 t2 的 a 字段进行索引关联查找;
3.根据索引到的记录取出表 t2 中满足条件的行,跟 R 组成一行,作为结果集的一部分;
4.重复执行步骤 1 到 3,直到表 t1 循环结束。
可见,通过索引的建立,避免了对大表进行全表扫描,加快了查询速度。
缓存块嵌套循环连接 Block Nested-Loop Join
优化思路:通过一次性缓存多条数据,减少外层表的循环次数。
t1为小表时的执行流程:
1.把t1 表查询的字段数据整个读入线程内存 join_buffer 中;
2.扫描表 t2,把表 t2 中的每一行取出来,跟 join_buffer 中的 数据做对比,满足 join 条件的,作为结果集的一部分返回。
t1为大表时的执行流程: 1.扫描表 t1,顺序读取一定长度的数据行放入 join_buffer 中;
2.扫描表 t2,把 t2 中的每一行取出来,跟 join_buffer 中的数据做对比,满足 join 条件的,作为结果集的一部分返回;
3.清空 join_buffer;
4.顺序读取 t1表下一批次数据放入 join_buffer 中,重复步骤2
Oracle的join算法
- Nested Loop Join,嵌套循环
- Hash Join,将两个表中较小的一个在内存中构造一个 Hash 表(对JoinKey),扫描另一个表
- Sort Merge Join,将两个表排序,然后再进行join
DB2和SQL Server也使用这三种方式join算法。
Hash Join
Hash Join的使用场景:
- 适合于小表与大表连接、返回大型结果集的连接
- 只能用于等值连接,且只能在CBO优化器模式下
在inner/left/right join,以及union/group by等 都会使用hash join进行操作。
实现原理:
Hash Join中的小表称之为hash表,大表称为探查表,以小表作为驱动表。
- 两个输入:
– build input(也叫做outer input),小表
– probe input(也叫做inner input),大表
- 两个阶段:
– Build(构造)阶段,处理build input
– Probe(探测)阶段,探测probe input
build 阶段,主要是构造哈希表(hash table):
- 在inner/left/right join等操作中,表关联字段作为hash key
- 在group by操作中,group by的字段作为hash key;
- 在union或其它去重操作中,hash key包括所有的select字段。
一个hash值对应到hash table中的hash buckets。多个hash buckets可以使用链表数据结构连接起来。
Probe 阶段,从probe input中取出每一行记录,根据key值生成hash值,从build阶段构造的hash table中搜索对应的hash bucket。
- Grace Hash join
以上为数据库常见的JOIN算法,「分布式技术专题」是国产数据库hubble团队精心整编,专题会持续更新,欢迎大家保持关注。
猜你喜欢
- 2025-05-11 产品切换数据库问题处理总结(切换数据库的命令是什么)
- 2025-05-11 真正让你明白Hive参数调优系列1:控制map个数与性能调优参数
- 2025-05-11 拉链表(拉链表取数)
- 2025-05-11 常见的数据库类型有哪些 & SQL介绍
- 2025-05-11 每日SQL自学知识点(第八天)—多表查询详解
- 2025-05-11 大厂必问:MySQL 三表 JOIN 操作的解析与性能优化,效率又如何?
- 2025-05-11 数据库(数据库有哪些)
- 2025-05-11 干货!SQL性能优化,书写高质量SQL语句
- 2025-05-11 Linq 下的扩展方法太少了,MoreLinq 来啦
- 2025-05-11 mysql学习3:select基础---单表查询
- 05-11产品切换数据库问题处理总结(切换数据库的命令是什么)
- 05-11真正让你明白Hive参数调优系列1:控制map个数与性能调优参数
- 05-11拉链表(拉链表取数)
- 05-11常见的数据库类型有哪些 & SQL介绍
- 05-11每日SQL自学知识点(第八天)—多表查询详解
- 05-11大厂必问:MySQL 三表 JOIN 操作的解析与性能优化,效率又如何?
- 05-11数据库(数据库有哪些)
- 05-11干货!SQL性能优化,书写高质量SQL语句
- 最近发表
- 标签列表
-
- xml (46)
- css animation (57)
- array_slice (60)
- htmlspecialchars (54)
- position: absolute (54)
- datediff函数 (47)
- array_pop (49)
- jsmap (52)
- toggleclass (43)
- console.time (63)
- .sql (41)
- ahref (40)
- js json.parse (59)
- html复选框 (60)
- css 透明 (44)
- css 颜色 (47)
- php replace (41)
- css nth-child (48)
- min-height (40)
- xml schema (44)
- css 最后一个元素 (46)
- location.origin (44)
- table border (49)
- html tr (40)
- video controls (49)