目录

mysql limit offset 原理分析与使用

警告
本文最后更新于 2021-03-16,文中内容可能已过时。

本文由原作者归档自 CSDN,原文发布于 2021-03-16。原文链接:mysql limit offset 原理分析与使用

一个行数为4亿条的表。

图 1

查询50000000~50000010行之间的数据。发现查询时间达到20s!!!

图 2

查询执行计划发现,需要进行全表扫描,没有索引。

图 3

但是,sbtest1这个表是有索引的

图 4

为什么mysql没有选择索引,而是全表扫描呢?

SELECT
    [ALL | DISTINCT | DISTINCTROW ]
    [HIGH_PRIORITY]
    [STRAIGHT_JOIN]
    [SQL_SMALL_RESULT] [SQL_BIG_RESULT] [SQL_BUFFER_RESULT]
    [SQL_NO_CACHE] [SQL_CALC_FOUND_ROWS]
    select_expr [, select_expr] ...
    [into_option]
    [FROM table_references
      [PARTITION partition_list]]
    [WHERE where_condition]
    [GROUP BY {col_name | expr | position}, ... [WITH ROLLUP]]
    [HAVING where_condition]
    [WINDOW window_name AS (window_spec)
        [, window_name AS (window_spec)] ...]
    [ORDER BY {col_name | expr | position}
      [ASC | DESC], ... [WITH ROLLUP]]
    [LIMIT {[offset,] row_count | row_count OFFSET offset}]
    [into_option]
    [FOR {UPDATE | SHARE}
        [OF tbl_name [, tbl_name] ...]
        [NOWAIT | SKIP LOCKED]
      | LOCK IN SHARE MODE]
    [into_option]

into_option: {
    INTO OUTFILE 'file_name'
        [CHARACTER SET charset_name]
        export_options
  | INTO DUMPFILE 'file_name'
  | INTO var_name [, var_name] ...
}

https://dev.mysql.com/doc/refman/8.0/en/select.html

MySQL的limit m n工作原理就是先读取前面m+n条记录,然后抛弃前m条,读后面n条想要的,所以m越大,偏移量越大,性能就越差。 https://cloud.tencent.com/developer/article/1505252

在网上找到一个解决办法:可以把limit的offset当做where条件,这样mysql直接走索引,通过B+树直接定位到offset位置。类似于看书用书签标记下看到哪里的思路。

图 5

查询执行计划发现的确如此

图 6

如果使用非聚簇索引,也可以达到相同的效果

图 7

比如:订单表、商品表,如果想做到分页效果、并提高 用户体验 ,选择这种优化会有很大的提升。

就好比openstack的 开源项目 trove模块就有此设计,通过marker参数来保证一直分页的offset。

marker的使用逻辑为:

  • 本次查询的最后一条记录标记为next_marker,
  • 将next_marker作为api结果的一部分返回给用户,
  • 用户下次再请求这个api时,把next_marker赋值给marker传入进来
  • 由于trove支持多种数据库,所以mysql user这类url需要通过注册的方式添加

图 8

https://github.com/openstack/trove/blob/master/trove/extensions/routes/mysql.py#L48

  • def index方法是/users的controller层实现,在这里调用了models.Users.load(context)方法,第一个参数是context,这个参数是trove封装的上下文里面包含一些基本信息。

图 9

https://github.com/openstack/trove/blob/master/trove/extensions/mysql/service.py#L64

  • 从上面controller层,调用到了models.User.load(context)方法,经过几次转换,调用到client.list_users(marker)方法参数带有marker。调用流程Users.load() -> load_via_context() -> Users.load_with_client(context.marker) -> client.list_users(marker)

图 10

https://github.com/openstack/trove/blob/master/trove/extensions/mysql/models.py#L182

  • client.list_users的实现(manager层)

图 11

https://github.com/openstack/trove/blob/master/trove/guestagent/datastore/manager.py#L833

  • list_users的service层实现,注释很详细,就不解释了。

图 12

https://github.com/openstack/trove/blob/master/trove/guestagent/datastore/mysql_common/service.py#L340