百度360必应搜狗淘宝本站头条
当前位置:网站首页 > IT技术 > 正文

MySQL数据爆炸怎么办?归档神器让你1分钟清理百万数据不丢分毫

wptr33 2025-03-03 20:29 32 浏览

一、开篇暴击:你的数据库正在经历这些痛苦吗?

  • 存储成本飙升:订单表3年增长到800GB,云盘费用月增2000+
  • 查询卡成PPT:用户历史数据检索响应时间突破15秒
  • 备份恢复噩梦:全库备份耗时从20分钟延长到2小时
  • 开发效率骤降:WHERE create_time<"2020年" 的查询拖垮整个实例

真实案例:某电商平台清理1.2亿日志数据,传统DELETE方式导致:

主从延迟12小时锁等待超时237次磁盘空间未释放


二、核弹级解决方案:pt-archiver工作原理揭秘

2.1 与传统方式的降维对比


DELETE语句

pt-archiver

执行方式

全事务提交

分批提交 (可配置)

锁机制

行锁升级为表锁

最小化锁定范围

磁盘空间

不会立即释放

立即释放

执行耗时

随数据量线性增长

恒定速率

风险指数

?????

?

2.2 三维透视工作原理




三、手把手实战教学(关键操作配截图)

3.1 安装篇:2分钟极速部署

# 适用于CentOS的「一行流」安装
sudo yum install percona-toolkit -y && which pt-archiver

3.2 基础篇:清理3年前订单数据

pt-archiver \
--source h=localhost,D=test,t=orders,u=root,p=123456 \
--where "create_time < DATE_SUB(NOW(), INTERVAL 3 YEAR)" \
--purge \
--limit 1000 \
--commit-each

参数解析表

参数名

作用说明

推荐值/示例

连接配置类



--source

指定源数据库连接(格式:h=主机,D=库名,t=表名,u=用户,p=密码)

h=192.168.1.2,D=order,t=logs

--dest

目标数据库连接(用于数据归档)

h=归档服务器IP,D=archive,t=logs

数据过滤类



--where

指定归档条件(需用引号包裹)

"create_time < '2022-01-01'"

--limit

每批次处理行数(影响锁持有时间)

500-5000(根据内存调整)

--progress

进度报告间隔行数

5000

执行控制类



--purge

直接删除数据不归档

清理日志表时使用

--no-delete

仅复制数据不删除(用于数据迁移)

数据迁移时启用

--txn-size

事务提交间隔(每N行提交事务)

1000(与limit值一致)

性能优化类



--bulk-delete

启用批量删除(提升删除效率)

总行数>10万时建议启用

--bulk-insert

启用批量插入(提升归档速度)

配合--dest使用

--sleep

批次间隔休眠时间(秒)

0.1-1(高负载时增加)

输出统计类



--statistics

输出执行统计信息

必启用

--why-quit

显示退出原因(调试用)

异常终止时使用

其他实用类



--charset

指定连接字符集

utf8mb4

--no-check-charset

跳过字符集验证(需确认兼容性)

谨慎使用

--dry-run

试运行模式(不实际执行操作)

必先执行验证

参数调优指南

  1. 高并发场景:--limit 500 --sleep 0.3
  2. 快速归档模式:--limit 5000 --bulk-insert --bulk-delete
  3. 敏感数据操作:--dry-run --why-quit

注意事项:

--limit值越大,单次事务时间越长,可能引发锁等待--sleep参数可有效降低主库压力,但会延长总执行时间务必先用--dry-run验证WHERE条件准确性


3.3 进阶篇:跨服务器归档

pt-archiver \
--source h=主库IP,D=生产库,t=订单表,u=archiver,p=密码 \
--dest h=归档库IP,D=历史库,t=订单表 \
--where "created_at < DATE_SUB(NOW(), INTERVAL 3 YEAR)" \
--limit 2000 \
--progress 5000 \
--bulk-delete \
--bulk-insert \
--statistics \
--txn-size 2000 \
--sleep 0.5 \
--no-check-charset

四、避坑指南:血泪经验总结

4.1 必查清单(执行前逐项确认)

  1. 已添加--dry-run参数试运行
  2. 目标表结构校验完成
  3. 从库延迟监控已开启
  4. 磁盘空间检查(至少保留20%)
  5. 业务低峰期窗口确认

4.2 高频报错解决方案

# 报错1:表结构不匹配
Error: Column count doesn't match
 修复方案:添加--columns参数指定字段

# 报错2:主键缺失
No PRIMARY or UNIQUE index found
 修复方案:临时添加索引
ALTER TABLE orders ADD INDEX idx_ctime(create_time);

# 报错3:外键约束
Cannot delete rows due to FOREIGN KEY
 修复方案:按依赖顺序归档或SET foreign_key_checks=0

五、性能核弹:百万级数据实战报告

5.1 测试环境

- 机器配置:4C8G SSD云主机
- MySQL版本:8.0.28
- 数据量:`orders`表350万条(未分区)

5.2 性能对比数据

指标

传统DELETE

pt-archiver

总耗时

6小时22分

11分钟

主库QPS波动

下降63%

波动<5%

磁盘空间释放

12小时后

立即释放

执行期间锁等待

89次

0次


六、专家私藏配置

结合Java代码以及shell脚本,是归档设置更加灵活

shell脚本

#!/bin/sh

set -e
#表结构列表
#echo $1

tableList=$1
sParams=$2
dParams=$3
oParams=$4
whereFrom=$5
whereTo=$6
operate=$7
IFS=";"

#历史数据处理
function doHistoryData() {
    for tableName in $tableList
    do
        commandStr="pt-archiver --source ${tableName} --dest ${tableName} ${whereFrom} --no-delete $oParams"
            echo "pt-archiver --source ${sParams}${tableName} --dest ${dParams}${tableName} ${whereFrom} --no-delete $oParams" | sh
            echo ${commandStr}
            commandStr="pt-archiver --source ${tableName} --dest ${tableName} ${whereTo} --bulk-delete $oParams"
            echo "pt-archiver --source ${sParams}${tableName} --dest ${dParams}${tableName} ${whereTo} --bulk-delete $oParams" | sh
            echo ${commandStr}
            echo "succ"
    done
}

# 参数检查
if [ -z ${operate} ]; then
  echo "operate can not be null."
else
  # 启动程序
  if [ ${operate} == "doHistory" ]; then
    doHistoryData
  else
    echo "Not supported the operate."
  fi
fi

Java代码

private Pair startBackUpSh(StringBuilder sBuilder, String tableName, String where, String filePath, String toFileName, String zipFileName, StringBuilder oBuilder, String method) throws IOException {
        String command = System.getProperty("user.dir") + "/bin/BackUp.sh";
        CommandLine cmdl = new CommandLine(command);
        cmdl.addArgument(sBuilder.toString(), false);
        cmdl.addArgument(tableName, false);
        cmdl.addArgument(where, false);
        cmdl.addArgument(filePath, false);
        cmdl.addArgument(toFileName, false);
        cmdl.addArgument(zipFileName, false);
        cmdl.addArgument(oBuilder.toString(), false);
        cmdl.addArgument(method, false);
        DefaultExecutor executor = new DefaultExecutor();
        ByteArrayOutputStream baos = new ByteArrayOutputStream();
        executor.setStreamHandler(new PumpStreamHandler(baos));
        int execute = executor.execute(cmdl);
        RUN_LOGGER.debug("execute result = {}", execute);
        final String result = baos.toString().trim();
        RUN_LOGGER.debug("execute result = {}", result);
        if (StrUtil.containsIgnoreCase(result, "succ") || StrUtil.containsIgnoreCase(result, "no more rows")) {
            return new Pair<>(true, result);
        } else {
            return new Pair<>(false, result);
        }
    }



相关推荐

MySQL进阶五之自动读写分离mysql-proxy

自动读写分离目前,大量现网用户的业务场景中存在读多写少、业务负载无法预测等情况,在有大量读请求的应用场景下,单个实例可能无法承受读取压力,甚至会对业务产生影响。为了实现读取能力的弹性扩展,分担数据库压...

Postgres vs MySQL_vs2022连接mysql数据库

...

3分钟短文 | Laravel SQL筛选两个日期之间的记录,怎么写?

引言今天说一个细分的需求,在模型中,或者使用laravel提供的EloquentORM功能,构造查询语句时,返回位于两个指定的日期之间的条目。应该怎么写?本文通过几个例子,为大家梳理一下。学习时...

一文由浅入深带你完全掌握MySQL的锁机制原理与应用

本文将跟大家聊聊InnoDB的锁。本文比较长,包括一条SQL是如何加锁的,一些加锁规则、如何分析和解决死锁问题等内容,建议耐心读完,肯定对大家有帮助的。为什么需要加锁呢?...

验证Mysql中联合索引的最左匹配原则

后端面试中一定是必问mysql的,在以往的面试中好几个面试官都反馈我Mysql基础不行,今天来着重复习一下自己的弱点知识。在Mysql调优中索引优化又是非常重要的方法,不管公司的大小只要后端项目中用到...

MySQL索引解析(联合索引/最左前缀/覆盖索引/索引下推)

目录1.索引基础...

你会看 MySQL 的执行计划(EXPLAIN)吗?

SQL执行太慢怎么办?我们通常会使用EXPLAIN命令来查看SQL的执行计划,然后根据执行计划找出问题所在并进行优化。用法简介...

MySQL 从入门到精通(四)之索引结构

索引概述索引(index),是帮助MySQL高效获取数据的数据结构(有序),在数据之外,数据库系统还维护者满足特定查询算法的数据结构,这些数据结构以某种方式引用(指向)数据,这样就可以在这些数据结构...

mysql总结——面试中最常问到的知识点

mysql作为开源数据库中的榜一大哥,一直是面试官们考察的重中之重。今天,我们来总结一下mysql的知识点,供大家复习参照,看完这些知识点,再加上一些边角细节,基本上能够应付大多mysql相关面试了(...

mysql总结——面试中最常问到的知识点(2)

首先我们回顾一下上篇内容,主要复习了索引,事务,锁,以及SQL优化的工具。本篇文章接着写后面的内容。性能优化索引优化,SQL中索引的相关优化主要有以下几个方面:最好是全匹配。如果是联合索引的话,遵循最...

MySQL基础全知全解!超详细无废话!轻松上手~

本期内容提醒:全篇2300+字,篇幅较长,可搭配饭菜一同“食”用,全篇无废话(除了这句),干货满满,可收藏供后期反复观看。注:MySQL中语法不区分大小写,本篇中...

深入剖析 MySQL 中的锁机制原理_mysql 锁详解

在互联网软件开发领域,MySQL作为一款广泛应用的关系型数据库管理系统,其锁机制在保障数据一致性和实现并发控制方面扮演着举足轻重的角色。对于互联网软件开发人员而言,深入理解MySQL的锁机制原理...

Java 与 MySQL 性能优化:MySQL分区表设计与性能优化全解析

引言在数据库管理领域,随着数据量的不断增长,如何高效地管理和操作数据成为了一个关键问题。MySQL分区表作为一种有效的数据管理技术,能够将大型表划分为多个更小、更易管理的分区,从而提升数据库的性能和可...

MySQL基础篇:DQL数据查询操作_mysql 查

一、基础查询DQL基础查询语法SELECT字段列表FROM表名列表WHERE条件列表GROUPBY分组字段列表HAVING分组后条件列表ORDERBY排序字段列表LIMIT...

MySql:索引的基本使用_mysql索引的使用和原理

一、索引基础概念1.什么是索引?索引是数据库表的特殊数据结构(通常是B+树),用于...