数据库根据指定字段去重
需求:对一张用户表根据name/email/card_num字段去除重复数据;
思路:用group by方法可以查询出'去重'后的数据,将这些数据存储到一张临时表中,然后将临时表的数据存储到指定的表中;
误区及解决方案:group by方法只能获取部分字段(去重指定字段),不能一次获取到完整的数据,但是可以通过max函数获取group by结果集中的id,再根据id集合查询出全部的记录。
测试思路
- 查询去重后的数据
SELECT max(id) as id,name,email,card_num FROM users GROUP BY name,email,card_num;
- 从去重后的数据中获取id集合
SELECT ID from (SELECT max(id) as id,name,email,card_num FROM users GROUP BY name,email,card_num) as T;
- 根据去重后的数据中获取id集合,从源数据中获得记录列表
SELECT * from users where id in (SELECT ID from (SELECT max(id) as id,name,email,card_num FROM users GROUP BY name,email,card_num) as T);
实际方法
- 根据去重后的数据中获取id集合,从源数据中获得记录列表,将这些列表数据存入一个临时表中
create TEMP TABLE tmp_data as SELECT * from users where id in (SELECT ID from (SELECT max(id) as id,name,email,card_num FROM users GROUP BY name,email,card_num) as T);
- 将临时表中的数据存入指定的数据表中,完毕
insert into users_copy1 select * from tmp_data;
检测
- 检测结果是不是和第一步查询去重后的数据总数相同
select count(*) from users_copy1;
测试结果:1.4w条数据中有2300条数据重复,实际运行结果为0.7s,基本满足现在的需求。
更多MySQL相关技术文章,请访问MySQL教程栏目进行学习!
以上就是数据库根据指定字段去重的详细内容,更多请关注其它相关文章!
推荐阅读
-
PHP以指定字段为索引返回数据库所取的数据数组
-
oracle 实际值超过数据库某个字段指定长度报错解决
-
Python Dataframe 指定多列去重、求差集的方法
-
C#NPOI.RabbitMQ.EF.Attribute.HttpRuntime.Cache.AD域.List
根据指定字段去重.前端JQuery.Cache.I18N(多语言).data-xx(自定义属性) -
php数组根据指定字段对数组进行排序函数
-
数据库表数据如何去重
-
Java8-Stream流操作List去重distinct、和指定字段去重(完整实例讲解)
-
摸不着头脑,flatMap处理后居然无法去重(原来是数据库添加字段的时候多了个空格= =)
-
List用法:根据对象属性排序、筛选、去重
-
js数组去重 数组拼接 替换数组中的指定值 递归数组 判断数组中是否存在指定值 数组求和 根据条件判数组值