这是我见过最简单易懂的sql窗口分析函数使用教程了[赞][赞][赞]
wptr33 2024-11-21 22:05 28 浏览
上一篇:「sql笔记」left join 还是right join?
一、理解
Mysql8.0开始支持窗口函数,极大增强了Mysql的统计性能,再也不会被Oracle等鄙视了。Mysql8.0还增加了其他实用的高级性能,关注公众号后续文章进行了解。
1、使用场景
可从两个角度来了解和分辨需要使用窗口函数的场景。
(1)要查询的数据有n组性质相同的数据集(订单表可以按品类分成n组、按日期分成n组等),对每组组内的数据都需要做相同的统计计算。比如各品类的销售额前3名的商品分别是?比如各部门出勤率最好的3位员工是?
(2)符合以下5类窗口函数的代表的统计意义
排序函数:row_number() 、rank()、dense_rank(),对每组组内进行排序。
分布函数:percent_rank()、cume_dist(),对每组组内的个体在组内占比或累计占比。
绝对位置函数:first_value()、last_value()、nth_value(),对每组组内的第1位、最后1位、第n位的值。
相对位置函数:lag()、lead(),对每组内的某字段的前n行和后n行的值。
分桶函数:ntile(x),将每组内的行,再分别分成x个组(桶)。
此前版本的Mysql没有窗口函数,要解决此类问题,会引入变量到sql中,很复杂。现在好啦,最方便的窗口函数可以使用了。
2、理解窗口
窗口可以理解为上面描述的把待分析数据分为n组的组或集合。每组内的每条数据都要在此窗口内执行同一个函数。窗口函数运行后,数据行数保持不变。
以下示例,每个品类的商品按照金额从大到小的排名。金额排名这列就是用窗口函数计算出来的,各窗口内的数据行数保持不变,零食类还是2行,水果类还是3行。
row_number() over(partition by 品类 order by 金额 desc) as 金额排名
当不分组,而是全部数据当作1组来对待,此时窗口只有1个,单一窗口。
row_number() over(order by 金额 desc) as 金额排名
二、函数介绍
1、排序函数
row_number(),1、2、3、4,重复值的序号也是连续+1,不会有重复结果。
rank(),1、1、3、4,有相同值时,序号可能不连续。
dense_rank(),1、1、2、3,有相同值时,序号也是连续的。
2、分布函数
3、相对位置函数
4、绝对位置函数
5、分桶函数
6、聚合函数参与窗口计算
三、特殊窗口
1、单一窗口
在理解窗口章节中已经提及过,over()中不使用pratition by,即where出来的数据作为1组。
2、细分窗口
3、滑动窗口
current row,边界是当前行,一般和其他范围关键字一起使用
rows x preceding/following,边界是当前行减去x行,边界是当前行加上x行
rows unbounded preceding/following,边界是分组的第一行,边界是分组的最后一行
range interval 7 day preceding/following,当前行日期向前、向后7天纳入计算
窗口函数很神奇,很强悍,可以把复杂的逻辑封装起来,简洁调用。对于数据分析师,这是打怪升级过程中必须掌握的,会让你的数据加工提效n倍。
最后提一个问题,本文案例均是partition by和order by一个字段,试问,over()里可以partition by几个字段,order by 几个字段?关注明天文章揭晓答案。
相关推荐
- python数据容器之列表、元组、字符串
-
数据容器分为5类,分别是:列表(list)、元组(tuple)、字符串(str)、集合(set)、字典(dict)list#字面量[元素1,元素2,元素3,……]...
- 深入理解 PYTHON 虚拟机:令人拍案叫绝的字节码设计
-
深入理解PYTHON虚拟机:令人拍案叫绝的字节码设计在本篇文章当中主要给大家介绍cpython虚拟机对于字节码的设计以及在调试过程当中一个比较重要的字段co_lnotab的设计原理!PYT...
- Python快速学习第一天!
-
第一天:Python是一种解释型的、面向对象的、带有动态语义的高级程序设计语言一、运行Python:1、在交互式环境下,直接输入Python进入Python编程环境[root@tanggao/]#...
- Java 程序员的第一套Python代码
-
选择的Web组件是Python里面的Django,这不一定是一个最佳的框架或者最快的框架,当时他应该算是一个最成熟的框架。...
- Python 中 必须掌握的 20 个核心函数及其含义,不允许你不会
-
以下是Python中必须掌握的20个核心函数及其含义...
- Python代码:按和值奇偶比对号码进行组合
-
Python代码:按和值奇偶比对号码进行组合不少朋友在选定号码以后,会按照一定的和值来组号,比如大乐透常见和值有626372737481108116等我们不用固定在一个数上,我们可以给定...
- 30天学会Python编程:16. Python常用标准库使用教程
-
16.1collections模块16.1.1高级数据结构16.1.2示例...
- Python强大的内置模块collections
-
1.模块说明collections是Python的一个内置模块,所谓内置模块的意思是指Python内部封装好的模块,无需安装即可直接使用。...
- Python自动化办公应用学习笔记31—全局变量和局部变量
-
一个Python程序中的变量包括两类:全局变量和局部变量。一、全局变量·...
- 精通Python可视化爬虫:Selenium实战全攻略
-
在数据驱动的时代,爬虫技术成为获取信息的强大武器。而Python作为编程界的“瑞士军刀”,搭配Selenium库,更是让我们在动态网页抓取领域如鱼得水。本文将带你深入探索PythonSelenium...
- Python中的数据类型操作
-
...
- Python教程(二十五):装饰器–函数的高级用法
-
今天您将学习什么...
- 玩转Python列表/字典:增删改查与高效遍历技巧
-
为什么列表和字典是Python的灵魂?你是否遇到过这样的场景?想存储学生成绩,用列表却发现查找某个学生的分数像大海捞针?用字典存储购物车商品,却不知道如何高效批量修改价格?遍历数据时,传统循环写得...
- Python列表操作
-
Python添加列表4分钟阅读在Python操作列表有各种方法。例如–简单地将一个列表的元素附加到...
- 充分利用Python多进程提高并发
-
在计算机编程中,我们经常需要同时执行多个任务。然而,传统的单线程方式无法充分利用计算机的多核处理器,导致程序的执行效率低下。Python中的多进程编程技术可以帮助我们解决这个问题,通过同时运行多个进程...
- 一周热门
-
-
因果推断Matching方式实现代码 因果推断模型
-
C# 13 和 .NET 9 全知道 :13 使用 ASP.NET Core 构建网站 (1)
-
git pull命令使用实例 git pull--rebase
-
面试官:git pull是哪两个指令的组合?
-
git 执行pull错误如何撤销 git pull fail
-
git pull 和git fetch 命令分别有什么作用?二者有什么区别?
-
git fetch 和git pull 的异同 git中fetch和pull的区别
-
git pull 之后本地代码被覆盖 解决方案
-
还可以这样玩?Git基本原理及各种骚操作,涨知识了
-
git命令之pull git.pull
-
- 最近发表
- 标签列表
-
- git pull (33)
- git fetch (35)
- mysql insert (35)
- mysql distinct (37)
- concat_ws (36)
- java continue (36)
- jenkins官网 (37)
- mysql 子查询 (37)
- python元组 (33)
- mybatis 分页 (35)
- vba split (37)
- redis watch (34)
- python list sort (37)
- nvarchar2 (34)
- mysql not null (36)
- hmset (35)
- python telnet (35)
- python readlines() 方法 (36)
- munmap (35)
- docker network create (35)
- redis 集合 (37)
- python sftp (37)
- setpriority (34)
- c语言 switch (34)
- git commit (34)