`
darrenzhu
  • 浏览: 808088 次
  • 性别: Icon_minigender_1
  • 来自: 上海
社区版块
存档分类
最新评论

SQL语句的各个关键字的解析过程详细总结

阅读更多
分组的极端情况就是根据所有列分组,那么返回的结果跟没有分组时一样的。

原文链接:http://www.jb51.net/article/33535.htm

主要内容是参照 Inside Microsoft SQL Server 2008:T-SQL Query书中的内容

由于最近需要做一些sql query性能提升的研究,因此研究了一下sql语句的解决过程。在园子里看了下,大家写了很多相关的文章,大家的侧重点各有不同。本文是我在看了各种资料后手机总结的,会详细的,一步一步的讲述一个sql语句的各个关键字的解析过程,欢迎大家互相学习。
SQL语句的解析顺序
简单的说一个sql语句是按照如下的顺序解析的:

1. FROM
FROM后面的表标识了这条语句要查询的数据源和一些子句如:(1-J1)笛卡尔积,(1-J2)ON过滤,(1-J3)添加外部列,所要应用的对象。FROM过程之后会生成一个虚拟表VT1。
(1-J1)笛卡尔积
这个步骤会计算两个相关联表的笛卡尔积(CROSS JOIN) ,生成虚拟表VT1-J1。
(1-J2)ON过滤
这个步骤基于虚拟表VT1-J1这一个虚拟表进行过滤,过滤出所有满足ON 谓词条件的列,生成虚拟表VT1-J2。
(1-J3)添加外部行
如果使用了外连接,保留表中的不符合ON条件的列也会被加入到VT1-J2中,作为外部行,生成虚拟表VT1-J3.

2. WHERE
对VT1过程中生成的临时表进行过滤,满足where子句的列被插入到VT2表中。

3. GROUP BY
这个子句会把VT2中生成的表按照GROUP BY中的列进行分组。生成VT3表。

4. HAVING
这个子句对VT3表中的不同的组进行过滤,满足HAVING条件的子句被加入到VT4表中。

5. SELECT
这个子句对SELECT子句中的元素进行处理,生成VT5表。
(5-1)计算表达式
计算SELECT 子句中的表达式,生成VT5-1
(5-2)DISTINCT
寻找VT5-1中的重复列,并删掉,生成VT5-2
(5-3)TOP
从ORDER BY子句定义的结果中,筛选出符合条件的列。生成VT5-3表ORDER BY 从VT5-3中的表中,根据ORDER BY 子句的条件对结果进行排序,生成VC6表。

客户,订单的查询例子
首先创建一个Customers表,插入如下数据:
customerid city
FISSA Madrid
FRNDO Madrid
KRLOS Madrid
MRPHS Zion
创建一个Orders表,插入如下数据:
orderid customerid
1 FRNDO
2 FRNDO
3 KRLOS
4 KRLOS
5 KRLOS
6 MRPHS
7 NULL
假如我们想要查询来自Madrid的,订单数小于3的客户,并把他们的订单数显示出来,结果按照订单数从小到大进行排序。
代码如下:

SELECT C.customerid, COUNT(O.orderid) AS numorders
FROM dbo.Customers AS C
LEFT OUTER JOIN dbo.Orders AS O
ON C.customerid = O.customerid
WHERE C.city = 'Madrid'
GROUP BY C.customerid
HAVING COUNT(O.orderid) < 3
ORDER BY numorders

查询结果为:
customerid numorders
FISSA 0
FRNDO 2
下面我们会详细的讲述sql是怎样计算出这个结果的:
FROM子句
FROM子句标识了需要查询的表,如果指定了表操作,会从左到右的处理,每一个基于一个或者两个表的表操作都会返回一个输出表。左边表的输出结果会作为下一个表操作的输入结果。例如,交表相关的操作有 (1-J1)笛卡尔积,(1-J2)ON过滤器,(1-J3)添加外部列。FROM句子生成虚拟表VT1。
Step 1-J1:执行笛卡尔积(CROSS JOIN)
笛卡尔积会把左右两个表每一行所有可能的组合都列出来生成表VT1-J1,如果左表有m列,右表有n列,那么笛卡尔积之后生成的VT1-J1表将会有m×n列。
Step 1-J1这个步骤等价于执行:
SELECT * from Customers C CROSS JOIN Orders O
执行结果为:(共有4×7列)
C.customerid C.city O.orderid O.customerid
FISSA Madrid 1 FRNDO
FISSA Madrid 2 FRNDO
FISSA Madrid 3 KRLOS
FISSA Madrid 4 KRLOS
FISSA Madrid 5 KRLOS
FISSA Madrid 6 MRPHS
FISSA Madrid 7 NULL
FRNDO Madrid 1 FRNDO
FRNDO Madrid 2 FRNDO
FRNDO Madrid 3 KRLOS
FRNDO Madrid 4 KRLOS
FRNDO Madrid 5 KRLOS
FRNDO Madrid 6 MRPHS
FRNDO Madrid 7 NULL
KRLOS Madrid 1 FRNDO
KRLOS Madrid 2 FRNDO
KRLOS Madrid 3 KRLOS
KRLOS Madrid 4 KRLOS
KRLOS Madrid 5 KRLOS
KRLOS Madrid 6 MRPHS
KRLOS Madrid 7 NULL
MRPHS Zion 1 FRNDO
MRPHS Zion 2 FRNDO
MRPHS Zion 3 KRLOS
MRPHS Zion 4 KRLOS
MRPHS Zion 5 KRLOS
MRPHS Zion 6 MRPHS
MRPHS Zion 7 NULL
Step 1-J2:应用ON过滤,(JOIN 条件)
ON过滤条件是sql的三个过滤条件(ON,WHERE,HAVING)中最先执行的,ON过滤条件应用于前一步生成的虚拟表(VT1-J1),满足ON过滤条件的行会被加入到虚拟表VT1-J2中。在应用了ON 过滤之后,生成的VT1-J2表如下所示:
C.customerid C.city O.orderid O.customerid
FRNDO Madrid 1 FRNDO
FRNDO Madrid 2 FRNDO
KRLOS Madrid 3 KRLOS
KRLOS Madrid 4 KRLOS
KRLOS Madrid 5 KRLOS
MRPHS Zion 6 MRPHS
Step 1-J3:添加外部列
这个步骤只会出现在使用了外连接的情况。对于外连接(LEFT,RIGHT, or FULL),你可以标记一个或者两个表作为保留表。作为保留表意味着你希望这个表里面的所有列都被返回,即使它里面的数据不满足ON子句的过滤条件。LEFT OUTER JOIN 把左边的表标记为保留表,RIGHTOUTER JOIN把右边的表作为保留表,FULL OUTER JOIN把两个表都标记为保留表.Step 1-J3为根据VT1-J2中的虚拟表,添加了保留表中不满足ON 条件的列,在未保留表中没有对应的列,因此标记为NULL。这个过程生成了虚拟表VT1-J3。
C.customerid C.city O.orderid O.customerid
FISSA Madrid NULL NULL
FRNDO Madrid 1 FRNDO
FRNDO Madrid 2 FRNDO
KRLOS Madrid 3 KRLOS
KRLOS Madrid 4 KRLOS
KRLOS Madrid 5 KRLOS
MRPHS Zion 6 MRPHS
如果FROM子句中有多个表操作运算,sql会按照从左到右的顺序处理,左边生成的临时表结果作为右边表的输入表。
Step 2 WHERE 子句
WHERE过滤被应用到前一步生成的临时表中,根据WHERE过滤条件生成临时表VT2。
注意:由于数据现在还没有被分组,因此现在你不能使用聚合运算-例如:你不能使用这样的句子 WHERE orderdate = MAX(orderdate)。另外你也不能使用SELECT子句中创建的变量别名,因为现在还没有处理SELECT子句-例如你不能写这样的句子:SELECT YEAR(orderdate) AS orderyear . . . WHERE orderyear > 2008.
应用这个过滤
WHERE C.city = 'Madrid'
这时生成的临时表VT2的内容如下:
C.customerid C.city O.orderid O.customerid
FISSA Madrid NULL NULL
FRNDO Madrid 1 FRNDO
FRNDO Madrid 2 FRNDO
KRLOS Madrid 3 KRLOS
KRLOS Madrid 4 KRLOS
KRLOS Madrid 5 KRLOS
在这个例子中,你需要在ON子句中使用ON C.customerid = O.customerid过滤,没有订单的客户在1-J2这一步中被过滤掉,但是在1-J3这一步中作为外部列又被加回来。但是,由于你只想返回来自Madrid的客户,因此你需要在WHERE子句中过滤城市(WHERE C.city = ‘Madrid'),如果你放在ON过滤中,不属于Madrid的客户在添加外部列中会被添加回来。
关于ON 和 WHERE 的区别需要在这里说明一下,ON 和WHERE 的主要区别在于 ON 实在添加外部列之前进行过滤,WHERE 是在之后。ON过滤掉的列会在1-J3中添加回来。如果你不需要添加外部列,那么这两个过滤是相同的。
Step 3 GROUP BY子句
这个子句会把前一步中生成的临时表中的数据进行分组,每一行都会分到并且只分到一个组里,生成虚拟表VT3。VT3表中包含了VT2表中所有的数据,和分组标识符。
这是生成的临时表VT3的内容如下:
Groups
C.customerid C.customerid C.city O.orderid O.customerid
FISSA FISSA Madrid NULL NULL
FRNDO FRNDO Madrid 1 FRNDO
FRNDO Madrid 2 FRNDO
KRLOS Madrid 3 KRLOS
KRLOS KRLOS Madrid 4 KRLOS
KRLOS Madrid 5 KRLOS
sql最终返回的结果中,每一个分组必须只能返回一行(除非被过滤掉),因此当一个sql语句中使用了GROUP BY时,在GROUP BY后面处理的子句,如SELECT,HAVING子句等,只能使用出现在GROUP BY后面的列,对于没有出现GROUP BY后面的列必须使用聚合函数(如 MAX ,MIN,COUNT,AVG等),保证每一个GROUP只返回一行。
Step 4 HAVING子句
HAVING子句用来过滤前一步生成的临时表,并且只作用于分组后的数据,满足HAVING条件的GROUP被添加到虚拟表VT4中。
当应用了这个过滤:
代码如下:

HAVING COUNT(O.orderid) < 3

之后,生成的VT4表内容如下:
Groups
C.customerid C.customerid C.city O.orderid O.customerid
FISSA FISSA Madrid NULL NULL
FRNDO FRNDO Madrid 1 FRNDO
FRNDO Madrid 2 FRNDO
需要注意的一点是,这里面使用的是COUNT(O.orderid),而不是COUNT(*),由于这个查询中添加了外部列,COUNT方法会忽略NULL的列,导致出现了你不想要的结果。
Step 5 SELECT 子句
尽管出现在sql语句的最前面,SELECT在第五步的时候才被处理,SELECT子句返回的表会最终返回给调用者。这个子句包含三个子阶段:(5-1)计算表达式,(5-2) 处理DISTINCT,(5-3)应用TOP过滤。
Step 5-1 计算表达式
SELECT子句中的表达式可以返回或者操作前一步表中返回的基本列。如果这个sql语句是一个聚合查询,在Step 3之后,你只能使用GROUP BY中的列,对不属于GROUP集合中的列必须使用聚合运算。不属于FROM表中基本列的必须为其起一个别名,如YEAR(orderdate) AS orderyear。
注意:在SELECT子句中创建的别名,不能在之前的Step中使用,即使在SELECT子句中也不能。原因是sql的很多操作是同时操作(all at once operation),至于什么是all-at-once operation这里就不再介绍了。因此,SELECT子句中创建的别名只能在后面的子句中使用,如ORDER BY。例如:SELECT YEAR(orderdate) AS orderyear . . . ORDER BY orderyear。
在这个例子中:
代码如下:

SELECT C.customerid, COUNT(O.orderid) AS numorders

结果会得到一个虚拟表VT5-1:
C.customerid numorders
FIFSSA 0
FRNDO 2
Step 5-2:应用DISTINCT子句
如果sql语句中使用了DISTINCT,sql会把重复列去掉,生成虚拟表VT5-2。
Step 5-3:应用TOP选项
TOP选项是T-SQL提供的一个功能,用来表示显示多少行。基于ORDER BY子句定义的顺序,指定个数的列会被查询出来。这个过程生成虚拟表VT5-3。
正如上文提到的,这一步依赖于ORDER BY定义的顺序来决定哪些列应该显示在前面。如果你没有指定结果的ORDER BY顺序,也没有使用WITH TIES子句 ,每一次的返回结果可能会不一致。
在我们的例子中,Step 5-3被省略了,因为我们没有使用TOP关键字。
Step 6:ORDER BY子句
前一步返回的虚拟表在这一步被排序,根据ORDER BY子句指定的顺序,返回游标VC6。ORDER BY子句也是唯一一个可以使用SELECT子句创建的别名的地方。
注意:这一步和之前不同的地方在于,这一步返回的结果是一个游标,而不是表。sql是基于集合理论的,一个集合没有对他的行定义顺序,它只是一个成员的逻辑集合,因此成员的顺序并不重要。带有ORDER BY子句的sql返回一个按照特定序列组织每一行的对象。ANSI 把这样的一个对象叫游标。理解这一点对你了解sql很重要。
上面的步骤如图所示


  • 大小: 145.8 KB
分享到:
评论

相关推荐

    SQL 常用关键字解析

    ### SQL 常用关键字解析 #### 一、DISTINCT - 实现去重查询 `DISTINCT` 是一个非常实用的关键字,它可以帮助我们在查询结果中去除重复的记录,只保留唯一的值。例如: ``` SELECT DISTINCT column_name FROM table_...

    JsonSQL:用SQL语句解析JSON文件

    **JsonSQL: SQL语句解析JSON文件** 在大数据处理和Web应用中,JSON(JavaScript Object Notation)格式已经成为数据交换的常见格式。然而,对于习惯使用SQL查询关系型数据库的人来说,处理JSON数据可能会觉得不太...

    Microsoft SQL Server 保留关键字

    这些关键字在SQL语句中有特定的意义,不能用作标识符(如表名、列名等)。本文将详细介绍Microsoft SQL Server中的保留关键字及其用途。 #### 一、SQL Server 保留关键字分类 SQL Server 的保留关键字可以分为以下...

    sql注入关键字大全

    本篇文章将围绕一份“SQL注入关键字大全”资料,详细介绍其中涉及的关键SQL注入技术点。 #### 二、SQL注入关键字与技术点解析 **1. 返回的是连接的数据库名** ```sql and db_name() &gt; 0 ``` 此语句用于获取当前...

    完成超长SQL语句执行前拆分

    - `keyWordSql`:标识SQL语句中的关键字(例如INSERT或UPDATE),用于确保每个分割后的SQL语句的完整性。 - `SqlMaxLen`:表示单个SQL语句的最大长度,如果原始SQL语句超过了这个长度,则会被拆分。 ##### 处理流程...

    自己编写sql语句分析工具

    1. **关键字提取**:工具能够识别并提取SQL语句中的关键字,如SELECT、FROM、WHERE、GROUP BY、HAVING等,这些关键字是SQL语句的基础构造块,反映了查询的基本类型和操作。 2. **查询分析**:对SELECT语句的字段...

    SQL语句生成器.rar

    SQL语句生成器是一款工具,主要用于简化和自动化SQL查询的编写过程。在数据库管理与开发中,SQL(Structured Query Language)是不可或缺的语言,用于检索、更新、插入和删除数据库中的数据。这款工具可以帮助用户...

    SqlParser C++实现的SQL语法解释器

    SqlParser是一款基于C++实现的SQL语法解释器,它的主要任务是解析SQL语句,将其转化为计算机可理解的形式,从而能够执行相应的数据库操作。在数据库系统中,SQL(Structured Query Language)是用于管理关系数据库的...

    面向数据库性能的SQL语句解析与翻译.pdf

    总结来说,面向数据库性能的SQL语句解析与翻译是保障数据库安全、提高管理效率的重要技术手段。通过解析和翻译SQL,可以实现对数据库操作的透明化,便于监控和审计,从而提升系统的安全性。同时,对于非专业人员,这...

    c#解析SQL语句(分析语句).zip

    总结来说,C#解析SQL语句是一个涉及词法分析、语法分析和抽象语法树构建的过程,这对于理解和处理复杂SQL查询、实现动态SQL生成、确保SQL安全等方面都有重要作用。"sqlparser-master"项目可能是实现这一功能的C#代码...

    Sql语句收藏 Sql语句收藏

    根据提供的文件信息,我们可以整理出两个SQL查询案例,并对其进行详细解析。这有助于更好地理解SQL语言在实际场景中的应用。 ### SQL语句一 #### 原始SQL语句: ```sql select *, (select count(0) from [picture]...

    SQL语句大全解析及示例(个人总结-入门级)

    ### SQL语句大全解析及示例(个人总结-入门级) #### 一、引言 在数据库管理系统(DBMS)中,SQL(Structured Query Language,结构化查询语言)是一种用于管理和处理存储在关系型数据库中的数据的标准语言。它不仅...

    SQL关键字大写

    3. **避免解析问题**:某些DBMS,如Oracle,对不区分大小写的SQL语句进行解析时,可能会因为大小写混淆导致问题。将关键字大写可以减少这类问题的发生。 4. **便于自动化处理**:在代码审查或自动化脚本中,大写的...

    antlr解析sql

    在SQL解析领域,ANTLR被广泛应用于构建能够理解SQL语句的解析器。这个项目的目标是将SQL查询语句解析成对象,以便于进一步的操作和处理。虽然当前实现仅涵盖了查询语句,但设计时已经考虑到了扩展性,预留了对UPDATE...

    SQL Server 和 MySql 语法和关键字的区别

    以下将详细解析这些不同之处,以便于在从 SQL Server 迁移到 MySQL 或反之亦然时能顺利进行转换。 1. **IFNULL() 与 ISNULL() 函数** - MySQL 使用 `IFNULL()` 函数来检查某个值是否为 NULL,如果为 NULL,则返回...

    页面传入多个条件——sql语句的拼接

    这里初始化SQL语句为“select * from book where 1=1”,其中`where 1=1`是一个常见的技巧,用于确保后续添加的条件之前总能有`WHERE`或`AND`关键字。 2. **根据条件拼接SQL语句**: - **bookID条件**: ```...

    c++解析sql,存储过程

    本项目涉及的是利用C++解析SQL语句,特别是Oracle的PL/SQL存储过程,来获取元数据信息,例如表与表之间的关联以及字段之间的关系。下面将详细介绍这个主题的各个方面。 首先,让我们来理解什么是SQL。SQL(结构化...

    基于 sql server的常用关键字

    本文将根据提供的标题、描述、标签以及部分内容,详细解析与SQL Server相关的几个重要概念及其用法,包括`TRUNCATE TABLE`、`ALTER TABLE`(包括`ADD COLUMN`、`DROP COLUMN`)、`ADD CONSTRAINT`(涉及`PRIMARY KEY...

Global site tag (gtag.js) - Google Analytics