重新认识正则表达式group

maimode

浏览: 418471 次
性别:
来自: 北京

最近访客更多访客>>

lwjshuai

dujianqiao

jwoo001

xwlleg

博主相关

博客

微博

相册

留言

关于我

文章分类

社区版块

存档分类

博客分类：

转载

在java中使用正则表达式返回符合正则表达式的字符串就要用到group()，group中记录了所有符合指定表达式的字符串，下面我通过一段代码讲解如何使用group：

public static void main(String[] args)
{

Pattern p = Pattern.compile("(\\d+,)(\\d+)")；
String s = "123,456-34,345";
Matcher m = p.matcher(s);
while(m.find())
{
System.out.println("m.group():"+m.group()); //打印所有

System.out.println("m.group(1):"+m.group(1)); //打印数字的

System.out.println("m.group(2):"+m.group(2)); //打印字母的
System.out.println();
}  

System.out.println("捕获个数:groupCount()="+m.groupCount());
}

首先创建Pattern对象，在其中编译要用到的表达式，接着使用matcher方法在字符串中匹配指定表达式，接下来，就要输出查找结果了，在调用m.group之前，一定要记着调用m.find，不然会产生编译错误，在正则表达式中，用括号括起来的算作一组，group(0)于group()等价，表示整个正则表达式的匹配字符串，group(1)等价于第一个括号内的表达式返回的字符串，以此类推。当while循环执行过一轮，第二轮就输出第二组匹配的字符串。上述程序的执行结果如下：

m.group():123,456
m.group(1):123,
m.group(2):456
m.group():34,345
m.group(1):34,
m.group(2):345

捕获个数：groupCount()=2

以下转载自：http://blog.csdn.net/lovingprince/article/details/2774819 其中带*部分为我添加的内容

正则表达式在字符串处理中经常使用，关于正则简单的用法相信有一点程序基础的人都懂得一些，这里就不介绍简单基础了。这里主要讲解一下在JAVA中实现了的正则的高级用法-分组与捕获。

对于要重复单个字符，非常简单，直接在字符后卖弄加上限定符即可，例如 a+ 表示匹配1个或一个以上的a，a?表示匹配0个或1个a。这些限定符如下所示：

X `?`	X ，一次或一次也没有
X `*`	X ，零次或多次
X `+`	X ，一次或多次
X `{` n `}`	X ，恰好 n 次
X `{` n `,}`	X ，至少 n 次
X `{` n `,` m `}`	X ，至少 n 次，但是不超过 m 次

但是我们如果要对多个字符进行重复怎么办呢？此时我们就要用到分组，我们可以使用小括号"()"来指定要重复的子表达式，然后对这个子表达式进行重复，例如：(abc)? 表示0个或1个abc 这里一个括号的表达式就表示一个分组。

分组可以分为两种形式，捕获组和非捕获组。

捕获组

捕获组可以通过从左到右计算其开括号来编号。例如，在表达式 ((A)(B(C))) 中，存在四个这样的组：

1 2 3 4

((A)(B(C)))

/A

(B(C))

(C)

组零始终代表整个表达式

之所以这样命名捕获组是因为在匹配中，保存了与这些组匹配的输入序列的每个子序列。捕获的子序列稍后可以通过Back 引用在表达式中使用，也可以在匹配操作完成后从匹配器检索。

Back 引用是说在后面的表达式中我们可以使用组的编号来引用前面的表达式所捕获到的文本序列(是文本不是正则) 。

例如 ([" ']).* /1 其中使用了分组，/1就是对引号这个分组的引用，它匹配包含在两个引号或者两个单引号中的所有字符串，如，"abc" 或 " ' " 或 ' " ' ，但是请注意，它并不会对" a'或者 'a"匹配。原因上面已经说明，Back引用只是引用文本而不是表达式。

*注意：在java字符串中得表示方法和元字符不同

示例：

Pattern p = Pattern.compile("(['\"])([a-zA-Z]*)\\1");//注意back引用第一组 为 \\1
		Matcher m = p.matcher("'hello',\"china\"!");
		while (m.find()){
			for (int i = 0; i <= m.groupCount(); i++){
				System.out.println(i + ": " + m.group(i));
			}
		}

非捕获组

以 (?) 开头的组是纯的非捕获 组，它不捕获文本，也不针对组合计进行计数。就是说，如果小括号中以?号开头，那么这个分组就不会捕获文本，当然也不会有组的编号，因此也不存在Back 引用。

在Java中，支持的非捕获组，有如下几种：




`(?=` X `)`	X ，通过零宽度的正 lookahead
`(?!` X `)`	X ，通过零宽度的负 lookahead
`(?<=` X `)`	X ，通过零宽度的正 lookbehind
`(?<!` X `)`	X ，通过零宽度的负 lookbehind

这四个非捕获组用于匹配表达式X，但是不包含表达式的文本。

(?=X )	零宽度正先行断言。仅当子表达式 X 在此位置的右侧匹配时才继续匹配。例如，/w+(?=/d) 与后跟数字的单词匹配，而不与该数字匹配。此构造不会回溯。
(?!X)	零宽度负先行断言。仅当子表达式 X 不在此位置的右侧匹配时才继续匹配。例如，例如，/w+(?!/d) 与后不跟数字的单词匹配，而不与该数字匹配。
(?<=X)	零宽度正后发断言。仅当子表达式 X 在此位置的左侧匹配时才继续匹配。例如，(?<=19)99 与跟在 19 后面的 99 的实例匹配。此构造不会回溯。
(?<!X)	零宽度负后发断言。仅当子表达式 X 不在此位置的左侧匹配时才继续匹配。例如，(?<!19)99 与不跟在 19 后面的 99 的实例匹配

举例：

上面都是理论性的介绍，这里就使用一些例子来说明一下问题：

1、测试匹配性 (?<!4)56(?=9) 这里的含义就是匹配后面的文本56前面不能是4，后面必须是9组成。因此，可以匹配如下文本 5569 ，与4569不匹配。

2 、提取字符串提取 da12bka3434bdca4343bdca234bm 提取包含在字符a和b之间的数字，但是这个a之前的字符不能是c,b后面的字符必须是d才能提取。

例如这里就只有3434这个数字满足要求。那么我们怎么提取呢？

首先我们写出提取这个字符串的表达式： (?<!c)a(/d+)bd 这里就只有一个捕获组(/d+)

JAVA代码片段如下：

Pattern p = Pattern.compile( "(?<!c)a(//d+)bd " );
Matcher m = p.matcher( "da12bka3434bdca4343bdca234bm" );
while (m.find()){
System.out.println(m.group( 1 )); //我们只要捕获组1的数字即可。结果 3434
System.out.println(m.group(0)); // 0组是整个表达式，看这里，并没有提炼出(?<!c)的字符。结果 a3434bd
}

可以看到，非捕获组，最后是不会返回结果的，因为它本身并不捕获文本。

分享到：

JDBC和JTA事务 | oracle非阻塞读需要重视

2011-10-13 17:52
浏览 1793
评论(0)
分类:编程语言
查看更多

发表评论

您还没有登录,请您登录后再发表评论

最近访客更多访客>>

博主相关

文章分类

社区版块

存档分类

最新评论