正则表达式和Java编程语言

　应用程序常常需要有文本处理功能，比如单词查找、电子邮件确认或XML文档集成。这通常会涉及到模式匹配。Perl、sed或awk等语言通过使用正则表达式来改善模式匹配，正则表达式是一串字符，它所定义的模式可用来查找匹配的文本。为了使用Java^TM编程语言进行模式匹配，需要使用带有许多charAt子字串的StringTokenizer 类，读取字母或符号以便处理文本。这常常导致复杂或凌乱的代码。

　　现在不一样了。

　　2平台标准版（J2SE^TM）1.4版包含一个名为java.util.regex的新软件包，使得使用正则表达式成为可能。目前的功能包括元字符的使用，它赋予正则表达式极大的灵活性

　　本文概括地介绍了正则表达式的使用，并详细解释如何利用 java.util.regex软件包来使用正则表达式，用以下常见情形作为例子：

简单的单词替换
电子邮件确认
从文件中删除控制字符
查找文件

　　为了编译这些例子中的代码和在应用程序中使用正则表达式，需要安装 J2SE 1.4版。

　　构造正则表达式

　　正则表达式是一种字符模式，它描述的是一组字符串。你可以使用 java.util.regex软件包，查找、显示或修改输入序列中出现的某个模式的一部分或全部。

　　正则表达式最简单的形式是一个精确的字符串，比如“Java”或 “programming”。正则表达式匹配还允许你检查一个字符串是否符合某个具体的句法形式，比如是不是一个电子邮件地址。

　　为了编写正则表达式，普通字符和特殊字符都要使用：

\$ ^ . *

+ ? [' ']

\.

　　正则表达式中出现的任何其他字符都是普通字符，除非它前面有个 \。

　　特殊字符有着特别的用处。例如，.可匹配除了换行符之外的任意字符。与 s.n这样的正则表达式匹配的是任何三个字符的、以s 开始以n结束的字符串，包括sun和son 。

　　在正则表达式中有许多特殊字符，可以查找一行开头的单词，忽略大小写或大小写敏感的单词，还有特殊字符可以给出一个范围，比如a-e表示从a到e的任何字母。

　　使用这个新软件包的正则表达式用法与Perl类似，所以如果你熟悉Perl中正则表达式的使用，就可以在Java语言中使用同样的表达式语法。如果你不熟悉正则表达式，下面是一些入门的例子：

构造匹配于

字符

x 字符 x

\\ 反斜线字符

\0n 八进制值的字符0n (0 <= n <= 7)

\0nn 八进制值的字符 0nn (0 <= n <= 7)

\0mnn 八进制值的字符0mnn 0mnn (0 <= m <= 3, 0 <= n <= 7)

\xhh 十六进制值的字符0xhh

\uhhhh 十六进制值的字符0xhhhh

\t 制表符('\u0009')

\n 换行符 ('\u000A')

\r 回车符 ('\u000D')

\f 换页符 ('\u000C')

\a 响铃符 ('\u0007')

\e 转义符 ('\u001B')

\cx T对应于x的控制字符 x

字符类

[abc] a, b, or c (简单类)

[^abc] 除了a、b或c之外的任意字符（求反）

[a-zA-Z] a到z或A到Z ，包含（范围)

[a-z-[bc]] a到z，除了b和c ： [ad-z]（减去）

[a-z-[m-p]] a到z，除了m到 p： [a-lq-z]

[a-z-[^def]] d, e, 或 f

预定义的字符类

. 任意字符（也许能与行终止符匹配，也许不能）

\d 数字: [0-9]

\D 非数字: [^0-9]

\s 空格符: [ \t\n\x0B\f\r]

\S 非空格符: [^\s]

\w 单词字符: [a-zA-Z_0-9]

\W 非单词字符: [^\w]

构造	匹配于
字符
x	字符 x
`\\`	反斜线字符
`\0`n	八进制值的字符`0`n (0 `<=` n `<=` 7)
`\0`nn	八进制值的字符 `0`nn (0 `<=` n `<=` 7)
`\0`mnn	八进制值的字符0mnn `0`mnn (0 `<=` m `<=` 3, 0 `<=` n `<=` 7)
`\x`hh	十六进制值的字符`0x`hh
`\u`hhhh	十六进制值的字符`0x`hhhh
`\t`	制表符(`'\u0009'`)
`\n`	换行符 (`'\u000A'`)
`\r`	回车符 (`'\u000D'`)
`\f`	换页符 (`'\u000C'`)
`\a`	响铃符 (`'\u0007'`)
`\e`	转义符 (`'\u001B'`)
`\c`x	T对应于x的控制字符 x

字符类
`[abc]`	`a`, `b`, or `c` (简单类)
`[^abc]`	除了`a`、`b`或`c`之外的任意字符（求反）
`[a-zA-Z]`	`a`到`z`或`A`到`Z` ，包含（范围)
`[a-z-[bc]]`	`a`到`z`，除了`b`和`c` ： `[ad-z]`（减去）
`[a-z-[m-p]]`	`a`到`z`，除了`m`到 `p`： `[a-lq-z]`
`[a-z-[^def]]`	`d`, `e`, 或 `f`
预定义的字符类
`.`	任意字符（也许能与行终止符匹配，也许不能）
`\d`	数字: `[0-9]`
`\D`	非数字: `[^0-9]`
`\s`	空格符: `[ \t\n\x0B\f\r]`
`\S`	非空格符: `[^\s]`
`\w`	单词字符: `[a-zA-Z_0-9]`
`\W`	非单词字符: `[^\w]`

黑暗岁月

　　有一个String，如何查询其中是否有y和f字符？最黑暗的办法就是：

　　程序1：我知道if、for语句和charAt()啊。

class Test{
　public static void main(String args[]) {
　　String str="For my money, the important thing "+"about the meeting was bridge-building";
　　char x='y';
　　char y='f';
　　boolean result=false;
　　for(int i=0;i＜str.length;i++){
　　　char z=str.charAt(i); //System.out.println(z);
　　　if(x==z||y==z) {
　　　　result=true;
　　　　break;
　　　}
　　　else result=false;
　　}
　　System.out.println(result);
　}
}

　　好像很直观，但这种方式难以应付复杂的工作。如查询一段文字中，是否有is？是否有thing或ting等。这是一个讨厌的工作。

　　Java的java.util.regex包

　　按照面向对象的思路，把希望查询的字符串如is、thing或ting封装成一个对象，以这个对象作为模板去匹配一段文字，就更加自然了。作为模板的那个东西就是下面要讨论的正则表达式。先不考虑那么复杂，看一个例子：程序2：不懂。先看看可以吧？

import java.util.regex.*;

class Regex1{
　public static void main(String args[]) {
　　String str="For my money, the important thing "+"about the meeting was bridge-building";
　　String regEx="a|f"; //表示a或f
　　Pattern p=Pattern.compile(regEx);
　　Matcher m=p.matcher(str);
　　boolean result=m.find();
　　System.out.println(result);
　}
}

　　如果str匹配regEx，那么result为true，否则为flase。如果想在查找时忽略大小写，则可以写成：

Pattern p=Pattern.compile(regEx,Pattern.CASE_INSENSITIVE);

　　虽然暂时不知道Pattern（模板、模式）和Matcher（匹配器）的细节，程序的感觉就比较爽，如果先查询is、后来又要查询thing或ting，我们只需要修改一下模板Pattern，而不是考虑if语句和for语句，或者通过charAt()。

　　1、写一个特殊的字符串——正则表达式如a|f。

　　2、将正则表达式编译成一个模板：p

　　3、用模板p去匹配字符串str。

　　思路清楚了，现在看Java是如何处理的（Java程序员直到JDK1.4才能使用这些类。

　　Pattern类与查找

　　①public final class java.util.regex.Pattern是正则表达式编译后的表达法。下面的语句将创建一个Pattern对象并赋值给句柄p：Pattern p=Pattern.compile(regEx);

　　有趣的是，Pattern类是final类，而且它的构造器是private。也许有人告诉你一些设计模式的东西，或者你自己查有关资料。这里的结论是：Pattern类不能被继承，我们不能通过new创建Pattern类的对象。

　　因此在Pattern类中，提供了2个重载的静态方法，其返回值是Pattern对象（的引用）。如：

public static Pattern compile(String regex) {
　return new Pattern(regex, 0);
}

　　当然，我们可以声明Pattern类的句柄，如Pattern p=null；

　　②p.matcher(str)表示以用模板p去生成一个字符串str的匹配器，它的返回值是一个Matcher类的引用，为什么要这个东西呢？按照自然的想法，返回一个boolean值不行吗？

　　我们可以简单的使用如下方法：

boolean result=Pattern.compile(regEx).matcher(str).find();

　　其实是三个语句合并的无句柄方式。无句柄常常不是好方式。后面再学习Matcher类吧。先看看regEx——这个怪咚咚。

　　正则表达式之限定符

　　正则表达式（Regular Expression）是一种生成字符串的字符串。晕吧。比如说，String regEx="me+";这里字符串me+能够生成的字符串是：me、mee、meee、meeeeeeeeee等等，一个正则表达式可能生成无穷的字符串，所以我们不可能（有必要吗？）输出正则表达式产生的所有东西。

　　反过来考虑，对于字符串：me、mee、meee、meeeeeeeeee等等，我们能否有一种语言去描述它们呢？显然，正则表达式语言是这种语言，它是一些字符串的模式——简洁而深刻的描述。

　　我们使用正则表达式，用于字符串查找、匹配、指定字符串替换、字符串分割等等目的。

　　生成字符串的字符串——正则表达式，真有些复杂，因为我们希望由普通字符（例如字符 a 到 z）以及特殊字符（称为元字符）描述任意的字符串，而且要准确。

　　先看几个正则表达式例子：

　　程序3：我们总用这个程序测试正则表达式。

import java.util.regex.*;

class Regex1{
　public static void main(String args[]) {
　　String str="For my money, the important thing "；
　　String regEx="ab*";
　　boolean result=Pattern.compile(regEx).matcher(str).find();
　　System.out.println(result);
　}
}//ture

　　①"ab*"——能匹配a、ab、abb、abbb……。所以，*表示前面字符可以有零次或多次。如果仅仅考虑查找，直接用"a"也一样。但想想替换的情况。问题regEx="abb*"结果如何？

　　②"ab+"——能匹配ab、abb、abbb……。等价于"abb*"。问题regEx="or+"结果如何？

　　③"or?"——能匹配o和or。? 表示前面字符可以有零次或一次。

　　这些限定符*、+、?方便地表示了其前面字符(子串)出现的次数（我们用{}来描述）： x*，零次或多次 ≡{0,}

posted on 2006-05-18 12:56 JAVA之路阅读(964) 评论(1) 编辑收藏所属分类: JAVA相关

My Links

常用链接

随笔分类

随笔档案

文章分类

文章档案

java

最新随笔

最新评论

阅读排行榜

正则表达式和Java编程语言