正则表达式（Regular Expressions）

正则表达式（Regular Expressions）

正则表达式在其他编程语言中的应用非常广泛，网上资料也非常多，而网上在ABAP语言中应用的资料却很少，尽管各语言中正则表达式语法知识都很类似，但仍然有一些区别，本文主要是简单介绍一下其基本语法。总结一下，方便大家查阅。

欢迎转载，请注明出处，文中不足之处还望指正。（Email：hubin0809@126.com）

一、简要认识

正则表达式就是用一个“字符串”来描述一个特征，然后去验证另一个“字符串”是否符合这个特征。比如表达式“ab+” 描述的特征是“一个 'a' 和任意个 'b' ”，那么 'ab','abb','abbbbbbbbbb' 都符合这个特征。

正则表达式可以用来：（1）验证字符串是否符合指定特征，比如验证是否是合法的邮件地址。（2）用来查找字符串，从一个长的文本中查找符合指定特征的字符串，比查找固定字符串更加灵活方便。（3）用来替换，比普通的替换更强大。

举例

DATA:matcherTYPEREFTOcl_abap_matcher,
matchTYPEcLENGTH1.
matcher=cl_abap_matcher=>create(pattern='\w+@\w+(\.\w+)+'
text='hubin0809@126.com').
match=matcher->match().
WRITEmatch.

输出结果：X

解释：

1> '\w+@\w+(\.\w+)+'中 \w 是表示任意一个字母或数字或下划线，+ 表示前面字符个数为一个或多个，@即为’@’字符

2> matcher参照类cl_abap_matcher，match有匹配的意思，调用静态方法create创建了匹配的对（暂时这么理解，好吧，我承认我不知道怎么形容），然后调用match方法，返回值中’X’表示匹配，SPACE表示不匹配。

具体含义后面会讲到，本程序主要是验证邮件地址是否合法。

二、语法规则

pattern模板，text要匹配的字符，match匹配结果，’X’表示匹配，SPACE表示不匹配。

1、普通字符

字母、数字、汉字、下划线、以及后面没有特殊定义的标点符号，都是"普通字符"。表达式中的普通字符，在匹配一个字符串的时候，匹配与之相同的一个字符。

Pattern	Text	Match
A	X
a	-
AB	X

2、转义字符

一些不便书写的字符，采用在前面加 "\" 的方法。例如’.’

表达式	可匹配
\\	代表 "\" 本身
\.	匹配小数点（.）本身
\Q...\E	中间的字符作为普通字符

Pattern

Match

.\.

f\f

\w\d

\\w\\d

\Q\w\d\E

3、能够与 '多种字符'匹配的表达式

正则表达式中的一些表示方法，可以匹配 '多种字符' 其中的任意一个字符。比如，表达式 "\d" 可以匹配任意一个数字。虽然可以匹配其中任意字符，但是只能是一个，不是多个。这就好比玩扑克牌时候，大小王可以代替任意一张牌，但是只能代替一张牌。（没玩过？好吧，去玩qq够级吧，ok，信息泄露了，承认我是山东人）

\d	任意一个数字，0~9 中的任意一个
\w	任意一个字母或数字或下划线，也就是 A~Z,a~z,0~9,_ 中任意一个
\s	包括空格、制表符、换页符等空白字符的其中任意一个
.	小数点可以匹配除了换行符（\n）以外的任意一个字符

\d\d

...

4zF

4、自定义能够与 '多种字符'匹配的表达式

使用方括号 [ ] 包含一系列字符，能够匹配其中任意一个字符。用 [^ ] 包含一系列字符，则能够匹配其中字符之外的任意一个字符。同样的道理，虽然可以匹配其中任意一个，但是只能是一个，不是多个。

[ab5@]	匹配 "a" 或 "b" 或 "5" 或 "@"
[^abc]	匹配 "a","b","c" 之外的任意一个字符
[f-k]	匹配 "f"~"k" 之间的任意一个字母
[^A-F0-3]	匹配 "A"~"F","0"~"3" 之外的任意一个字符

[abc]

abc

[^abc]b

[a-g]b

5、支持的 POSIX字符集合

POSIX字符集合	可匹配
[:alnum:]	任何一个字母或数字（A - Z,a - z,0 - 9）
[:alpha:]	任何一个字母（A - Z,a - z）
[:cntrl:]	任何一个控制字符（\x00 – \x1F,\x7F）
[:digit:]	任何一个数字（0 – 9）
[:space:]	任何一个空白字符（\x09 – \x0D,\x20）
[:graph:]	任何一个可显示的 ASCII 字符，不包含空格
[:lower:]	任何一个小写字母（a – z）
[:upper:]	任何一个大写字母（A – Z）
[:punct:]	可显示字符 [:print:] 中除去字母数字 [:alnum:]
[:blank:]	空格或者制表符（\x20,\x09）

个人感觉意义不大，可能对一些控制字符有用吧，了解。

[[:alnum:]]

[:lower:][:digit:]

[[:lower:][:digit:]]

6、修饰匹配次数的特殊符号

前面讲到的表达式，无论是只能匹配一种字符的表达式，还是可以匹配多种字符其中任意一个的表达式，都只能匹配一次。如果使用表达式再加上修饰匹配次数的特殊符号，那么不用重复书写表达式就可以重复匹配，否则会累死的。

作用
{n}	表达式重复n次，比如："\w{2}" 相当于 "\w\w"；"a{5}" 相当于 "aaaaa"
{m,n}	表达式至少重复m次，最多重复n次，比如："ba{1,3}"可以匹配 "ba"或"baa"或"baaa"
表达式至少重复m次，比如："\w\d{2,}"可以匹配 "a12","_456","M12344"...
?	匹配表达式0次或者1次，相当于 {0,1}，比如："a[cd]?"可以匹配 "a","ac","ad"
+	表达式至少出现1次，相当于 {1,}，比如："a+b"可以匹配 "ab","aab","aaab"...
*	表达式不出现或出现任意次，相当于 {0,}，比如："*b"可以匹配 "b","cccb"...

[abc]{3}

bca

.{3,5}

abcd

\d{5,}

12345

a*b

a+b

7、其他一些代表抽象意义的特殊符号

与字符串开始的地方匹配，不匹配任何字符

与字符串结束的地方匹配，不匹配任何字符

匹配一个单词边界，也就是单词和空格之间的位置，不匹配任何字符

左右两边表达式之间 "或" 关系，匹配左边或者右边

( )

(1). 在被修饰匹配次数的时候，括号中的表达式可以作为整体被修饰
(2). 取匹配结果的时候，括号中的表达式匹配到的内容可以被单独得到

(?: )

匹配pattern但不获取匹配结果，也就是说这是一个非获取匹配，不进行存储供以后使用。

进一步的文字说明仍然比较抽象，因此，举例帮助大家理解。

举例1：表达式 "^aaa" 在匹配 "xxx aaa xxx" 时，匹配结果是：失败。因为 "^" 要求与字符串开始的地方匹配，因此，只有当 "aaa" 位于字符串的开头的时候，"^aaa" 才能匹配，比如："aaa xxx xxx"。

举例2：表达式 "aaa$" 在匹配 "xxx aaa xxx" 时，匹配结果是：失败。因为 "$" 要求与字符串结束的地方匹配，因此，只有当 "aaa" 位于字符串的结尾的时候，"aaa$" 才能匹配，比如："xxx xxx aaa"。

举例3：表达式 ".\b." 在匹配 "@@@abc" 时，能够找到匹配的内容；匹配到的内容是："@a"；匹配到的位置是：开始于2，结束于4。
进一步说明："\b" 与 "^" 和 "$" 类似，本身不匹配任何字符，但是它要求它在匹配结果中所处位置的左右两边，其中一边是 "\w" 范围，另一边是非"\w" 的范围。

举例4：表达式 "\bend\b" 在匹配 "weekend,endfor,end" 时，能够找到匹配的内容；匹配到的内容是："end"；匹配到的位置是：开始于15，结束于18。

Pattern

Match

(.{1,3})|(.{5,})

bcade

三、正则表达式中的一些高级规则(ABAP部分支持)

1、匹配次数中的贪婪与非贪婪

贪婪模式：

在使用修饰匹配次数的特殊符号时，有几种表示方法可以使同一个表达式能够匹配不同的次数，比如："{m,n}","{m,}","?","*","+"，具体匹配的次数随被匹配的字符串而定。这种重复匹配不定次数的表达式在匹配过程中，总是尽可能多的匹配。比如，针对文本 "dxxxdxxxd"，举例如下：

表达式	匹配结果
(d)(\w+)	"\w+" 将匹配第一个 "d" 之后的所有字符 "xxxdxxxd"
(d)(\w+)(d)	"\w+" 将匹配第一个 "d" 和最后一个 "d" 之间的所有字符 "xxxdxxx"。虽然 "\w+" 也能够匹配上最后一个 "d"，但是为了使整个表达式匹配成功，"\w+" 可以 "让出" 它本来能够匹配的最后一个 "d"

由此可见，"\w+" 在匹配的时候，总是尽可能多的匹配符合它规则的字符。虽然第二个举例中，它没有匹配最后一个 "d"，但那也是为了让整个表达式能够匹配成功。同理，带 "*" 和 "{m,n}" 的表达式都是尽可能地多匹配，带 "?" 的表达式在可匹配可不匹配的时候，也是尽可能的 "要匹配"。这种匹配原则就叫作 "贪婪" 模式。

非贪婪模式：（ABAP暂时不支持，但是最好理解吧）

在修饰匹配次数的特殊符号后再加上一个 "?" 号，则可以使匹配次数不定的表达式尽可能少的匹配，使可匹配可不匹配的表达式，尽可能的 "不匹配"。这种匹配原则叫作 "非贪婪" 模式，也叫作 "勉强" 模式。如果少匹配就会导致整个表达式匹配失败的时候，与贪婪模式类似，非贪婪模式会最小限度的再匹配一些，以使整个表达式匹配成功。举例如下，针对文本 "dxxxdxxxd" 举例：

(d)(\w+?)

"\w+?" 将尽可能少的匹配第一个 "d" 之后的字符，结果是："\w+?" 只匹配了一个 "x"

(d)(\w+?)(d)

为了让整个表达式匹配成功，"\w+?" 不得不匹配 "xxx" 才可以让后边的 "d" 匹配，从而使整个表达式匹配成功。因此，结果是："\w+?" 匹配 "xxx"

更多的情况，举例如下：
举例1：表达式 "<td>(.*)</td>" 与字符串 "<td>aa</td> <td>bb</td>" 匹配时，匹配的结果是：成功；匹配到的内容是 "<td>aa</td> <td>bb</td>" 整个字符串，表达式中的 "</td>" 将与字符串中最后一个 "</td>" 匹配。
举例2：相比之下，表达式 "<td>(.*?)</td>" 匹配举例1中同样的字符串时，将只得到 "<td>aa</td>"，再次匹配下一个时，可以得到第二个 "<td>bb</td>"。

2、反向引用 \1,\2

表达式在匹配时，表达式引擎会将小括号 "( )" 包含的表达式所匹配到的字符串记录下来。在获取匹配结果的时候，小括号包含的表达式所匹配到的字符串可以单独获取。这一点，在前面的举例中，已经多次展示了。在实际应用场合中，当用某种边界来查找，而所要获取的内容又不包含边界时，必须使用小括号来指定所要的范围。比如前面的 "<td>(.*?)</td>"。

其实，"小括号包含的表达式所匹配到的字符串" 不仅是在匹配结束后才可以使用，在匹配过程中也可以使用。表达式后边的部分，可以引用前面 "括号内的子匹配已经匹配到的字符串"。引用方法是 "\" 加上一个数字。"\1" 引用第1对括号内匹配到的字符串，"\2" 引用第2对括号内匹配到的字符串……以此类推，如果一对括号内包含另一对括号，则外层的括号先排序号。换句话说，哪一对的左括号 "(" 在前，那这一对就先排序号。

举例如下：

举例1：表达式 "('|")(.*?)\1" 在匹配 " 'Hello',"World" " 时，匹配结果是：成功；匹配到的内容是：" 'Hello' "。再次匹配下一个时，可以匹配到 " "World" "。

举例2：表达式 "(\w)\1{4,}" 在匹配 "aa bbbb abcdefg ccccc 111121111 999999999" 时，匹配结果是：成功；匹配到的内容是 "ccccc"。再次匹配下一个时，将得到 999999999。这个表达式要求 "\w" 范围的字符至少重复5次，注意与 "\w{5,}" 之间的区别。

举例3：表达式 "<(\w+)\s*(\w+(=('|").*?\4)?\s*)*>.*?</\1>" 在匹配 "<td id='td1' style="bgcolor:white"></td>" 时，匹配结果是成功。如果 "<td>" 与 "</td>" 不配对，则会匹配失败；如果改成其他配对，也可以匹配成功。

3、预搜索

前面的章节中，我讲到了几个代表抽象意义的特殊符号："^"，"$"，"\b"。它们都有一个共同点，那就是：它们本身不匹配任何字符，只是对 "字符串的两头" 或者 "字符之间的缝隙" 附加了一个条件。理解到这个概念以后，本节将继续介绍另外一种对 "两头" 或者 "缝隙" 附加条件的，更加灵活的表示方法。

格式："(?=xxxxx)"，在被匹配的字符串中，它对所处的 "缝隙" 或者 "两头" 附加的条件是：所在缝隙的右侧，必须能够匹配上 xxxxx 这部分的表达式。因为它只是在此作为这个缝隙上附加的条件，所以它并不影响后边的表达式去真正匹配这个缝隙之后的字符。这就类似 "\b"，本身不匹配任何字符。"\b" 只是将所在缝隙之前、之后的字符取来进行了一下判断，不会影响后边的表达式来真正的匹配。

举例1：表达式 "Windows (?=NT|XP)" 在匹配 "Windows 98,Windows NT,Windows 2000" 时，将只匹配 "Windows NT" 中的 "Windows "，其他的 "Windows " 字样则不被匹配。

举例2：表达式 "(\w)((?=\1\1\1)(\1))+" 在匹配字符串 "aaa ffffff 999999999" 时，将可以匹配6个"f"的前4个，可以匹配9个"9"的前7个。这个表达式可以读解成：重复4次以上的字母数字，则匹配其剩下最后2位之前的部分。当然，这个表达式可以不这样写，在此的目的是作为演示之用。

格式："(?!xxxxx)"，所在缝隙的右侧，必须不能匹配 xxxxx 这部分表达式。

举例3：表达式 "((?!\bstop\b).)+" 在匹配 "fdjka ljfdl stop fjdsla fdj" 时，将从头一直匹配到 "stop" 之前的位置，如果字符串中没有 "stop"，则匹配整个字符串。

举例4：表达式 "do(?!\w)" 在匹配字符串 "done,do,dog" 时，只能匹配 "do"。在本条举例中，"do" 后边使用 "(?!\w)" 和使用 "\b" 效果是一样的。

4、其他补充

1> 在表达式 "\s"，"\d"，"\w"，"\b" 表示特殊意义的同时，其大写字母表示相反的意义

2> 在表达式中有特殊意义，需要添加 "\" 才能匹配该字符本身的字符汇总

规则终于写完了！其实和其他编程语言规则差不多啦！下面结合ABAP讲讲怎么使用吧，Let’s GO!

不过需要注意,SAP只能是ECC6或者更高版本才可以使用正则(ABAP supports POSIX regular expressions as of Release 7.00)

CL_ABAP_REGEX regex就是regular expression的缩写，里面的方法不是很多，可能用到的也就只有构造方法和REATE_MATCHER这个方法。

CL_ABAP_MATCHER matcher匹配的意思，也就是说所有的匹配规则都和它有关，里面具体方法，se24去查看

其实正则表达式的应用无外乎三种：验证（是否符合规则）、查找（包含提取）、替换

IFCL_ABAP_MATCHER=>MATCHES(PATTERN='\D+'
TEXT='ZF25')
=ABAP_TRUE.
WRITE'ISNUMBER'.
ELSE.
WRITE'ISNOTNUMBER'.
ENDIF.

DATA:
MATCHERTYPEREFTOCL_ABAP_MATCHER,
MATCHESTYPEMATCH_RESULT_TAB,
MATCHLIKELINEOFMATCHES,
W_TEXTTYPESTRING.
W_TEXT='<aid="MyLinks1_NewPostLink"'
&'href="http://www.cnblogs.com/VerySky/admin/EditPosts.aspx?opt=1">'.
MATCHER=CL_ABAP_MATCHER=>CREATE(PATTERN='http://.*(?=")'
TEXT=W_TEXT).
MATCHES=MATCHER->FIND_ALL().
LOOPATMATCHESINTOMATCH.
WRITE:/W_TEXT+MATCH-OFFSET(MATCH-LENGTH).
ENDLOOP.

这个方法是不是太麻烦了啊，不急有简单的方法，其实就是字符串处理中用到的。

DATA:pattTYPEstringVALUE`n.?w`,
textTYPEstring,
result_tabTYPEmatch_result_tab.
FIELD-SYMBOLS<match>LIKELINEOFresult_tab.
FINDALLOCCURRENCESOFREGEXpattIN
`Everybodyknowsthisisnowhere`
RESULTSresult_tab.
LOOPATresult_tabASSIGNING<match>.
WRITE:/<match>-offset,<match>-length.
ENDLOOP.

DATA:STRTYPESTRING,
RESULT_TABTYPEMATCH_RESULT_TAB,
WALIKELINEOFRESULT_TAB.
*找出STRING里面的双字节字符
str='abc我啊adfsf们'.
FINDALLOCCURRENCESOFREGEX'[^\x00-\xff]*'INSTRRESULTSRESULT_TAB.
LOOPATRESULT_TABINTOWA.
WRITE/STR+WA-OFFSET(WA-LENGTH).
ENDLOOP.

解释：大家都知道英文字母是单字节的，中文是双字节的，但是在ABAP里面用strlen等方法是区别不出单双字节的，这个实例中讲的不失为一个很好的办法。

大家肯定会说了，字符串前后没有没替换啊。注意修改的不是W_TEXT本身，他将修改后的值放到了MATCHER->TEXT即match类实例的属性里面，我们只需令W_TEXT = MATCHER->TEXT即可。

同样这里也有简单方法，字符串处理中的方法也是支持正则的

DATATEXTTYPESTRINGVALUE'-dfufdud-'.
REPLACEALLOCCURRENCESOFREGEX'u'INtextWITH'x'.
WRITETEXT.

表达式	方向	说明
(?=xxx)	正向预搜索（向右）	正向预搜索，判断当前位置右侧是否能匹配指定表达式
(?!xxx)	正向预搜索（向右）	正向预搜索否定，判断当前位置右侧是否不能够匹配指定表达式
(?<=xxx)	反向预搜索（向左）[ABAP不支持]	反向预搜索，判断当前位置左侧是否能够匹配指定表达式
(?<!xxx)	反向预搜索（向左）[ABAP不支持]	反向预搜索否定，判断当前位置左侧是否不能够匹配指定表达式

可匹配
\S	匹配所有非空白字符（"\s" 可匹配各个空白字符）
\D	匹配所有的非数字字符
\W	匹配所有的字母、数字、下划线以外的字符
\B	匹配非单词边界，即左右两边都是 "\w" 范围或者左右两边都不是 "\w" 范围时的字符缝隙

Placeholder for any single character
\C	\d	Placeholder for any single digit
\D	Placeholder for any character other than a digit
\l	Placeholder for any lower-case letter
\L	Placeholder for any character other than a lower-case letter
\s	Placeholder for a blank character
\S	Placeholder for any character other than a blank character
\u	Placeholder for any upper-case letter
\U	Placeholder for any character other than an upper-case letter
\w	Placeholder for any alphanumeric character including_
\W	Placeholder for any non-alphanumeric character except for_
[ ]	Definition of a value set for single characters
[^ ]	Negation of a value set for single characters
[ - ]	Definition of a range in a value set for single characters
[ [:alnum:] ]	Description of all alphanumeric characters in a value set
[ [:alpha:] ]	Description of all letters in a value set
[ [:blank:] ]	Description for blank characters and horizontal tabulators in a value set
[ [:cntrl:] ]	Description of all control characters in a value set
[ [:digit:] ]	Description of all digits in a value set
[ [:graph:] ]	Description of all graphic special characters in a value set
[ [:lower:] ]	Description of all lower-case letters in a value set
[ [:print:] ]	Description of all displayable characters in a value set
[ [:punct:] ]	Description of all punctuation characters in a value set
[ [:space:] ]	Description of all blank characters,tabulators,and carriage Feeds in a value set
[ [:unicode:] ]	Description of all Unicode characters in a value set with a code larger than 255
[ [:upper:] ]	Description of all upper-case letters in a value set
[ [:word:] ]	Description of all alphanumeric characters in a value set,including_
[ [:xdigit:] ]	Description of all hexadecimal digits in a value set
\a \f \n \r \t \v	Diverse platform-specific control characters
[..]	Reserved for later enhancements
[==]	Reserved for later enhancements

字符	描述
\	将下一个字符标记为一个特殊字符、或一个原义字符、或一个向后引用、或一个八进制转义符。例如，“`n`”匹配字符“`n`”。“`\n`”匹配一个换行符。序列“`\\`”匹配“`\`”而“`\(`”则匹配“`(`”。
^	匹配输入字符串的开始位置。如果设置了RegExp对象的Multiline属性，^也匹配“`\n`”或“`\r`”之后的位置。
$	匹配输入字符串的结束位置。如果设置了RegExp对象的Multiline属性，$也匹配“`\n`”或“`\r`”之前的位置。
*	匹配前面的子表达式零次或多次。例如，zo能匹配“`z`”以及“`zoo`”。等价于{0,}。
+	匹配前面的子表达式一次或多次。例如，“`zo+`”能匹配“`zo`”以及“`zoo`”，但不能匹配“`z`”。+等价于{1,sans-serif; border:1px solid silver; border-collapse:collapse; padding:3px"> ?	匹配前面的子表达式零次或一次。例如，“`do(es)?`”可以匹配“`do`”或“`does`”中的“`do`”。?等价于{0,1}。
{n}	n是一个非负整数。匹配确定的n次。例如，“`o{2}`”不能匹配“`Bob`”中的“`o`”，但是能匹配“`food`”中的两个o。
{n,}	n是一个非负整数。至少匹配n次。例如，“`o{2,}`”不能匹配“`Bob`”中的“`o`”，但能匹配“`foooood`”中的所有o。“`o{1,}`”等价于“`o+`”。“`o{0,}`”则等价于“`o*`”。
m和n均为非负整数，其中n<=m。最少匹配n次且最多匹配m次。例如，“`o{1,3}`”将匹配“`fooooood`”中的前三个o。“`o{0,1}`”等价于“`o?`”。请注意在逗号和两个数之间不能有空格。
当该字符紧跟在任何一个其他限制符（*,+,?，{n}，{n,}，{n,m}）后面时，匹配模式是非贪婪的。非贪婪模式尽可能少的匹配所搜索的字符串，而默认的贪婪模式则尽可能多的匹配所搜索的字符串。例如，对于字符串“`oooo`”，“`o+?`”将匹配单个“`o`”，而“`o+`”将匹配所有“`o`”。
.	匹配除“`\n`”之外的任何单个字符。要匹配包括“`\n`”在内的任何字符，请使用像“`[.\n]`”的模式。
(pattern)	匹配pattern并获取这一匹配。所获取的匹配可以从产生的Matches集合得到，在VBScript中使用SubMatches集合，在JScript中则使用$0…$9属性。要匹配圆括号字符，请使用“`\(`”或“`\)`”。
(?:pattern)	匹配pattern但不获取匹配结果，也就是说这是一个非获取匹配，不进行存储供以后使用。这在使用或字符“`(\|)`”来组合一个模式的各个部分是很有用。例如“`industr(?:y\|ies)`”就是一个比“`industry\|industries`”更简略的表达式。
(?=pattern)	正向预查，在任何匹配pattern的字符串开始处匹配查找字符串。这是一个非获取匹配，也就是说，该匹配不需要获取供以后使用。例如，“`Windows(?=95\|98\|NT\|2000)`”能匹配“`Windows2000`”中的“`Windows`”，但不能匹配“`Windows3.1`”中的“`Windows`”。预查不消耗字符，也就是说，在一个匹配发生后，在最后一次匹配之后立即开始下一次匹配的搜索，而不是从包含预查的字符之后开始。
(?!pattern)	负向预查，在任何不匹配pattern的字符串开始处匹配查找字符串。这是一个非获取匹配，也就是说，该匹配不需要获取供以后使用。例如“`Windows(?!95\|98\|NT\|2000)`”能匹配“`Windows3.1`”中的“`Windows`”，但不能匹配“`Windows2000`”中的“`Windows`”。预查不消耗字符，也就是说，在一个匹配发生后，在最后一次匹配之后立即开始下一次匹配的搜索，而不是从包含预查的字符之后开始
x\|y	匹配x或y。例如，“`z\|food`”能匹配“`z`”或“`food`”。“`(z\|f)ood`”则匹配“`zood`”或“`food`”。
[xyz]	字符集合。匹配所包含的任意一个字符。例如，“`[abc]`”可以匹配“`plain`”中的“`a`”。
[^xyz]	负值字符集合。匹配未包含的任意字符。例如，“`[^abc]`”可以匹配“`plain`”中的“`p`”。
[a-z]	字符范围。匹配指定范围内的任意字符。例如，“`[a-z]`”可以匹配“`a`”到“`z`”范围内的任意小写字母字符。
[^a-z]	负值字符范围。匹配任何不在指定范围内的任意字符。例如，“`[^a-z]`”可以匹配任何不在“`a`”到“`z`”范围内的任意字符。
\b	匹配一个单词边界，也就是指单词和空格间的位置。例如，“`er\b`”可以匹配“`never`”中的“`er`”，但不能匹配“`verb`”中的“`er`”。
\B	匹配非单词边界。“`er\B`”能匹配“`verb`”中的“`er`”，但不能匹配“`never`”中的“`er`”。
\cx	匹配由x指明的控制字符。例如，\cM匹配一个Control-M或回车符。x的值必须为A-Z或a-z之一。否则，将c视为一个原义的“`c`”字符。
\d	匹配一个数字字符。等价于[0-9]。
\D	匹配一个非数字字符。等价于[^0-9]。
\f	匹配一个换页符。等价于\x0c和\cL。
\n	匹配一个换行符。等价于\x0a和\cJ。
\r	匹配一个回车符。等价于\x0d和\cM。
\s	匹配任何空白字符，包括空格、制表符、换页符等等。等价于[\f\n\r\t\v]。
\S	匹配任何非空白字符。等价于[^\f\n\r\t\v]。
\t	匹配一个制表符。等价于\x09和\cI。
\v	匹配一个垂直制表符。等价于\x0b和\cK。
\w	匹配包括下划线的任何单词字符。等价于“`[A-Za-z0-9_]`”。
\W	匹配任何非单词字符。等价于“`[^A-Za-z0-9_]`”。
\xn	匹配n，其中n为十六进制转义值。十六进制转义值必须为确定的两个数字长。例如，“`\x41`”匹配“`A`”。“`\x041`”则等价于“`\x04&1`”。正则表达式中可以使用ASCII编码。.
\num	匹配num，其中num是一个正整数。对所获取的匹配的引用。例如，“`(.)\1`”匹配两个连续的相同字符。
\n	标识一个八进制转义值或一个向后引用。如果\n之前至少n个获取的子表达式，则n为向后引用。否则，如果n为八进制数字（0-7），则n为一个八进制转义值。
\nm	标识一个八进制转义值或一个向后引用。如果\nm之前至少有nm个获得子表达式，则nm为向后引用。如果\nm之前至少有n个获取，则n为一个后跟文字m的向后引用。如果前面的条件都不满足，若n和m均为八进制数字（0-7），则\nm将匹配八进制转义值nm。
\nml	如果n为八进制数字（0-3），且m和l均为八进制数字（0-7），则匹配八进制转义值nml。
\un	匹配n，其中n是一个用四个十六进制数字表示的Unicode字符。例如，\u00A9匹配版权符号（?）。

正则表达式（Regular Expressions）

1、匹配次数中的贪婪与非贪婪

2、反向引用 \1,\2

3、预搜索

4、其他补充

Special Characters in Regular Expressions

Escape character

Special character for single character strings

如何写出高效率的正则表达式

猜你在找的正则表达式相关文章

正则表达式（Regular Expressions）

1、 匹配次数中的贪婪与非贪婪

2、 反向引用 \1,\2

3、 预搜索

4、 其他补充

Special Characters in Regular Expressions

Escape character

Special character for single character strings

如何写出高效率的正则表达式

猜你在找的正则表达式相关文章

1、匹配次数中的贪婪与非贪婪

2、反向引用 \1,\2

3、预搜索

4、其他补充