JavaScript正则表达式的修饰符

程序员文章站 2024-02-20 19:53:46

...

修饰符是影响整个正则规则的特殊符号，会对匹配结果和部分内置函数行为产生不同的效果。

有如下几个修饰符：

i （intensity）：不区分大小写
g（global）：全局匹配；（不仅仅在得到第一个匹配后就停止进行）
m（multip）：检测字符串中的换行符；主要影响字符串中开始标识符(^)和结束标识符($)的使用
u（Unicode）：ES6新增；链接
y （sticky）：ES6新增，粘连（sticky）修饰符。

i 修饰符

var s1 = 'Hello';
var s2 = 'hello';
var p1 = /Hello/;
var p2 = /Hello/i;

console.log(p1.test(s1)); //true
console.log(p1.test(s2)); //false
console.log(p2.test(s1)); //true
console.log(p2.test(s2)); //true

g 修饰符

var p1 = /hello/;
var p2 = /hello/g;
var str = 'hello world, hello world';

console.log(str.match(p1)); //hello         Array[1]
console.log(str.match(p2)); //hello hello   Array[2]

m 修饰符

var str = 'hello world,\nhello world';
var p1 = /^hello/g;
var p2 = /^hello/gm;

console.log(str.match(p1)); //hello        Array[1]
console.log(str.match(p2)); //hello hello  Array[2]

u 修饰符

ES6 对正则表达式添加了u修饰符，含义为“Unicode 模式”，用来正确处理大于\uFFFF的 Unicode 字符。也就是说，会正确处理四个字节的 UTF-16 编码。

/^\uD83D/u.test('\uD83D\uDC2A') // false
/^\uD83D/.test('\uD83D\uDC2A') // true

上面代码中，\uD83D\uDC2A是一个四个字节的 UTF-16 编码，代表一个字符。但是，ES5 不支持四个字节的 UTF-16 编码，会将其识别为两个字符，导致第二行代码结果为true。加了u修饰符以后，ES6 就会识别其为一个字符，所以第一行代码结果为false。

一旦加上u修饰符号，就会修改下面这些正则表达式的行为。

（1）点字符

点（.）字符在正则表达式中，含义是除了换行符以外的任意单个字符。对于码点大于0xFFFF的 Unicode 字符，点字符不能识别，必须加上u修饰符。

var s = '????';

/^.$/.test(s) // false
/^.$/u.test(s) // true

上面代码表示，如果不添加u修饰符，正则表达式就会认为字符串为两个字符，从而匹配失败。

（2）Unicode 字符表示法

ES6 新增了使用大括号表示 Unicode 字符，这种表示法在正则表达式中必须加上u修饰符，才能识别当中的大括号，否则会被解读为量词。

/\u{61}/.test('a') // false
/\u{61}/u.test('a') // true
/\u{20BB7}/u.test('????') // true

上面代码表示，如果不加u修饰符，正则表达式无法识别\u{61}这种表示法，只会认为这匹配 61 个连续的u。

（3）量词

使用u修饰符后，所有量词都会正确识别码点大于0xFFFF的 Unicode 字符。

/a{2}/.test('aa') // true
/a{2}/u.test('aa') // true
/????{2}/.test('????????') // false
/????{2}/u.test('????????') // true

（4）预定义模式

u修饰符也影响到预定义模式，能否正确识别码点大于0xFFFF的 Unicode 字符。

/^\S$/.test('????') // false
/^\S$/u.test('????') // true

上面代码的\S是预定义模式，匹配所有非空白字符。只有加了u修饰符，它才能正确匹配码点大于0xFFFF的 Unicode 字符。

利用这一点，可以写出一个正确返回字符串长度的函数。

function codePointLength(text) {
  var result = text.match(/[\s\S]/gu);
  return result ? result.length : 0;
}

var s = '????????';

s.length // 4
codePointLength(s) // 2

（5）i 修饰符

有些 Unicode 字符的编码不同，但是字型很相近，比如，\u004B与\u212A都是大写的K。

/[a-z]/i.test('\u212A') // false
/[a-z]/iu.test('\u212A') // true

上面代码中，不加u修饰符，就无法识别非规范的K字符。

y 修饰符

y 修饰符的作用与 g 修饰符类似，也是全局匹配，后一次匹配都从上一次匹配成功的下一个位置开始。

不同之处在于，g 修饰符只要剩余位置中存在匹配就可，而 y 修饰符确保匹配必须从剩余的第一个位置开始，这也就是“粘连”的涵义。

var s = 'aaa_aa_a';
var r1 = /a+/g;
var r2 = /a+/y;

r1.exec(s) // ["aaa"]
r2.exec(s) // ["aaa"]

r1.exec(s) // ["aa"]
r2.exec(s) // null

上面代码有两个正则表达式，一个使用g修饰符，另一个使用y修饰符。这两个正则表达式各执行了两次，第一次执行的时候，两者行为相同，剩余字符串都是_aa_a。由于g修饰没有位置要求，所以第二次执行会返回结果，而y修饰符要求匹配必须从头部开始，所以返回null。

如果改一下正则表达式，保证每次都能头部匹配，y修饰符就会返回结果了。

var s = 'aaa_aa_a';
var r = /a+_/y;

r.exec(s) // ["aaa_"]
r.exec(s) // ["aa_"]

上面代码每次匹配，都是从剩余字符串的头部开始。

上一篇： vim常用配置

下一篇： mysql like查询字符串示例语句_MySQL

JavaScript正则表达式的修饰符

i 修饰符

g 修饰符

m 修饰符

u 修饰符

y 修饰符