normalize()方法运用实例

程序员文章站 2022-03-13 12:20:05

normalize()方法许多欧洲语言有语调符号和重音符号。为了表示它们，Unicode 提供了两种方法。一种是直接提供带重音符号的字符，比如ǒ(\u01D1)。另一种是提供合...

normalize()方法

许多欧洲语言有语调符号和重音符号。为了表示它们，Unicode 提供了两种方法。一种是直接提供带重音符号的字符，比如ǒ(\u01D1)。另一种是提供合成符号(combining character)，即原字符与重音符号的合成，两个字符合成一个字符，比如O(\u004F)和ˇ(\u030C)合成ǒ(\u004F\u030C)。

这两种表示方法，在视觉和语义上都等价，但是 JavaScript 不能识别。

'\u01D1'==='\u004F\u030C' //false

'\u01D1'.length // 1

'\u004F\u030C'.length // 2

上面代码表示，JavaScript 将合成字符视为两个字符，导致两种表示方法不相等。

ES6 提供字符串实例的normalize()方法，用来将字符的不同表示方法统一为同样的形式，这称为 Unicode 正规化。

'\u01D1'.normalize() === '\u004F\u030C'.normalize()

// true

normalize()方法可以接受一个参数来指定normalize()的方式，参数的四个可选值如下。

NFC，默认参数，表示“标准等价合成”(Normalization Form Canonical Composition)，返回多个简单字符的合成字符。所谓“标准等价”指的是视觉和语义上的等价。

NFD，表示“标准等价分解”(Normalization Form Canonical Decomposition)，即在标准等价的前提下，返回合成字符分解的多个简单字符。

NFKC，表示“兼容等价合成”(Normalization Form Compatibility Composition)，返回合成字符。所谓“兼容等价”指的是语义上存在等价，但视觉上不等价，比如“囍”和“喜喜”。(这只是用来举例，normalize()方法不能识别中文。)

NFKD，表示“兼容等价分解”(Normalization Form Compatibility Decomposition)，即在兼容等价的前提下，返回合成字符分解的多个简单字符。

'\u004F\u030C'.normalize('NFC').length // 1

'\u004F\u030C'.normalize('NFD').length // 2

上面代码表示，NFC参数返回字符的合成形式，NFD参数返回字符的分解形式。

不过，normalize()方法目前不能识别三个或三个以上字符的合成。这种情况下，还是只能使用正则表达式，通过 Unicode 编号区间判断。

上一篇：前端四角定位代码实例

下一篇： Liunx命令（一）

normalize()方法运用实例

java 中createStatement()方法的实例详解

Android编程之九宫格实现方法实例分析

linux下用renameTo方法修改java web项目中文件夹名称的实例

Android ToolBar整合实例使用方法详解

原生js实现each方法实例代码详解

C#中使用Split方法拆分字符串实例

Java 创建动态类和查看方法列表信息的实例

实例详解C#实现http不同方法的请求

C#在PDF中绘制不同风格类型的文本方法实例

c#启动EXE文件的方法实例