欢迎您访问程序员文章站本站旨在为大家提供分享程序员计算机编程知识!
您现在的位置是: 首页  >  IT编程

Golang 正则匹配效率详解

程序员文章站 2022-06-09 19:16:34
最近有个小需求,校验imei是否为15位纯数字(是否合法),以下是正则匹配,与自己实现的简单验证方式进行压测package mainimport ( "regexp" "testing")...

最近有个小需求,校验imei是否为15位纯数字(是否合法),以下是正则匹配,与自己实现的简单验证方式进行压测

package main
import (
    "regexp"
    "testing"
)
func benchmarkisdigitalregexp(b *testing.b) {
    for i := 0; i < b.n; i++ {
        _ = isdigitalregexp("358901806972417")
    }
}
func benchmarkisdigital(b *testing.b) {
    for i := 0; i < b.n; i++ {
        _ = isdigital("358901806972417")
    }
}
func isdigitalregexp(imei string) bool {
    if ok, _ := regexp.match("^[0-9]{15}$", []byte(imei)); ok {
        return true
    }else {
        return false
    }
}
func isdigital(imei string) bool {
    n := len(imei)
    if n == 15 {
        for i := 0; i < n; i++ {
            if imei[i] >= 48 && imei[i] <= 57 {
                continue
            }else {
                return false
            }
        }
    }else {
        return false
    }
    return true
}

压测结果:

c:\users\m709fjsa\go\src\pprof_demo\re>go test -bench=. -benchmem
goos: windows
goarch: amd64
pkg: pprof_demo/re
benchmarkisdigitalregexp-12       300000              4644 ns/op            6450 b/op         70 allocs/op
benchmarkisdigital-12           200000000                9.48 ns/op            0 b/op          0 allocs/op
pass
ok      pprof_demo/re   4.577s

很明显,正则需要重新分配内存较多,从pprof生成图也可以看出,正则调用关系错综复杂

很明显,正则需要重新分配内存较多,从pprof生成图也可以看出,正则调用关系错综复杂

Golang 正则匹配效率详解

补充:golang —— 正则表达式

正则表达式是一种进行模式匹配和文本操纵的复杂而又强大的工具。虽然正则表达式比纯粹的文本匹配效率低,但是它却更灵活。

按照它的语法规则,随需构造出的匹配模式就能够从原始文本中筛选出几乎任何你想要得到的字符组合。

go语言通过regexp标准包为正则表达式提供了官方支持,如果你已经使用过其他编程语言提供的正则相关功能,那么你应该对go语言版本的不会太陌生,但是它们之间也有一些小的差异,因为go实现的是re2标准,除了\c。

其实字符串处理我们可以使用strings包来进行搜索(contains、index)、替换(replace)和解析(split、join)等操作,但是这些都是简单的字符串操作,他们的搜索都是大小写敏感,而且固定的字符串,如果我们需要匹配可变的那种就没办法实现了,当然如果strings包能解决你的问题,那么就尽量使用它来解决。

因为他们足够简单、而且性能和可读性都会比正则好。

正则匹配规则图

详细请参考

Golang 正则匹配效率详解

简单的正则表达式

1. 匹配任意类型

	buf := "abc azc a7c aac 888 a9c tac"
	// 1. 解释规则
	reg := regexp.mustcompile(`a.c`) // 这里会解析正则表达式,成功就返回解释器(. ——> 除\n外任意字符)
	if reg == nil { // 解释失败
		fmt.println("mustcompile err")
		return
	}
	// 2. 根据规则提取关键信息
	res :=  reg.findallstringsubmatch(buf, -1) //-1表示匹配所有的
	// res :=  reg.findallstringsubmatch(buf, 1) //1表示匹配一个
	fmt.println("res = ", res)

执行结果:

res =  [[abc] [azc] [a7c] [aac] [a9c]]

2. 使用 […] (字符集) 匹配[0-9]之间的数值

  buf := "abc azc a7c aac 888 a9c  tac"
 
    //1) 解释规则, 它会解析正则表达式,如果成功返回解释器
    reg1 := regexp.mustcompile(`a[0-9]c`)
 
    if reg1 == nil { //解释失败,返回nil
        fmt.println("mustcompile err")
        return
    }
 
    //2) 根据规则提取关键信息
    result1 := reg1.findallstringsubmatch(buf, -1)
    fmt.println("result1 = ", result1)

执行结果:

result1 =  [[a7c] [a9c]]

3. 使用 \d 匹配[0-9]之间的数值

  buf := "abc azc a7c aac 888 a9c  tac"
 
    //1) 解释规则, 它会解析正则表达式,如果成功返回解释器
    reg1 := regexp.mustcompile(`a\dc`)
    if reg1 == nil { //解释失败,返回nil
        fmt.println("mustcompile err")
        return
    }
 
    //2) 根据规则提取关键信息
    result1 := reg1.findallstringsubmatch(buf, -1)
    fmt.println("result1 = ", result1)

执行结果:

result1 =  [[a7c] [a9c]]

4.匹配小数

 buf := "3.14 456 adsc as23d 1.23 3. 9.99 1lsa23d 0.08 0.00  "
 // 解释正则表达式
 reg := regexp.mustcompile(`\d+\.\d+`) // +表示匹配前一个字符的一次或者多次
 if reg == nil {
  fmt.println("mustcompile err")
  return
 }
 // 提取关键信息
 res := reg.findallstringsubmatch(buf, -1)
 fmt.println("res = ", res)

执行结果:

res =  [[3.14] [1.23] [9.99] [0.08] [0.00]]

5.匹配信息中某关键字并过滤带标签的

	// ` ` 是原生字符串
	buf := `
			<!doctype html>
			<html lang="zh-cn">
			<head>
				<title>go语言标准库文档中文版 | go语言中文网 | golang中文社区 | golang中国</title>
				<meta name="viewport" content="width=device-width, initial-scale=1, maximum-scale=1.0, user-scalable=no">
				<meta http-equiv="x-ua-compatible" content="ie=edge, chrome=1">
				<meta charset="utf-8">
				<link rel="shortcut icon" href="/static/img/go.ico" rel="external nofollow" >
				<link rel="apple-touch-icon" type="image/png" href="/static/img/logo2.png" rel="external nofollow" >
				<meta name="author" content="polaris <polaris@studygolang.com>">
				<meta name="keywords" content="中文, 文档, 标准库, go语言,golang,go社区,go中文社区,golang中文社区,go语言社区,go语言学习,学习go语言,go语言学习园地,golang 中国,golang中国,golang china, go语言论坛, go语言中文网">
				<meta name="description" content="go语言文档中文版,go语言中文网,中国 golang 社区,go语言学习园地,致力于构建完善的 golang 中文社区,go语言爱好者的学习家园。分享 go 语言知识,交流使用经验">
			</head>
				<div>和爱好</div>
				<div>哈哈
				你在吗
				不在
				</div>
				<div>测试</div>
				<div>你过来啊</div>
			
			<frameset cols="15,85">
				<frame src="/static/pkgdoc/i.html">
				<frame name="main" src="/static/pkgdoc/main.html" tppabs="main.html" >
				<noframes>
				</noframes>
			</frameset>
			</html>
			`
	// 解释正则表达式
	reg := regexp.mustcompile(`<div>(?s:(.*?))</div>`) // s用来处理换行情况
	if reg == nil {
		fmt.println("mustcompile err")
		return
	}
	// 提取关键字
	res := reg.findallstringsubmatch(buf, -1)
	// fmt.println("res = ", res)
	// 过滤<> </>
	for _, text := range res {
		//fmt.println("text[0] = ", text[0]) // 带<> </>的
		fmt.println("text[1] = ", text[1]) //  不带<> </> 的
	}

执行结果:

text[1] =  和爱好
text[1] =  哈哈
    你在吗
    不在
    
text[1] =  测试
text[1] =  你过来啊

以上为个人经验,希望能给大家一个参考,也希望大家多多支持。如有错误或未考虑完全的地方,望不吝赐教。