Golang 获取文件md5校验的方法以及效率对比
程序员文章站
2022-09-22 17:56:14
近期有一个需求:获取多个文件 md5 校验和判断是否存在重复文件,因为文件数量较多,有的文件还比较大,需要处理的文件还没有到位,我就考虑了一下效率的问题。目前我已知的 golang 中获取 md5 校...
近期有一个需求:获取多个文件 md5 校验和判断是否存在重复文件,因为文件数量较多,有的文件还比较大,需要处理的文件还没有到位,我就考虑了一下效率的问题。
目前我已知的 golang 中获取 md5 校验和的方法有两个
这里直接给出实现源码。
package main import ( "crypto/md5" "flag" "fmt" "io" "io/ioutil" "os" ) var which = flag.bool("which", true, "") var path = flag.string("path", "", "") var cnt = flag.int("cnt", 100, "") func aaa() { f, err := os.open(*path) if err != nil { fmt.println("open", err) return } defer f.close() body, err := ioutil.readall(f) if err != nil { fmt.println("readall", err) return } md5.sum(body) //fmt.printf("%x\n", md5.sum(body)) } func bbb() { f, err := os.open(*path) if err != nil { fmt.println("open", err) return } defer f.close() md5hash := md5.new() if _, err := io.copy(md5hash, f); err != nil { fmt.println("copy", err) return } md5hash.sum(nil) //fmt.printf("%x\n", md5hash.sum(nil)) } func main() { flag.parse() for i := 0; i < *cnt; i++ { if *which { aaa() } else { bbb() } } }
还有可供参考的获取 md5 校验和的 shell 命令
md5 -- calculate a message-digest fingerprint (checksum) for a file md5 [-pqrtx] [-s string] [file ...]
测试文件是公司项目的日志文件
banjakukutekiimac:shell panshiqu$ ls -an | grep by -rw-r--r-- 1 501 20 7285957 11 17 16:14 by.out banjakukutekiimac:shell panshiqu$ cp by.out by2.out banjakukutekiimac:shell panshiqu$ cat by.out >> by2.out banjakukutekiimac:shell panshiqu$ ls -an | grep by -rw-r--r-- 1 501 20 7285957 11 17 16:14 by.out -rw-r--r-- 1 501 20 14571914 11 17 17:03 by2.out
下面效率展示
banjakukutekiimac:shell panshiqu$ time ./gomd5 -cnt=1 -which=true -path="by.out" real 0m0.027s user 0m0.017s sys 0m0.012s banjakukutekiimac:shell panshiqu$ time ./gomd5 -cnt=1 -which=true -path="by2.out" real 0m0.048s user 0m0.033s sys 0m0.018s banjakukutekiimac:shell panshiqu$ time ./gomd5 -cnt=1 -which=false -path="by.out" real 0m0.018s user 0m0.012s sys 0m0.004s banjakukutekiimac:shell panshiqu$ time ./gomd5 -cnt=1 -which=false -path="by2.out" real 0m0.031s user 0m0.024s sys 0m0.005s banjakukutekiimac:shell panshiqu$ time md5 by.out md5 (by.out) = 9d79e19a00cef1ae1bb6518ca4adf9de real 0m0.023s user 0m0.019s sys 0m0.006s banjakukutekiimac:shell panshiqu$ time md5 by2.out md5 (by2.out) = 0a029a460a20e8dcb00d032d6fab74c6 real 0m0.042s user 0m0.037s sys 0m0.009s
总结:
不管什么方法都会随着文件变大时间会变长,上面的例子大约都是2倍
io.copy 方法效率最高,建议大家这样使用
补充:go语言:md5计算方法的效率研究
研究了一下go的md5计算方法,目前来看,效率最高运行最快的写法是调用md5.sum()函数返回16字节checksum,然后把每个字节的高4位和低4位分别映射成16进制字符存到两个字节里,得到32字节,再转成字符串。
fastmd5较其它算法效率提高了至少46%以上。
const hextable = "0123456789abcdef" //作者: pengpengzhou func fastmd5(str string) string { src := md5.sum([]byte(str)) var dst = make([]byte, 32) j := 0 for _, v := range src { dst[j] = hextable[v>>4] dst[j+1] = hextable[v&0x0f] j += 2 } return string(dst) }
go test benchmark测试结果:
goos: linux goarch: amd64 pkg: example benchmarkfastmd5-4 5564898 205 ns/op benchmarkv1-4 3461698 379 ns/op benchmarkv2-4 2277235 516 ns/op benchmarkv3-4 2158122 527 ns/op pass ok example 6.440s
详细代码如下:
package main import ( "crypto/md5" "encoding/hex" "fmt" "io" ) const hextable = "0123456789abcdef" func fastmd5(str string) string { src := md5.sum([]byte(str)) var dst = make([]byte, 32) j := 0 for _, v := range src { dst[j] = hextable[v>>4] dst[j+1] = hextable[v&0x0f] j += 2 } return string(dst) } func md5v1(str string) string { h := md5.new() h.write([]byte(str)) return hex.encodetostring(h.sum(nil)) } func md5v2(str string) string { data := []byte(str) has := md5.sum(data) md5str := fmt.sprintf("%x", has) return md5str } func md5v3(str string) string { w := md5.new() io.writestring(w, str) md5str := fmt.sprintf("%x", w.sum(nil)) return md5str } func main() { str := "中文" fmt.println(fastmd5(str)) fmt.println(md5v1(str)) fmt.println(md5v2(str)) fmt.println(md5v3(str)) }
package main import ( "testing" ) var str = "golang中文教程" func benchmarkfastmd5(b *testing.b) { for i := 0; i < b.n; i++ { fastmd5(str) } } func benchmarkv1(b *testing.b) { for i := 0; i < b.n; i++ { md5v1(str) } } func benchmarkv2(b *testing.b) { for i := 0; i < b.n; i++ { md5v2(str) } } func benchmarkv3(b *testing.b) { for i := 0; i < b.n; i++ { md5v3(str) } }
以上为个人经验,希望能给大家一个参考,也希望大家多多支持。如有错误或未考虑完全的地方,望不吝赐教。