欢迎您访问程序员文章站本站旨在为大家提供分享程序员计算机编程知识!
您现在的位置是: 首页  >  IT编程

Golang 获取文件md5校验的方法以及效率对比

程序员文章站 2022-09-22 17:56:14
近期有一个需求:获取多个文件 md5 校验和判断是否存在重复文件,因为文件数量较多,有的文件还比较大,需要处理的文件还没有到位,我就考虑了一下效率的问题。目前我已知的 golang 中获取 md5 校...

近期有一个需求:获取多个文件 md5 校验和判断是否存在重复文件,因为文件数量较多,有的文件还比较大,需要处理的文件还没有到位,我就考虑了一下效率的问题。

目前我已知的 golang 中获取 md5 校验和的方法有两个

这里直接给出实现源码。

package main
import (
 "crypto/md5"
 "flag"
 "fmt"
 "io"
 "io/ioutil"
 "os"
)
var which = flag.bool("which", true, "")
var path = flag.string("path", "", "")
var cnt = flag.int("cnt", 100, "")
func aaa() {
 f, err := os.open(*path)
 if err != nil {
  fmt.println("open", err)
  return
 }
 defer f.close()
 body, err := ioutil.readall(f)
 if err != nil {
  fmt.println("readall", err)
  return
 }
 md5.sum(body)
 //fmt.printf("%x\n", md5.sum(body))
}
func bbb() {
 f, err := os.open(*path)
 if err != nil {
  fmt.println("open", err)
  return
 }
 defer f.close()
 md5hash := md5.new()
 if _, err := io.copy(md5hash, f); err != nil {
  fmt.println("copy", err)
  return
 }
 md5hash.sum(nil)
 //fmt.printf("%x\n", md5hash.sum(nil))
}
func main() {
 flag.parse()
 for i := 0; i < *cnt; i++ {
  if *which {
   aaa()
  } else {
   bbb()
  }
 }
}

还有可供参考的获取 md5 校验和的 shell 命令

md5 -- calculate a message-digest fingerprint (checksum) for a file
md5 [-pqrtx] [-s string] [file ...]

测试文件是公司项目的日志文件

banjakukutekiimac:shell panshiqu$ ls -an | grep by
-rw-r--r--   1 501  20   7285957 11 17 16:14 by.out
banjakukutekiimac:shell panshiqu$ cp by.out by2.out
banjakukutekiimac:shell panshiqu$ cat by.out >> by2.out
banjakukutekiimac:shell panshiqu$ ls -an | grep by
-rw-r--r--   1 501  20   7285957 11 17 16:14 by.out
-rw-r--r--   1 501  20  14571914 11 17 17:03 by2.out

下面效率展示

banjakukutekiimac:shell panshiqu$ time ./gomd5 -cnt=1 -which=true -path="by.out"
real 0m0.027s
user 0m0.017s
sys 0m0.012s
banjakukutekiimac:shell panshiqu$ time ./gomd5 -cnt=1 -which=true -path="by2.out"
real 0m0.048s
user 0m0.033s
sys 0m0.018s
banjakukutekiimac:shell panshiqu$ time ./gomd5 -cnt=1 -which=false -path="by.out"
real 0m0.018s
user 0m0.012s
sys 0m0.004s
banjakukutekiimac:shell panshiqu$ time ./gomd5 -cnt=1 -which=false -path="by2.out"
real 0m0.031s
user 0m0.024s
sys 0m0.005s
banjakukutekiimac:shell panshiqu$ time md5 by.out
md5 (by.out) = 9d79e19a00cef1ae1bb6518ca4adf9de
real 0m0.023s
user 0m0.019s
sys 0m0.006s
banjakukutekiimac:shell panshiqu$ time md5 by2.out
md5 (by2.out) = 0a029a460a20e8dcb00d032d6fab74c6
real 0m0.042s
user 0m0.037s
sys 0m0.009s

总结:

不管什么方法都会随着文件变大时间会变长,上面的例子大约都是2倍

io.copy 方法效率最高,建议大家这样使用

补充:go语言:md5计算方法的效率研究

研究了一下go的md5计算方法,目前来看,效率最高运行最快的写法是调用md5.sum()函数返回16字节checksum,然后把每个字节的高4位和低4位分别映射成16进制字符存到两个字节里,得到32字节,再转成字符串。

fastmd5较其它算法效率提高了至少46%以上。

 
const hextable = "0123456789abcdef" 
//作者: pengpengzhou
func fastmd5(str string) string {
	src := md5.sum([]byte(str))
	var dst = make([]byte, 32)
	j := 0
	for _, v := range src {
		dst[j] = hextable[v>>4]
		dst[j+1] = hextable[v&0x0f]
		j += 2
	}
	return string(dst)
}

go test benchmark测试结果:

goos: linux
goarch: amd64
pkg: example
benchmarkfastmd5-4       5564898               205 ns/op
benchmarkv1-4            3461698               379 ns/op
benchmarkv2-4            2277235               516 ns/op
benchmarkv3-4            2158122               527 ns/op
pass
ok      example 6.440s

详细代码如下:

package main 
import (
	"crypto/md5"
	"encoding/hex"
	"fmt"
	"io"
)
 
const hextable = "0123456789abcdef"
 
func fastmd5(str string) string {
	src := md5.sum([]byte(str))
	var dst = make([]byte, 32)
	j := 0
	for _, v := range src {
		dst[j] = hextable[v>>4]
		dst[j+1] = hextable[v&0x0f]
		j += 2
	}
	return string(dst)
}
 
func md5v1(str string) string {
	h := md5.new()
	h.write([]byte(str))
	return hex.encodetostring(h.sum(nil))
}
 
func md5v2(str string) string {
	data := []byte(str)
	has := md5.sum(data)
	md5str := fmt.sprintf("%x", has)
	return md5str
}
 
func md5v3(str string) string {
	w := md5.new()
	io.writestring(w, str)
	md5str := fmt.sprintf("%x", w.sum(nil))
	return md5str
}
 
func main() {
	str := "中文"
	fmt.println(fastmd5(str))
	fmt.println(md5v1(str))
	fmt.println(md5v2(str))
	fmt.println(md5v3(str))
}
package main 
import (
	"testing"
)
 
var str = "golang中文教程"
 
func benchmarkfastmd5(b *testing.b) {
	for i := 0; i < b.n; i++ {
		fastmd5(str)
	}
}
 
func benchmarkv1(b *testing.b) {
	for i := 0; i < b.n; i++ {
		md5v1(str)
	}
}
 
func benchmarkv2(b *testing.b) {
	for i := 0; i < b.n; i++ {
		md5v2(str)
	}
}
 
func benchmarkv3(b *testing.b) {
	for i := 0; i < b.n; i++ {
		md5v3(str)
	}
}

以上为个人经验,希望能给大家一个参考,也希望大家多多支持。如有错误或未考虑完全的地方,望不吝赐教。

相关标签: Golang md5 校验