Python语言检测模块langid和langdetect的使用实例
程序员文章站
2022-07-11 09:46:41
之前使用数据编码风格检测的模块chardet比较多一点,今天提到的两个模块是检测数据的语言类型,比如是:中文还是英文,模块的使用方法也比较简单,我这里只是简单地使用了一下,...
之前使用数据编码风格检测的模块chardet比较多一点,今天提到的两个模块是检测数据的语言类型,比如是:中文还是英文,模块的使用方法也比较简单,我这里只是简单地使用了一下,因为项目中有这个需求,所以拿来用了一下,并没有深入地去研究这两个模块,模块的地址链接我都给出来了,需要的话可以去研究下:
def langidfunc(): ''' https://github.com/yishuihanhan/langid.py ''' print langid.classify("we are family") print langid.classify("questa e una prova") print langid.classify("我们都有一个家") identifier=languageidentifier.from_modelstring(model,norm_probs=true) print identifier.classify("we are family") def langdetectfunc(): ''' https://github.com/yishuihanhan/langdetect ''' s1=u"本篇文章主要介绍两款语言探测工具,用于区分文本到底是什么语言," s2=u'we are pleased to introduce today a new technology' print detect(s1) print detect(s2) print detect_langs(s2) # detect_langs()输出探测出的所有语言类型及其所占的比例 print detect_langs("otec matka syn.")
结果如下:
('en', 9.061840057373047)
('it', -35.41771221160889)
('zh', -85.79573845863342)
('en', 0.16946150595865334)
zh-cn
en
[en:0.999998109575]
[pl:0.571426592237, fi:0.428568772028]
总结
以上就是这篇文章的全部内容了,希望本文的内容对大家的学习或者工作具有一定的参考学习价值,谢谢大家对的支持。如果你想了解更多相关内容请查看下面相关链接
上一篇: nginx的负载均衡实例,均衡策略,session保持方案
下一篇: 学习笔记
推荐阅读
-
使用Python的urllib和urllib2模块制作爬虫的实例教程
-
Python语言检测模块langid和langdetect的使用实例
-
python中的hashlib和base64加密模块使用实例
-
使用Python的urllib和urllib2模块制作爬虫的实例教程
-
使用Python的urllib和urllib2模块制作爬虫的实例教程
-
使用Python的urllib和urllib2模块制作爬虫的实例教程
-
Python语言检测模块langid和langdetect的使用实例
-
python中的hashlib和base64加密模块使用实例
-
python中的hashlib和base64加密模块使用实例