大橙子网站建设,新征程启航
为企业提供网站建设、域名注册、服务器等服务
这篇文章主要讲解了Python3爬虫中如何实现识别图形验证码,内容清晰明了,对此有兴趣的小伙伴可以学习一下,相信大家阅读完之后会有帮助。
网站的建设成都创新互联专注网站定制,经验丰富,不做模板,主营网站定制开发.小程序定制开发,H5页面制作!给你焕然一新的设计体验!已为成都活动板房等企业提供专业服务。表单的最后一项就是图形验证码,我们必须完全输入正确图中的字符才可以完成注册。
1.本节目标
本节我们就以知网的验证码为例,讲解一下利用 OCR 技术识别此种图形验证码的方法。
2. 准备工作
识别图形验证码需要的库有 Tesserocr,如果没有安装可以参考第一章的安装说明。
3. 获取验证码
为了便于实验,我们先将验证码的图片保存到本地,以供测试。
打开开发者工具,找到验证码元素,可以看到这是一张图片,它的 src 属性是 CheckCode.aspx,在这里我们直接将这个链接打开:http://my.cnki.net/elibregister/CheckCode.aspx,就可以看到一个验证码,直接右键保存下来即可,将名称命名为 code.jpg,如图 8-2 所示:
这样我们就可以得到一张验证码图片供下面测试识别使用了。
4. 识别测试
接下来我们新建一个项目,将验证码图片放到项目根目录下,用 Tesserocr 库来识别一下该验证码试试,代码如下:
import tesserocr from PIL import Image image = Image.open('code.jpg') result = tesserocr.image_to_text(image) print(result)